Patronus AI، ایک سٹارٹ اپ جو خود مختار AI ایجنٹوں کا جائزہ لینے کے لیے مصنوعی ڈیجیٹل ماحول تیار کرتا ہے، نے ایک سیریز B راؤنڈ میں قابل اعتماد ایجنٹ کی جانچ میں اضافے کی مانگ کے طور پر $50 ملین اکٹھے کیے ہیں۔ اس راؤنڈ کی قیادت گرین فیلڈ پارٹنرز نے کی جس میں قابل ذکر کیپٹل، لائٹ اسپیڈ، ڈیٹا ڈوگ اور سام سنگ کی شرکت تھی، ٹیک کرنچ نے رپورٹ کیا، کمپنی کی کل فنڈنگ $70 ملین تک پہنچ گئی۔
ایک نیا مسئلہ: ایجنٹ جو شارٹ کٹ لیتے ہیں۔ For more context on this story, see our ongoing more AI stories.
جیسا کہ AI ایجنٹس سوالوں کے جواب دینے سے لے کر پیچیدہ، کثیر قدمی کاموں کو خود مختار طور پر انجام دینے تک تیار ہوتے ہیں، ماڈل فراہم کرنے والے اور ایسے ایجنٹوں کو بنانے والے اسٹارٹ اپ کو اس بات کی یقین دہانی کی ضرورت ہوتی ہے کہ سسٹمز وسیع پیمانے پر منظرناموں میں قابل اعتماد کارکردگی کا مظاہرہ کریں گے۔ AI لیبز اکثر ماڈل کی صلاحیت کو ظاہر کرنے کے لیے بینچ مارکس کا استعمال کرتی ہیں، لیکن ایجنٹ پر مبنی بینچ مارک پر اعلی اسکور یہ ثابت نہیں کرتا کہ AI حقیقت میں حقیقی دنیا کے کاموں کو صحیح طریقے سے انجام دے سکتا ہے۔
وہ خلا ہے جہاں Patronus AI توجہ مرکوز کرتا ہے۔ 2023 میں میٹا اے آئی کے سابق محققین آنند کنپن اور ریبیکا کیان کے ذریعہ قائم کیا گیا، سان فرانسسکو میں قائم کمپنی اسے "ڈیجیٹل ورلڈ ماڈلز" کہتی ہے، ویب سائٹس اور اندرونی نظاموں کی نقل تیار کرتی ہے جس میں ایجنٹوں کو تربیت کے بعد تناؤ کا سامنا کرنا پڑتا ہے۔ ایجنٹوں کا اندازہ کمک سیکھنے کا استعمال کرتے ہوئے کیا جاتا ہے، جو بار بار کامیاب کام کی تکمیل کا بدلہ دیتا ہے اور غلطیوں کو سزا دیتا ہے۔
خود مختار گاڑیوں سے قرض لینا
کمپنی اپنے نقطہ نظر کا موازنہ کرتی ہے کہ کس طرح Waymo نے خود سے چلنے والی کاروں کو تربیت دی، پہلے مصنوعی دنیا بنا کر گاڑیوں کو نایاب خطرات جیسے کہ شدید موسم یا گیند کے پیچھے بھاگنے والے بچے کے خلاف جانچنے کے لیے تیار کیا۔ AI ایجنٹوں کے ساتھ اہم فرق یہ ہے کہ وہ شارٹ کٹس لیتے ہیں، جس کا مطلب ہے کہ وہ کاموں کو درست طریقے سے مکمل کرنے میں ناکام رہتے ہیں یہاں تک کہ جب وہ کامیاب دکھائی دیتے ہیں۔
"Patronus ہیکس کو تلاش کرنے اور اس بات کو یقینی بنانے میں بہت اچھا ہے کہ وہ ماڈلز کو جوابدہ ٹھہرا رہے ہیں،" Glenn Solomon، Notable Capital کے منیجنگ ڈائریکٹر نے کہا۔ سلیمان نے کمپنی کے مصنوعی ماحول کی مانگ کو تقریباً ناقابل تسخیر قرار دیا۔ عملی طور پر ہر فرنٹیئر اے آئی لیب اور بہت سے ابھرتے ہوئے سٹارٹ اپس اب گاہک ہیں، اور پیٹرونس کی آمدنی میں پچھلے سال کے دوران 15 گنا اضافہ ہوا ہے۔
قابل تصدیق کاموں سے آگے بڑھنا
Patronus فی الحال سافٹ ویئر انجینئرنگ اور فنانس کے لیے اپنی نقلی ڈیجیٹل دنیا فراہم کرتا ہے، دو ڈومینز جہاں نتائج کی تصدیق کرنا نسبتاً آسان ہے۔ لیکن کمپنی ان کو صرف آغاز کے طور پر دیکھتی ہے۔ کنپپن نے کہا، "آج ہم ان مسائل پر بہت توجہ مرکوز کر رہے ہیں جو قابل تصدیق ہیں، وہ مسائل جن کی آپ فوری طور پر جانچ اور تصدیق کر سکتے ہیں، لیکن ایک ٹن مزید ایسے علاقے ہیں جن کی تصدیق نہیں کی جا سکتی ہے یا تصدیق کرنا بہت مشکل ہے۔"
عزائم یہ ہے کہ طویل افق پر ایجنٹوں کی جانچ کرنے کے لیے کافی حد تک ماحول بنایا جائے۔ کنپپن نے کہا، "ہم حقیقت میں ایسا ماحول پیدا کرنے کے قابل ہونا چاہتے ہیں جس میں آپ ایک ایسا ایجنٹ چلا سکتے ہیں جو 10 گھنٹے یا 10 دن یا 10 ہفتوں تک چل سکے۔" صرف اس وجہ سے کہ عمل قابل تصدیق ہیں اس کا مطلب یہ نہیں ہے کہ وہ سادہ ہیں، اور ایک دن کے کام کے فلو کے ذریعے جزوی طور پر ناکام ہونے والے ایجنٹ کو پکڑنے کی صلاحیت کمپنی کی قیمت کی تجویز میں مرکزی حیثیت رکھتی ہے۔
فنڈنگ اس وقت بھی پہنچتی ہے جب وسیع تر AI صنعت ترقی کی پیمائش کرنے کے طریقے سے جوڑتی ہے۔ بینچ مارک اسکورز ایک متنازعہ کرنسی بن چکے ہیں، ناقدین یہ دلیل دیتے ہیں کہ ماڈلز کو حقیقی کاموں میں حقیقی طور پر بہتر کیے بغیر مخصوص ٹیسٹوں کے لیے بہتر بنایا جا سکتا ہے۔ پیٹرونس کے نقلی ماحول کھلے عام حالات میں ایک متبادل، ٹیسٹنگ ایجنٹس پیش کرتے ہیں جہاں کامیابی کا واحد ثبوت لیڈر بورڈ پر نمبر کے بجائے صحیح طریقے سے مکمل شدہ کام ہے۔
انٹرپرائز صارفین کے لیے، یہ فرق اہمیت رکھتا ہے۔ ایک کوڈنگ ایجنٹ جو بینچ مارک پاس کرتا ہے لیکن خاموشی سے پروڈکشن کوڈبیس میں کیڑے متعارف کرواتا ہے، یا ایک فنانس ایجنٹ جو اعداد و شمار کو غلط طریقے سے گول کرتا ہے، کم ٹیسٹ اسکور تجویز کرنے سے کہیں زیادہ نقصان پہنچا سکتا ہے۔ تعیناتی سے پہلے سینڈ باکس میں ان ناکامیوں کو پکڑ کر، پیٹرونس تشخیص کو اعتماد کی شرط کے طور پر پیش کر رہا ہے، نہ کہ بعد کی سوچ۔
بھیڑ بھرے میدان میں ایک الگ نقطہ نظر
جہاں تک حریفوں کا تعلق ہے، پیٹرونس کا خیال ہے کہ یہ بنیادی طور پر ان داخلی تشخیصی ٹیموں کے خلاف مقابلہ کر رہی ہے جنہیں AI لیبز نے ایجنٹ کے رویے کا اندازہ لگانے کے لیے پہلے ہی بنایا ہے۔ جبکہ ہیومن ڈیٹا فرمز جیسے مرکر اور سرج ماڈل بنانے والوں کو کمک سیکھنے میں مدد کرتے ہیں، پیٹرونس مختلف طریقے سے کام کرتا ہے اس بات کا جائزہ لے کر کہ ایجنٹ کسی انسانی شمولیت کے بغیر کیسے برتاؤ کرتے ہیں، ناکامیوں کا پتہ لگانے کو خودکار بناتے ہیں جن کے لیے بصورت دیگر مہنگے دستی جائزہ کی ضرورت ہوگی۔
راؤنڈ سرمایہ کاروں کے اعتماد کی نشاندہی کرتا ہے کہ ایجنٹ کی تشخیص AI اسٹیک کی بنیادی تہہ بن جائے گی۔ جیسا کہ ایجنٹ زیادہ خودمختار کام کرتے ہیں، بکنگ ٹرپس سے لے کر مالیاتی تجزیہ کرنے تک، اسٹارٹ اپ ان سسٹمز کو قابل بھروسہ ثابت کرنے کے قابل ہوتے ہیں، ان کی تعیناتی سے پہلے، خود کو ایجنٹی AI دور میں ناگزیر گیٹ کیپرز کے طور پر پیش کر رہے ہیں۔
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →


