یک استارتآپ جدید هوش مصنوعی که توسط یک محقق سابق OpenAI تأسیس شده است، آنچه را که یک کلاس کاملاً جدید از مدل مینامد راهاندازی کرده است - مدلی که نمیتواند برای شما مقاله بنویسد، و میگوید که دقیقاً موضوع همین است.
هوش مصنوعی TypeSafe روز سه شنبه از انتشار اولین "System One Model" خود به نام Jev خبر داد که بلافاصله در دسترس است. این شرکت توسط دیوگو آلمیدا تأسیس شد که میگوید تحقیقات پشت دستورالعملهای ChatGPT ناشی از کار او در OpenAI بوده است. پس از دو سال مخفی کاری، او استدلال می کند که تثبیت صنعت در چت، جایی که اتوماسیون واقعاً شکست می خورد، پنهان کرده است. For more context on this story, see our ongoing AI news.
مدلها سالهاست که در چت مافوق بشر بودهاند، پس این همه اتوماسیون کجاست؟ آلمیدا در پست راه اندازی نوشت. "این سوال رانندگی من در چهار سال گذشته بوده است."
در واقع یک مدل "System One" چیست
این نام از تمایز روانشناسی بین تفکر سریع، غریزی و استدلال کند و عمدی وام گرفته شده است. در جایی که مدلهای زبان بزرگ، نشانههای متنی را تولید میکنند - انعطافپذیر، کلی، و مستعد گاه به گاه مزخرفات مطمئن - TypeSafe's Jev برای انجام کاری باریکتر ساخته شده است: حالت بدون ساختار را بهعنوان ورودی گرفته و تصمیمهای تایپشده، ساختاریافته با احتمالات کالیبرهشده را برمیگرداند.
این شرکت Jev را بهعنوان یک فراخوان تابع اطلاعات مرزی توصیف میکند: حالت بدون ساختار، تصمیمهای احتمالی تایپ شده خارج میشود. از آنجا که خروجیهای ممکن از قبل تعریف شدهاند و مدل هرگز رشتههایی با فرم آزاد تولید نمیکند، TypeSafe ادعا میکند که نمیتواند خطاهای نوع ایجاد کند - ویژگیای که شرکت میگوید از نظر ریاضی تضمین شده است تا احتمال آماری - و نمیتواند به روشی که مدلهای تولید متن میتوانند توهم ایجاد کند.
طبق پست راهاندازی، معماری به سه روش از روش اصلی خارج میشود: یک معماری مدل جدید، یک نمونهگر موازی که همه خروجیها را در یک پرسوجو تولید میکند و نه بهصورت متوالی، و یک روش آموزشی که شرکت آن را آموزش تقویتی برای تصمیمهای کالیبره شده (RLCD) مینامد، که احتمالات معرفتی صادقانه را بهجای ترجیحات انسانی یا برنامههای خروجی تأیید شده از نظر انسانی بهینه میکند.
ادعاها: 100 برابر سریعتر، کسری از هزینه
اعدادی که TypeSafe منتشر می کند تهاجمی هستند. این شرکت میگوید Jev اطلاعات قابل مقایسه با LLMهای مرزی موجود را در مورد وظایف «System One shaped» - طبقهبندی، مسیریابی، امتیازدهی، استخراج و تصمیمگیریهای انشعاب - ارائه میکند در حالی که در 70 تا 500 میلیثانیه پاسخ میدهد، در مقابل زمانهای پاسخ انتها به انتها 3 تا 329 ثانیه برای مدلهای مرزی. این شرکت می گوید که 40 برابر تا 200 برابر سریعتر عمل می کند.
قیمتگذاری بهطور مشابه غیر متعارف است: 0.042 دلار به ازای هر میلیون توکن ورودی، با توکنهای خروجی رایگان، زیرا خروجیها بهجای تولید توکن با توکن، بهصورت موازی محاسبه میشوند. این شرکت در پست خود اذعان کرد که هنوز نمی تواند ثابت کند که قیمت گذاری در مقیاس پایدار است.
در این پست پیش از ارائه شواهدی که در اختیار دارد، آمده است: «ادعاهای فوقالعاده به شواهد فوقالعاده نیاز دارند».
رسیدها - و آنچه شکاکان می گویند
TypeSafe یک نسخه نمایشی کنار هم منتشر کرد که Jev را با GPT-5.6 Terra مقایسه کرد، که آن را به عنوان قابل مقایسهترین مدل مرزی در هوش مشابه توصیف میکند و میگوید که تنها اختلاف نظر در اجرای ضبطشده شامل یک قضاوت واقعا مبهم است. همچنین یک روش جدید «ارزیابی گردش کار» معرفی کرد که مدلها را در برابر اجماع بزرگترین مدلهای خارجی - OpenAI's Astra و Anthropic's Fable - در داخل یک نمودار محاسباتی ثابت اندازهگیری میکند و ادعا میکند که Jev «دارای مرز پارتو برای تقریباً 2 مرتبه بزرگی است».
شایان ذکر است، این شرکت یک پست همراه با عنوان «antibenchmaxxing» منتشر کرد و توضیح داد که چرا از معیارهای سنتی اجتناب میکند، با این استدلال که مدلی که برای تصمیمگیریهای ساختاریافته در جریانهای کاری نرمافزار طراحی شده است، در برابر مقایسه معنادار جهانی مقاومت میکند.
واکنش هاکر نیوز، جایی که پرتاب صدها نقطه را در عرض چند ساعت به خود جلب کرد، از هیجان واقعی تا شک و تردید شدید متغیر بود. چندین نظردهنده خاطرنشان کردند که شواهد عمومی عمدتاً شامل ویدیوهای نمایشی است - از جمله یکی که نشان میدهد مدل یک حلقه بازی Doom را تقویت میکند - نه ارزیابیهای شخص ثالث قابل تکرار. برخی دیگر استدلال کردند که این رویکرد بهعنوان یک طبقهبندی بسیار سریع و با کیفیت مرزی شناخته میشود که به جای جایگزینی برای LLMها، برای بخشی از حجم کاری مفید است.
حتی ناظران دلسوز بار اثبات را به وضوح بیان کردند. یکی از کامنتکنندگان نوشت: «بله، آنها بهعنوان شکاک صحبت میکنند، اما شواهد زیادی ارائه نمیکنند، بهجز چند ویدیوی نمایشی». "یک نمایش زنده بسیار متقاعد کننده تر خواهد بود."
چرا به هر حال ممکن است مهم باشد
زمین در یک نقطه درد واقعی فرود می آید. بخش بزرگی از فراخوانهای تولیدی LLM در نرمافزارهای تجاری به هیچ وجه مولد نیستند - آنها قضاوتهای باینری، تخصیص دستهها و تصمیمهای مسیریابی هستند که در نثر پیچیده شدهاند. اگر یک مدل بتواند آن تماسها را با اطمینان مدرج در ۷۰ میلیثانیه و در واقع هزینه خروجی صفر انجام دهد، اقتصاد نرمافزار مجهز به هوش مصنوعی بهطور قابلتوجهی تغییر میکند: رابطهای کاربری بلادرنگ عملی میشوند، و مراحل خط لوله که برای خودکارسازی با LLM بسیار گران بودند، به اندازهای ارزان میشوند که همه جا اجرا شوند.
موارد استفاده پیشنهادی TypeSafe شامل طبقهبندی و مسیریابی دادهها، تأیید و محافظت از خروجیهای LLM، تشخیص فرار از زندان و تحلیل کاهش نقشه بر روی مجموعههای داده بزرگ است - حجم کاری که در آن کدهای اطراف میتوانند آزادی مدل را محدود کرده و خطاها را شناسایی کنند.
این شرکت در مورد سؤالات باز صادق است: ارزشهای منتشر شده آن از لپتاپهای ساحل غربی ایالات متحده اجرا میشد و پایداری قیمتگذاری درازمدت ثابت نشده است. اینکه آیا ادعاهای اطلاعاتی Jev از تماس با آزمایش مستقل جان سالم به در میبرد، تعیین میکند که آیا «System One Models» به یک مقوله تبدیل میشود یا یک کنجکاوی.
دسترسی زودهنگام اکنون از طریق وب سایت شرکت باز است.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →