یک استارت‌آپ جدید هوش مصنوعی که توسط یک محقق سابق OpenAI تأسیس شده است، آنچه را که یک کلاس کاملاً جدید از مدل می‌نامد راه‌اندازی کرده است - مدلی که نمی‌تواند برای شما مقاله بنویسد، و می‌گوید که دقیقاً موضوع همین است.

هوش مصنوعی TypeSafe روز سه شنبه از انتشار اولین "System One Model" خود به نام Jev خبر داد که بلافاصله در دسترس است. این شرکت توسط دیوگو آلمیدا تأسیس شد که می‌گوید تحقیقات پشت دستورالعمل‌های ChatGPT ناشی از کار او در OpenAI بوده است. پس از دو سال مخفی کاری، او استدلال می کند که تثبیت صنعت در چت، جایی که اتوماسیون واقعاً شکست می خورد، پنهان کرده است. For more context on this story, see our ongoing AI news.

مدل‌ها سال‌هاست که در چت مافوق بشر بوده‌اند، پس این همه اتوماسیون کجاست؟ آلمیدا در پست راه اندازی نوشت. "این سوال رانندگی من در چهار سال گذشته بوده است."

در واقع یک مدل "System One" چیست

این نام از تمایز روانشناسی بین تفکر سریع، غریزی و استدلال کند و عمدی وام گرفته شده است. در جایی که مدل‌های زبان بزرگ، نشانه‌های متنی را تولید می‌کنند - انعطاف‌پذیر، کلی، و مستعد گاه به گاه مزخرفات مطمئن - TypeSafe's Jev برای انجام کاری باریک‌تر ساخته شده است: حالت بدون ساختار را به‌عنوان ورودی گرفته و تصمیم‌های تایپ‌شده، ساختاریافته با احتمالات کالیبره‌شده را برمی‌گرداند.

این شرکت Jev را به‌عنوان یک فراخوان تابع اطلاعات مرزی توصیف می‌کند: حالت بدون ساختار، تصمیم‌های احتمالی تایپ شده خارج می‌شود. از آنجا که خروجی‌های ممکن از قبل تعریف شده‌اند و مدل هرگز رشته‌هایی با فرم آزاد تولید نمی‌کند، TypeSafe ادعا می‌کند که نمی‌تواند خطاهای نوع ایجاد کند - ویژگی‌ای که شرکت می‌گوید از نظر ریاضی تضمین شده است تا احتمال آماری - و نمی‌تواند به روشی که مدل‌های تولید متن می‌توانند توهم ایجاد کند.

طبق پست راه‌اندازی، معماری به سه روش از روش اصلی خارج می‌شود: یک معماری مدل جدید، یک نمونه‌گر موازی که همه خروجی‌ها را در یک پرس‌وجو تولید می‌کند و نه به‌صورت متوالی، و یک روش آموزشی که شرکت آن را آموزش تقویتی برای تصمیم‌های کالیبره شده (RLCD) می‌نامد، که احتمالات معرفتی صادقانه را به‌جای ترجیحات انسانی یا برنامه‌های خروجی تأیید شده از نظر انسانی بهینه می‌کند.

ادعاها: 100 برابر سریعتر، کسری از هزینه

اعدادی که TypeSafe منتشر می کند تهاجمی هستند. این شرکت می‌گوید Jev اطلاعات قابل مقایسه با LLM‌های مرزی موجود را در مورد وظایف «System One shaped» - طبقه‌بندی، مسیریابی، امتیازدهی، استخراج و تصمیم‌گیری‌های انشعاب - ارائه می‌کند در حالی که در 70 تا 500 میلی‌ثانیه پاسخ می‌دهد، در مقابل زمان‌های پاسخ انتها به انتها 3 تا 329 ثانیه برای مدل‌های مرزی. این شرکت می گوید که 40 برابر تا 200 برابر سریعتر عمل می کند.

قیمت‌گذاری به‌طور مشابه غیر متعارف است: 0.042 دلار به ازای هر میلیون توکن ورودی، با توکن‌های خروجی رایگان، زیرا خروجی‌ها به‌جای تولید توکن با توکن، به‌صورت موازی محاسبه می‌شوند. این شرکت در پست خود اذعان کرد که هنوز نمی تواند ثابت کند که قیمت گذاری در مقیاس پایدار است.

در این پست پیش از ارائه شواهدی که در اختیار دارد، آمده است: «ادعاهای فوق‌العاده به شواهد فوق‌العاده نیاز دارند».

رسیدها - و آنچه شکاکان می گویند

TypeSafe یک نسخه نمایشی کنار هم منتشر کرد که Jev را با GPT-5.6 Terra مقایسه کرد، که آن را به عنوان قابل مقایسه‌ترین مدل مرزی در هوش مشابه توصیف می‌کند و می‌گوید که تنها اختلاف نظر در اجرای ضبط‌شده شامل یک قضاوت واقعا مبهم است. همچنین یک روش جدید «ارزیابی گردش کار» معرفی کرد که مدل‌ها را در برابر اجماع بزرگ‌ترین مدل‌های خارجی - OpenAI's Astra و Anthropic's Fable - در داخل یک نمودار محاسباتی ثابت اندازه‌گیری می‌کند و ادعا می‌کند که Jev «دارای مرز پارتو برای تقریباً 2 مرتبه بزرگی است».

شایان ذکر است، این شرکت یک پست همراه با عنوان «antibenchmaxxing» منتشر کرد و توضیح داد که چرا از معیارهای سنتی اجتناب می‌کند، با این استدلال که مدلی که برای تصمیم‌گیری‌های ساختاریافته در جریان‌های کاری نرم‌افزار طراحی شده است، در برابر مقایسه معنادار جهانی مقاومت می‌کند.

واکنش هاکر نیوز، جایی که پرتاب صدها نقطه را در عرض چند ساعت به خود جلب کرد، از هیجان واقعی تا شک و تردید شدید متغیر بود. چندین نظردهنده خاطرنشان کردند که شواهد عمومی عمدتاً شامل ویدیوهای نمایشی است - از جمله یکی که نشان می‌دهد مدل یک حلقه بازی Doom را تقویت می‌کند - نه ارزیابی‌های شخص ثالث قابل تکرار. برخی دیگر استدلال کردند که این رویکرد به‌عنوان یک طبقه‌بندی بسیار سریع و با کیفیت مرزی شناخته می‌شود که به جای جایگزینی برای LLM‌ها، برای بخشی از حجم کاری مفید است.

حتی ناظران دلسوز بار اثبات را به وضوح بیان کردند. یکی از کامنت‌کنندگان نوشت: «بله، آنها به‌عنوان شکاک صحبت می‌کنند، اما شواهد زیادی ارائه نمی‌کنند، به‌جز چند ویدیوی نمایشی». "یک نمایش زنده بسیار متقاعد کننده تر خواهد بود."

چرا به هر حال ممکن است مهم باشد

زمین در یک نقطه درد واقعی فرود می آید. بخش بزرگی از فراخوان‌های تولیدی LLM در نرم‌افزارهای تجاری به هیچ وجه مولد نیستند - آنها قضاوت‌های باینری، تخصیص دسته‌ها و تصمیم‌های مسیریابی هستند که در نثر پیچیده شده‌اند. اگر یک مدل بتواند آن تماس‌ها را با اطمینان مدرج در ۷۰ میلی‌ثانیه و در واقع هزینه خروجی صفر انجام دهد، اقتصاد نرم‌افزار مجهز به هوش مصنوعی به‌طور قابل‌توجهی تغییر می‌کند: رابط‌های کاربری بلادرنگ عملی می‌شوند، و مراحل خط لوله که برای خودکارسازی با LLM بسیار گران بودند، به اندازه‌ای ارزان می‌شوند که همه جا اجرا شوند.

موارد استفاده پیشنهادی TypeSafe شامل طبقه‌بندی و مسیریابی داده‌ها، تأیید و محافظت از خروجی‌های LLM، تشخیص فرار از زندان و تحلیل کاهش نقشه بر روی مجموعه‌های داده بزرگ است - حجم کاری که در آن کدهای اطراف می‌توانند آزادی مدل را محدود کرده و خطاها را شناسایی کنند.

این شرکت در مورد سؤالات باز صادق است: ارزش‌های منتشر شده آن از لپ‌تاپ‌های ساحل غربی ایالات متحده اجرا می‌شد و پایداری قیمت‌گذاری درازمدت ثابت نشده است. اینکه آیا ادعاهای اطلاعاتی Jev از تماس با آزمایش مستقل جان سالم به در می‌برد، تعیین می‌کند که آیا «System One Models» به یک مقوله تبدیل می‌شود یا یک کنجکاوی.

دسترسی زودهنگام اکنون از طریق وب سایت شرکت باز است.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →