أطلقت شركة ناشئة جديدة في مجال الذكاء الاصطناعي، أسسها باحث سابق في OpenAI، ما تسميه فئة جديدة تمامًا من النماذج - فئة لا يمكنها أن تكتب لك مقالًا، وتقول إن هذا هو الهدف بالضبط.

أعلنت شركة TypeSafe AI يوم الثلاثاء عن إطلاق أول "System One Model"، المسمى Jev، والمتاح على الفور في الوصول المبكر. تأسست الشركة على يد ديوغو ألميدا، الذي يقول إن البحث وراء اتباع تعليمات ChatGPT نشأ عن العمل الذي ساهم فيه في OpenAI. وبعد عامين من التخفي، يقول إن هوس الصناعة بالدردشة قد حجب المجالات التي تفشل فيها الأتمتة فعليًا. لمزيد من السياق حول هذه القصة، راجع أحدث تطورات الذكاء الاصطناعي.

"لقد كانت العارضات خارقات في الدردشة لسنوات، فأين كل الأتمتة؟" كتب ألميدا في منشور الإطلاق. "لقد كان هذا هو سؤالي الدافع خلال السنوات الأربع الماضية."

ما هو نموذج "النظام الأول" في الواقع؟

الاسم مستوحى من تمييز علم النفس بين التفكير السريع الغريزي والتفكير البطيء والمتعمد. حيث تقوم نماذج اللغة الكبيرة بإنشاء رمز نصي مميز تلو الآخر - مرن، عام، وعرضة للهراء الواثق في بعض الأحيان - تم تصميم TypeSafe's Jev للقيام بشيء أضيق: اتخاذ حالة غير منظمة كمدخلات وإرجاع مكتوبة، وقرارات منظمة مع احتمالات معايرة مرفقة.

تصف الشركة Jev بأنه "استدعاء وظيفة استخبارات الحدود: حالة غير منظمة، قرارات احتمالية مكتوبة." نظرًا لأن المخرجات المحتملة يتم تحديدها مسبقًا، ولا يقوم النموذج أبدًا بإنشاء سلاسل ذات شكل حر، تدعي شركة TypeSafe أنها لا تستطيع إنتاج أخطاء كتابية - وهي خاصية تقول الشركة إنها مضمونة رياضيًا وليست محتملة إحصائيًا - ولا يمكنها الهلوسة بالطريقة التي يمكن بها لنماذج إنشاء النص.

تبتعد البنية عن الممارسة السائدة بثلاث طرق، وفقًا لمنشور الإطلاق: بنية نموذجية جديدة، وعينة متوازية تنتج جميع المخرجات في استعلام واحد بدلاً من التسلسل، وطريقة تدريب تسميها الشركة التعلم المعزز لاتخاذ القرارات المعايرة (RLCD)، والتي تعمل على تحسين الاحتمالات الصادقة معرفيًا بدلاً من التفضيل البشري أو المخرجات التي يمكن التحقق منها برمجيًا.

المطالبات: أسرع 100 مرة، وجزء بسيط من التكلفة

الأرقام التي تنشرها TypeSafe عدوانية. تقول الشركة إن Jev يقدم معلومات استخباراتية مماثلة لبرامج LLM الحدودية الحالية فيما تسميه مهام "System One Shape" - التصنيف والتوجيه والتسجيل والاستخراج والقرارات المتفرعة - بينما يستجيب في 70 إلى 500 مللي ثانية، مقابل أوقات استجابة شاملة من 3 إلى 329 ثانية للنماذج الحدودية. وتقول الشركة إن ذلك يعمل بشكل أسرع بمعدل 40 إلى 200 مرة.

التسعير غير تقليدي بالمثل: 0.042 دولار لكل مليون رمز إدخال، مع رموز الإخراج المجانية، حيث يتم حساب المخرجات بالتوازي بدلاً من إنشاء رمز مميز برمز مميز. واعترفت الشركة في منشورها بأنها لا تستطيع حتى الآن إثبات أن السعر مستدام على نطاق واسع.

وجاء في المنشور: "الادعاءات غير العادية تتطلب أدلة غير عادية"، قبل تقديم الأدلة التي لديها.

الإيصالات – وما يقوله المتشككون

نشرت TypeSafe عرضًا توضيحيًا جنبًا إلى جنب يقارن Jev مع GPT-5.6 Terra، والذي تصفه بأنه النموذج الحدودي الأكثر قابلية للمقارنة في الذكاء المماثل، وتقول إن الخلاف الوحيد في التشغيل المسجل كان يتعلق بقرار حكم غامض حقًا. كما قدمت أيضًا منهجية "تقييم سير العمل" الجديدة التي تقيس النماذج مقابل إجماع أكبر النماذج الخارجية - Astra من OpenAI وAnthropic's Fable - داخل رسم بياني حسابي ثابت، وتدعي أن Jev "يمتلك حدود Pareto لما يقرب من 2 أوامر من حيث الحجم."

والجدير بالذكر أن الشركة نشرت منشورًا مصاحبًا بعنوان "antibenchmaxxing" يشرح سبب تجنبها للمعايير التقليدية، بحجة أن النموذج المصمم لاتخاذ قرارات منظمة داخل سير عمل البرامج يقاوم المقارنة العالمية ذات المغزى.

ردود الفعل على Hacker News، حيث اجتذب الإطلاق مئات النقاط في غضون ساعات، تراوحت بين الإثارة الحقيقية والشكوك الواضحة. لاحظ العديد من المعلقين أن الأدلة العامة تتكون إلى حد كبير من مقاطع فيديو تجريبية – بما في ذلك مقطع يظهر النموذج الذي يعمل على تشغيل حلقة لعب Doom – بدلاً من تقييمات الطرف الثالث القابلة للتكرار. ورأى آخرون أن من الأفضل فهم هذا النهج باعتباره مصنفًا سريعًا للغاية وعالي الجودة، ومفيدًا لشريحة من أعباء العمل بدلاً من استبداله ببرامج ماجستير إدارة الأعمال.

وحتى المراقبون المتعاطفون وضعوا عبء الإثبات بوضوح. وكتب أحد المعلقين: "نعم، إنهم يتحدثون كمتشككين، لكنهم لا يقدمون الكثير من الأدلة، بخلاف مقطعي فيديو للعروض التوضيحية". "العرض التجريبي المباشر سيكون أكثر إقناعا بكثير."

لماذا قد يكون الأمر مهمًا على أي حال

الملعب يهبط على نقطة ألم حقيقية. إن نسبة كبيرة من مكالمات LLM الإنتاجية في البرامج التجارية ليست منتجة على الإطلاق - فهي عبارة عن أحكام ثنائية، وتعيينات فئة، وقرارات توجيه ملفوفة في النثر. إذا تمكن النموذج من إجراء تلك المكالمات بثقة معايرة عند 70 مللي ثانية وبتكلفة إنتاج صفر فعليًا، فإن اقتصاديات البرامج التي تعمل بالذكاء الاصطناعي تتغير بشكل كبير: تصبح واجهات المستخدم في الوقت الفعلي عملية، وخطوات خط الأنابيب التي كانت مكلفة للغاية بحيث لا يمكن أتمتتها باستخدام LLMs تصبح رخيصة بما يكفي للتشغيل في كل مكان.

تتضمن حالات الاستخدام المقترحة لـ TypeSafe تصنيف البيانات وتوجيهها، والتحقق من مخرجات LLM وحمايتها، واكتشاف عمليات كسر الحماية، وتحليل تقليل الخرائط على مجموعات البيانات الكبيرة - أعباء العمل حيث يمكن للتعليمات البرمجية المحيطة تقييد حرية النموذج والتقاط الأخطاء.

الشركة صريحة بشأن الأسئلة المفتوحة: فقد تم إجراء تقييماتها المنشورة من أجهزة كمبيوتر محمولة على الساحل الغربي للولايات المتحدة، ولا تزال استدامة التسعير على المدى الطويل غير مثبتة. ما إذا كانت ادعاءات ذكاء جيف تنجو من الاتصال باختبارات مستقلة ستحدد ما إذا كانت "نماذج النظام الأول" ستصبح فئة أو فضولًا.

الوصول المبكر مفتوح الآن من خلال موقع الشركة.

---

ابق على اطلاع بأخبار الذكاء الاصطناعي

آخر أخبار وتحليلات وإنجازات الذكاء الاصطناعي — في مكان واحد.

اقرأ المزيد من أخبار الذكاء الاصطناعي →