Fireworks Research، تیم مدل در استارتآپ Fireworks AI، Ember-1 را معرفی کرده است، مدلی تخصصی که به گفته این شرکت، پاسخهای مشابهی با Kimi K3 متعلق به Moonshot AI ارائه میکند در حالی که تقریباً 40 درصد توکنهای کمتری منتشر میکند. این مدل در 23 سپتامبر بر روی پلتفرم Fireworks پخش شد و در چند روز گذشته به یکی از مورد بحث ترین نسخه ها در جامعه توسعه دهندگان تبدیل شد و صدها رای مثبت را در Hacker News جلب کرد زیرا کدنویس ها در مورد اینکه آیا توکن های استدلال مرز هزینه بعدی هستند یا خیر.
این بازی در زمانی اتفاق میافتد که صورتحسابهای استنباط، نه قابلیت مدل، به طور فزایندهای تصمیم میگیرند که تیمها چه چیزی را میتوانند ارسال کنند. برای تیمهایی که در حال تماشای حجمهای کاری عاملی هستند که بودجه مصرف میکنند، [آخرین پیشرفتهای هوش مصنوعی] (https://aibuzzwire.news) یک چیز را روشن کرده است: گرانترین عادت صنعت در حال حاضر آموزش مدلهای مرزی نیست، بلکه آنها را اجرا میکند. Ember-1 تلاش Fireworks برای حمله مستقیم به این مشکل است و این شرکت با مجموعهای از معیارها و اعداد تولید با جزئیات غیرمعمول از آن پشتیبانی کرد.
مدل های تفکر بیش از حد فکر می کنند
مشاهدات اصلی پشت Ember-1 این است که مدلهای استدلالی مانند Kimi K3 اکثر توکنهای تولید شده خود را - به گفته Fireworks - گاهی بیش از 90 درصد - صرف استدلال داخلی میکنند تا خود پاسخ. با یک درخواست، گران است. در بارهای کاری عامل، ترکیب میشود: هر نوبت مکالمه نماینده، تمام استدلالهای قبلی را به مدل بازمیگرداند، بنابراین زمینه با تعداد دورها تقریباً به صورت درجه دوم رشد میکند و ردپای استدلال طولانی از نوبتهای اولیه دوباره خوانده میشود و در هر تماس بعدی دوباره صورتحساب میشود.
Fireworks میگوید مشتریان به آنها گفتهاند که توانایی کدنویسی Kimi K3 را با هزینه کمتری میخواهند، اما صرفاً نادیده گرفتن تلاش استدلال مدل کارساز نبود - تنظیمات کمتلاش کیفیت بیش از حد را کاهش دادند. جایگزین، آموزش مدلی بود که در عین حفظ استدلال های مهم، کارآمدتر استدلال کند.
آموزش زباله ها
طبق پست وبلاگ این شرکت، ساختمان Ember-1 بیش از 50 آزمایش آموزشی و بیش از 200 ارزیابی را انجام داد، که کاملاً بر روی پلت فرم آموزش بدون سرور خود Fireworks اجرا شد. این تیم میگوید الگوریتمهای آموزشی جدیدی را در طول مسیر توسعه داده است تا استدلال را بدون از دست دادن دقت کوتاه کند.
قابل ذکر است، این شرکت تلاشی برای حذف استدلال به صورت عمده نداشت. برخی از پرحرفی های ظاهری کیمی کی 3، خود انعکاس مولد است – بازبینی یک فرض، پاسخ به بازخورد، یا ردیابی نتیجه به تصمیم قبلی به مدل کمک می کند تا از اشتباهات خود بازگردد. رژیم آموزشی برای حفظ این توانایی در حین کوتاه کردن حلقههای غیرمولد طراحی شده بود.
دادههای آموزشی شامل ریاضیات، کدگذاری، پیگیری دستورالعملها، مکالمه، جستجو، استفاده از ابزار و مهندسی نرمافزار میشد که هم مشکلات مستقل و هم تعاملات چند نوبتی گسترده را پوشش میداد. Fireworks میگوید که فقط از دادههای خود و بدون اطلاعات مشتری استفاده کرده است.
معیارها: در مرز پارتو یا نزدیک آن
برای بررسی هزینه، Fireworks هزینه هر بنچمارک را با استفاده از قیمت گذاری عمومی API Kimi K3 - 3 دلار به ازای هر میلیون توکن ورودی ذخیره نشده، 0.30 دلار به ازای هر میلیون توکن ورودی ذخیره شده و 15 دلار در هر میلیون توکن خروجی - محاسبه کرد و Ember-1 را با K3 در تلاش استدلال کم، زیاد و حداکثر مقایسه کرد. در هر معیاری با بیش از 50 نمونه آزمایشی، این شرکت گزارش میدهد که Ember-1 روی مرز پارتو یا نزدیک آن قرار دارد، با حداکثر تلاش برای کسری از هزینه K3 و با تلاش کم به شدت بر K3 تسلط دارد.
مقایسه تیتر با K3 در حداکثر تلاش، همانطور که توسط Fireworks گزارش شده است:
| معیار | نمونه ها | K3 (حداکثر تلاش) | Ember-1 |
|---|---|---|---|
| ترمینال بنچ 2.1 | 89 | 80.9% | 82.0% |
| SWE-bench تایید شده | 500 | 93.2% | 92.2% |
| SWE-Interact | 75 | 21.3 درصد | 20.0% |
| DeepSWE 1.1 | 113 | 66.4 درصد | 75.2% |
| τ²-Bench Airline | 50 | 64 درصد | 66 درصد |
در مورد هزینه هر کار، Fireworks گزارش می دهد که Ember-1 هزینه ها را 51.9٪ در ترمینال Bench 2.1، 32.5٪ در SWE-Interact، 23.7٪ در DeepSWE 1.1، و 15.5٪ در SWE-bench Verified نسبت به K3 در حداکثر تلاش - در مورد تفاوت 6 واحد کار شرکت DeepSWE، در مورد 6 دلار بیشتر از هر واحد کار، محاسبه می کند. نرخ ها
این شرکت همچنین Ember-1 را روی نیمکت Doximity's Bedside ارزیابی کرد، یک معیار تأیید شده توسط پزشک از 500 مورد بالینی در 10 تخصص که Fireworks از طریق شاخص هوش تخصصی تازه راه اندازی شده خود اجرا می کند. Fireworks میگوید که Ember-1 مرز پارتو جدیدی را برای هزینه هر کار در هر دو مدل باز و بسته، از جمله GPT-5.6 Sol، GPT-6 Astra و Claude Opus 5 تعیین میکند. این ادعا از شاخص خود Fireworks میآید و به طور مستقل تأیید نشده است.
ترافیک زنده: نشانه های کمتر، امتیازات یکسان
معیارها یک چیز هستند. تولید دیگری است. Fireworks آزمایشهای مستقیم A/B را با دو مشتری در بارهای کاری کدگذاری تولید خود انجام داد و گزارش داد که Ember-1 تقریباً 35٪ توکنهای کمتری در هر کار با کیفیت قابل مقایسه استفاده میکرد. در یک مقایسه اندازهگیری شده، Kimi K3 در حالی که 49300 توکن خروجی در هر کار تولید میکرد، در مقابل 0.753 برای Ember-1 روی 29900 توکن، 71.3 درصد کاهش در توکنهای استدلال و 39 درصد کمتر توکنهای کل به دست آورد. پس از آزمایشها، یکی از مشتریان Ember-1 را با برنامههایی برای افزایش مقیاس آن بهمنظور جایگزینی کامل مدل پایه، به تولید زنده منتقل کرد.
در داخل خود Fireworks، این مدل قبل از راهاندازی بیسروصدا در جریانهای کاری کدگذاری خود شرکت جایگزین شد. نتیجه ای که تیم می گوید به آن افتخار می کند: هیچ کس متوجه نشد. توسعه دهندگان کار خود را بدون شناسایی سوئیچ انجام دادند و در عین حال توکن های کمتری مصرف کردند.
هوش تخصصی به عنوان یک استراتژی
Ember-1 اولین مدل از سری برنامهریزیشده از Fireworks Research است و در کنار شاخص هوش تخصصی این شرکت، تلاشی برای مقایسه مدلهای باز، بسته و تخصصی در کارهای دنیای واقعی که در اوایل ماه جاری معرفی شد، ارائه شد.
نمایشنامه استراتژیک به راحتی قابل خواندن است. به جای آموزش یک مدل مرزی از ابتدا، Fireworks یک مدل وزن باز قوی را انتخاب کرد، کارایی توکن را در آن آموزش داد و اکنون همان قابلیت را با هزینه کمتر برای هر کار به فروش میرساند. از آنجایی که نسخههای با وزن باز از آزمایشگاههایی مانند Moonshot شکاف قابلیتها را کم میکنند، ارائهدهندگان استنباط متوجه میشوند که تمایز بادوام ممکن است در هزینه به ازای هر کار انجامشده بهجای جایگاه رهبران باشد - تغییری که به نفع شرکتهایی است که زیرساختهای آموزشی و خدماتی قوی دارند.
اخطارها ارزش بیان را دارند: اعداد بالا از وبلاگ خود Fireworks، ارزیابیهای خود و مشتریان پرداختکننده خود آمده است. تکرار مستقل پس انداز توکن در بارهای کاری خارجی، آزمون واقعی خواهد بود. اما اگر نتایج باقی بماند، مقرون به صرفه ترین راه برای اجرای یک مدل باز کلاس مرزی ممکن است دیگر کمتر فکر کند - ممکن است مدلی باشد که یاد گرفته است کارآمد فکر کند.
---
آخرین اخبار، تحلیل ها و پیشرفت های هوش مصنوعی را دریافت کنید - همه در یک مکان.
بیشتر بخوانید اخبار هوش مصنوعی →