Fireworks Research، تیم مدل در استارت‌آپ Fireworks AI، Ember-1 را معرفی کرده است، مدلی تخصصی که به گفته این شرکت، پاسخ‌های مشابهی با Kimi K3 متعلق به Moonshot AI ارائه می‌کند در حالی که تقریباً 40 درصد توکن‌های کمتری منتشر می‌کند. این مدل در 23 سپتامبر بر روی پلتفرم Fireworks پخش شد و در چند روز گذشته به یکی از مورد بحث ترین نسخه ها در جامعه توسعه دهندگان تبدیل شد و صدها رای مثبت را در Hacker News جلب کرد زیرا کدنویس ها در مورد اینکه آیا توکن های استدلال مرز هزینه بعدی هستند یا خیر.

این بازی در زمانی اتفاق می‌افتد که صورت‌حساب‌های استنباط، نه قابلیت مدل، به طور فزاینده‌ای تصمیم می‌گیرند که تیم‌ها چه چیزی را می‌توانند ارسال کنند. برای تیم‌هایی که در حال تماشای حجم‌های کاری عاملی هستند که بودجه مصرف می‌کنند، [آخرین پیشرفت‌های هوش مصنوعی] (https://aibuzzwire.news) یک چیز را روشن کرده است: گران‌ترین عادت صنعت در حال حاضر آموزش مدل‌های مرزی نیست، بلکه آنها را اجرا می‌کند. Ember-1 تلاش Fireworks برای حمله مستقیم به این مشکل است و این شرکت با مجموعه‌ای از معیارها و اعداد تولید با جزئیات غیرمعمول از آن پشتیبانی کرد.

مدل های تفکر بیش از حد فکر می کنند

مشاهدات اصلی پشت Ember-1 این است که مدل‌های استدلالی مانند Kimi K3 اکثر توکن‌های تولید شده خود را - به گفته Fireworks - گاهی بیش از 90 درصد - صرف استدلال داخلی می‌کنند تا خود پاسخ. با یک درخواست، گران است. در بارهای کاری عامل، ترکیب می‌شود: هر نوبت مکالمه نماینده، تمام استدلال‌های قبلی را به مدل بازمی‌گرداند، بنابراین زمینه با تعداد دورها تقریباً به صورت درجه دوم رشد می‌کند و ردپای استدلال طولانی از نوبت‌های اولیه دوباره خوانده می‌شود و در هر تماس بعدی دوباره صورت‌حساب می‌شود.

Fireworks می‌گوید مشتریان به آنها گفته‌اند که توانایی کدنویسی Kimi K3 را با هزینه کمتری می‌خواهند، اما صرفاً نادیده گرفتن تلاش استدلال مدل کارساز نبود - تنظیمات کم‌تلاش کیفیت بیش از حد را کاهش دادند. جایگزین، آموزش مدلی بود که در عین حفظ استدلال های مهم، کارآمدتر استدلال کند.

آموزش زباله ها

طبق پست وبلاگ این شرکت، ساختمان Ember-1 بیش از 50 آزمایش آموزشی و بیش از 200 ارزیابی را انجام داد، که کاملاً بر روی پلت فرم آموزش بدون سرور خود Fireworks اجرا شد. این تیم می‌گوید الگوریتم‌های آموزشی جدیدی را در طول مسیر توسعه داده است تا استدلال را بدون از دست دادن دقت کوتاه کند.

قابل ذکر است، این شرکت تلاشی برای حذف استدلال به صورت عمده نداشت. برخی از پرحرفی های ظاهری کیمی کی 3، خود انعکاس مولد است – بازبینی یک فرض، پاسخ به بازخورد، یا ردیابی نتیجه به تصمیم قبلی به مدل کمک می کند تا از اشتباهات خود بازگردد. رژیم آموزشی برای حفظ این توانایی در حین کوتاه کردن حلقه‌های غیرمولد طراحی شده بود.

داده‌های آموزشی شامل ریاضیات، کدگذاری، پیگیری دستورالعمل‌ها، مکالمه، جستجو، استفاده از ابزار و مهندسی نرم‌افزار می‌شد که هم مشکلات مستقل و هم تعاملات چند نوبتی گسترده را پوشش می‌داد. Fireworks می‌گوید که فقط از داده‌های خود و بدون اطلاعات مشتری استفاده کرده است.

معیارها: در مرز پارتو یا نزدیک آن

برای بررسی هزینه، Fireworks هزینه هر بنچمارک را با استفاده از قیمت گذاری عمومی API Kimi K3 - 3 دلار به ازای هر میلیون توکن ورودی ذخیره نشده، 0.30 دلار به ازای هر میلیون توکن ورودی ذخیره شده و 15 دلار در هر میلیون توکن خروجی - محاسبه کرد و Ember-1 را با K3 در تلاش استدلال کم، زیاد و حداکثر مقایسه کرد. در هر معیاری با بیش از 50 نمونه آزمایشی، این شرکت گزارش می‌دهد که Ember-1 روی مرز پارتو یا نزدیک آن قرار دارد، با حداکثر تلاش برای کسری از هزینه K3 و با تلاش کم به شدت بر K3 تسلط دارد.

مقایسه تیتر با K3 در حداکثر تلاش، همانطور که توسط Fireworks گزارش شده است:

| معیار | نمونه ها | K3 (حداکثر تلاش) | Ember-1 |
|---|---|---|---|
| ترمینال بنچ 2.1 | 89 | 80.9% | 82.0% |
| SWE-bench تایید شده | 500 | 93.2% | 92.2% |
| SWE-Interact | 75 | 21.3 درصد | 20.0% |
| DeepSWE 1.1 | 113 | 66.4 درصد | 75.2% |
| τ²-Bench Airline | 50 | 64 درصد | 66 درصد |

در مورد هزینه هر کار، Fireworks گزارش می دهد که Ember-1 هزینه ها را 51.9٪ در ترمینال Bench 2.1، 32.5٪ در SWE-Interact، 23.7٪ در DeepSWE 1.1، و 15.5٪ در SWE-bench Verified نسبت به K3 در حداکثر تلاش - در مورد تفاوت 6 واحد کار شرکت DeepSWE، در مورد 6 دلار بیشتر از هر واحد کار، محاسبه می کند. نرخ ها

این شرکت همچنین Ember-1 را روی نیمکت Doximity's Bedside ارزیابی کرد، یک معیار تأیید شده توسط پزشک از 500 مورد بالینی در 10 تخصص که Fireworks از طریق شاخص هوش تخصصی تازه راه اندازی شده خود اجرا می کند. Fireworks می‌گوید که Ember-1 مرز پارتو جدیدی را برای هزینه هر کار در هر دو مدل باز و بسته، از جمله GPT-5.6 Sol، GPT-6 Astra و Claude Opus 5 تعیین می‌کند. این ادعا از شاخص خود Fireworks می‌آید و به طور مستقل تأیید نشده است.

ترافیک زنده: نشانه های کمتر، امتیازات یکسان

معیارها یک چیز هستند. تولید دیگری است. Fireworks آزمایش‌های مستقیم A/B را با دو مشتری در بارهای کاری کدگذاری تولید خود انجام داد و گزارش داد که Ember-1 تقریباً 35٪ توکن‌های کمتری در هر کار با کیفیت قابل مقایسه استفاده می‌کرد. در یک مقایسه اندازه‌گیری شده، Kimi K3 در حالی که 49300 توکن خروجی در هر کار تولید می‌کرد، در مقابل 0.753 برای Ember-1 روی 29900 توکن، 71.3 درصد کاهش در توکن‌های استدلال و 39 درصد کمتر توکن‌های کل به دست آورد. پس از آزمایش‌ها، یکی از مشتریان Ember-1 را با برنامه‌هایی برای افزایش مقیاس آن به‌منظور جایگزینی کامل مدل پایه، به تولید زنده منتقل کرد.

در داخل خود Fireworks، این مدل قبل از راه‌اندازی بی‌سروصدا در جریان‌های کاری کدگذاری خود شرکت جایگزین شد. نتیجه ای که تیم می گوید به آن افتخار می کند: هیچ کس متوجه نشد. توسعه دهندگان کار خود را بدون شناسایی سوئیچ انجام دادند و در عین حال توکن های کمتری مصرف کردند.

هوش تخصصی به عنوان یک استراتژی

Ember-1 اولین مدل از سری برنامه‌ریزی‌شده از Fireworks Research است و در کنار شاخص هوش تخصصی این شرکت، تلاشی برای مقایسه مدل‌های باز، بسته و تخصصی در کارهای دنیای واقعی که در اوایل ماه جاری معرفی شد، ارائه شد.

نمایشنامه استراتژیک به راحتی قابل خواندن است. به جای آموزش یک مدل مرزی از ابتدا، Fireworks یک مدل وزن باز قوی را انتخاب کرد، کارایی توکن را در آن آموزش داد و اکنون همان قابلیت را با هزینه کمتر برای هر کار به فروش می‌رساند. از آنجایی که نسخه‌های با وزن باز از آزمایشگاه‌هایی مانند Moonshot شکاف قابلیت‌ها را کم می‌کنند، ارائه‌دهندگان استنباط متوجه می‌شوند که تمایز بادوام ممکن است در هزینه به ازای هر کار انجام‌شده به‌جای جایگاه رهبران باشد - تغییری که به نفع شرکت‌هایی است که زیرساخت‌های آموزشی و خدماتی قوی دارند.

اخطارها ارزش بیان را دارند: اعداد بالا از وبلاگ خود Fireworks، ارزیابی‌های خود و مشتریان پرداخت‌کننده خود آمده است. تکرار مستقل پس انداز توکن در بارهای کاری خارجی، آزمون واقعی خواهد بود. اما اگر نتایج باقی بماند، مقرون به صرفه ترین راه برای اجرای یک مدل باز کلاس مرزی ممکن است دیگر کمتر فکر کند - ممکن است مدلی باشد که یاد گرفته است کارآمد فکر کند.
---

از هوش مصنوعی جلوتر بمانید

آخرین اخبار، تحلیل ها و پیشرفت های هوش مصنوعی را دریافت کنید - همه در یک مکان.

بیشتر بخوانید اخبار هوش مصنوعی →