xAI پس از هفتهها انتشار عمومی و حداقل یک تاخیر، Grok 4.7، توانمندترین مدل این شرکت برای کدنویسی و کار دانشی را تا به امروز منتشر کرد. این مدل که در روز یکشنبه در سایت این شرکت اعلام شد، با همان قیمت و سرعت سرویس دهی قبلی خود Grok 4.6 عرضه می شود: 2 دلار به ازای هر میلیون توکن ورودی و 6 دلار در هر میلیون توکن خروجی، تقریباً نصف قیمت فهرست OpenAI GPT-5.6 Sol Max (4 دلار / 20 دلار) و بسیار کمتر از آنتروپیک / 50 دلار (مکس 50 دلار).
برای اطلاع از آخرین اخبار و تحلیلهای هوش مصنوعی، به [AI Buzz Wire] (https://aibuzzwire.news) مراجعه کنید.
یک مدل پایه بزرگتر، آموزش دیده برای کارهای طولانی
طبق اعلام xAI، Grok 4.7 از یک مدل پایه جدید و بزرگتر در مقایسه با Grok 4.6 استفاده میکند و با یادگیری تقویتی طولانیتری در ترکیبی سختتر از وظایف، با وزنی برای مشکلاتی که تکمیل آن ساعتها طول میکشد، آموزش دیده است. این شرکت میگوید این مدل در تأیید کار خود و مدیریت زمینه طولانیتر بهتر است و برای درک بومی مهار Grok Bot، بهبود وظایف مکالمه و کار دانش عمومی آموزش دیده است.
انتشار به دنبال یک اجرا پر سر و صدا است. طبق گزارش TeslaNorth.com، ایلان ماسک ابتدا در اوایل سپتامبر گفت که Grok 4.7 ظرف ده روز فرود میآید، سپس در اواسط سپتامبر اذعان کرد که این مدل به چند روز دیگر نیاز دارد. اکنون در حال ارسال است و GitHub در همان روز تأیید کرد که Grok 4.7 در GitHub Copilot در دسترس است.
تصویر معیار: قوی، نه فراگیر
دادههای محک منتشر شده توسط xAI مدلی را نشان میدهد که در چندین دستهبندی افق طولانی پیشرو است و در عین حال پشت سر گرانترین پیکربندی Anthropic در سایرین باقی میماند:
- CursorBench 4.0 که بر کارهای کدنویسی طولانیتر تاکید میکند: Grok 4.7 امتیاز 46.3% را کسب میکند، بالاتر از GPT-5.6 Sol Max (41.7%) و Grok 4.6 High (40.4%)، اما پس از Fable 5.1 Max (51.8%).
- Terminal-Bench 4.0، کار ترمینال چند ساعته: 38.0 درصد، نسبت به 20.3 درصد برای Grok 4.6 و درست جلوتر از GPT-5.6 Sol Max (37.3 درصد)، به شدت افزایش یافته است، اگرچه Fable 5.1 Max با 57.9 درصد پیشتاز است.
- EEBench، یک معیار مهندسی برق: 64.0٪، یک جهش بزرگ از Grok 4.6 53.0٪ و بالاترین مدل های لیست شده.
- DeepSWE نسخه 1.1: 71.0٪ در تلاش زیاد، در مقابل 65.2٪ برای Grok 4.6 و 72.7٪ برای GPT-5.6 Sol Max.
- AA Briefcase نسخه 1.1، کار اداری چند ساعته: 1,657، از 1,546 افزایش یافته و پس از Fable 5.1 Max در 1,678.
- معیار نماینده قانونی هاروی: 19.6٪، جلوتر از Grok 4.6 (15.8٪) و بسیار جلوتر از GPT-5.6 Sol Max (2.5٪) و Fable 5.1 Max (6.7٪) در این اندازه گیری.
- HealthBench Professional: 56.7٪، بهبود در Grok 4.6 48.5٪ اما پس از GPT-5.6 Sol Max (60.5٪) و Fable 5.1 Max (62.1٪).
در GDPval، معیار کار دانش حرفه ای که توسط Elo به ثمر رسیده است، نمودار xAI، Grok 4.7 را در 1695 قرار می دهد — از 1605 برای Grok 4.6، پس از Fable 5.1 Max (1735) و جلوتر از GPT-6 Astra Max (1542).
قیمت داستان است
تهاجمیترین ادعا در این اعلامیه به جای فنی، اقتصادی است: xAI Grok 4.7 را دو برابر سریعتر با نصف قیمت مدلهای قابل مقایسه توصیف میکند، و جدول قیمتگذاری منتشر شده از مقایسه تیتر با پیکربندیهای سطح بالای دو رقیب اصلی آن پشتیبانی میکند. قیمت توکن 2/6 دلاری Grok 4.7 نسبت به Grok 4.6 تغییری نکرده است، به این معنی که خریداران بدون افزایش قیمت، بهبود نسل بیش از نسل را دریافت می کنند.
این موقعیتیابی، استراتژیای را که xAI در خط Grok 4.x دنبال کرده است، گسترش میدهد: مطابقت یا نزدیک شدن به کیفیت مرزی در حالی که سطح قیمتگذاری برتر OpenAI و Anthropic را کاهش میدهد، سپس به طور تهاجمی از طریق شرکای مانند GitHub، Cursor و OpenRouter توزیع میشود.
چه چیزی را تماشا کنیم
هشدار صادقانه این است که xAI خود نمودار مقایسه را منتشر کرد و تأیید مستقل از جمعآوران معیار چند روز طول میکشد. در اعدادی که xAI برای برجسته کردن انتخاب کرد، Grok 4.7 یک گام واقعی نسبت به Grok 4.6 است - به وضوح در Terminal-Bench 4.0 و EEBench - اما Fable 5.1 Max را که پیشتازی را در معیارهای کدنویسی و سلامت حفظ میکند در حالی که هزینه خروجی آن پنج برابر بیشتر است، حفظ نمیکند.
برای توسعه دهندگانی که بارهای کاری طولانی مدت و چند ساعته را اجرا می کنند، ریاضیات قیمت-عملکرد ممکن است بیشتر از جایگاه خام امتیازات مهم باشد. Grok 4.7 اکنون از طریق API xAI و در GitHub Copilot در دسترس است.
از هوش مصنوعی جلوتر بمانید
برای پوشش مداوم مهمترین پیشرفتهای صنعت هوش مصنوعی، [AI Buzz Wire] (https://aibuzzwire.news) را نشانکگذاری کنید و هرگز یک داستان مهم را از دست ندهید.
اخبار هوش مصنوعی را بیشتر بخوانید