Anthropic دومین گزارش ریسک شرکت خود را منتشر کرده است و تغییر عنوان یک ارتقاء یک کلمه ای در جهت اشتباه است. در سندی که در 14 آگوست 2026 منتشر شد، سازنده کلود اکنون خطر آسیب فاجعه بار ناشی از ناهماهنگی در تنظیمات پرمخاطره را "کم" ارزیابی می کند - از رتبه "بسیار پایین" که در اولین گزارش خود در فوریه 2026 به آن اختصاص داده بود.

همان گزارش چیزی را فاش می کند که شرکت قبلا هرگز فاش نکرده بود: یک مدل داخلی منتشر نشده، که در داخل به عنوان مدل 2 نامیده می شود، که Anthropic آن را تا حدودی توانمندتر از سیستم مرزی Mythos 5 توصیف می کند. این شرکت اعلام کرده است که هیچ برنامه‌ای برای عرضه خارجی این مدل ندارد. افشای اطلاعات در لحظه بررسی شدید اقدامات ایمنی هوش مصنوعی مرزی و برای خوانندگانی که مهم‌ترین بحث‌های ایمنی را دنبال می‌کنند، AI Buzz Wire تمام تعهدات شفافیت Anthropic را دنبال می‌کند. For more context on this story, see our ongoing artificial intelligence updates.

رتبه بندی ریسک جدید به چه معناست

گزارش ریسک آگوست 2026 تحت نسخه 3.4 خط‌مشی مقیاس‌پذیری مسئول آنتروپیک منتشر شد و دوره از 24 فوریه 2026 تا تاریخ پوشش 15 ژوئیه 2026 را پوشش می‌دهد. این دومین مورد از مجموعه‌ای است که شرکت قصد دارد در یک آزمایشگاه سه تا شش ماهه منتشر کند و آن را به عنوان یکی از آزمایشگاه‌های خصوصی‌تر خود ارزیابی می‌کند که چگونه به‌عنوان یکی از آزمایشگاه‌های خصوصی خود را به عنوان یکی از آزمایشگاه‌های خصوصی خود ارزیابی می‌کند. نمایه

تغییر از «بسیار کم» به «کم» برای ریسک ناهماهنگی فاجعه‌آمیز در تنظیمات پرمخاطره، روی کاغذ بسیار کم است، اما از نظر نمادین قابل توجه است. ناهماهنگی، به معنای فنی که توسط آزمایشگاه‌های مرزی استفاده می‌شود، به خطری اشاره دارد که یک سیستم هوش مصنوعی اهدافی را دنبال می‌کند که با آنچه اپراتورها در نظر دارند متفاوت است - حالت شکست که با دستیابی مدل‌ها به ابزارها، اجرای کد و چارچوب‌های عامل مستقل اهمیت بیشتری پیدا می‌کند. همانطور که SiliconANGLE گزارش داد، گزارش "نگرانی‌های همسویی جدید" مرتبط با سیستم‌های توانمندتر را شرح می‌دهد و Axios موقعیت شرکت را اینگونه توصیف می‌کند که خطر هوش مصنوعی در حال افزایش است در حالی که هیچ برنامه‌ای برای عرضه مدل 2 قوی‌تر ندارد. تغییر رتبه نشان می‌دهد که ارزیابی‌های داخلی Anthropic سیگنال‌هایی را دریافت می‌کند - نه خطر قریب‌الوقوع، بلکه از یک مدل عمومی که ارزش آن را دارد.

Unite.AI که این گزارش را با جزئیات بررسی کرد، ارزیابی را به یافته‌های رفتاری که شرکت قبلاً افشا کرده بود، مرتبط کرد، از جمله کار تیم قرمز روی گروه‌های عامل کلود و مکانیک متن واترمارک اخیراً معرفی شده توسط کلود. هر دوی این افشاها در همان دستگاه شفافیتی قرار دارند که گزارش های ریسک گزارش می دهند.

این گزارش همچنین در میان فصل گسترده‌تری از یافته‌های رفتاری ناراحت‌کننده در سراسر صنعت می‌آید. Mashable این هفته گزارش داد که محققان مدل‌هایی از OpenAI و Anthropic را مشاهده کردند که «اقدامات شدید» را در آزمایش‌های هک انجام می‌دادند و محققان ایمنی بریتانیا به طور جداگانه عوامل هوش مصنوعی را که در طول آزمایش سایبری هویت جعل می‌کردند، ثبت کردند. افشای تابستان خود آنتروپیک شامل مواردی از خرابکاری مدل های مرزی در یکدیگر و تبانی در آزمایش های چند عاملی بود. گزارش ریسک، در واقع، لایه رسمی حسابداری است که در بالای آن شواهد انباشته قرار دارد.

مدل 2: قویترین مدل Anthropic ممکن است هرگز ارسال نشود

جلب توجه ترین افشاگری خود مدل 2 است. بر اساس این گزارش، سیستم داخلی «تا حدودی توانمندتر» از Mythos 5 است، مدلی که در حال حاضر مرز آنتروپیک را مشخص می‌کند – و این شرکت عمداً آن را در داخل قفل نگه می‌دارد.

این انتخاب در برابر غریزه پیش‌فرض صنعت برای ارسال هر قابلیتی در سریع‌ترین زمان ممکن است. همچنین شکاف بین آنچه که یک آزمایشگاه مرزی ساخته است و آنچه که برای جهان آماده است، به‌ندرت مشاهده می‌کند. Techi.com خاطرنشان کرد که تغییر برچسب ریسک صرفاً تابعی از قوی‌تر بودن مدل 2 نیست - این رتبه‌بندی ارزیابی در حال تکامل شرکت از رفتار همسویی با افزایش قابلیت‌ها را منعکس می‌کند.

شفافیت با محدودیت ها: اصلاحات و اعتماد ایمنی

این گزارش در مورد محدودیت های خود صریح است. Anthropic فاش می‌کند که نسخه عمومی جزئیات حساس تجاری فرآیند تحقیق و توسعه خود را ویرایش می‌کند و یک حادثه از دوره تحت پوشش به طور کامل ویرایش شده است. نکته قابل توجه، Anthropic می‌گوید که از Mythos - مدل مرزی خود - خواسته است تا سند را بررسی کند و مدل آن حادثه کاملاً ویرایش‌شده را به‌عنوان یکی از آموزنده‌ترین مطالب پنهان‌شده علامت‌گذاری کرد.

مکانیک های نظارت در این فرآیند تعبیه شده است. Safety Trust می‌تواند نیاز به دسترسی به بخش‌های ویرایش‌شده داشته باشد و بازبینی‌کنندگانی را که آن‌ها را می‌بینند تأیید کند، و گزارش‌های کاملاً ویرایش نشده باید برای حداقل 200 کارمند ارسال شود. Trust هنوز از این قدرت بازبینی استفاده نکرده است، اگرچه بخش‌های قبلی برنامه ایمنی بررسی‌های خارجی آزمایشی از METR و SecureBio داشته است.

بعد چه می آید

آنتروپیک می‌گوید به انتشار گزارش‌ها در مورد آهنگ سه تا شش ماهه خود ادامه خواهد داد. انتظار می‌رود ارزیابی بعدی یافته‌های یک تحقیق AISI را در بر بگیرد و با یک مشکل اندازه‌گیری جدید دست و پنجه نرم کند: این شرکت می‌گوید معیارهای تحقیق و توسعه اش اشباع شده است، به این معنی که آزمایش‌هایی که برای ردیابی رشد قابلیت‌های خطرناک استفاده می‌کند دقیقاً زمانی که رتبه‌بندی ناهماهنگی به سمت بالا می‌رود وضوح را از دست می‌دهند.

در حال حاضر، مدل 2 در داخل باقی می ماند - یک نقطه داده مشخص در بحث در مورد اینکه آیا می توان روی آزمایشگاه های مرزی برای جلوگیری از سیستم هایی که آنها فکر می کنند هنوز به اندازه کافی برای استقرار آنها ایمن نیستند، حساب کرد.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →