Згідно з новим тестом безпеки некомерційної організації FAR.AI, моделі Frontier AI дуже відрізняються за тим, наскільки важко їх зламати, і розрив набагато більший, ніж багато хто припускав.
29 липня FAR.AI запустив свою таблицю лідерів безпеки штучного інтелекту, перевіряючи захист чотирьох провідних моделей за однакових умов. Claude Fable 5 від Anthropic і GPT-5.6 Sol від OpenAI стійко протистояли атакам, тоді як Grok 4.5 від xAI і Gemini 3.1 Pro від Google зламалися на суму менше 300 доларів, повідомляє організація. FAR.AI описав різницю між найбільш і найменш надійними моделями як «стократний розрив» у гарантіях. For more context on this story, see our ongoing AI trends.
Поряд із таблицею лідерів FAR.AI представив те, що він називає мінімальним стандартом захисту, спільною базовою лінією безпеки, повністю зібраною із засобів захисту, які однорангові розробники вже використовують у виробництві. Мета полягає в тому, щоб дати лабораторіям бетонну підлогу — і зробити видимими слабкі засоби захисту.
Висновки повторюють попередні стрес-тести FAR.AI. У травневому звіті було виявлено, що засоби захисту DeepSeek-V4-Pro «майже повністю зруйновані», а зловмисники з низькими навичками обходять механізми безпеки в 98–100% випадків у кожному тестованому домені. Загальнодоступний джейлбрейк, створений для попередника моделі, працював без жодної зміни, що свідчить про те, що відомі вразливості не виправлені.
WIRED, звітуючи про таблицю лідерів, дійшов висновку, що все ще «страшно легко зламати деякі передові моделі ШІ». Оскільки агенти беруться за більш чутливі завдання, невідповідність викликає гострі питання про те, які системи безпечні для розгортання.
Читачі можуть стежити за AI Buzz Wire, щоб постійно висвітлювати дослідження безпеки та безпеки ШІ.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →