Modely Frontier AI se velmi liší v tom, jak těžké je prolomit, podle nového měřítka od bezpečnostní neziskové organizace FAR.AI – a rozdíl je mnohem větší, než mnozí předpokládali.

29. července FAR.AI spustila svůj žebříček AI Security Leaderboard, testující zabezpečení čtyř předních modelů za stejných podmínek. Claude Fable 5 od Anthropic a GPT-5.6 Sol od OpenAI obstály proti útokům, zatímco Grok 4.5 od xAI a Gemini 3.1 Pro od Googlu se zlomily za méně než 300 dolarů, uvedla organizace. FAR.AI popsal rozdíl mezi nejvíce a nejméně robustními modely jako „stonásobnou mezeru“ v zabezpečení. For more context on this story, see our ongoing AI news.

Vedle žebříčku FAR.AI představila to, co nazývá Minimální standard pro Safeguards, sdílenou bezpečnostní základní linii sestavenou výhradně z obran, které již vývojáři používají ve výrobě. Cílem je poskytnout laboratořím betonovou podlahu, aby se mohly setkat – a zviditelnit slabé ochrany.

Zjištění odrážejí dřívější zátěžové testy FAR.AI. Květnová zpráva zjistila, že ochrany DeepSeek-V4-Pro se „téměř úplně zhroutily“, přičemž útočníci s nízkou kvalifikací obcházeli bezpečnostní mechanismy v 98–100 % případů ve všech testovaných doménách. Veřejně dostupný útěk z vězení vytvořený pro předchůdce modelu fungoval bez jediné úpravy, což naznačuje, že známé zranitelnosti byly neopraveny.

WIRED, hlásící se na žebříčku, dospěl k závěru, že je stále „děsivě snadné útěk z vězení na některé hraniční modely umělé inteligence“. Jak agenti přebírají citlivější úkoly, tento rozdíl vyvolává naléhavé otázky ohledně toho, které systémy je bezpečné nasadit.

Pro nepřetržité pokrytí výzkumu bezpečnosti a zabezpečení AI mohou čtenáři sledovat AI Buzz Wire.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →