Modelele de frontieră AI diferă enorm în ceea ce privește cât de greu sunt de spart, conform unui nou standard de referință de la FAR.AI, organizația nonprofit de siguranță, iar decalajul este mult mai mare decât presupun mulți.

Pe 29 iulie, FAR.AI și-a lansat AI Security Leaderboard, testând garanțiile a patru modele de top în condiții identice. Claude Fable 5 de la Anthropic și GPT-5.6 Sol de la OpenAI au ținut ferm împotriva atacurilor, în timp ce Grok 4.5 de la xAI și Gemini 3.1 Pro de la Google s-au spart fiecare pentru sub 300 de dolari, a spus organizația. FAR.AI a descris diferența dintre cele mai robuste și cele mai puțin robuste modele ca un „decalaj de sută de ori” în garanții. For more context on this story, see our ongoing AI industry coverage.

Alături de clasament, FAR.AI a introdus ceea ce el numește Standardul minim pentru garanții, o linie de bază de securitate partajată asamblată în întregime din apărările pe care dezvoltatorii de la egal la egal le rulează deja în producție. Scopul este de a oferi laboratoarelor o podea de beton pe care să o întâlnească - și de a face vizibile protecțiile slabe.

Descoperirile reflectă testele de stres anterioare ale FAR.AI. Un raport din mai a constatat că măsurile de protecție ale DeepSeek-V4-Pro „s-au prăbușit aproape complet”, atacatorii cu competențe reduse ocolind mecanismele de siguranță 98-100% din timp în fiecare domeniu testat. Un jailbreak disponibil public creat pentru predecesorul modelului a funcționat fără nicio modificare, ceea ce sugerează că vulnerabilitățile cunoscute nu au fost corectate.

WIRED, raportând pe clasament, a concluzionat că rămâne „înspăimântător de ușor să faci jailbreak unor modele AI de frontieră”. Pe măsură ce agenții preiau sarcini mai sensibile, disparitatea ridică întrebări stringente cu privire la sistemele care pot fi implementate în siguranță.

Pentru o acoperire continuă a cercetării privind siguranța și securitatea AI, cititorii pot urma AI Buzz Wire.

---

Stay Ahead of AI

Get the latest AI news, analysis, and breakthroughs — all in one place.

Read more AI news →