Frontier AI-modeller skiljer sig mycket åt i hur svåra de är att bryta, enligt ett nytt riktmärke från säkerhetsorganisationen FAR.AI – och klyftan är mycket större än vad många antog.
Den 29 juli lanserade FAR.AI sin AI Security Leaderboard, och testade skydden för fyra ledande modeller under identiska förhållanden. Anthropics Claude Fable 5 och OpenAI:s GPT-5.6 Sol höll fast mot attackerna, medan xAI:s Grok 4.5 och Googles Gemini 3.1 Pro vardera gick sönder för under $300, sa organisationen. FAR.AI beskrev skillnaden mellan de mest och minst robusta modellerna som en "hundrafaldig lucka" i skyddsåtgärder. For more context on this story, see our ongoing AI industry coverage.
Vid sidan av topplistan introducerade FAR.AI vad den kallar Minimal Standard for Safeguards, en delad säkerhetsbas som helt och hållet är sammansatt av försvar som peer-utvecklare redan kör i produktion. Målet är att ge labbet ett betonggolv att möta – och att synliggöra svaga skydd.
Fynden återspeglar FAR.AI:s tidigare stresstester. En rapport från maj fann att DeepSeek-V4-Pros skydd hade "kollapserat nästan fullständigt", med lågkompetens angripare som kringgick säkerhetsmekanismer 98–100 % av tiden över alla testade domäner. Ett offentligt tillgängligt jailbreak byggt för modellens föregångare fungerade utan en enda modifiering, vilket tyder på att kända sårbarheter inte åtgärdades.
WIRED, som rapporterade på topplistan, drog slutsatsen att det fortfarande är "skrämmande lätt att jailbreaka vissa frontier AI-modeller." När agenter tar på sig mer känsliga uppgifter väcker skillnaden pressande frågor om vilka system som är säkra att distribuera.
För kontinuerlig bevakning av AI-säkerhets- och säkerhetsforskning kan läsarna följa AI Buzz Wire.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →