Frontier AI-modellen verschillen enorm in hoe moeilijk ze te doorbreken zijn, volgens een nieuwe benchmark van veiligheidsnon-profitorganisatie FAR.AI – en de kloof is veel groter dan velen dachten.

Op 29 juli lanceerde FAR.AI zijn AI Security Leaderboard, waarbij de veiligheidsmaatregelen van vier toonaangevende modellen onder identieke omstandigheden werden getest. Claude Fable 5 van Anthropic en GPT-5.6 Sol van OpenAI hielden stand tegen de aanvallen, terwijl Grok 4.5 van xAI en Gemini 3.1 Pro van Google elk voor minder dan $ 300 kapot gingen, aldus de organisatie. FAR.AI beschreef het verschil tussen de meest en de minst robuuste modellen als een “honderdvoudige kloof” in de veiligheidsmaatregelen. Voor meer context over dit verhaal, zie ons AI-trends.

Naast het klassement introduceerde FAR.AI wat zij de Minimal Standard for Safeguards noemt, een gedeelde beveiligingsbasislijn die volledig is samengesteld uit verdedigingen die peer-ontwikkelaars al in productie gebruiken. Het doel is om laboratoria een betonnen vloer te geven waar ze aan kunnen voldoen – en zwakke bescherming zichtbaar te maken.

De bevindingen weerspiegelen de eerdere stresstests van FAR.AI. Uit een rapport uit mei bleek dat de beveiligingen van DeepSeek-V4-Pro "bijna volledig waren ingestort", waarbij laaggeschoolde aanvallers in elk getest domein 98-100% van de tijd veiligheidsmechanismen omzeilden. Een openbaar beschikbare jailbreak die voor de voorganger van het model was gebouwd, werkte zonder enige wijziging, wat erop wijst dat bekende kwetsbaarheden niet zijn gepatcht.

WIRED, dat op het scorebord rapporteerde, concludeerde dat het "beangstigend eenvoudig blijft om sommige grensverleggende AI-modellen te jailbreaken." Naarmate agenten gevoeligere taken op zich nemen, roept de ongelijkheid prangende vragen op over welke systemen veilig kunnen worden ingezet.

Voor voortdurende berichtgeving over AI-veiligheids- en beveiligingsonderzoek kunnen lezers AI Buzz Wire volgen.

---

Blijf Voorop met AI

Het laatste AI-nieuws, analyses en doorbraken — allemaal op één plek.

Lees meer AI-nieuws →