Anthropic tillkännagav på tisdagen en stor utökning av sina säkerhetsfokuserade modellåtkomstinsatser, och omstrukturerade sitt initiativ för besiktad åtkomst till ett formellt cyberverifieringsprogram (CVP) med tre distinkta nivåer för cybersäkerhetsproffs. Flytten kommer när företaget avslöjade att dess Project Glasswing-initiativ har avslöjat minst 129 000 verifierade mjukvaruproblem sedan april.
Det omstrukturerade programmet tillåter kontrollerade säkerhetsteam att köra Anthropics mest kapabla modeller – inklusive Claude Opus 5.5, Claude Sonnet 5.5 och Claude Mythos 5.1 – med minskade säkerhetsåtgärder och blockerande klassificerare, behörigheter som normalt inte är tillgängliga för allmänna användare. Enligt Anthropic är målet att sätta frontier AI-kapacitet i händerna på försvarare innan illvilliga aktörer beväpnar samma verktyg. For more context on this story, see our ongoing breaking AI news.
Tre åtkomstnivåer, tre hotscenarier
Det nya programmet är organiserat kring tre åtkomstnivåer, var och en skräddarsydd för olika typer av säkerhetsarbete:
- Defense Access täcker defensiva operationer som incidentrespons, malware reverse engineering och sårbarhetsanalys och validering.
- Red Team Access lägger till auktoriserad penetrationstestning och red-teaming till de defensiva användningsfallen, vilket möjliggör simulerade attacker mot system som organisationer har tillstånd att testa.
- Specialiserad åtkomst har de minsta säkerhetsåtgärderna och är reserverad för en begränsad uppsättning verifierade organisationer som är auktoriserade att själva testa AI-säkerhetssystem.
Organisationer och individuella säkerhetsteam ansöker om den nivå som matchar deras arbete, och Anthropic granskar varje ansökan innan de beviljar åtkomst. Företaget sa att alla tre nivåerna inkluderar tillgång till dess nuvarande flaggskeppsmodeller såväl som nya modeller som släpps framöver.
Säkerhetsåtgärder biter fortfarande — Selektivt
Anthropic parade tillkännagivandet med utvärderingsdata för att visa att nivåsystemet skiljer godartat defensivt arbete från genuint farlig förmåga. I en CyScenarioBench-utvärdering av Claude Opus 5.5 rapporterade företaget att säkerhetsåtgärder blockerade 46 av 50 uppgifter i Defence Access-nivån. I Red Team Access-nivån på samma modell blockerades ingen av uppgifterna, och modellen slutförde 34 av 50 — samma slutförandegrad som registrerades när inga skyddsåtgärder tillämpades alls.
Däremot, utan CVP-åtkomst, blockerades varje uppgift vid den första prompten, enligt Anthropic.
"Dessa utvärderingar ger oss förtroende för att vi kan göra avancerade cyberfunktioner säkert tillgängliga för en bredare uppsättning försvarare, vilket utökar de defensiva ansträngningar vi påbörjade med Project Glasswing", sa företaget i sitt tillkännagivande, som rapporterades brett av The Hacker News, Reuters och SecurityWeek.
Designen återspeglar en satsning på att det mesta defensiva säkerhetsarbetet - patchning, logganalys, triage av skadlig programvara - kan fortsätta under strikta skyddsräcken, medan legitima offensiva tester behöver en bredare korridor. Det speglar också hur säkerhetsindustrin länge har hanterat verktyg med dubbla användningsområden: vet läkaren, inte bara verktyget.
Glasswings expanderande fotavtryck
Programexpansionen är tätt kopplad till Project Glasswing, Anthropics initiativ att tillämpa sina modeller för att härda kritisk programvara. Företaget sa att Glasswing upptäckte minst 129 000 verifierade sårbarheter i mjukvaran mellan april och juli 2026, och ytterligare 5 500 verifierade sårbarheter mellan april och oktober genom skanning med öppen källkod.
Av de verifierade sårbarheterna har mer än 33 000 hittills bedömts som kritiska eller hög svårighetsgrad – en siffra som Anthropic beskriver som sannolikt en betydande underräkning, eftersom den bygger på undersökningsdata från endast en delmängd av Glasswing-partners. Företaget uppskattar att den verkliga effekten kan vara minst fem gånger högre.
En uppmätt bild av AI-driven sårbarhetsupptäckt
Oberoende analys tyder på att floden av AI-funna brister inte direkt översätts till en matchande våg av utnyttjade intrång. I en analys som publicerades i slutet av förra månaden fann VulnCheck-forskaren Patrick Garrity att endast 2 av de 300 sårbarheter som upptäckts av Anthropic eller Project Glasswing - ungefär 0,67 procent - har utnyttjats i naturen.
De två utnyttjade bristerna är CVE-2026-26980, en SQL-injektionssårbarhet i Ghost CMS, och CVE-2026-61500, en sessionsförfalskning i Rejetto HTTP File Server. Uppgifterna stöder en nyans som säkerhetsforskare har betonat: AI sänker barriären för upptäckt av sårbarheter, men de flesta av bristerna som den upptäcker fanns aldrig på angriparnas radar.
Tillkännagivandet landar också mitt i en bredare debatt om AI-genererat säkerhetsarbete. Forskning från 1Password och Veracode har visat att AI-skrivna sårbarhetskorrigeringar själva kan introducera nya brister, vilket understryker att automatisering hjälper men inte ersätter mänsklig verifiering.
Vad det betyder för säkerhetsbranschen
För säkerhetsteam sänker CVP aktiveringsenergin för att använda frontier-modeller på riktigt defensivt arbete. Incident responders får en sanktionerad väg till analys av skadlig programvara; penetrationstestare får en styrd miljö för AI-assisterade attacker; och den lilla uppsättningen organisationer som själva granskar AI-säkerhetssystem får den minst begränsade åtkomsten.
För Anthropic är programmet både en säkerhetsstrategi och en kommersiell. Det konkretiserar företagets ståndpunkt att kraftfulla cyberfunktioner bör släppas medvetet, till granskade försvarare, snarare än att undertryckas helt – en kontrast till rivaler som har ställts inför granskning av modeller med svagare cyberkontroller. Det fördjupar också Anthropics relationer med de företag som mest sannolikt kommer att betala för gränsmodellaccess: regeringar, operatörer av kritisk infrastruktur och stora säkerhetsleverantörer.
Företaget tillkännagav inte prisändringar kopplade till programmet, och ansökningar behandlas genom Anthropics befintliga kanaler för besiktigad åtkomst. Med tanke på omfattningen av vad Glasswing redan har dykt upp - och företagets eget medgivande att siffrorna sannolikt underskattar verkligheten - kommer säkerhetsbranschen att se hur många av dessa 129 000 fynd som fixas innan angriparna hittar dem först.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →