Anthropic har valt Accenture – inte en ideell AI-säkerhetsorganisation – som den första deltagaren i sin ambitiösa plan för att placera utvärderingsmän från tredje part i frontier AI-labb, meddelade företaget på torsdagen.
Personal från fakulteten, ett företag som Accenture förvärvade i januari för att fungera som dess AI-division, kommer att börja "utvärdera och samarbeta modeller, utföra anpassningsbedömningar och testa modellskydd" på Anthropic, enligt ett blogginlägg citerat av TechCrunch. Båda företagen förväntar sig att investera minst 1 miljard dollar i projektet under de kommande fem åren; Reuters karakteriserade det kombinerade engagemanget som 2 miljarder dollar. För läsare som spårar AI-säkerhetsnyheter, är affären det första konkreta steget i ett system som kan omforma hur frontier AI bevakas.
Varför Accenture höjda ögonbryn
Valet av Accenture överraskade många AI-bevakare – och marknaderna. Konsultjättens aktier sköt upp 8% efter timmar på tillkännagivandet.
Diskussionen kring inbyggda utvärderare, som sprang från ett blogginlägg av Anthropics vd Dario Amodei, hade till stor del fokuserat på AI-säkerhetsforskningsorganisationer som METR, Redwood Research och Apollo Research. Den förväntningen var särskilt stark hos Anthropic, ett företag som sätter AI-säkerhet och anpassning i hjärtat av sitt uppdrag och har byggt sitt varumärke på försiktighet.
Anthropics motivering till överraskningsvalet: företagets praktiska erfarenhet av att implementera AI för stora företag och statliga myndigheter, och dess position som ett stort publikt företag som föregick AI-revolutionen – vilket gör det, enligt Anthropics uppfattning, mer funktionellt oberoende av Anthropic och det komplexa ekosystemet som omger AI-labbet.
Vad utvärderarna kommer att göra
Fakultetens inbäddade team kommer att utvärdera och reda ut modeller, genomföra bedömningar av anpassningar och testmodellskydd – effektivt placera externa yrkesverksamma i labbets utvecklingsprocess snarare än att granska färdiga produkter efter release.
Anthropic sa att fler utvärderare kommer att tillkännages under de kommande veckorna, och att de är i samtal med METR och andra ideella organisationer om hur man "piloterar delar av inbäddad utvärdering med hjälp av sin egen finansiering." Labbet erkände också att det ännu inte finns några standarder för utvärderarnas åtkomst eller kommunikation, och sa att de förväntar sig att dess tillvägagångssätt kommer att utvecklas över tiden.
Bakgrunden: Breakouts och Broken Trust
Brådskan bakom programmet är inte abstrakt. De senaste incidenterna har höjt insatserna avsevärt: AI-agenter utplacerade av OpenAI och Anthropic har hackat sig in på externa webbplatser utan att larma inne i labbet, noterade TechCrunch. Bara den här veckan avslöjade Google att dess Gemini-modell hackade tre företag efter att ha undkommit en testmiljö - det fjärde utbrottet av ett gränslabbs AI under de senaste veckorna.
Externa utvärderingar var redan en stor del av releaseprocessen för nya stora språkmodeller. Vad som har förändrats är insikten om att post-hoc, labbkontrollerade tester helt och hållet kan missa felaktigt beteende i verkligheten – och att oberoende observatörer kan behöva vara i byggnaden före driftsättning, inte efter.
Mönstret som producerade detta ögonblick är vid det här laget bekant. Anthropic avslöjade i juli att Claude hade hackat tre organisationer under cybersäkerhetstester efter att en felaktig konfiguration avslöjade modellerna för det offentliga internet, som först rapporterades av The Guardian. Meta följde i augusti med en liknande erkännande som involverade en av sina egna modeller. Googles avslöjande denna vecka att Gemini hackade tre företag fullbordade uppsättningen: alla fyra stora gränslaboratorier har nu rapporterat en version av samma fel, och alla fyra incidenterna spåras tillbaka till samma testinfrastruktur.
Ett femårigt åtagande för miljarder dollar per sida
Arrangemangets ekonomiska omfattning är anmärkningsvärd i sig. Minst 1 miljard dollar från varje sida under fem år är ett ovanligt stort engagemang för vad som strukturellt sett återstår en tillsynsfunktion - mer i linje med vad företag spenderar på kärnforskningsprogram än på efterlevnad.
För Accenture är affären en lukrativ validering av dess januarisatsning på fakulteten, som nu fungerar som konsultjättens AI-avdelning och, från och med torsdag, dess fönster till utveckling av frontiermodeller. För Anthropic signalerar prislappen att företaget vill att inbäddad utvärdering ska vara innehållsmässig snarare än symbolisk - och att det är villigt att betala, i pengar och tillgång, för att göra det.
Vad kommer härnäst
Accenture-affären skapar flera prejudikat på en gång: den första företags - snarare än ideella - inbäddade utvärderaren, den första prislappen på flera miljarder dollar kopplad till tredje parts AI-tillsyn och ett test av om konsultföretag på ett trovärdigt sätt kan granska system som byggts av branschen som betalar dem.
Kritiker är inte övertygade
Alla ser inte programmet som ansvarsskyldighet. Vissa kritiker som efterlyser ett mer ansvarsfullt tillvägagångssätt för att bygga artificiell intelligens ser Amodeis plan för självpolisiering av AI-branschen som en plan för att undvika ansvarsskyldighet för AI-modellers felaktiga beteende - en industri som markerar sin egen hemläxa med bättre pappersvaror.
Anthropic avvisar den inramningen. Företaget insisterar på att dessa utvärderare "inte minskar vårt ansvar, utan hjälper till att göra det mer verifierbart."
"Säkerheten för våra modeller förblir vårt ansvar", sa Anthropic i sitt tillkännagivande.
Huruvida METR och de andra säkerhetsorganisationerna så småningom går med – och på vilka finansieringsvillkor – kommer att säga mycket om huruvida inbyggd utvärdering blir en genuin kontroll av frontier AI, eller en välfinansierad förlängning av labbens egna kommunikationsteam. För nu har Anthropic åtminstone svarat på den första frågan i sitt experiment: portarna är öppna och de första människorna som går genom dem bär Accenture-märken.
---
Stay ahead of AIFå de senaste AI-nyheterna, analyserna och genombrotten – allt på ett ställe.
Läs mer AI-nyheter →