Anthropic har publicerat forskning som visar att automatiserade AI-system på ett tillförlitligt sätt kan reparera en modells inriktningsfel, ett resultat som kan omforma hur säkerhetsarbetet i centrum av AI-industrin går till. Uppsatsen, med titeln "Automatiserade forskare kan på ett tillförlitligt sätt mildra Alignment Failures", släpptes på fredagen och detaljerades av TechCrunch.
Forskningen kommer från Anthropics stipendiatersprogram och leddes av Chen Yueh-Han. Dess centrala påstående är slående: när företagets automatiserade forskningssystem pekade på tio riktmärken som mätte specifika felaktiga beteenden, förbättrade de prestandan på varenda en – utan att försämra modellens övergripande kapacitet. För ett område som har kämpat för att hålla säkerhetsarbetet i takt med modellskala är det ett anmärkningsvärt resultat. For more context on this story, see our ongoing breaking AI news.
Berättelsen landade under en hektisk sträcka för AI-säkerhetstäckning. Det följer en sommar där agentiskt missbeteende har dominerat rubrikerna, från OpenAI:s interna rapport om belöningshackande agenter till uppmaningar till oberoende utredningar av kramningen av Hugging Face. Anthropics nya papper närmar sig problemet från motsatt håll: istället för att fråga hur agenter missköter sig, frågar den om andra agenter kan lita på att fixa dem.
Vad tidningen faktiskt rapporterar
Systemet som beskrivs i artikeln kallas en Automated Alignment Researcher, eller AAR. Istället för att ersätta forskningsprocessen, replikerar AAR mycket av det: varje automatiserat system söker igenom tillgänglig litteratur, föreslår en metod och tränar modellen med den metoden i ungefär 30 minuter. Processen upprepas sedan över flera iterationer.
Urvalsmekanismen är enkel. Metoder som flyttar riktmärket bevaras; metoder som inte gör det kasseras. Den slingan låter systemet fungera snabbt och i en skala som inget mänskligt team kan matcha, testar många forskningsriktningar parallellt och behåller bara det som fungerar.
Enligt tidningen var resultaten konsekventa över hela linjen. På alla tio riktmärken som täcker specifika felaktiga beteenden, producerade de automatiserade systemen mätbara förbättringar utan att skada den övergripande modellens prestanda – den vanliga avvägningen som gör anpassningsarbetet svårt.
"Sammantaget ger dessa resultat tidiga bevis för att automatiserad anpassning efter träning kan bli praktiskt på kort sikt", står det i tidningen.
Beating the Humans, till 1/37:e kostnaden
De mest citerade avsnitten i tidningen är de där den jämför AAR direkt med dess mänskliga motsvarigheter. Anthropic säkrade inte jämförelsen.
"Den bästa AAR-metoden slår vad erfarna människor föreslår, i genomsnitt inom sex timmar", står det i tidningen. Den tillägger, påpekat, att "mänsklig vägledda forskningsriktningar inte leder till starkare prestationer."
Ekonomin är lika trubbig. "En AAR kostar ungefär $4 per timme i API-slutledning mot $150 per timme vi betalar våra mänskliga forskare", skriver författarna. Det är en kostnadsskillnad på nästan 40 gånger, och det förklarar varför labb tar automatiserad forskning på allvar som mer än en kuriosa.
Varför kostnadsgapet är viktigt
Anpassningsforskning är dyrt på ett sätt som är lätt att underskatta. Varje kandidatinsats måste implementeras, tränas och utvärderas mot riktmärken, och de flesta kandidater misslyckas. Om ett system kan köra den sökslingan kontinuerligt för priset av API-anrop, närmar sig marginalkostnaden för att prova ytterligare en idé noll. Begränsningen skiftar från antal anställda till beräkning.
The Limitations Anthropic Itself Flagged
Tidningen är uppriktig om vad resultatet inte slår fast. Det automatiserade systemet fungerar bara i den mån riktmärkena faktiskt återspeglar anpassningsmålen som betyder något - och att bygga och underhålla riktmärken som fångar upp felaktigt beteende i verkligheten är fortfarande ett öppet problem i fältet.
Det finns också ett beroende som är lätt att missa: de automatiserade forskarna bygger på en befintlig metodlitteratur. Att upprätthålla och utöka den litteraturen är i sig ett betydande arbete, och ett system som bara remixar kända tekniker kan slå ett tak som mänsklig kreativitet inte skulle göra.
Dessa varningar spelar roll eftersom forskningens långsiktiga betydelse beror på dem. Om riktmärkena mäter fel saker kan en AAR optimera sin väg till starka siffror samtidigt som de underliggande riskerna förblir orörda. Anthropics inramning - "tidiga bevis", inte en lösning - speglar den osäkerheten.
Ett steg mot rekursiv självförbättring
Tidningen matar också en större debatt om rekursiv självförbättring, tanken att AI-system så småningom skulle kunna förbättra själva träningsprocesserna som producerar dem. Att träna AI-modeller med andra AI-modeller har blivit ett populärt mål för frontier labs, och Anthropics resultat är en tidig, konkret titt på hur det ser ut i en smal domän.
Logiken är okomplicerad. Om modeller på ett tillförlitligt sätt kan förbättra sin egen inriktningsträning, skulle samma maskineri troligen kunna riktas mot träningsmetoder mer allmänt – kapacitetsarbete inkluderat. TechCrunch noterar implikationen att mänskliga AI-forskare så småningom kan bli mindre centrala i processen, en möjlighet som tidningen själv engagerar sig i snarare än att undvika.
Vad du ska titta på härnäst
Tre frågor kommer att avgöra om detta resultat generaliserar. För det första, om tillvägagångssättet håller utanför de tio riktmärken som Anthropic testade, på fellägen som är stökigare och mindre väldefinierade. För det andra, om benchmark-underhållsproblemet kan lösas tillräckligt snabbt för att hålla automatiserad forskning ärlig. För det tredje, om andra laboratorier publicerar jämförbara resultat, vilket skulle förvandla ett enda dokument till en branschriktning.
För tillfället är upptäckten snäv men verklig: på de specifika anpassningsuppgifterna som Antropiskt testade, överträffade automatiserade forskare erfarna människor, snabbare och mycket billigare. Säkerhetssidan av AI-industrin kan vara det första stället där AI-forskare – inte mänskliga – gör det mesta av arbetet.
---
Stay Ahead of AIGet the latest AI news, analysis, and breakthroughs — all in one place.
Read more AI news →
