Anthropic ha lanciato OSS Scanner, un servizio opt-in gratuito che utilizza i modelli di intelligenza artificiale più potenti dell'azienda, tra cui Claude Mythos, per scansionare periodicamente progetti open source idonei alla ricerca di vulnerabilità di sicurezza e fornire report di bug completamente generati dal modello direttamente ai manutentori.

Il servizio, annunciato mercoledì in un post sul blog aziendale, è il prodotto di un cambiamento silenzioso nel lavoro di sicurezza di Anthropic: i suoi modelli hanno recentemente scoperto le vulnerabilità più velocemente di quanto il team di sicurezza di Anthropic possa verificarle. Per gli sviluppatori che monitorano gli strumenti che rimodellano la sicurezza del software, il lancio rappresenta un momento significativo per la nostra copertura degli sviluppi dell'intelligenza artificiale nell'infrastruttura open source.

Dal progetto Glasswing a un servizio pubblico

OSS Scanner si basa sull'esperienza di Anthropic nell'utilizzo di Claude per individuare le vulnerabilità durante Project Glasswing, lo sforzo interno di scoperta delle vulnerabilità dell'azienda. I numeri di quel lavoro spiegano perché Anthropic sta aprendo il gasdotto al pubblico.

Negli ultimi sei mesi, Anthropic afferma che i suoi ultimi modelli hanno fatto emergere più di 29.000 vulnerabilità candidate in alcuni dei progetti software più importanti del mondo, ma l'azienda è stata in grado di esaminarne e valutarne manualmente solo circa 6.000. La capacità di validazione umana, non la capacità di modello, è diventata il collo di bottiglia.

Il lato della domanda racconta una storia simile. Rapporti di Anthropic secondo cui i manutentori che ricevono i primi report chiedono sempre più spesso tutto ciò che l'azienda ha: quasi 5.000 report sono già stati inviati direttamente ai manutentori che hanno richiesto l'invio in blocco di risultati non verificati, patch incluse.

Il contesto delle capacità è desolante. Su CyberGym, un benchmark accademico per l’individuazione delle vulnerabilità, i modelli linguistici di grandi dimensioni sono passati dal rilevamento di meno del 20% delle vulnerabilità all’inizio dello scorso anno a oltre l’85% quest’anno, secondo Anthropic – un salto che ha trasformato le segnalazioni di bug dell’IA da rumore in risultati utilizzabili.

Come hanno resistito i numeri durante i test

Prima del lancio, Anthropic ha convalidato la pipeline con dozzine di progetti open source, producendo centinaia di segnalazioni di bug, comprese le vulnerabilità che, secondo l’azienda, potrebbero essere legate a exploit di esecuzione di codice remoto non autenticati.

Il test più significativo prevedeva un esame esterno. Anthropic ha chiesto agli esperti penetration tester che esaminano i risultati della divulgazione coordinata delle vulnerabilità (CVD) di esaminare 97 risultati critici e di alta gravità emersi dallo scanner, estratti da 48 progetti. Di questi, 85 (l'88%) hanno soddisfatto gli standard del processo CVD di Anthropic. Dei restanti 12, 11 erano reali ma duplicavano problemi noti o altri risultati della stessa scansione. Solo uno era un vero e proprio falso positivo.

Ogni rapporto, afferma l'azienda, contiene un riproduttore autonomo e una spiegazione della vulnerabilità, inclusa una bisezione per determinare quando è stata introdotta la falla.

Il compromesso: velocità anziché certezza

La decisione progettuale centrale di OSS Scanner rappresenta anche il rischio maggiore: i report sono completamente generati da modelli, senza revisione o triage umano. Anthropic specifica esplicitamente che ciò consente scansioni più rapide e frequenti, ma anche che alcuni report saranno errati o non validi.

L'azienda definisce il compromesso come responsivo alla domanda del manutentore. Poiché ora gli exploit possono essere sviluppati in pochi minuti, i progetti preferiscono sempre più ricevere immediatamente ogni risultato non verificato – con le patch proposte allegate – piuttosto che attendere il controllo umano. Ispirato da OSS-Fuzz di Google, che da anni scansiona software open source con fuzzer, OSS Scanner applica la stessa logica all'analisi del codice basata sull'intelligenza artificiale.

I progetti che preferiscono la gestione tradizionale non vengono esclusi: Anthropic afferma che continuerà a divulgare manualmente i rapporti sulle vulnerabilità verificate dall’uomo attraverso il processo CVD esistente, in particolare per i progetti senza le risorse per valutare autonomamente i rapporti. È disponibile una corsia preferenziale opzionale per coloro che desiderano risultati grezzi non appena vengono generati.

Chi può iscriversi e cos'altro ha annunciato Anthropic

I manutentori principali dei progetti idonei possono iscriversi inviando una richiesta pull a un repository GitHub seguendo un modello di progetto standard. L’ammissibilità rispecchia i criteri OSS-Fuzz: i progetti dovrebbero avere un impatto critico sulle infrastrutture e sulla sicurezza degli utenti, con le ammissioni decise caso per caso.

Lo scanner arriva insieme a una serie più ampia di iniziative di sicurezza antropica. Il Cyber ​​Verification Program dell'azienda mette a disposizione dei professionisti della sicurezza qualificati funzionalità informatiche avanzate e classificatori di blocco ridotti: un programma Anthropic ampliato all'inizio di questa settimana con tre livelli di accesso Claude per i team di sicurezza. Un impegno separato di Claude for OSS fornisce abbonamenti gratuiti Claude Max 20x per aiutare i manutentori a correggere le vulnerabilità e migliorare i propri progetti. SiliconANGLE ha anche segnalato un nuovo programma Anthropic incentrato sulla protezione delle infrastrutture critiche, inquadrando gli annunci della settimana come una spinta coordinata verso la sicurezza informatica difensiva.

Cosa significa per la sicurezza open source

Se OSS Scanner funziona come pubblicizzato, segna un cambiamento strutturale nella sicurezza open source: l’intelligenza artificiale trova i bug e gli esseri umani passano dalla caccia alla verifica. Questo cambiamento trasferisce un onere reale ai manutentori, che devono valutare i report generati dalle macchine, alcuni dei quali errati, mentre decidono se fidarsi delle patch automatizzate.

Il tasso di convalida dell'88% suggerisce che il rapporto segnale-rumore è ora abbastanza buono da valere il tempo di un manutentore, almeno per i progetti di infrastrutture critiche. Se l’ecosistema più ampio sarà d’accordo si vedrà dal numero di iscrizioni e dal numero di progetti iscritti che si ritireranno silenziosamente dopo la prima ondata di rapporti.

---

Stai al passo con l'intelligenza artificiale

Ricevi le ultime notizie, analisi e scoperte sull'intelligenza artificiale, tutto in un unico posto.

Leggi altre notizie sull'AI →