Martedì Google ha annunciato Gemini 4 Argon, il suo nuovo modello di frontiera creato per il lavoro professionale a lungo orizzonte nell'ingegneria del software, nelle attività di conoscenza aziendale e nella difesa della sicurezza informatica. Scrivendo sul blog ufficiale di Google, Koray Kavukcuoglu, SVP di Google DeepMind e Chief AI Architect, ha affermato che il modello verrà inizialmente distribuito a una serie di difensori informatici fidati attraverso il programma Fairwind di Google, con un accesso più ampio da seguire una volta rafforzati i guardrail.
L'annuncio arriva durante uno dei periodi più impegnativi dell'anno per i rilasci di IA di frontiera. Per una copertura continua del lancio di modelli, delle lotte politiche e dei finanziamenti, AI Buzz Wire tiene traccia degli sviluppi che contano man mano che si verificano.
Un'implementazione graduale dettata dalla cautela
A differenza del tipico lancio di un modello importante, oggi la maggior parte degli utenti non può provare l'Argon. Google ha affermato di essere impegnata nel processo volontario del governo degli Stati Uniti per l'accesso al modello pre-rilascio e di espandere gradualmente la disponibilità man mano che il feedback dei primi tester modella i suoi guardrail. Reuters ha riferito che l'ammiraglia arriva dopo mesi di ritardi e VentureBeat ha notato che la strategia di rilascio limitato consente ancora a Google di rivendicare un vantaggio nei benchmark riconquistati su OpenAI e Anthropic. Bloomberg ha riportato un notevole scetticismo nei confronti del nuovo modello tra i dipendenti di Google prima del lancio.
Quando arriverà un accesso più ampio, Google ha affermato che inizierà con i clienti API a pagamento e gli abbonati Google AI Ultra.
Cosa dice Google che l'Argon può fare
Il cambiamento di capacità principale è la resistenza. Il limite dei token di output di Argon è stato esteso a 1 milione di token leader del settore, rispetto ai precedenti 64.000. Google sostiene che dare a un modello il margine di manovra per ragionare su centinaia di migliaia di token in un’unica traiettoria gli consente di risolvere problemi difficili in un unico passaggio anziché frammentare il lavoro tra sessioni.
Google ha pubblicato i risultati dei benchmark a sostegno della tesi della frontiera:
- DeepSWE v1.1: 77,9%: un nuovo stato dell'arte nel benchmark dell'ingegneria del software nel mondo reale
- Indice Vals: n. 1: performance leader nei settori finanziario, codificazione, legale e fiscale, ponderati in base al contributo al PIL degli Stati Uniti
- AutomationBench: 51,3% — primo posto nel benchmark di esecuzione aziendale end-to-end di Zapier
- LVBench: 91,7%: stato dell'arte nella comprensione dei video di lunga durata
- CWE-bench v1: 68%: primo classificato nella risoluzione delle vulnerabilità della sicurezza
All'interno dei flussi di lavoro di Google
L'argon sta già alimentando il lavoro interno di Google e l'azienda ha offerto esempi insolitamente concreti. Nell’ambito dell’informatica quantistica, il modello ha ottimizzato le risorse spaziotemporali per le subroutine dei colli di bottiglia, battendo il riferimento pubblicato del 40% in pochi minuti. Analizzando la telemetria di profilazione a livello di flotta, i team di agenti Argon hanno identificato e applicato ottimizzazioni della memoria nei data center di Google che hanno liberato oltre 300 TiB una volta implementati, con un risparmio totale stimato tra 500 TiB e 1 PiB.
Il modello sta inoltre guidando migrazioni di codice su larga scala da C/C++ a Rust, passando da decine di migliaia di righe nelle librerie principali come re2 e libgav1 fino a oltre 800.000 righe nel kernel Fuchsia Zircon. Per libgav1, il decoder video open source di Google, gli agenti Argon hanno sostituito 32.000 righe di codice SIMD con Rust sicuro e facile da compilare, producendo un decoder memory-safe che funziona 2,7 volte più velocemente della precedente porta Rust con output identico.
La difesa della sicurezza informatica viene prima di tutto
Argon è stato esplicitamente addestrato per il lavoro informatico difensivo: ricerca, convalida e correzione autonoma delle vulnerabilità software critiche. Per i difensori fidati e i team interni di Google, la società rilascerà il modello senza barriere informatiche in modo che i difensori possano ottenere la piena capacità. Sul CWE-bench v1, che misura la risoluzione delle vulnerabilità, Argon si colloca al primo posto con il 68%, basandosi sulle prestazioni di frontiera di 3.8 Flash Cyber, e Google afferma che Argon ha sovraperformato quel modello nell'individuazione della superficie di attacco e nella generazione di prove di concetto sul benchmark interno dei test di penetrazione black-box di Wiz.
La società di sicurezza Wiz sta già utilizzando l’Argon attraverso la sua iniziativa Scan for Good, che protegge gratuitamente le infrastrutture pubbliche critiche. In una prima dimostrazione, Google afferma che il modello ha scoperto una vulnerabilità critica che espone informazioni personali sensibili attraverso il software sanitario utilizzato dagli ospedali di tutto il mondo: un rischio che i precedenti modelli di frontiera non avevano previsto.
Quattro livelli di salvaguardia delle frontiere
Prima di un’ampia disponibilità, Google sta rafforzando le misure di salvaguardia in quattro aree. Contro gli abusi, Argon è progettato per rifiutare le richieste di attacchi informatici e CBRN preservando al contempo la legittima ricerca sul duplice uso, con nuove tecniche che monitorano le attivazioni interne del modello per individuare gli abusi. Contro la pronta iniezione, la formazione contraddittoria ha reso Argon il modello di Google più resiliente finora, leader nel benchmark Indirect Prompt Injection di Gray Swan.
Per il disallineamento, Google sta implementando misure di mitigazione che monitorano la catena di pensiero e di azioni di Argon, interrompendone l'esecuzione quando necessario, con avvisi indirizzati a un team dedicato di risposta agli incidenti. L’azienda ha inoltre rafforzato i suoi ambienti di formazione e valutazione sandbox, sigillandoli prima delle corse ad alto rischio. In particolare, Google ha esortato il resto del settore a preservare la trasparenza del ragionamento in modo che i pensieri modello rimangano utili per diagnosticare il disallineamento.
Prezzi e disponibilità
Argon verrà lanciato a un prezzo di lancio di 2 dollari per milione di token di input e 10 dollari per milione di token di output, con token di input memorizzati nella cache con uno sconto del 95% sul prezzo di input. Dopo il periodo introduttivo, i prezzi salgono a 4 dollari per milione di token di input e 20 dollari per milione di token di output, posizionando Argon in modo aggressivo rispetto alle offerte rivali di frontiera.
Il debutto graduale riflette una nuova realtà per i rilasci di frontiera: la capacità è ora la posta in gioco e l’elemento di differenziazione sta dimostrando il controllo. Google scommette che i difensori informatici, i software ospedalieri e le migrazioni di Rust siano la vetrina giusta e che un’implementazione pubblica più lenta costi meno di un altro incidente di sicurezza. Gli sviluppatori e le imprese dovrebbero prestare attenzione all'API a pagamento e alla finestra di accesso AI Ultra, che secondo Google si aprirà non appena i test guardrail lo consentiranno.
---
Stai al passo con l'intelligenza artificialeRicevi le ultime notizie, analisi e scoperte sull'intelligenza artificiale, tutto in un unico posto.
Leggi altre notizie sull'AI →