Google kündigte am Dienstag Gemini 4 Argon an, sein neuestes Grenzmodell, das für langfristige professionelle Arbeit in den Bereichen Softwareentwicklung, Unternehmensdatenentwicklung und Cybersicherheitsverteidigung entwickelt wurde. Koray Kavukcuoglu, SVP von Google DeepMind und Chief AI Architect, schrieb im offiziellen Google-Blog, dass das Modell zunächst über das Fairwind-Programm von Google für eine Reihe vertrauenswürdiger Cyber-Verteidiger eingeführt wird und ein breiterer Zugang folgen soll, sobald die Leitplanken gestärkt werden.

Die Ankündigung fällt in eine der geschäftigsten Phasen des Jahres für bahnbrechende KI-Veröffentlichungen. Für eine kontinuierliche Berichterstattung über Modelleinführungen, politische Auseinandersetzungen und Finanzierungsrunden verfolgt AI Buzz Wire die wichtigen Entwicklungen, sobald sie stattfinden.

Eine schrittweise Einführung, die von Vorsicht geprägt ist

Anders als bei einer typischen großen Modelleinführung können die meisten Benutzer Argon heute nicht ausprobieren. Google sagte, dass es sich am freiwilligen Prozess der US-Regierung für den Zugang zu Vorabversionsmodellen beteiligt und die Verfügbarkeit schrittweise erweitern wird, da das Feedback der ersten Tester seine Leitplanken prägt. Reuters berichtete, dass das Flaggschiff nach monatelangen Verzögerungen auf den Markt kommt, und VentureBeat stellte fest, dass die Strategie der limitierten Veröffentlichung es Google immer noch ermöglicht, einen Benchmark-Vorsprung vor OpenAI und Anthropic zurückzuerobern. Bloomberg berichtete von einer messbaren Skepsis gegenüber dem neuen Modell unter Google-Mitarbeitern vor der Markteinführung.

Wenn es einen breiteren Zugang gibt, wird Google laut Google mit kostenpflichtigen API-Kunden und Google AI Ultra-Abonnenten beginnen.

Was Google sagt, kann Argon

Die wichtigste Fähigkeitsänderung ist Ausdauer. Das Ausgabe-Token-Limit von Argon wurde von bisher 64.000 auf branchenweit führende 1 Million Token erhöht. Google argumentiert, dass es schwierige Probleme in einem Durchgang lösen kann, wenn man einem Modell den Spielraum gibt, Hunderttausende Token in einer einzigen Trajektorie zu berücksichtigen, anstatt die Arbeit über mehrere Sitzungen hinweg zu fragmentieren.

Google hat Benchmark-Ergebnisse veröffentlicht, um die Grenzbehauptung zu untermauern:

  • DeepSWE v1.1: 77,9 % – ein neuer Stand der Technik im realen Software-Engineering-Benchmark
  • Vals-Index: Nr. 1 – führende Leistung in den Bereichen Finanzen, Kodierung, Recht und Steuern, gewichtet nach Beitrag zum US-BIP
  • AutomationBench: 51,3 % – erster Platz im End-to-End-Business-Execution-Benchmark von Zapier
  • LVBench: 91,7 % – Stand der Technik beim Verstehen langer Videos
  • CWE-Bench v1: 68 % – gleichauf an erster Stelle bei der Behebung von Sicherheitslücken

In Googles eigenen Arbeitsabläufen

Argon treibt bereits die interne Arbeit bei Google voran, und das Unternehmen lieferte ungewöhnlich konkrete Beispiele. Beim Quantencomputing optimierte das Modell die Raumzeitressourcen für Engpass-Subroutinen und übertraf den veröffentlichten Basiswert innerhalb von Minuten um 40 %. Durch die Analyse der flottenweiten Profiling-Telemetrie haben Teams von Argon-Agenten Speicheroptimierungen in den Rechenzentren von Google identifiziert und angewendet, die nach der Einführung über 300 TiB freisetzten, mit geschätzten Gesamteinsparungen von 500 TiB bis 1 PiB.

Das Modell treibt auch groß angelegte Codemigrationen von C/C++ nach Rust voran, die von Zehntausenden Zeilen in Kernbibliotheken wie re2 und libgav1 bis zu mehr als 800.000 Zeilen im Fuchsia Zircon-Kernel reichen. Für libgav1, den Open-Source-Videodecoder von Google, ersetzten Argon-Agenten 32.000 Zeilen SIMD-Code durch den Compiler-freundlichen, sicheren Rust und erzeugten so einen speichersicheren Decoder, der 2,7-mal schneller als der vorherige Rust-Port mit identischer Ausgabe läuft.

Die Verteidigung der Cybersicherheit steht an erster Stelle

Argon wurde ausdrücklich für defensive Cyber-Arbeit geschult: das autonome Finden, Validieren und Patchen kritischer Software-Schwachstellen. Für vertrauenswürdige Verteidiger und die internen Teams von Google wird das Unternehmen das Modell ohne Cyber-Leitplanken veröffentlichen, damit Verteidiger die volle Funktionalität erhalten. Beim CWE-Bench v1, der die Behebung von Schwachstellen misst, belegt Argon mit 68 % den ersten Platz und baut auf der Spitzenleistung von 3,8 Flash Cyber ​​auf. Laut Google hat Argon dieses Modell bei der Erkennung von Angriffsflächen und der Erstellung von Proof-of-Concept im internen Black-Box-Penetrationstest-Benchmark von Wiz übertroffen.

Das Sicherheitsunternehmen Wiz nutzt Argon bereits im Rahmen seiner Scan for Good-Initiative, die kritische öffentliche Infrastruktur kostenlos schützt. Laut Google hat das Modell in einer frühen Demonstration eine kritische Schwachstelle aufgedeckt, die vertrauliche persönliche Informationen in der von Krankenhäusern weltweit verwendeten Gesundheitssoftware preisgibt – ein Risiko, das frühere Grenzmodelle übersehen hatten.

Vier Ebenen des Grenzschutzes

Vor einer breiten Verfügbarkeit verstärkt Google die Sicherheitsvorkehrungen in vier Bereichen. Gegen Missbrauch ist Argon darauf ausgelegt, Cyber- und CBRN-Angriffsanfragen abzuwehren und gleichzeitig die legitime Dual-Use-Forschung zu wahren, mit neuen Techniken, die die internen Aktivierungen des Modells überwachen, um Missbrauch zu erkennen. Im Vergleich zur Prompt-Injection hat das gegnerische Training Argon zum bisher widerstandsfähigsten Modell von Google gemacht und führt den Indirect-Prompt-Injection-Benchmark von Gray Swan an.

Bei Fehlausrichtungen setzt Google Abhilfemaßnahmen ein, die die Gedanken- und Handlungskette von Argon überwachen und bei Bedarf die Ausführung stoppen, wobei Warnungen an ein spezielles Team zur Reaktion auf Vorfälle weitergeleitet werden. Das Unternehmen hat außerdem seine Sandbox-Trainings- und Evaluierungsumgebungen gehärtet und sie vor risikoreichen Läufen versiegelt. Insbesondere forderte Google den Rest der Branche auf, die Argumentationstransparenz zu wahren, damit Modellgedanken weiterhin für die Diagnose von Fehlausrichtungen nützlich bleiben.

Preise und Verfügbarkeit

Argon wird zu einem Einführungspreis von 2 US-Dollar pro Million Input-Tokens und 10 US-Dollar pro Million Output-Tokens eingeführt, wobei zwischengespeicherte Input-Tokens 95 % des Input-Preises kosten. Nach der Einführungsphase steigt der Preis auf 4 US-Dollar pro Million Input-Tokens und 20 US-Dollar pro Million Output-Tokens und positioniert Argon damit aggressiv gegenüber konkurrierenden Grenzangeboten.

Das inszenierte Debüt spiegelt eine neue Realität für Frontier-Releases wider: Leistungsfähigkeit steht jetzt auf dem Spiel, und das Unterscheidungsmerkmal ist die Demonstration der Kontrolle. Google geht davon aus, dass Cyber-Verteidiger, Krankenhaussoftware und Rust-Migrationen das richtige Beispiel dafür sind – und dass eine langsamere öffentliche Einführung weniger kostet als ein weiterer Sicherheitsvorfall. Entwickler und Unternehmen sollten auf das kostenpflichtige API- und AI Ultra-Zugriffsfenster achten, das laut Google geöffnet wird, sobald die Leitplankentests dies zulassen.

---

Der KI einen Schritt voraus sein

Erhalten Sie die neuesten KI-Nachrichten, Analysen und Durchbrüche – alles an einem Ort.

Weitere KI-Neuigkeiten lesen →