Während sich die künstliche Intelligenz von Single-Turn-Chatbots zu autonomen Agenten verlagert, die kontinuierlich laufen, erweitert NVIDIA seine offene Modellpalette, um dem Bedarf gerecht zu werden. Am 11. August 2026 stellte das Unternehmen Nemotron 3.5 Lightning vor, ein Expertenmix-Modell mit 30 Milliarden Parametern, das es als das effizienteste Modell seiner Klasse für lang laufende Agenten-KI-Workloads bezeichnet. Die Veröffentlichung, die im NVIDIA-Blog von Kari Briski ausführlich beschrieben wird, erscheint zusammen mit NeMo Switchyard, einer Open-Source-Routing-Bibliothek, die jede Aufgabe automatisch an das leistungsfähigste und kostengünstigste Modell weiterleitet. Für die neueste KI-Branchenberichterstattung können Sie verfolgen, wie der Agent-KI-Stack Gestalt annimmt.

Ein Modell, das für Always-On-Agenten entwickelt wurde

Moderne Agentensysteme funktionieren zunehmend als das, was NVIDIA als „Modellsysteme“ oder Modellensembles bezeichnet. Ein Frontier Reasoning-Modell wie Nemotron 3 Ultra oder GPT-5.6 könnte einen Arbeitsablauf planen und orchestrieren, während kleinere spezialisierte Modelle gezielte Aufgaben wie Codeüberprüfung, Tool-Nutzung, Überwachung von Sicherheitswarnungen oder die Beantwortung von Abrechnungsfragen übernehmen. Nemotron 3.5 Lightning wurde speziell für die zweite Ebene entwickelt: hochvolumige, spezialisierte Aufgaben, die ständig verfügbare Agenten unterstützen.

Laut NVIDIA bietet das Modell eine bis zu 4x schnellere Ausgabegeschwindigkeit, was im Vergleich zu anderen Modellen seiner Klasse zu einer etwa 30 % schnelleren Erledigung von Agentenaufgaben führt. NVIDIAs eigene PinchBench-Benchmarks zeigen Berichten zufolge, dass Nemotron 3.5 Lightning eine Genauigkeit auf höchstem Niveau beibehält und gleichzeitig Aufgaben schneller erledigt als seine Mitbewerber. Das Modell wurde mit Beiträgen der Nemotron Coalition entwickelt, deren Mitglieder Bewertungsmethoden, Inferenzsoftware und Datensätze bereitstellten, um zur Weiterentwicklung des Modells beizutragen.

Da es offen und anpassbar ist, können Unternehmen Nemotron 3.5 Lightning mit NVIDIA NeMo auf ihren eigenen Domänendaten, Tools und Arbeitsabläufen nachtrainieren, um die Genauigkeit für spezielle Aufgaben zu verbessern. NVIDIA veröffentlicht außerdem Nemotron-RL-Agentic-Terminal-Pivot, einen Datensatz für das Lernen zur Agentenverstärkung, der zum Nachtrainieren des Modells für Codierungsagentenfunktionen verwendet wird.

Läuft überall, vom Edge bis zur Cloud

Eines der zentralen Verkaufsargumente von Nemotron 3.5 Lightning ist die Flexibilität bei der Bereitstellung. Das Modell kann auf lokalen KI-Systemen ausgeführt werden – einschließlich NVIDIA RTX-PCs, NVIDIA DGX Spark, NVIDIA DGX Station und NVIDIA Jetson – und ermöglicht es Unternehmen, bestehende Infrastrukturinvestitionen zu maximieren. Es kann auch über Edge-KI-Geräte, NVIDIA RTX PRO-Workstations, Rechenzentren und Cloud-Umgebungen für Unternehmensanwendungsfälle skaliert werden. Diese Flexibilität ist für Unternehmen wichtig, die vertrauliche Daten verarbeiten, die vor Ort bleiben müssen.

Wie bei jedem Nemotron-Start gibt NVIDIA an, so viele Trainingsdaten und -techniken zu veröffentlichen, wie die Lizenz zulässt, was die Rückverfolgbarkeit, Prüfung und Schulung anderer Modelle ermöglicht. Dieses Engagement für Transparenz ist zu einem Wettbewerbsvorteil geworden, da Unternehmen offene Modelle gegenüber proprietären Alternativen abwägen, die weniger Einblick in ihre Konstruktion bieten.

NeMo Switchyard: Intelligentes Routing für Modellsysteme

Wenn Nemotron 3.5 Lightning das Arbeitstier ist, ist NeMo Switchyard der Dispatcher. Die Open-Source-Bibliothek leitet Eingabeaufforderungen für jeden Schritt eines Agenten-Workflows automatisch an das leistungsfähigste und effizienteste Modell weiter, basierend auf spezifischen Anforderungen. Einige Modelle eignen sich besser zum Codieren, andere zum Denken, einige für einfache Aufgaben und einige sind für die lokale Ausführung optimiert, um mehr Privatsphäre und Effizienz zu gewährleisten. Sich auf ein einziges Standardmodell zu verlassen, kann zu Mehrausgaben oder Qualitätseinbußen bedeuten; Die manuelle Verwaltung des Routings hingegen wird zu einer Integrationsarbeit, die eine Bereitstellung verlangsamen kann.

Entwickler von Agent-Anwendungen können den Router mit verschiedenen Routing-Algorithmen optimieren oder modifizieren, um sie an ihre Prioritäten wie Qualitäts-, Latenz- und Kostenanforderungen anzupassen. Interne Benchmarks von NVIDIA zeigen, dass NeMo Switchyard eine Präzision auf höchstem Niveau beibehält und gleichzeitig die Kosten für die Aufgabenerledigung auf fast ein Drittel von Opus 4.8 allein senkt – ein bemerkenswerter Effizienzgewinn für Unternehmen, die eine große Anzahl von Agentenaufgaben ausführen.

Das Unternehmen hob eine Reihe von Partnerintegrationen hervor. Boomi meldete eine Domain-Routing-Genauigkeit von 100 % und leitete 59 % des Datenverkehrs an ein fünfmal schnelleres, fein abgestimmtes Modell weiter. Cadence verbesserte die Effizienz bei einem formalen Verifizierungsanwendungsfall um 9,9 %. Cognition hat Switchyard in Devin Desktop integriert und so eine nahezu bahnbrechende Leistung auf FrontierCode Main erreicht und gleichzeitig die Durchschnittskosten um 28 % gesenkt. LangChain meldete 74 % geringere Kosten bei 145 Multi-Turn-Deep-Agents-Aufgaben, da nur 7 % der Anrufe an ein Frontier-Modell weitergeleitet wurden. LiteLLM fügt NeMo Switchyard als Plug-in zu seiner Proxy-Ebene hinzu, und Kong liefert nun Routing nativ über das Kong AI Gateway. Insbesondere hat Nous Research NeMo Switchyard in Hermes integriert, um Entwicklern ein einfach zu konfigurierendes Routing-System für die Agenteneffizienz zu bieten.

Branchenakzeptanz und das Gesamtbild

KI-Führungskräfte aus allen Branchen passen Nemotron 3.5 Lightning bereits an ihre Arbeitslasten an. CrowdStrike wendet es auf die Cybersicherheit an, Harvey nutzt es für juristische Dienstleistungen und CodeRabbit setzt es für die Codeüberprüfung ein. Lila Sciences trägt dazu bei, die Argumentationsfähigkeiten für Agentenaufgaben in den Bereichen Physik und Biowissenschaften zu verbessern, während Fastino Labs das Modell angepasst und führende Genauigkeiten für Softwareentwicklung, Finanzen und Arbeitslasten im Gesundheitswesen gemeldet hat.

Die Veröffentlichung unterstreicht einen breiteren Branchentrend: Mit zunehmender Reife der Agenten-KI kann kein einzelnes Modell alles zu akzeptablen Kosten gut erledigen. Die Zukunft gehört Ensembles – Grenzplanern, die Flotten spezialisierter Arbeitskräfte koordinieren – und den Werkzeugen, die sie miteinander verbinden. NVIDIA geht davon aus, dass Unternehmen mit offenen Modellen und intelligentem Routing diese Systeme zusammenstellen können, ohne sich an den Stack eines einzelnen Anbieters zu binden.

Bleiben Sie der KI immer einen Schritt voraus

NVIDIAs Nemotron 3.5 Lightning und NeMo Switchyard signalisieren, wohin sich die Agenten-KI entwickelt: schneller, günstiger, transparenter und überall einsetzbar. Um über die Modellveröffentlichungen und Unternehmenstools, die die Landschaft verändern, auf dem Laufenden zu bleiben, lesen Sie unsere aktuellen KI-Nachrichten.

Weitere KI-Neuigkeiten lesen →