OpenAI hat GPT-Live auf den Markt gebracht, eine neue Reihe von Sprachmodellen für ChatGPT, die gleichzeitig zuhören und sprechen können. Die Version verwendet eine von OpenAI als Vollduplex-Architektur beschriebene Architektur, die es Benutzern ermöglicht, den Assistenten zu unterbrechen, zu besprechen und sich mit ihm zu unterhalten, und zwar auf eine Art und Weise, die sich nach Angaben des Unternehmens wie ein echtes Telefongespräch anfühlt.

Der Start erfolgt parallel zu OpenAIs umfassenderem Rollout der GPT-5.6-Modellfamilie in dieser Woche und stellt einen Vorstoß dar, damit sich aktuelle KI-Nachrichten über Sprachschnittstellen weniger wie das Befehlen einer Maschine, sondern eher wie das Chatten mit einer Person anfühlen.

Was GPT-Live anders macht

Herkömmliche Sprachassistenten arbeiten im Halbduplex-Modus: Sie sprechen, dann halten Sie inne, dann verarbeitet das System Ihre Anfrage und antwortet. Das Abwechseln ist starr. GPT-Live durchbricht dieses Muster mit Vollduplex-Audioverarbeitung, was bedeutet, dass das Modell Sie hören kann, während es noch spricht. Dies ermöglicht natürliche Unterbrechungen, Korrekturen mitten im Satz und sich überschneidende Gespräche – die Art von Hin und Her, die Menschen als selbstverständlich ansehen, mit der Sprach-KIs jedoch in der Vergangenheit zu kämpfen hatten.

Laut Reuters hören und sprechen die GPT-Live-Modelle gleichzeitig – eine Fähigkeit, die seit langem ein Ziel für den Bereich der Sprach-KI ist. Der Ansatz beseitigt die unangenehmen Pausen und das erzwungene Abwechseln, die frühere Versionen des Sprachmodus von ChatGPT kennzeichneten.

Ein bemerkenswertes technisches Detail: Wenn GPT-Live auf komplexe Fragen stößt, übergibt es diese im Hintergrund an GPT-5.5. Das Sprachmodell verwaltet den Gesprächsfluss in Echtzeit, während ein größeres Argumentationsmodell hinter den Kulissen an schwierigeren Aufgaben arbeitet und dann die Antwort zurückmeldet. Laut OpenAI verbessert diese Arbeitsteilung die Antwortqualität drastisch, ohne die Reaktionsfähigkeit zu beeinträchtigen, die dafür sorgt, dass sich Gespräche in Echtzeit natürlich anfühlen.

Verfügbarkeit und Preise

OpenAI führt die neuen Sprachmodelle in zwei Stufen ein:

  • GPT-Live-1 – das vollständige Modell, jetzt verfügbar für zahlende ChatGPT-Abonnenten (Plus-, Pro- und Team-Pläne).
  • GPT-Live-1 mini – eine kleinere, leichtere Version, die für kostenlose ChatGPT-Konten verfügbar ist.
API-Zugriff wird bald verfügbar sein, sagte OpenAI, was es Entwicklern ermöglichen wird, Vollduplex-Sprache in ihre eigenen Anwendungen zu integrieren. Das Unternehmen hat noch keine detaillierten Preise für die API veröffentlicht.

Mit der Einführung wird auch die Websuche direkt in die Sprachkonversation integriert. Wie das Search Engine Journal berichtete, integriert GPT-Live die Live-Suche in ChatGPT Voice, sodass Benutzer Fragen zu aktuellen Ereignissen oder sich schnell ändernden Informationen stellen und Antworten auf der Grundlage aktueller Webergebnisse erhalten können, ohne den Modus wechseln zu müssen.

Ein wettbewerbsfähiger Sprach-KI-Markt

GPT-Live landet in einer zunehmend überfüllten Sprach-KI-Landschaft. Google hat seine Gemini-basierten Sprachfunktionen auf Android und sein Gemini Live-Produkt ausgeweitet, während Apple weiterhin Siri für große Sprachmodelle überarbeitet. Anthropic, der Hauptkonkurrent von OpenAI, hat seine jüngsten Bemühungen eher auf Agenten-Codierungs- und Argumentationsmodelle als auf Sprache konzentriert.

Der Vollduplex-Ansatz scheint die Richtung zu sein, in die sich die gesamte Branche bewegt. Durch das gleichzeitige Zuhören und Sprechen reduziert GPT-Live die Latenz und beseitigt die größte Beschwerde, die Benutzer bei Sprachassistenten hatten: das Warten. Die Übergabe an GPT-5.5 für komplexe Abfragen ist auch ein Signal dafür, dass OpenAI Sprache nicht als abgespeckte Schnittstelle, sondern als Eingangstür zu seinen leistungsfähigsten Modellen betrachtet.

Warum es wichtig ist

Sprache wird seit Jahren als sekundäre, befehlsgesteuerte Schnittstelle behandelt – gut zum Einstellen von Timern und zum Überprüfen des Wetters, weniger nützlich für differenzierte Gespräche. GPT-Live geht davon aus, dass der Flaschenhals nie die Intelligenz des Modells war, sondern die Schnittstelle: Menschen dazu zu zwingen, in isolierten Ausbrüchen zu sprechen.

Wenn Vollduplex-Konversation in großem Maßstab zuverlässig funktioniert, verändert sie die Art und Weise, wie Menschen mit KI auf Telefonen, in Autos, auf intelligenten Lautsprechern und schließlich auf tragbaren Geräten interagieren. Es wirft auch bekannte Bedenken auf – hinsichtlich der Zustimmung bei immer zuhörenden Geräten, hinsichtlich des Realismus synthetischer Stimmen und hinsichtlich der Frage, ob eine natürlichere Konversation dazu führt, dass Benutzer den Antworten einer KI zu sehr vertrauen.

OpenAI hat über seine bestehenden Inhaltsrichtlinien hinaus keine spezifischen Sicherheitsmaßnahmen für GPT-Live detailliert beschrieben, obwohl die Suchintegration bedeutet, dass das Modell jetzt Live-Informationen in eine Stimme übertragen kann, die für Benutzer möglicherweise schwieriger kritisch zu bewerten ist als Text, durch den sie zurückscrollen können.

Was als nächstes kommt

Derzeit ist GPT-Live in erster Linie eine ChatGPT-Funktion und in zweiter Linie ein Entwicklerprodukt. Der eigentliche Test wird mit dem API-Zugriff kommen, wenn Apps von Drittanbietern, Kundendienstplattformen und Hardwarehersteller Vollduplex-Kommunikation in ihre eigenen Produkte integrieren können. Zu diesem Zeitpunkt wird OpenAI auch Preisdruck durch billigere Open-Source-Sprachmodelle und durch Konkurrenten ausgesetzt sein, die diese Funktion nutzen möchten.

Der gleichzeitige Start mit der öffentlichen Veröffentlichung von GPT-5.6 legt nahe, dass OpenAI Stimme und Argumentation als zwei Hälften derselben Strategie betrachtet: ein leistungsstarkes Modell, das denkt, gepaart mit einer Schnittstelle, mit der Sie wie mit einem Kollegen sprechen können.

Bleiben Sie der KI immer einen Schritt voraus

Für eine kontinuierliche Berichterstattung über Modellveröffentlichungen, Sprach-KI und alles, was die Branche prägt, verfolgen Sie die neuesten KI-Entwicklungen unter AI Buzz Wire.

Weitere KI-Neuigkeiten lesen →