OpenAI a lancé GPT-Live, une nouvelle série de modèles vocaux pour ChatGPT qui peuvent écouter et parler en même temps, marquant la refonte la plus importante de l'entreprise en matière d'expérience vocale conversationnelle à ce jour. La version utilise ce qu'OpenAI décrit comme une architecture full-duplex, permettant aux utilisateurs d'interrompre, de parler et de converser avec l'assistant d'une manière qui, selon l'entreprise, ressemble à un véritable appel téléphonique.

Le lancement arrive cette semaine parallèlement au déploiement plus large par OpenAI de la famille de modèles GPT-5.6 et représente une impulsion pour que les dernières nouvelles sur l'IA concernant les interfaces vocales ressemblent moins à commander une machine qu'à discuter avec une personne.

Qu'est-ce qui rend GPT-Live différent

Les assistants vocaux traditionnels fonctionnent en mode semi-duplex : vous parlez, puis vous vous arrêtez, puis le système traite votre demande et répond. Le tour de rôle est rigide. GPT-Live brise ce modèle avec un traitement audio full-duplex, ce qui signifie que le modèle peut vous entendre pendant qu'il parle encore. Cela permet des interruptions naturelles, des corrections au milieu de phrases et des conversations qui se chevauchent – ​​le genre de va-et-vient que les humains tiennent pour acquis mais avec lequel les IA vocales ont toujours eu du mal.

Selon Reuters, les modèles GPT-Live écoutent et parlent simultanément – ​​une capacité qui est depuis longtemps une cible pour le domaine de l'IA vocale. Cette approche supprime les pauses gênantes et le tour de rôle forcé qui définissaient les versions antérieures du mode vocal de ChatGPT.

Détail technique notable : lorsque GPT-Live rencontre des questions complexes, il les transmet à GPT-5.5 en arrière-plan. Le modèle vocal gère le flux conversationnel en temps réel, tandis qu'un modèle de raisonnement plus large travaille sur des tâches plus difficiles en coulisses, puis renvoie la réponse. Selon OpenAI, cette division du travail améliore considérablement la qualité des réponses sans sacrifier la réactivité qui rend la conversation en temps réel naturelle.

Disponibilité et prix

OpenAI déploie les nouveaux modèles vocaux sur deux niveaux :

  • GPT-Live-1 — le modèle complet, disponible dès maintenant pour les abonnés ChatGPT payants (forfaits Plus, Pro et Team).
  • GPT-Live-1 mini — une version plus petite et plus légère disponible pour les comptes ChatGPT gratuits.

L'accès API sera bientôt disponible, a annoncé OpenAI, ce qui permettra aux développeurs d'intégrer la voix en duplex intégral dans leurs propres applications. La société n'a pas encore publié les tarifs détaillés de l'API.

Le lancement intègre également la recherche sur le Web directement dans la conversation vocale. Comme l'a rapporté Search Engine Journal, GPT-Live intègre la recherche en direct dans la voix ChatGPT, afin que les utilisateurs puissent poser des questions sur l'actualité ou des informations en évolution rapide et obtenir des réponses fondées sur de nouveaux résultats Web sans changer de mode.

Un marché de l'IA vocale compétitif

GPT-Live atterrit dans un paysage d'IA vocale de plus en plus encombré. Google a étendu ses fonctionnalités vocales basées sur Gemini sur Android et son produit Gemini Live, tandis qu'Apple continue de retravailler Siri autour de grands modèles linguistiques. Anthropic, le principal rival d'OpenAI, a récemment concentré ses efforts sur le codage agent et les modèles de raisonnement plutôt que sur la voix.

L’approche full-duplex semble être la direction vers laquelle l’industrie dans son ensemble semble se diriger. En permettant l'écoute et la parole simultanées, GPT-Live réduit la latence et supprime le plus gros reproche que les utilisateurs ont eu avec les assistants vocaux : l'attente. Le passage à GPT-5.5 pour les requêtes complexes est également un signal qu'OpenAI considère la voix non pas comme une interface simplifiée, mais comme une porte d'entrée vers ses modèles les plus performants.

Pourquoi c'est important

La voix a été traitée pendant des années comme une interface secondaire pilotée par des commandes – idéale pour régler des minuteries et vérifier la météo, moins utile pour des conversations nuancées. Le pari de GPT-Live est que le goulot d'étranglement n'a jamais été l'intelligence du modèle, mais l'interface : obliger les humains à parler par rafales isolées.

Si la conversation en duplex intégral fonctionne de manière fiable à grande échelle, elle change la façon dont les gens interagissent avec l’IA sur les téléphones, dans les voitures, sur les haut-parleurs intelligents et, éventuellement, sur les appareils portables. Cela soulève également des préoccupations familières : sur le consentement dans les appareils à écoute permanente, sur le réalisme des voix synthétiques et sur la question de savoir si une conversation plus naturelle conduit les utilisateurs à faire trop confiance aux réponses d'une IA.

OpenAI n'a pas détaillé de mesures de sécurité spécifiques pour GPT-Live au-delà de ses politiques de contenu existantes, bien que l'intégration de la recherche signifie que le modèle peut désormais extraire des informations en direct dans une voix qui peut être plus difficile à évaluer de manière critique pour les utilisateurs que le texte qu'ils peuvent parcourir en arrière.

Ce qui vient ensuite

Pour l'instant, GPT-Live est d'abord une fonctionnalité ChatGPT et ensuite un produit de développement. Le véritable test arrivera avec l’accès aux API, lorsque les applications tierces, les plates-formes de service client et les fabricants de matériel pourront intégrer une conversation en duplex intégral dans leurs propres produits. C’est également à ce moment-là qu’OpenAI sera confronté à la pression sur les prix de la part de modèles vocaux open source moins chers et de concurrents désireux d’égaler cette fonctionnalité.

Le lancement simultané avec la sortie publique de GPT-5.6 suggère qu'OpenAI considère la voix et le raisonnement comme les deux moitiés d'une même stratégie : un modèle puissant qui réfléchit, associé à une interface qui vous permet de lui parler comme un collègue.

Gardez une longueur d'avance sur l'IA

Pour une couverture continue des sorties de modèles, de l'IA vocale et de tout ce qui façonne l'industrie, suivez les derniers développements de l'IA sur AI Buzz Wire.

Lire plus d'actualités sur l'IA →