GPT-Live sépare la parole du raisonnement approfondi

GPT-Live fait circuler la voix en continu, délègue le raisonnement en arrière-plan et prépare une API pour les interactions en temps réel.

GPT-Live est le système vocal de troisième génération d’OpenAI. Son modèle fonctionne en full-duplex, ce qui lui permet d’écouter et de parler simultanément, sans attendre qu’un détecteur séparé décide que l’utilisateur a terminé sa phrase.

L’audio circule en continu entre l’appareil et le modèle sur un chemin dédié. Le raisonnement plus approfondi, les appels d’outils et les règles propres à chaque application sont traités séparément. GPT-Live peut ainsi consulter un modèle comme GPT-5.5 en arrière-plan tout en maintenant la conversation.

OpenAI a remplacé une précédente implémentation Python par un système écrit en Go. Selon l’entreprise, le niveau de fluidité atteint au 95e percentile correspond désormais au niveau médian de l’ancienne architecture. Le transport repose sur WebRTC, avec des mécanismes capables d’absorber les pertes de paquets et les variations de connexion.

Le protocole WARP réduit le démarrage d’une session WebRTC de six échanges réseau à un seul. Un autre mécanisme, Instant Connect, prépare certains paramètres avant la connexion afin que le serveur puisse répondre dès la réception du premier paquet audio.

Pour les conversations longues, le système prépare une nouvelle instance du modèle en parallèle, lui transmet le contexte courant, puis bascule une fois celle-ci prête. La même méthode permet de compacter l’historique sans interrompre la voix ni reconstruire l’état pendant l’échange.

Cette architecture alimente déjà ChatGPT Voice et ses fonctions de contrôle de l’ordinateur et de coordination d’agents dans l’application de bureau. Elle doit également servir de base à une future API GPT-Live.