OpenAI publie trois nouveaux modèles vocaux temps réel sur son API
OpenAI lance GPT-Realtime-2, Translate et Whisper sur sa Realtime API, trois modèles vocaux temps réel dotés d'un raisonnement avancé pour les agents.
OpenAI étoffe sa Realtime API avec trois modèles audio destinés aux agents vocaux et aux interfaces conversationnelles. Le premier, GPT-Realtime-2, est présenté comme le premier modèle vocal de la maison à embarquer un raisonnement de niveau GPT-5. Il peut enchaîner des appels d'outils en parallèle, signaler verbalement ce qu'il fait ("je vérifie votre agenda"), placer des préambules courts avant une réponse longue, et récupérer plus proprement en cas d'erreur. La fenêtre de contexte passe de 32K à 128K tokens, et l'effort de raisonnement devient ajustable sur cinq niveaux, de minimal à xhigh, pour arbitrer entre latence et profondeur de réflexion. Sur Big Bench Audio, le modèle atteint 96,6 % (contre 81,4 % pour la version 1.5), et Zillow rapporte un taux de succès en conditions adversariales de 95 %, contre 69 % auparavant.
GPT-Realtime-Translate prend en charge la traduction simultanée depuis plus de 70 langues vers 13 langues de sortie, en cherchant à préserver le sens et le rythme du locuteur, y compris sur des accents régionaux ou un vocabulaire métier. BolnaAI rapporte un taux d'erreur de mot inférieur de 12,5 % à celui des modèles concurrents testés sur le hindi, le tamoul et le télougou. Deutsche Telekom et Vimeo figurent parmi les premiers utilisateurs. GPT-Realtime-Whisper, le troisième modèle, est une déclinaison de transcription en streaming pensée pour les sous-titres en direct et les comptes rendus de réunion.
Côté tarifs, GPT-Realtime-2 est facturé 32 dollars par million de tokens audio en entrée et 64 dollars en sortie. GPT-Realtime-Translate revient à 0,034 dollar par minute, GPT-Realtime-Whisper à 0,017 dollar. Les trois modèles sont disponibles via la Realtime API, avec EU Data Residency pour les déploiements européens.