Gemini 3.5 Live Translate, la traduction vocale simultanée dans plus de 70 langues

Google lance Gemini 3.5 Live Translate, un modèle de traduction vocale continue en temps réel pour plus de 70 langues, déployé via API, Meet et Translate.

Vingt ans après ses premiers pas dans la traduction automatique, Google franchit une étape avec Gemini 3.5 Live Translate, un modèle audio de traduction speech-to-speech en quasi temps réel. Contrairement aux systèmes au tour par tour qui attendent la fin d'une phrase, le modèle génère la parole en continu, en restant quelques secondes derrière le locuteur, tout en préservant son intonation, son débit et sa hauteur de voix. Il détecte automatiquement plus de 70 langues au sein d'une même session et filtre le bruit ambiant pour fonctionner dans des environnements sonores difficiles.

Le déploiement s'effectue sur trois fronts : en preview publique pour les développeurs via la Gemini Live API et AI Studio, en preview privée dans Google Meet pour certains clients Workspace (qui passe au passage de 5 à 70 langues et de l'anglais pivot à plus de 2 000 combinaisons par réunion), et dans l'application Google Translate sur Android et iOS. Android reçoit en prime un mode écoute qui diffuse la traduction directement dans l'écouteur du téléphone, tenu contre l'oreille comme un appel classique. Grab teste déjà le modèle pour les échanges entre chauffeurs et voyageurs. Tout l'audio généré est marqué par SynthID, le watermark inaudible de Google.

Côté API, l'entrée se limite à l'audio, et Google reconnaît des incohérences possibles de réplication de voix lors de longues pauses ou de conversations rapides à plusieurs interlocuteurs.