Musique, voix, SFX, bande-son : Pika élargit son terrain à l’audio

Pika réunit quatre modèles audio dédiés à la musique, aux effets sonores, à la voix et aux bandes-son synchronisées avec la vidéo.

Pika étend son environnement génératif à l’audio avec une famille de quatre modèles spécialisés. Pika Soundtrack produit une bande-son à partir d’une vidéo, Pika Music génère des morceaux complets, Pika SFX se concentre sur les effets sonores et Pika Speech sur la synthèse vocale expressive et le clonage de voix. L’ensemble est pour l’instant accessible exclusivement via Pika API Club.

Pika Soundtrack analyse directement une vidéo pour générer musique, ambiance, voix et effets sonores synchronisés avec l’action. Le prompt peut rester vide pour produire un environnement sonore complet ou servir à préciser les éléments à privilégier ou à exclure. Dans ses propres tests face à LTX-2.3 Foley V2A, HunyuanVideo-Foley et MMAudio v2, Pika revendique le meilleur alignement sémantique et la plus faible désynchronisation audiovisuelle, avec 0,617 seconde de calcul par seconde de vidéo générée.

Pika Music accepte plusieurs types d’entrées combinables : prompt textuel, paroles, référence vocale ou morceau de référence. Il peut produire des chansons pouvant atteindre six minutes, avec la possibilité de mélanger ces différents signaux au sein d’une même génération. Pika indique qu’un morceau de 90 secondes est généré en moyenne en 6,21 secondes dans ses tests, soit environ 14,5 fois plus vite que sa durée de lecture.

Pika SFX transforme une description en effet sonore pouvant atteindre 20 secondes en stéréo 44,1 kHz. Le modèle peut travailler un événement isolé ou une séquence plus longue en tenant compte du matériau, de l’espace, de la perspective, du timing ou de la texture demandée. L’entreprise mesure un temps moyen de génération de 0,847 seconde dans son benchmark local.

Pika Speech complète la gamme avec du text-to-speech en 48 kHz. Il peut utiliser des voix prédéfinies ou créer un clone vocal à partir de quelques secondes de référence, tandis qu’une description permet de guider le rythme, l’intonation ou le timbre. Les requêtes peuvent atteindre cinq minutes et Pika annonce un real-time factor de 0,02 dans ses tests locaux, soit environ une seconde de calcul pour une minute de parole.

Le prix constitue l’autre axe mis en avant par Pika. L’entreprise affirme que ses modèles audio peuvent coûter jusqu’à 20 fois moins cher que certaines alternatives selon la catégorie. Elle compare notamment Pika Speech à ElevenLabs v3, Cartesia, ElevenLabs Turbo et Fish Audio, et Pika Music à plusieurs modèles musicaux concurrents. Ces écarts reposent sur les prix catalogue relevés par Pika et doivent donc être lus comme des comparaisons publiées par l’entreprise, non comme un benchmark tarifaire indépendant.