Introduction
Dans le monde actuel, la rapidité et l'efficacité sont des facteurs cruciaux pour les technologies de synthèse vocale. Lorsqu'il s'agit de text-to-speech (TTS), un des défis majeurs est de réduire le temps de réponse tout en assurant une qualité audio irréprochable. Chez Nari Labs, nous avons relevé ce défi avec notre modèle Qwen3-TTS, qui parvient désormais à répondre en moins de 50 ms. Voici comment nous avons fait.
Définir le TTS en temps réel
Pour comprendre notre approche, il est essentiel de définir ce que signifie réellement "en temps réel" pour un serveur TTS. Cela se résume à quatre éléments :
- Faible TTFA audible : Le temps entre l'envoi de la requête et l'apparition du premier son doit être minimal.
- Zéro underrun : Une fois la lecture commencée, l'audio ne doit jamais être interrompu.
- Capacité : Les deux premiers critères doivent être respectés même avec une augmentation des requêtes par seconde (RPS).
- Sortie non malformée : Le discours doit être compréhensible.
Performance des autres moteurs
Nous avons comparé l'implémentation Qwen3-TTS à d'autres moteurs comme vLLM-Omni et SGLang-Omni△. Nos tests ont montré que notre modèle est le seul à atteindre un p95 TTFA sous la barre des 50 ms.
Comment nous avons optimisé Qwen3-TTS
L'optimisation de Qwen3-TTS a nécessité plusieurs étapes clés :
- Suppression du silence initial : Nous avons détecté et éliminé les silences en tête de l'audio généré par le modèle.
- Amélioration du pipeline de traitement : En optimisant chaque étape du processus, nous avons réduit les délais cumulés.
- Utilisation efficace du matériel : L'utilisation d'une NVIDIA H100 SXM nous a permis de maximiser l'efficacité sans sacrifier la qualité.
Nous avons également testé notre modèle sous un trafic open-loop Poisson pour simuler des charges de travail réelles, et avons constaté que nous pouvions maintenir des performances sous-50 ms même à 10 RPS.
Ce qui suit ?
Nous continuons à affiner notre modèle pour accroître encore sa capacité tout en réduisant les coûts. Notre objectif est de rendre cette technologie accessible et abordable pour toutes les entreprises cherchant à intégrer des solutions TTS de haute qualité.
Discutons de ton projet en 15 minutes.
Conclusion
Optimiser un modèle TTS pour répondre en moins de 50 ms est un défi de taille, mais pas impossible. Avec les bonnes stratégies et technologies, il est possible de repousser les limites de ce qui est réalisable.