← Retour au blog
tech 22 août 2026

Comment nous avons fait en sorte qu'un modèle texte-parole réponde en moins de 50 ms

Découvrez comment nous avons optimisé notre modèle Qwen3-TTS pour atteindre un temps de réponse en dessous de 50 ms, tout en maintenant une performance de haut niveau.

Article inspiré de la source originale
How we made a text-to-speech model respond in sub-50 ms ↗ nari-labs.com

Introduction

Dans le monde actuel, la rapidité et l'efficacité sont des facteurs cruciaux pour les technologies de synthèse vocale. Lorsqu'il s'agit de text-to-speech (TTS), un des défis majeurs est de réduire le temps de réponse tout en assurant une qualité audio irréprochable. Chez Nari Labs, nous avons relevé ce défi avec notre modèle Qwen3-TTS, qui parvient désormais à répondre en moins de 50 ms. Voici comment nous avons fait.

Définir le TTS en temps réel

Pour comprendre notre approche, il est essentiel de définir ce que signifie réellement "en temps réel" pour un serveur TTS. Cela se résume à quatre éléments :

  • Faible TTFA audible : Le temps entre l'envoi de la requête et l'apparition du premier son doit être minimal.
  • Zéro underrun : Une fois la lecture commencée, l'audio ne doit jamais être interrompu.
  • Capacité : Les deux premiers critères doivent être respectés même avec une augmentation des requêtes par seconde (RPS).
  • Sortie non malformée : Le discours doit être compréhensible.

Performance des autres moteurs

Nous avons comparé l'implémentation Qwen3-TTS à d'autres moteurs comme vLLM-Omni et SGLang-Omni△. Nos tests ont montré que notre modèle est le seul à atteindre un p95 TTFA sous la barre des 50 ms.

Comment nous avons optimisé Qwen3-TTS

L'optimisation de Qwen3-TTS a nécessité plusieurs étapes clés :

  1. Suppression du silence initial : Nous avons détecté et éliminé les silences en tête de l'audio généré par le modèle.
  2. Amélioration du pipeline de traitement : En optimisant chaque étape du processus, nous avons réduit les délais cumulés.
  3. Utilisation efficace du matériel : L'utilisation d'une NVIDIA H100 SXM nous a permis de maximiser l'efficacité sans sacrifier la qualité.

Nous avons également testé notre modèle sous un trafic open-loop Poisson pour simuler des charges de travail réelles, et avons constaté que nous pouvions maintenir des performances sous-50 ms même à 10 RPS.

Ce qui suit ?

Nous continuons à affiner notre modèle pour accroître encore sa capacité tout en réduisant les coûts. Notre objectif est de rendre cette technologie accessible et abordable pour toutes les entreprises cherchant à intégrer des solutions TTS de haute qualité.

Discutons de ton projet en 15 minutes.

Conclusion

Optimiser un modèle TTS pour répondre en moins de 50 ms est un défi de taille, mais pas impossible. Avec les bonnes stratégies et technologies, il est possible de repousser les limites de ce qui est réalisable.

TTS Qwen3-TTS latency optimization real-time
Newsletter Deepthix · 100% IA · chaque lundi 8h

Un agent IA lit la tech à ta place.

Notre agent IA scanne ~200 sources par semaine et te livre les meilleurs articles le lundi 8h. Gratuit. 1 clic pour se désinscrire.

Voir la page newsletter →

Tu veux automatiser tes opérations ?

Discutons de ton projet en 15 minutes.

Réserver un call