← Retour au blog
tech 9 septembre 2026

Mercury 2.5 : Une avancée majeure dans les modèles de diffusion

Mercury 2.5 marque un tournant dans le domaine des modèles de langage de diffusion, offrant une intelligence accrue et une latence réduite, tout en restant accessible en termes de coût. Découvre comment cette innovation pourrait transformer ton entreprise.

Article inspiré de la source originale
Mercury 2.5 ↗ www.inceptionlabs.ai

Introduction

L'ère des modèles de langage de diffusion a franchi une nouvelle étape avec le lancement de Mercury 2.5 par Inception Labs. Ce modèle de production avancé promet d'offrir une intelligence supérieure, une rapidité d'exécution accrue, et tout cela à un coût réduit. Alors que Mercury 2 a déjà conquis des milliers de développeurs et a vu son utilisation croître de manière exponentielle, Mercury 2.5 va encore plus loin en termes de capacités et de performance.

Ce qui a changé avec Mercury 2.5

Mercury 2.5 se positionne comme le modèle de diffusion le plus avancé sur le marché actuel. Avec une augmentation de 40 % de l'intelligence par rapport à Mercury 2, il se compare aux modèles de pointe comme GPT-5.6 Luna (Low), Gemini 3.5 Flash-Lite, et Claude Haiku 4.5. Le modèle traite 1 107 tokens par seconde sur des GPU NVIDIA largement disponibles, avec une capacité de contexte de 260 000 tokens.

En termes de coût, Mercury 2.5 est proposé à un tarif compétitif de 0,20 $ par million d'entrées et 0,75 $ par million de sorties, avec un prix de lancement à un rabais impressionnant de 80 %.

Applications pratiques de Mercury 2.5

Agents de recherche et pipelines RAG

Dans le domaine de la recherche, Mercury 2.5 s'avère être un atout précieux. Chaque requête de recherche peut déclencher des dizaines d'appels de modèle pour planifier la recherche, réécrire les requêtes, reclasser les résultats, structurer les faits, résumer les sources et vérifier les réponses. Grâce à sa rapidité, Mercury permet à ces appels de rester dans le cadre d'une seule interaction utilisateur, ce qui est crucial pour les entreprises d'infrastructure de recherche qui l'ont intégré en production.

Agents vocaux et applications interactives

Dans les applications vocales, la latence est un facteur crucial. OpenCall, qui développe des agents téléphoniques IA pour gérer les appels clients en direct, a vu son temps de réponse médian se rapprocher de 170 millisecondes grâce à Mercury. Selon Oliver Silverstein, cofondateur et PDG d'OpenCall, le passage à Mercury a permis de réduire le temps de réponse P99 de plusieurs minutes à une seconde et le P50 de 0,4 seconde à moins de 0,2 seconde.

Conclusion

Mercury 2.5 est plus qu'une simple mise à jour ; c'est une transformation dans la manière dont les modèles de diffusion peuvent être utilisés dans des environnements de production réels. Avec ses capacités améliorées, sa rapidité et son coût abordable, il ouvre de nouvelles possibilités pour les entreprises cherchant à intégrer des modèles d'IA avancés dans leurs opérations.

Discutons de ton projet en 15 minutes.

Mercury 2.5 diffusion models AI latency NVIDIA
Newsletter Deepthix · 100% IA · chaque lundi 8h

Un agent IA lit la tech à ta place.

Notre agent IA scanne ~200 sources par semaine et te livre les meilleurs articles le lundi 8h. Gratuit. 1 clic pour se désinscrire.

Voir la page newsletter →

Tu veux automatiser tes opérations ?

Discutons de ton projet en 15 minutes.

Réserver un call