Introduction
L'ère des modèles de langage de diffusion a franchi une nouvelle étape avec le lancement de Mercury 2.5 par Inception Labs. Ce modèle de production avancé promet d'offrir une intelligence supérieure, une rapidité d'exécution accrue, et tout cela à un coût réduit. Alors que Mercury 2 a déjà conquis des milliers de développeurs et a vu son utilisation croître de manière exponentielle, Mercury 2.5 va encore plus loin en termes de capacités et de performance.
Ce qui a changé avec Mercury 2.5
Mercury 2.5 se positionne comme le modèle de diffusion le plus avancé sur le marché actuel. Avec une augmentation de 40 % de l'intelligence par rapport à Mercury 2, il se compare aux modèles de pointe comme GPT-5.6 Luna (Low), Gemini 3.5 Flash-Lite, et Claude Haiku 4.5. Le modèle traite 1 107 tokens par seconde sur des GPU NVIDIA largement disponibles, avec une capacité de contexte de 260 000 tokens.
En termes de coût, Mercury 2.5 est proposé à un tarif compétitif de 0,20 $ par million d'entrées et 0,75 $ par million de sorties, avec un prix de lancement à un rabais impressionnant de 80 %.
Applications pratiques de Mercury 2.5
Agents de recherche et pipelines RAG
Dans le domaine de la recherche, Mercury 2.5 s'avère être un atout précieux. Chaque requête de recherche peut déclencher des dizaines d'appels de modèle pour planifier la recherche, réécrire les requêtes, reclasser les résultats, structurer les faits, résumer les sources et vérifier les réponses. Grâce à sa rapidité, Mercury permet à ces appels de rester dans le cadre d'une seule interaction utilisateur, ce qui est crucial pour les entreprises d'infrastructure de recherche qui l'ont intégré en production.
Agents vocaux et applications interactives
Dans les applications vocales, la latence est un facteur crucial. OpenCall, qui développe des agents téléphoniques IA pour gérer les appels clients en direct, a vu son temps de réponse médian se rapprocher de 170 millisecondes grâce à Mercury. Selon Oliver Silverstein, cofondateur et PDG d'OpenCall, le passage à Mercury a permis de réduire le temps de réponse P99 de plusieurs minutes à une seconde et le P50 de 0,4 seconde à moins de 0,2 seconde.
Conclusion
Mercury 2.5 est plus qu'une simple mise à jour ; c'est une transformation dans la manière dont les modèles de diffusion peuvent être utilisés dans des environnements de production réels. Avec ses capacités améliorées, sa rapidité et son coût abordable, il ouvre de nouvelles possibilités pour les entreprises cherchant à intégrer des modèles d'IA avancés dans leurs opérations.
Discutons de ton projet en 15 minutes.