Introduction
L'industrie du codage automatique est en pleine effervescence avec l'arrivée de SWE-2, le dernier né de Cognition. Ce modèle promet de révolutionner le paysage en repoussant les frontières de la performance et du coût. Face à des géants comme Fable 5.1 et GPT-Astra, SWE-2 se positionne comme un acteur incontournable.
SWE-2 : Une avancée significative
SWE-2 a été conçu pour dépasser la performance de ses prédécesseurs tout en étant plus économique. Le modèle atteint 50,0% sur le benchmark FrontierCode 1.1 Main, se rapprochant ainsi de Fable 5.1 avec un coût réduit de 64%. Cette prouesse est le résultat d'une montée en échelle sans précédent de l'apprentissage par renforcement (RL) à un régime de paramètres multi-billions.
Scalabilité et Efficacité
En s'appuyant sur l'infrastructure de formation SWE-1.72, SWE-2 introduit un nouvel algorithme de RL qui entraîne tous les niveaux d'effort de raisonnement en une seule fois. Cela permet d'avancer l'ensemble de la frontière coût-performance. Le modèle post-formé à partir de Kimi K33, un modèle de 2,8T paramètres, a bénéficié d'une optimisation continue, ajoutant 5 à 6 points sur de nombreux benchmarks.
Comparaison avec les Concurrents
Performance Benchmark
SWE-2 se démarque non seulement par sa performance mais également par son coût avantageux. Sur le benchmark FrontierCode 1.1 Main, SWE-2 obtient 50,0%, surpassant SWE-1.7 et Grok 4.6, et se rapprochant de GPT-6 Astra à un quart du prix. De plus, sur DeepSWE 1.1, SWE-2 atteint 73,0%, se positionnant très proche de Fable 5.1.
Optimisation des Coûts
L'approche de SWE-2 en matière de coût implique l'application de pénalités linéaires par niveau d'effort, ajustées pour refléter les coûts réels des utilisateurs. Cette méthode, dérivée de principes fondamentaux, permet de préserver la forme de la frontière de Pareto tout en avançant ses limites.
Innovations Technologiques
Bases de Récompense et Environnements RL
Cognition a introduit des avancées comme des baselines de récompense pondérées par la longueur, stabilisant significativement l'entraînement. En triplant le nombre d'environnements RL et en ajoutant des overlays de suivi d'instruction, SWE-2 améliore la robustesse de ses résultats.
Efficacité de l'Entraînement
Avec l'utilisation des noyaux NVFP4/FP8 et de la quantification consciente, SWE-2 réduit la mémoire totale nécessaire, permettant une correspondance entraînement-inférence plus optimisée que SWE-1.7 malgré un modèle de base trois fois plus grand.
Conclusion
SWE-2 n'est pas seulement un modèle de codage avancé, il redéfinit les standards de performance et de coût dans l'industrie. Sa capacité à rivaliser avec des modèles tels que Fable 5.1 et GPT-Astra en fait un choix stratégique pour les entreprises cherchant à optimiser leurs processus de développement de logiciels.
Discutons de ton projet en 15 minutes.