Introduction
Les transformers sont devenus incontournables dans le domaine de l'intelligence artificielle, servant de base à des applications allant de la vision par ordinateur à la modélisation du langage. Au cœur de leur succès se trouve le mécanisme d'attention QKV, basé sur trois projections : requête (Q), clé (K), et valeur (V). Mais cette complexité est-elle vraiment nécessaire ? Cet article se penche sur une étude récente qui explore l'impact de la réduction de ces projections à une ou deux.
Variantes de partage de projections
Q-K=V : Clés et valeurs partagées
Cette approche envisage que les clés et les valeurs puissent occuper des espaces représentationnels similaires, ce qui permet de réduire de moitié le cache KV avec seulement une augmentation de 3,1% de la perplexité dans la modélisation du langage. Dans un contexte d'inférence sur appareil, cette réduction est significative.
Q=K-V : Requête et clé partagées
Bien que cette variante crée des cartes d'attention symétriques, elle brise la directionnalité de l'attention, ce qui peut nuire à la qualité des résultats. Cependant, elle offre des gains d'efficacité intéressants dans certains cas spécifiques.
Q=K=V : Projection unique
L'utilisation d'une seule projection simplifie grandement le modèle, mais peut limiter la capacité du modèle à capter des dynamiques complexes entre requêtes, clés et valeurs. L'étude montre que dans certains cas, cette simplification peut néanmoins être suffisante pour des tâches spécifiques.
Expérimentations et résultats
Les auteurs de l'étude ont testé ces variantes sur des tâches synthétiques, ainsi que sur des ensembles de données de vision (MNIST, CIFAR, TinyImageNet) et de modélisation du langage avec des modèles allant de 300M à 1,2B de paramètres sur 10 milliards de tokens. Les résultats indiquent que les transformers avec partage de projections peuvent rivaliser, voire surpasser, les transformers traditionnels QKV, notamment dans des contextes où l'inférence sur appareil est cruciale.
Implications pratiques
La réduction de la mémoire requise pour le cache d'attention a des implications directes pour le déploiement sur des appareils limités en ressources. Le partage de projections, combiné avec des techniques comme le partage de têtes (GQA/MQA), permet une réduction significative des besoins en mémoire, facilitant ainsi l'inférence sur des appareils embarqués.
Conclusion
L'étude systématique des variantes QKV montre que les transformers n'ont pas nécessairement besoin de trois projections pour être efficaces. En explorant des configurations moins complexes, il est possible de réduire la consommation de ressources tout en maintenant une performance compétitive. Pour les développeurs et décideurs, cela ouvre la voie à des modèles plus légers et plus adaptables. Discutons de ton projet en 15 minutes.
Références
- Kayyam, A., Madan Gopal, A., Lewis, M. A. (2026). "Do Transformers Need Three Projections? Systematic Study of QKV Variants." ICML 2026.
Code source
Le code de l'étude est disponible publiquement à cette [URL].