← Retour au blog
tech 22 juillet 2026

Les Labs d'IA sont-ils en train de 'Pelicanmaxxer' ?

Le test du pélican sur vélo est devenu un benchmark célèbre pour évaluer les modèles d'IA. Mais les laboratoires d'IA sont-ils en train de truquer leurs modèles pour réussir ce test ?

Article inspiré de la source originale
Are AI Labs Pelicanmaxxing? ↗ dylancastillo.co

Introduction

Depuis quelques années, un test apparemment absurde est devenu un critère de référence dans le monde de l'IA : demander à un modèle de générer une image SVG d'un pélican sur un vélo. Ce qui a commencé comme une blague est maintenant un outil sérieux pour évaluer les capacités créatives des modèles de langage. Avec des milliards de dollars en jeu, se pourrait-il que les laboratoires d'IA soient tentés de 'pelicanmaxxer', c'est-à-dire d'optimiser leurs modèles spécifiquement pour ce test ?

Le Test du Pélican sur Vélo

Simon Willison, un développeur et blogueur renommé, a popularisé ce test en l'utilisant pour chaque nouvelle version de modèle de langage important. Le test est devenu une référence sur des forums comme Hacker News, suscitant des discussions sur sa validité et sur la tentation pour les laboratoires d'améliorer uniquement ce critère.

Méthodologie de l'Expérience

Pour explorer la question du 'pelicanmaxxing', Dylan Castillo a mené une expérience en générant 1 008 images SVG à travers sept modèles de pointe. Les modèles testés incluaient GPT-5.6 Terra, Claude Sonnet 5, et d'autres. Chaque modèle a reçu une série de 48 invites, combinant différents animaux et véhicules, afin de tester la flexibilité et la créativité des modèles.

Résultats de l'Expérience

Les résultats ont montré que les modèles d'IA ne se comportaient pas mieux avec le pélican sur vélo qu'avec d'autres combinaisons animal-véhicule. Par exemple, le taux de réussite pour générer une image cohérente était similaire entre un pélican sur un vélo et un flamant rose sur un scooter. Cela suggère que les laboratoires ne pelicanmaxxent pas leurs modèles, du moins pas de manière significative.

Limites et Interprétations

Il est important de noter que l'expérience ne couvrait qu'un sous-ensemble limité de modèles et de scénarios. Les résultats ne peuvent pas être généralisés à l'ensemble du domaine de l'IA. Cependant, ils fournissent des indices précieux sur le comportement des modèles face à des tâches spécifiques et complexes.

Conclusion

Alors, les laboratoires d'IA pelicanmaxxent-ils ? Les résultats de l'expérience de Dylan Castillo suggèrent que ce n'est pas le cas. Les modèles semblent avoir des capacités généralisées plutôt qu'optimisées pour des tâches spécifiques comme le pélican sur vélo. Cela dit, l'attrait pour des benchmarks facilement manipulables reste une préoccupation valable dans l'évaluation des modèles.

Discutons de ton projet en 15 minutes.

AI pelicanmaxxing benchmarking language models SVG generation
Newsletter Deepthix · 100% IA · chaque lundi 8h

Un agent IA lit la tech à ta place.

Notre agent IA scanne ~200 sources par semaine et te livre les meilleurs articles le lundi 8h. Gratuit. 1 clic pour se désinscrire.

Voir la page newsletter →

Tu veux automatiser tes opérations ?

Discutons de ton projet en 15 minutes.

Réserver un call