Introduction
Depuis quelques années, un test apparemment absurde est devenu un critère de référence dans le monde de l'IA : demander à un modèle de générer une image SVG d'un pélican sur un vélo. Ce qui a commencé comme une blague est maintenant un outil sérieux pour évaluer les capacités créatives des modèles de langage. Avec des milliards de dollars en jeu, se pourrait-il que les laboratoires d'IA soient tentés de 'pelicanmaxxer', c'est-à-dire d'optimiser leurs modèles spécifiquement pour ce test ?
Le Test du Pélican sur Vélo
Simon Willison, un développeur et blogueur renommé, a popularisé ce test en l'utilisant pour chaque nouvelle version de modèle de langage important. Le test est devenu une référence sur des forums comme Hacker News, suscitant des discussions sur sa validité et sur la tentation pour les laboratoires d'améliorer uniquement ce critère.
Méthodologie de l'Expérience
Pour explorer la question du 'pelicanmaxxing', Dylan Castillo a mené une expérience en générant 1 008 images SVG à travers sept modèles de pointe. Les modèles testés incluaient GPT-5.6 Terra, Claude Sonnet 5, et d'autres. Chaque modèle a reçu une série de 48 invites, combinant différents animaux et véhicules, afin de tester la flexibilité et la créativité des modèles.
Résultats de l'Expérience
Les résultats ont montré que les modèles d'IA ne se comportaient pas mieux avec le pélican sur vélo qu'avec d'autres combinaisons animal-véhicule. Par exemple, le taux de réussite pour générer une image cohérente était similaire entre un pélican sur un vélo et un flamant rose sur un scooter. Cela suggère que les laboratoires ne pelicanmaxxent pas leurs modèles, du moins pas de manière significative.
Limites et Interprétations
Il est important de noter que l'expérience ne couvrait qu'un sous-ensemble limité de modèles et de scénarios. Les résultats ne peuvent pas être généralisés à l'ensemble du domaine de l'IA. Cependant, ils fournissent des indices précieux sur le comportement des modèles face à des tâches spécifiques et complexes.
Conclusion
Alors, les laboratoires d'IA pelicanmaxxent-ils ? Les résultats de l'expérience de Dylan Castillo suggèrent que ce n'est pas le cas. Les modèles semblent avoir des capacités généralisées plutôt qu'optimisées pour des tâches spécifiques comme le pélican sur vélo. Cela dit, l'attrait pour des benchmarks facilement manipulables reste une préoccupation valable dans l'évaluation des modèles.
Discutons de ton projet en 15 minutes.