Introduction
Qu'on se le dise, utiliser des modèles de langage (LLM) pour classer des produits ou des requêtes de recherche est devenu une routine. Pourtant, ces modèles peinent souvent à s'adapter au vocabulaire prédéfini des marques, couleurs et catégories autorisées par un système. Imaginons le jeu de données e-commerce de Wayfair WANDS : comment classifier une requête telle que "table basse en bois" parmi des centaines de catégories possibles ?
Le problème des classifications classiques
Les méthodes traditionnelles s'appuient sur des sorties structurées. Tu définis une liste de valeurs autorisées et fais en sorte que tes modèles s'y conforment. Dans l'exemple de Wayfair, cela signifie créer un énorme ensemble de valeurs légales, un processus coûteux en temps et en ressources. Même avec des outils comme Pydantic en Python, l'effort reste conséquent.
Prenons l'exemple de Pydantic :
```python from typing import Literal from pydantic import BaseModel, Field
FullyQualifiedClassifications = Literal[ 'Furniture / Bedroom Furniture / Beds & Headboards / Beds', ... # 500 autres ]
class QueryClassification(BaseModel): classifications: list[FullyQualifiedClassifications] = Field(description="Classification possible pour le produit.") ```
Une alternative innovante : l'hallucination
Plutôt que de s'enliser dans des modèles complexes, pourquoi ne pas demander à un LLM "bête" de créer des classifications fictives mais plausibles ? C'est l'idée derrière l'hallucination contrôlée. En générant des classifications fictives et originales, on contourne les limitations des modèles classiques tout en réduisant les coûts.
Exemple d'hallucination
``python hallucination_prompt = f""" Votre mission est de créer des classifications inédites pour une requête de recherche. Voici la requête : table basse en bois """ ``
L'idée est simple et efficace : demander à un modèle de langage de concevoir des classifications jamais vues auparavant, adaptées au contexte donné.
Avantages et limitations
Avantages
- Économie de ressources : L'hallucination permet l'utilisation de modèles plus petits et moins coûteux.
- Flexibilité : Pas besoin de maintenir une liste énorme de classifications prédéfinies.
- Innovation : Cette approche favorise la créativité du modèle, souvent sous-exploitée.
Limitations
- Contrôle réduit : L'hallucination peut conduire à des classifications inattendues.
- Nécessité de validation : Les résultats doivent être vérifiés pour s'assurer de leur pertinence et conformité.
Cas d'usage et impact économique
Prenons le cas d'une entreprise de e-commerce qui doit classifier des milliers de nouveaux produits chaque jour. En intégrant l'hallucination contrôlée, elle pourrait réduire ses coûts de classification de 30 à 50 %, tout en augmentant la vitesse de traitement.
Conclusion
L'hallucination contrôlée change la donne en matière de classification de données. Elle offre une alternative viable et économique aux méthodes traditionnelles tout en apportant une flexibilité inédite. Curieux de voir comment cela peut transformer ton projet ?
Discutons de ton projet en 15 minutes.