De quoi parle cet article
C'est un commentaire sur un benchmark publié par Christina Sørensen (Lead SWE chez Vitvio, NixOS Steering Committee) dans lequel elle fait tourner Gemma 3 sur un Intel Xeon E5-2620 v4 de 2016. L'article original est dans le lien source ci-dessus — lis-le d'abord ; ce texte se contente de résumer ce qu'il faut en retenir si tu décides côté équipe entre du compute CPU bon marché et du GPU coûteux.
La machine
- CPU : Intel Xeon E5-2620 v4 (Broadwell-EP, 2016) — 8 cœurs / 16 threads, base 2,1 GHz, AVX2.
- RAM : DDR4 ECC (la génération v4 a fait passer les Xeon en DDR4 ; la v3 était la dernière en DDR3). Ce qui compte c'est la bande passante de la carte, pas la quantité.
- GPU : aucun.
Sur le papier ça semble dix ans dépassé. En vrai, pour un usage solo en homelab, c'est largement suffisant pour des modèles petits ou moyens.
Pourquoi ça marche : le mur mémoire
L'inférence LLM sur CPU n'est pas limitée par la puissance de calcul. Elle est limitée par la bande passante mémoire — chaque token généré demande que les poids du modèle transitent de la RAM jusqu'aux cœurs en passant par les caches. Le Xeon E5-2620 v4 a quatre canaux DDR4 ; c'est assez pour nourrir les cœurs avec un modèle quantisé de 2 à 7 milliards de paramètres.
C'est aussi pour ça que des CPUs modernes plus chers ne gagnent pas toujours autant que leur TDP le suggère sur cette tâche — ils tapent dans le même mur mémoire.
Ce que la mesure de Christina montre vraiment
Le propos utile n'est pas « le vieux matos vaut le neuf ». C'est plus précis et plus intéressant :
- La quantization change la donne : avec un Gemma 3 quantisé en 4 bits, le working set tient en quelques Go, et la bande passante DDR4 d'une carte de 2016 suffit à produire un flux de tokens stable.
llama.cppest CPU-first : contrairement à une idée reçue,llama.cppa été construit pour tourner sur CPU et traite l'accélération GPU comme un chemin optionnel. C'est le bon outil pour ce type de matériel.- Le débit est mono-utilisateur : la mesure cible une génération à la fois, pas un service multi-tenants. Pour servir beaucoup d'utilisateurs, le coût par token par seconde favorise toujours les GPUs modernes.
Quand ça compte pour une équipe
Si tu es une startup, tu n'as pas besoin d'un H100 pour prototyper une feature IA. Une vieille tour CPU — même de dix ans — suffit pour valider les prompts, le schéma de sortie et les cibles de latence en local avant la moindre dépense cloud. Une fois qu'il faut servir des vrais utilisateurs, l'équation bascule vers le GPU. Utilise le chemin pas cher pendant la phase où se tromper est normal ; paie le chemin rapide quand la question n'est plus si mais combien.
Lis l'original
Ce texte est un résumé. Les vraies mesures, la configuration OS et les détails runtime sont dans l'article de Christina. Ouvre le lien source ci-dessus et lis-le — c'est elle qui a fait le travail, on ne fait que pointer dessus.