← Retour au blog
tech 1 juin 2026

Faire tourner un LLM sur un Xeon de 10 ans : ce que Christina Sørensen a démontré

Christina Sørensen a montré qu'un Xeon E5-2620 v4 de 2016 peut faire tourner Gemma 3 à des vitesses utilisables. Ce que son benchmark nous apprend sur le vrai goulet d'étranglement de l'inférence LLM sur CPU : la bande passante mémoire, pas le compute.

Article inspiré de la source originale
Gemma 3 on a 2016 Xeon — Christina Sørensen ↗ point.free

De quoi parle cet article

C'est un commentaire sur un benchmark publié par Christina Sørensen (Lead SWE chez Vitvio, NixOS Steering Committee) dans lequel elle fait tourner Gemma 3 sur un Intel Xeon E5-2620 v4 de 2016. L'article original est dans le lien source ci-dessus — lis-le d'abord ; ce texte se contente de résumer ce qu'il faut en retenir si tu décides côté équipe entre du compute CPU bon marché et du GPU coûteux.

La machine

  • CPU : Intel Xeon E5-2620 v4 (Broadwell-EP, 2016) — 8 cœurs / 16 threads, base 2,1 GHz, AVX2.
  • RAM : DDR4 ECC (la génération v4 a fait passer les Xeon en DDR4 ; la v3 était la dernière en DDR3). Ce qui compte c'est la bande passante de la carte, pas la quantité.
  • GPU : aucun.

Sur le papier ça semble dix ans dépassé. En vrai, pour un usage solo en homelab, c'est largement suffisant pour des modèles petits ou moyens.

Pourquoi ça marche : le mur mémoire

L'inférence LLM sur CPU n'est pas limitée par la puissance de calcul. Elle est limitée par la bande passante mémoire — chaque token généré demande que les poids du modèle transitent de la RAM jusqu'aux cœurs en passant par les caches. Le Xeon E5-2620 v4 a quatre canaux DDR4 ; c'est assez pour nourrir les cœurs avec un modèle quantisé de 2 à 7 milliards de paramètres.

C'est aussi pour ça que des CPUs modernes plus chers ne gagnent pas toujours autant que leur TDP le suggère sur cette tâche — ils tapent dans le même mur mémoire.

Ce que la mesure de Christina montre vraiment

Le propos utile n'est pas « le vieux matos vaut le neuf ». C'est plus précis et plus intéressant :

  1. La quantization change la donne : avec un Gemma 3 quantisé en 4 bits, le working set tient en quelques Go, et la bande passante DDR4 d'une carte de 2016 suffit à produire un flux de tokens stable.
  2. llama.cpp est CPU-first : contrairement à une idée reçue, llama.cpp a été construit pour tourner sur CPU et traite l'accélération GPU comme un chemin optionnel. C'est le bon outil pour ce type de matériel.
  3. Le débit est mono-utilisateur : la mesure cible une génération à la fois, pas un service multi-tenants. Pour servir beaucoup d'utilisateurs, le coût par token par seconde favorise toujours les GPUs modernes.

Quand ça compte pour une équipe

Si tu es une startup, tu n'as pas besoin d'un H100 pour prototyper une feature IA. Une vieille tour CPU — même de dix ans — suffit pour valider les prompts, le schéma de sortie et les cibles de latence en local avant la moindre dépense cloud. Une fois qu'il faut servir des vrais utilisateurs, l'équation bascule vers le GPU. Utilise le chemin pas cher pendant la phase où se tromper est normal ; paie le chemin rapide quand la question n'est plus si mais combien.

Lis l'original

Ce texte est un résumé. Les vraies mesures, la configuration OS et les détails runtime sont dans l'article de Christina. Ouvre le lien source ci-dessus et lis-le — c'est elle qui a fait le travail, on ne fait que pointer dessus.

Xeon LLM Optimisation Hardware Performance
Newsletter Deepthix · 100% IA · chaque lundi 8h

Un agent IA lit la tech à ta place.

Notre agent IA scanne ~200 sources par semaine et te livre les meilleurs articles le lundi 8h. Gratuit. 1 clic pour se désinscrire.

Voir la page newsletter →

Tu veux automatiser tes opérations ?

Discutons de ton projet en 15 minutes.

Réserver un call