← Retour au blog
tech 29 août 2026

Exécuter Qwen3.8 27B localement : chiffres réels depuis mon Mac Studio

Découvre comment Qwen3.8 27B, un modèle dense de 27,3 milliards de paramètres, fonctionne sur un Mac Studio. Analyse des performances, besoins en RAM et conseils pour l'exécution locale.

Article inspiré de la source originale
Run Qwen3.8 27B locally: real numbers from my Mac Studio ↗ terminalbytes.com

Introduction

L'IA locale est en pleine expansion. Avec des modèles comme Qwen3.8 27B, tu peux désormais exécuter des tâches complexes directement depuis ton Mac Studio. Ce modèle de 27,3 milliards de paramètres promet des performances de pointe tout en restant accessible.

Qu'est-ce que Qwen3.8 27B ?

Qwen3.8 27B est un modèle dense avec une conception d'attention hybride, intégrant la compréhension d'images et de vidéos. Il offre une fenêtre contextuelle native de 262 144 tokens et est distribué sous licence Apache 2.0. Selon la carte du modèle officielle, il obtient 61,7 sur SWE-bench Pro et 89,2 sur GPQA Diamond.

Performance sur Mac Studio

Sur mon Mac Studio M3 Ultra, Qwen3.8 27B (Q4_K_M, 17GB) génère environ 14 tokens par seconde via Ollama. Comparativement, son prédécesseur, Qwen3.6:27B, atteint environ 28,6 tokens par seconde. Bien que cela semble inférieur, Qwen3.8 utilise environ un tiers des tokens pour répondre aux mêmes invites, ce qui rend le temps total de réponse presque équivalent.

Expérience 1-bit : ce que j'ai découvert

J'ai testé une quantification 1-bit (6,7GB) et ai constaté qu'elle génère à 27 tokens par seconde dans llama.cpp. Cependant, elle a du mal à fournir des réponses cohérentes. Il est crucial d'utiliser une version récente de llama.cpp, car les anciennes versions échouent avec l'architecture inconnue 'qwen35'.

Besoins en RAM

Pour exécuter Qwen3.8 27B confortablement, 32GB de RAM sont nécessaires pour Q4 et 16GB pour Q2. Ces chiffres sont essentiels pour prévoir l'infrastructure nécessaire à l'exécution locale.

Comment l'utiliser au quotidien

Qwen3.8 27B s'intègre parfaitement dans mon flux de travail quotidien. Il résume mes flux RSS, renomme et classe automatiquement les PDF, et gère diverses tâches de synthèse. C'est la première fois que je fais confiance à un modèle local pour des tâches aussi cruciales.

Conclusion

Qwen3.8 27B prouve qu'un modèle dense et puissant peut être exécuté localement, transformant la manière dont nous interagissons avec l'IA. Sa capacité à traiter des tâches complexes en fait un outil indispensable pour les professionnels de la tech. Prêt à explorer les possibilités ?

Discutons de ton projet en 15 minutes.

Qwen3.8 Local AI Mac Studio Model Performance AI Automation
Newsletter Deepthix · 100% IA · chaque lundi 8h

Un agent IA lit la tech à ta place.

Notre agent IA scanne ~200 sources par semaine et te livre les meilleurs articles le lundi 8h. Gratuit. 1 clic pour se désinscrire.

Voir la page newsletter →

Tu veux automatiser tes opérations ?

Discutons de ton projet en 15 minutes.

Réserver un call