Qwen3.8 - comment l'exécuter localement
Guide pour exécuter les quants Qwen3.8, y compris Qwen3.8-27B, sur votre configuration locale.
Qwen3.8 est la nouvelle famille de modèles de Qwen, comprenant Qwen3.8-27B, Qwen3.8-2.4T-A95B et Qwen3.8-Max. Qwen3.8-27B a vision et des capacités de raisonnement, une fenêtre de contexte de 256K et fonctionne localement sur des configurations avec 17 Go de RAM/VRAM Qwen3.8 excelle dans le codage agentique, les tâches de vision et de chat, et peut désormais s'exécuter via les GGUF Unsloth, NVFP4 et Unsloth Desktop. Qwen3.8-2.4T-A95B est un modèle de 2,4 T de paramètres (95B actifs) rivalisant avec GPT-5.6 Sol.
Mise à jour du 19 août : Les GGUF de Qwen3.8-27B utilisent désormais Unsloth Dynamic V3.0 pour 10 % de précision en plus à taille égale, surpassant largement les autres.
Merci à Qwen pour l'accès dès le jour de la sortie. Les quantifications Unsloth incluent également :
Prise en charge du rôle développeur pour des outils agentiques comme Codex
MTP activé pour une inférence rapide
Appel d'outils : Analyse améliorée des objets imbriqués pour faire réussir davantage les outils
Le Qwen3.8-2.4T-A95B en précision complète nécessite 4,9 To de stockage et du 1 bit Unsloth Les GGUF dynamiques prennent 397 Go (91 % plus petit), et le plus grand IQ1_S prend 508 Go.

Quantifications Unsloth :
⚙️ Guide d'utilisation
Exigences pour Qwen3.8-27B :
Qwen3.8-27B Les quantifications 4 bits fonctionnent sur 16-19 Go de VRAM comme une RTX 5080, une 4090 ou un Mac avec 24 Go de RAM. Tableau : exigences matérielles (unités = mémoire totale : RAM + VRAM, ou mémoire unifiée)
7-8 Go
9-11 Go
12-14 Go
16-19 Go
23-26 Go
31 Go
56 Go
Qwen3.8-2,4 T Exigences :
397 Go
508 Go
657 Go
2,6 To
4,9 To
Paramètres recommandés
Qwen3.8-Paramètres 27B :
Qwen3.8-27B est un raisonnement hybride modèle avec des paramètres par défaut différents pour les modes de réflexion et sans réflexion. Le niveau très élevé est activé par défaut, donc si vous voulez des traces de réflexion plus courtes, vous pouvez ajuster l'effort de réflexion:
température
1.0
0.7
top_p
0.95
0.80
top_k
20
20
min_p
0.0
0.0
presence_penalty
0.0
1.5
repetition_penalty
1.0
1.0
Fenêtre de contexte maximale :
262,144(peut être étendue à 1 M via YaRN)Mode de réflexion :
température=1.0,top_p=0.95,top_k=20,min_p=0.0,presence_penalty=0.0,repetition_penalty=1.0Mode Instruct (ou sans réflexion) :
température=0.7,top_p=0.80,top_k=20,min_p=0.0,presence_penalty=1.5,repetition_penalty=1.0
Qwen3.8-Paramètres 2,4 T :
Qwen3.8-2.4T est uniquement pour le raisonnement, tandis que Qwen3.8-Max est hybride.
température = 1.0
top_p = 0.95
top_k = 20
min_p = 0.0
presence_penalty = 0.0
Longueur de contexte = jusqu'à
1,010,000température=1.0,top_p=0.95,top_k=20,min_p=0.0,presence_penalty=0.0,repetition_penalty=1.0
Si le modèle tient en mémoire, vous obtiendrez une génération d'environ 20 jetons/s avec des B200 et un débit supérieur à 120 jetons/s. La meilleure règle empirique : RAM+VRAM ≈ la taille de la quantification ; sinon cela fonctionnera quand même, mais beaucoup plus lentement à cause du déchargement sur disque.
💡 Réflexion + conservation de la réflexion
Qwen3.8 a Conserver le raisonnement qui laisse la trace de réflexion de la conversation précédente. Cela augmente le nombre de jetons utilisés, mais peut améliorer la précision dans les conversations poursuivies. Unsloth dispose de bascules « Think » et « Raisonnement conservé » pour Qwen3.8 (voir à droite) :

Qwen3.8-27B est livré avec la prise en charge de reasoning_effort, qui peut être utilisé pour ajuster la profondeur du raisonnement et contrôler le coût. Ces bascules sont activées automatiquement dans Unsloth :
xhigh(par défaut) : pour les tâches complexes exigeant une analyse approfondiemedium: équilibre entre précision et rapiditélow: raisonnement efficace optimisé pour la vitesse et le coûtnone
Pour modifier l'effort de réflexion / de raisonnement dans unsloth run ou llama-server, utilisez --chat-template-kwargs '{"reasoning_effort":"medium"}'
Si vous êtes sur Windows Powershell, utilisez : --chat-template-kwargs "{\"reasoning_effort\":\"medium\"}"
Modifiez medium selon le niveau de raisonnement souhaité.
Guide d'exécution de Qwen3.8
Vous pouvez désormais exécuter Qwen3.8 dans llama.cpp et Unsloth Desktop. Pour le grand modèle Qwen3.8-2.T, nous utiliserons la quantification IQ1_XXXS de 397 Go IQ1_XXXS (nommée Q1_0) pour les meilleurs résultats en termes d'accessibilité et de précision, et elle nécessitera au moins 450 Go de RAM. N'hésitez pas à changer le type de quantification.
Hugging Face : Qwen3.8-27B-GGUF • Qwen3.8-27B-NVFP4
ModelScope : Qwen3.8-27B-GGUF • Qwen3.8-27B-NVFP4
2.4T-A95B : Qwen3.8-2.4T-A95B-GGUF
🦥 Exécuter Qwen3.8 dans Unsloth Desktop
Qwen3.8 peut s'exécuter dans Unsloth Desktopune application d'interface utilisateur open source pour l'IA locale. Unsloth décharge automatiquement vers la RAM et détecte les configurations multiGPU. Avec Unsloth Desktop, vous pouvez exécuter des modèles localement sur MacOS, Windows, Linux et :
Rechercher, télécharger, exécuter des GGUF, des modèles MLX et safetensor
Autoréparation appel d'outils + recherche web
Exécution de code (Python, Bash)
Inférence automatique ajustement des paramètres (temp, top-p, etc.)
Inférence rapide sur CPU + GPU via MLX et llama.cpp
Entraîner des LLM 2x plus rapide avec 70 % de VRAM en moins

Installer Unsloth
Le moyen le plus simple pour commencer est de télécharger l application Unsloth Desktop. Fonctionne sur macOS, Windows, et Linux.
Ou, si vous préférez une installation manuelle :
MacOS, Linux, WSL :
Windows PowerShell :
Rechercher et télécharger Qwen3.8
Accédez à Unsloth Chat ou au hub de modèles et recherchez Qwen3.8 dans la barre de recherche, puis téléchargez le modèle et la quantification souhaités.

Exécuter Qwen3.8
Les paramètres d'inférence devraient être définis automatiquement lors de l'utilisation d'Unsloth, mais vous pouvez toujours les modifier manuellement. Vous pouvez également modifier la longueur de contexte, le modèle de chat et d'autres paramètres.
Pour plus d'informations, vous pouvez consulter notre guide d'inférence Unsloth.
Par exemple, utiliser Unsloth Desktop avec le Qwen3.8 de 397 Go (91 % plus petit) vous permet d'activer les modes de réflexion, le canvas en ligne, la recherche web et l'exécution de code, et bien plus encore.

Servir Qwen3.8 avec l'API Unsloth
Vous pouvez utiliser unsloth run la commande et servir Qwen3.8 via une API à l'aide de llama-server des indicateurs d'exécution, y compris la taille du contexte, les couches GPU, l'enfilage, l'échantillonnage, la mise en réseau et la configuration des outils. Pour plus d'informations, consultez nos documents API ou unsloth start.
Unsloth est maintenant prêt
Vous pouvez aussi faire beaucoup d'autres choses avec Qwen3.8 via Unsloth Desktop, comme :
Connecter des outils : Claude Code, Codex, recherche web, MCP et plus encore
Entraîner des modèles : Affiner du texte, de la diffusion, l'intégration, et plus encore
Générer des médias : Créer et entraîner des images, des vidéos, TTS localement

Nouveaux types de données 1 bit Qwen3.8-2.4T-A95B
Nous avons étendu IQ1_S dans llama.cpp, qui est à 1,5625 bits par poids, à 1,1875 bpw en réduisant le nombre d'entrées dans le codebook - nous avons constaté que cela fonctionne bien pour les grands modèles, et peut encore conserver beaucoup de précision - nous avons également constaté que ces nouveaux types de données conviennent à la quantification post-entraînement (PTQ) sans avoir besoin de QAT ou QAD (entraînement / distillation sensible à la quantification). Qwen3.8-2.4T-A95B-GGUF
En raison de problèmes de nommage, nous avons utilisé TQ2_0, TQ1_0 et Q1_0, sinon cela n'apparaîtra pas dans le dépôt HF.
IQ1_S
IQ1_S
1.5625
2048
11
50 B
UD-IQ1_XS
TQ2_0
1.4375
1024
10
46 B
UD-IQ1_XXS
TQ1_0
1.3125
512
9
42 B
UD-IQ1_XXXS
Q1_0
1.1875
256
8
38 B
Nous effectuons toujours des benchmarks pour les nouveaux types de données, mais pour d'autres grands modèles, nous obtenons de bons résultats sans aucun QAT / QAD:
IQ1_S
553.204
2.578876
0.564553
78.882
UD-IQ1_XS
513.583
2.931261
0.690161
75.726
UD-IQ1_XXS
473.961
3.540383
0.876007
71.284
UD-IQ1_XXXS
434.340
4.488796
1.109944
66.257
🦙 Exécuter Qwen3.8 dans llama.cpp
Nous devons utiliser la branche spécifique IQ1_XXXS ici. Vous pouvez également suivre les instructions de compilation ci-dessous. Modifiez -DGGML_CUDA=ON en -DGGML_CUDA=OFF si vous n'avez pas de GPU ou si vous voulez simplement une inférence CPU. Pour les appareils Apple Mac / Metal, définissez -DGGML_CUDA=OFF puis poursuivez comme d'habitude - la prise en charge de Metal est activée par défaut.
Si vous voulez simplement exécuter la version standard IQ1_S et les autres quantifications, compilez alors llama.cpp normalement :
Téléchargez le modèle via (après avoir installé pip install huggingface_hub). Vous pouvez choisir Q1_0 pour IQ1_XXXS ou d'autres versions quantifiées comme Q8_0 . Si les téléchargements se bloquent, voir : Hugging Face Hub, débogage XET
Qwen3.8-27B :
Qwen3.8-2.4T :
Pour exécuter le modèle dans llama-cli, suivez les extraits de code ci-dessous : N'oubliez pas de modifier les paramètres selon votre cas d'utilisation.
Qwen3.8-27B :
Qwen3.8-2.4T :
Pour exécuter le UD-IQ1_S général, vous pouvez faire :
Qwen3.8-2.4T :
Puis pour l'exécuter :
⚡️NVFP4
Comme pour Qwen3.6, nous publions également de nouveaux Qwen3.8 NVFP4 dynamique-27B quants qui tournent ~1,5× plus rapides que les checkpoints BF16, avec de meilleures performances et des tailles de fichier comparables. Exécutez Qwen3.8-27B NVFP4 1,5x plus rapide sur 24 Go de VRAM. Nous avons également ajouté l'étalonnage du cache KV en FP8 pour des longueurs de contexte 2x plus longues ! NVFP4 nécessite les GPU Blackwell de NVIDIA comme les RTX 50X, DGX Spark (voir Qwen3.8-27B), GPU B200, B300. Pour les GPU plus anciens, nos GGUF fonctionnent bien ! Vous pouvez exécuter des quants NVFP4 dans vLLM uniquement pour le moment (SGLang n'est pas pris en charge).
Qwen3.8-27B-NVFP4 quant
1
89.8
133.7
1.49x
89.8
133.7
8
649.4
938.8
1.45x
81.2
117.3
32
1983.0
2787.0
1.41x
62.0
87.1
64
3048.5
4407.2
1.45x
47.6
68.9
Voir ci-dessous les benchmarks précédents réalisés pour Qwen3.6, comparant également d'autres implémentations NVFP4 qui utilisent des activations 16 bits à nos activations NVFP4 :

Tous les benchmarks utilisent 1× B200 avec une concurrence de 128. Une concurrence plus élevée peut porter le 35B à 17 561 jetons/s.
Pour les benchmarks de précision, nous avons exécuté KLD et l'accord Top-1 sur le code, le chat et de nombreux domaines. NVFP4 récupère de manière cohérente 92 % à 97 % de la précision par rapport à BF16
zh
0.01628
93.55%
code
0.02600
96.68%
refgen
0.03993
94.46%
chat
0.05818
92.15%
ja / ko / ru / es
0.0124-0.0155
94-95%
Pour les benchmarks de précision pour Qwen 3.6, nous avons réalisé MMLU-Pro, AIME 2025, GPQA pour FP8, BF16, le NVFP4 de NVIDIA et nos NVFP4 — nous montrons que nos quants plus rapides se comportent de manière similaire sur tous :

Pour plus d'informations, vous pouvez lire notre article de blog sur les quants NVFP4 dynamiques.
Pour exécuter des quants NVFP4, voir ci-dessous les commandes pour exécuter Qwen3.8-27B dans vLLM ou SGLang:
vLLM :
Pour installer vLLM dans un venv séparé :
Puis, pour servir la variante 27B :
Pour activer MTP / le décodage spéculatif (décodage plus rapide mais avec un débit quelque peu inférieur), utilisez :
Si vous rencontrez des problèmes avec Torchcodec, assurez-vous de faire ce qui suit, puis relancez vllm.
SGLang :
Si vous utilisez SGLang, vous devez utiliser SGLang version v0.5.19 sinon cela ne fonctionnera pas, car nous quantifions le lm_head en FP8.
Pour sglang après avoir installé la dernière version :
Vous pouvez ensuite le servir :
Pour activer MTP, utilisez :
🤯Analyse de la quantification
Les quants NVFP4 sont 1,5x plus rapides que BF16 et conservent une précision top-1 de 92 à 97 %.
Nous avons utilisé Dynamic 3.0 GGUFs pour améliorer considérablement Qwen3.8-27B !
Graphique de précision top-1 tel qu'affiché dans UD-3 pour Qwen3.8-27B :

Et le KLD moyen pour Qwen3.8 :

📊 Benchmarks
Pour les benchmarks de quantification GGUF, vous pouvez voir ci-dessus notre analyse de la quantification ou article Dynamic V3.0.
Qwen3.8-27B
Voir plus bas pour les benchmarks du tableau :


Performances textuelles
Codage
Codage terminal agentiqueTerminal Bench 2.1 (Terminus)
73.0
63.4
64.0
51.7
78.2
Codage agentiqueSWE-bench Pro
61.7
53.5
57.6
51.2
53.4
Génération de code au niveau dépôtNL2Repo-Bench
42.3
36.2
41.1
--
47.6
Codage agentiqueDeepSWE 1.1
42.2
13.3
14.2
--
--
Génie logicielQwenSWEBench
79.0
49.3
59.2
--
63.8
Agent
Travail de bureau à long termeCoWorkBench
70.7
61.0
65.1
--
68.2
Tâches professionnellesJobBench
33.4
21.8
27.6
--
--
Tâches agentiques de pointeAgents' Last Exam
Pass@120.4Score42.9
Pass@1 10.6 Score 27.3
Pass@1 13.2 Score 33.6
--
--
Général
Suivi d'instructionsIFBench
79.5
69.1
79.1
77.0
62.5
Raisonnement scientifiqueGPQA Diamond
89.2
87.8
90.3
83.5
91.3
Raisonnement multidisciplinaireHLE
30.8
24.0
34.7
22.0
40.0
Codage compétitifLiveCodeBench v6
90.3
83.9
89.6
--
88.8
Qwen3.8-2.4T-A95B

Mis à jour
Ce contenu vous a-t-il été utile ?

