For the complete documentation index, see llms.txt. This page is also available as Markdown.

Qwen3.8 - comment l'exécuter localement

Guide pour exécuter les quants Qwen3.8, y compris Qwen3.8-27B, sur votre configuration locale.

Qwen3.8 est la nouvelle famille de modèles de Qwen, comprenant Qwen3.8-27B, Qwen3.8-2.4T-A95B et Qwen3.8-Max. Qwen3.8-27B a vision et des capacités de raisonnement, une fenêtre de contexte de 256K et fonctionne localement sur des configurations avec 17 Go de RAM/VRAM Qwen3.8 excelle dans le codage agentique, les tâches de vision et de chat, et peut désormais s'exécuter via les GGUF Unsloth, NVFP4 et Unsloth Desktop. Qwen3.8-2.4T-A95B est un modèle de 2,4 T de paramètres (95B actifs) rivalisant avec GPT-5.6 Sol.

Mise à jour du 19 août : Les GGUF de Qwen3.8-27B utilisent désormais Unsloth Dynamic V3.0 pour 10 % de précision en plus à taille égale, surpassant largement les autres.

Guide d'exécution de Qwen3.8Télécharger Unsloth

Merci à Qwen pour l'accès dès le jour de la sortie. Les quantifications Unsloth incluent également :

  • Prise en charge du rôle développeur pour des outils agentiques comme Codex

  • MTP activé pour une inférence rapide

  • Appel d'outils : Analyse améliorée des objets imbriqués pour faire réussir davantage les outils

Le Qwen3.8-2.4T-A95B en précision complète nécessite 4,9 To de stockage et du 1 bit Unsloth Les GGUF dynamiques prennent 397 Go (91 % plus petit), et le plus grand IQ1_S prend 508 Go.

Qwen3.8-27B dynamique en 4 bits dans Unsloth Desktop

Quantifications Unsloth :

⚙️ Guide d'utilisation

Exigences pour Qwen3.8-27B :

Qwen3.8-27B Les quantifications 4 bits fonctionnent sur 16-19 Go de VRAM comme une RTX 5080, une 4090 ou un Mac avec 24 Go de RAM. Tableau : exigences matérielles (unités = mémoire totale : RAM + VRAM, ou mémoire unifiée)

1 bit
2 bits
3 bits
4 bits
6 bits
8 bits
BF16

7-8 Go

9-11 Go

12-14 Go

16-19 Go

23-26 Go

31 Go

56 Go

Si vous voulez utiliser MTP pour une inférence plus rapide, prévoyez 1 à 2 Go de marge supplémentaire.

Qwen3.8-2,4 T Exigences :

Dynamic 1-bit XXXS
Dynamic 1-bit Standard
Dynamic 2-bit
Q8_0
BF16 (sans perte)

397 Go

508 Go

657 Go

2,6 To

4,9 To

Paramètres recommandés

Qwen3.8-Paramètres 27B :

Qwen3.8-27B est un raisonnement hybride modèle avec des paramètres par défaut différents pour les modes de réflexion et sans réflexion. Le niveau très élevé est activé par défaut, donc si vous voulez des traces de réflexion plus courtes, vous pouvez ajuster l'effort de réflexion:

Paramètre
Mode de réflexion
Mode Instruct (sans réflexion)

température

1.0

0.7

top_p

0.95

0.80

top_k

20

20

min_p

0.0

0.0

presence_penalty

0.0

1.5

repetition_penalty

1.0

1.0

  • Fenêtre de contexte maximale : 262,144 (peut être étendue à 1 M via YaRN)

  • Mode de réflexion : température=1.0, top_p=0.95, top_k=20, min_p=0.0, presence_penalty=0.0, repetition_penalty=1.0

  • Mode Instruct (ou sans réflexion) : température=0.7, top_p=0.80, top_k=20, min_p=0.0, presence_penalty=1.5, repetition_penalty=1.0

Qwen3.8-Paramètres 2,4 T :

Qwen3.8-2.4T est uniquement pour le raisonnement, tandis que Qwen3.8-Max est hybride.

Par défaut

température = 1.0

top_p = 0.95

top_k = 20

min_p = 0.0

presence_penalty = 0.0

  • Longueur de contexte = jusqu'à 1,010,000

  • température=1.0, top_p=0.95, top_k=20, min_p=0.0, presence_penalty=0.0, repetition_penalty=1.0

Si le modèle tient en mémoire, vous obtiendrez une génération d'environ 20 jetons/s avec des B200 et un débit supérieur à 120 jetons/s. La meilleure règle empirique : RAM+VRAM ≈ la taille de la quantification ; sinon cela fonctionnera quand même, mais beaucoup plus lentement à cause du déchargement sur disque.

💡 Réflexion + conservation de la réflexion

Qwen3.8 a Conserver le raisonnement qui laisse la trace de réflexion de la conversation précédente. Cela augmente le nombre de jetons utilisés, mais peut améliorer la précision dans les conversations poursuivies. Unsloth dispose de bascules « Think » et « Raisonnement conservé » pour Qwen3.8 (voir à droite) :

Qwen3.8-27B est livré avec la prise en charge de reasoning_effort, qui peut être utilisé pour ajuster la profondeur du raisonnement et contrôler le coût. Ces bascules sont activées automatiquement dans Unsloth :

  • xhigh (par défaut) : pour les tâches complexes exigeant une analyse approfondie

  • medium: équilibre entre précision et rapidité

  • low: raisonnement efficace optimisé pour la vitesse et le coût

  • none

Guide d'exécution de Qwen3.8

Vous pouvez désormais exécuter Qwen3.8 dans llama.cpp et Unsloth Desktop. Pour le grand modèle Qwen3.8-2.T, nous utiliserons la quantification IQ1_XXXS de 397 Go IQ1_XXXS (nommée Q1_0) pour les meilleurs résultats en termes d'accessibilité et de précision, et elle nécessitera au moins 450 Go de RAM. N'hésitez pas à changer le type de quantification.

Exécuter dans Unsloth DesktopExécuter dans llama.cppGuide NVFP4

🦥 Exécuter Qwen3.8 dans Unsloth Desktop

Qwen3.8 peut s'exécuter dans Unsloth Desktopune application d'interface utilisateur open source pour l'IA locale. Unsloth décharge automatiquement vers la RAM et détecte les configurations multiGPU. Avec Unsloth Desktop, vous pouvez exécuter des modèles localement sur MacOS, Windows, Linux et :

1

Installer Unsloth

Le moyen le plus simple pour commencer est de télécharger l application Unsloth Desktop. Fonctionne sur macOS, Windows, et Linux.

Télécharger Unsloth

Ou, si vous préférez une installation manuelle :

MacOS, Linux, WSL :

Windows PowerShell :

2

Rechercher et télécharger Qwen3.8

Accédez à Unsloth Chat ou au hub de modèles et recherchez Qwen3.8 dans la barre de recherche, puis téléchargez le modèle et la quantification souhaités.

3

Exécuter Qwen3.8

Les paramètres d'inférence devraient être définis automatiquement lors de l'utilisation d'Unsloth, mais vous pouvez toujours les modifier manuellement. Vous pouvez également modifier la longueur de contexte, le modèle de chat et d'autres paramètres.

Pour plus d'informations, vous pouvez consulter notre guide d'inférence Unsloth.

Par exemple, utiliser Unsloth Desktop avec le Qwen3.8 de 397 Go (91 % plus petit) vous permet d'activer les modes de réflexion, le canvas en ligne, la recherche web et l'exécution de code, et bien plus encore.

GGUF dynamique 1 bit de 397 Go, 91 % plus petit, de Qwen3.8 2.4T dans Unsloth Desktop
4

Servir Qwen3.8 avec l'API Unsloth

Vous pouvez utiliser unsloth run la commande et servir Qwen3.8 via une API à l'aide de llama-server des indicateurs d'exécution, y compris la taille du contexte, les couches GPU, l'enfilage, l'échantillonnage, la mise en réseau et la configuration des outils. Pour plus d'informations, consultez nos documents API ou unsloth start.

5

Unsloth est maintenant prêt

Vous pouvez aussi faire beaucoup d'autres choses avec Qwen3.8 via Unsloth Desktop, comme :

Nouveaux types de données 1 bit Qwen3.8-2.4T-A95B

Nous avons étendu IQ1_S dans llama.cpp, qui est à 1,5625 bits par poids, à 1,1875 bpw en réduisant le nombre d'entrées dans le codebook - nous avons constaté que cela fonctionne bien pour les grands modèles, et peut encore conserver beaucoup de précision - nous avons également constaté que ces nouveaux types de données conviennent à la quantification post-entraînement (PTQ) sans avoir besoin de QAT ou QAD (entraînement / distillation sensible à la quantification). Qwen3.8-2.4T-A95B-GGUF

En raison de problèmes de nommage, nous avons utilisé TQ2_0, TQ1_0 et Q1_0, sinon cela n'apparaîtra pas dans le dépôt HF.

Type
Nommage
BPW
# entrées
Bits d'index
Bloc

IQ1_S

IQ1_S

1.5625

2048

11

50 B

UD-IQ1_XS

TQ2_0

1.4375

1024

10

46 B

UD-IQ1_XXS

TQ1_0

1.3125

512

9

42 B

UD-IQ1_XXXS

Q1_0

1.1875

256

8

38 B

Nous effectuons toujours des benchmarks pour les nouveaux types de données, mais pour d'autres grands modèles, nous obtenons de bons résultats sans aucun QAT / QAD:

Type
GiB
PPL
KLD
top-p

IQ1_S

553.204

2.578876

0.564553

78.882

UD-IQ1_XS

513.583

2.931261

0.690161

75.726

UD-IQ1_XXS

473.961

3.540383

0.876007

71.284

UD-IQ1_XXXS

434.340

4.488796

1.109944

66.257

🦙 Exécuter Qwen3.8 dans llama.cpp

1

Nous devons utiliser la branche spécifique IQ1_XXXS ici. Vous pouvez également suivre les instructions de compilation ci-dessous. Modifiez -DGGML_CUDA=ON en -DGGML_CUDA=OFF si vous n'avez pas de GPU ou si vous voulez simplement une inférence CPU. Pour les appareils Apple Mac / Metal, définissez -DGGML_CUDA=OFF puis poursuivez comme d'habitude - la prise en charge de Metal est activée par défaut.

2

Si vous voulez simplement exécuter la version standard IQ1_S et les autres quantifications, compilez alors llama.cpp normalement :

3

Téléchargez le modèle via (après avoir installé pip install huggingface_hub). Vous pouvez choisir Q1_0 pour IQ1_XXXS ou d'autres versions quantifiées comme Q8_0 . Si les téléchargements se bloquent, voir : Hugging Face Hub, débogage XET

Qwen3.8-27B :

Qwen3.8-2.4T :

4

Pour exécuter le modèle dans llama-cli, suivez les extraits de code ci-dessous : N'oubliez pas de modifier les paramètres selon votre cas d'utilisation.

Qwen3.8-27B :

Qwen3.8-2.4T :

5

Pour exécuter le UD-IQ1_S général, vous pouvez faire :

Qwen3.8-2.4T :

6

Puis pour l'exécuter :

⚡️NVFP4

Comme pour Qwen3.6, nous publions également de nouveaux Qwen3.8 NVFP4 dynamique-27B quants qui tournent ~1,5× plus rapides que les checkpoints BF16, avec de meilleures performances et des tailles de fichier comparables. Exécutez Qwen3.8-27B NVFP4 1,5x plus rapide sur 24 Go de VRAM. Nous avons également ajouté l'étalonnage du cache KV en FP8 pour des longueurs de contexte 2x plus longues ! NVFP4 nécessite les GPU Blackwell de NVIDIA comme les RTX 50X, DGX Spark (voir Qwen3.8-27B), GPU B200, B300. Pour les GPU plus anciens, nos GGUF fonctionnent bien ! Vous pouvez exécuter des quants NVFP4 dans vLLM uniquement pour le moment (SGLang n'est pas pris en charge).

lot
tok/s totaux BF16
tok/s totaux NVFP4
accélération
BF16 par utilisateur
NVFP4 par utilisateur

1

89.8

133.7

1.49x

89.8

133.7

8

649.4

938.8

1.45x

81.2

117.3

32

1983.0

2787.0

1.41x

62.0

87.1

64

3048.5

4407.2

1.45x

47.6

68.9

Voir ci-dessous les benchmarks précédents réalisés pour Qwen3.6, comparant également d'autres implémentations NVFP4 qui utilisent des activations 16 bits à nos activations NVFP4 :

Tous les benchmarks utilisent 1× B200 avec une concurrence de 128. Une concurrence plus élevée peut porter le 35B à 17 561 jetons/s.

Pour les benchmarks de précision, nous avons exécuté KLD et l'accord Top-1 sur le code, le chat et de nombreux domaines. NVFP4 récupère de manière cohérente 92 % à 97 % de la précision par rapport à BF16

corpus
KLD moyen
accord top-1

zh

0.01628

93.55%

code

0.02600

96.68%

refgen

0.03993

94.46%

chat

0.05818

92.15%

ja / ko / ru / es

0.0124-0.0155

94-95%

Pour les benchmarks de précision pour Qwen 3.6, nous avons réalisé MMLU-Pro, AIME 2025, GPQA pour FP8, BF16, le NVFP4 de NVIDIA et nos NVFP4 — nous montrons que nos quants plus rapides se comportent de manière similaire sur tous :

Pour plus d'informations, vous pouvez lire notre article de blog sur les quants NVFP4 dynamiques.

Pour exécuter des quants NVFP4, voir ci-dessous les commandes pour exécuter Qwen3.8-27B dans vLLM ou SGLang:

vLLM :

Pour installer vLLM dans un venv séparé :

Puis, pour servir la variante 27B :

Pour activer MTP / le décodage spéculatif (décodage plus rapide mais avec un débit quelque peu inférieur), utilisez :

Si vous rencontrez des problèmes avec Torchcodec, assurez-vous de faire ce qui suit, puis relancez vllm.

SGLang :

Si vous utilisez SGLang, vous devez utiliser SGLang version v0.5.19 sinon cela ne fonctionnera pas, car nous quantifions le lm_head en FP8.

vLLM possède un CompressedTensorsW8A8Fp8 noyau qui prend cela en charge, alors que SGLang v0.5.19 ne peut pas charger le lm_head FP8. v0.5.19 fonctionne maintenant !

Pour sglang après avoir installé la dernière version :

Vous pouvez ensuite le servir :

Pour activer MTP, utilisez :

🤯Analyse de la quantification

Les quants NVFP4 sont 1,5x plus rapides que BF16 et conservent une précision top-1 de 92 à 97 %.

Nous avons utilisé Dynamic 3.0 GGUFs pour améliorer considérablement Qwen3.8-27B !

Graphique de précision top-1 tel qu'affiché dans UD-3 pour Qwen3.8-27B :

Et le KLD moyen pour Qwen3.8 :

📊 Benchmarks

Pour les benchmarks de quantification GGUF, vous pouvez voir ci-dessus notre analyse de la quantification ou article Dynamic V3.0.

Qwen3.8-27B

Voir plus bas pour les benchmarks du tableau :

Performances textuelles

Benchmark
Qwen3.8-27B
Qwen3.6-27B
Qwen3.7-Plus
Muse Glimmer-30B
Opus4.6 Max

Codage

Codage terminal agentiqueTerminal Bench 2.1 (Terminus)

73.0

63.4

64.0

51.7

78.2

Codage agentiqueSWE-bench Pro

61.7

53.5

57.6

51.2

53.4

Génération de code au niveau dépôtNL2Repo-Bench

42.3

36.2

41.1

--

47.6

Codage agentiqueDeepSWE 1.1

42.2

13.3

14.2

--

--

Génie logicielQwenSWEBench

79.0

49.3

59.2

--

63.8

Agent

Travail de bureau à long termeCoWorkBench

70.7

61.0

65.1

--

68.2

Tâches professionnellesJobBench

33.4

21.8

27.6

--

--

Tâches agentiques de pointeAgents' Last Exam

Pass@120.4Score42.9

Pass@1 10.6 Score 27.3

Pass@1 13.2 Score 33.6

--

--

Général

Suivi d'instructionsIFBench

79.5

69.1

79.1

77.0

62.5

Raisonnement scientifiqueGPQA Diamond

89.2

87.8

90.3

83.5

91.3

Raisonnement multidisciplinaireHLE

30.8

24.0

34.7

22.0

40.0

Codage compétitifLiveCodeBench v6

90.3

83.9

89.6

--

88.8

Qwen3.8-2.4T-A95B

Mis à jour

Ce contenu vous a-t-il été utile ?