For the complete documentation index, see llms.txt. This page is also available as Markdown.

💜Qwen3.6 - comment l'exécuter localement

Exécutez les nouveaux modèles Qwen3.6-27B et 35B-A3B localement !

Qwen3.6 est la nouvelle famille de modèles multimodaux à raisonnement hybride d’Alibaba, comprenant : Qwen3.6-27B et 35B-A3B. Il offre des performances de pointe pour sa taille, prend en charge un contexte de 256K sur 201 langues. Il excelle dans le codage agentique, la vision et les tâches de chat. Qwen3.6-27B fonctionne sur 18 Go de RAM des configurations et 35B-A3B fonctionne sur 22 Go. Vous pouvez désormais exécuter et entraîner les modèles dans Unsloth Desktop.

Tutoriels d'exécution de Qwen3.6Guide MTP

Les GGUF Qwen3.6 utilisent Unsloth Dynamic 2.0 pour des performances de quantification SOTA - les quantifications sont donc calibrées sur des jeux de données d'utilisation réels et les couches importantes sont remontées en précision. Merci à Qwen pour l'accès dès le premier jour.

  • Prise en charge du rôle développeur pour Codex, OpenCode et plus : Nos envois prennent désormais en charge le rôle développeur pour les outils de codage agentique.

  • Appel d'outils : Comme Qwen3.5, nous avons amélioré l'analyse des objets imbriqués pour faire davantage réussir les appels d'outils.

Qwen3.6 exécuté dans Unsloth Studio.

⚙️ Guide d'utilisation

Tableau : exigences matérielles pour l'inférence (unités = mémoire totale : RAM + VRAM, ou mémoire unifiée)

Qwen3.6
3 bits
4 bits
6 bits
8 bits
BF16

27B

15 Go

18 Go

24 Go

30 Go

55 Go

35B-A3B

17 Go

23 Go

30 Go

38 Go

70 Go

Pour entraîner Qwen3.6, vous pouvez vous référer à notre précédent guide de fine-tuning Qwen3.5.

Paramètres recommandés

  • Fenêtre de contexte maximale : 262,144 (peut être étendue à 1M via YaRN)

  • presence_penalty = 0.0 à 2.0 par défaut, cela est désactivé, mais pour réduire les répétitions, vous pouvez utiliser cela ; toutefois, utiliser une valeur plus élevée peut entraîner une légère baisse des performances

  • Longueur de sortie adéquate: 32,768 jetons pour la plupart des requêtes

Si vous obtenez du charabia, la longueur de votre contexte est peut-être réglée trop bas. Ou essayez d'utiliser --cache-type-k bf16 --cache-type-v bf16 ce qui pourrait aider.

Comme Qwen3.6 est à raisonnement hybride, le mode de réflexion et le mode sans réflexion ont des paramètres différents :

Mode de réflexion :

Tâches générales
Tâches de codage précises (p. ex. WebDev)

temperature = 1.0

temperature = 0.6

top_p = 0.95

top_p = 0.95

top_k = 20

top_k = 20

min_p = 0.0

min_p = 0.0

presence_penalty = 0.0

presence_penalty = 0.0

repeat_penalty = désactivé ou 1.0

repeat_penalty = désactivé ou 1.0

Mode de réflexion pour les tâches générales :

Mode de réflexion pour les tâches de codage précises :

Paramètres du mode Instruct (sans réflexion) :

Tâches générales

temperature = 0.7

top_p = 0.8

top_k = 20

min_p = 0.0

presence_penalty = 1.5

repeat_penalty = désactivé ou 1.0

Mode Instruct (sans réflexion) pour les tâches générales :

Tutoriels d'inférence Qwen3.6 :

Nous allons utiliser du 4 bits dynamique UD-Q4_K_XL variantes GGUF pour les charges de travail d'inférence. Cliquez ci-dessous pour accéder aux instructions du modèle concerné :

Exécuter dans Unsloth DesktopExécuter dans llama.cppGuide MTPGuide NVFP4

🦥 Guide Unsloth

Qwen3.6 et Qwen3.6 MTP peuvent désormais être exécutés dans Unsloth Desktop, notre nouvelle interface open source pour l'IA locale. Unsloth Studio vous permet d'exécuter des modèles localement sur MacOS, Windows, Linux et :

1

Installer Unsloth

La façon la plus simple de commencer est de télécharger l application Unsloth Desktop. Fonctionne sur macOS, Windows, et Linux.

Télécharger Unsloth

Ou, si vous préférez installer manuellement :

MacOS, Linux, WSL :

Windows PowerShell :

2

Lancer Unsloth

MacOS, Linux, WSL et Windows :

Puis ouvrez http://127.0.0.1:8888 (ou votre URL spécifique) dans votre navigateur.

Lancer Unsloth en toute sécurité avec HTTPS et Cloudflare

NOUVEAU ! Unsloth propose désormais un moyen sécurisé de lancer Unsloth via HTTPS grâce à un tunnel Cloudflare gratuit. Utilisez ce qui suit (fonctionne sous Windows, Mac et Linux) :

3

Rechercher et télécharger Qwen3.6 ou Qwen3.6 MTP

Au premier lancement, vous devrez créer un mot de passe pour sécuriser votre compte et vous reconnecter plus tard. Puis allez dans l onglet Unsloth Chat et recherchez Qwen3.6 ou Qwen3.6 MTP dans la barre de recherche, puis téléchargez le modèle et la quantification souhaités.

4

Exécuter Qwen3.6

Les paramètres d'inférence devraient être définis automatiquement lors de l'utilisation d'Unsloth Studio, mais vous pouvez toujours les modifier manuellement. Vous pouvez également modifier la longueur du contexte, le modèle de chat et d'autres paramètres.

Pour plus d'informations, vous pouvez consulter notre guide d'inférence d'Unsloth Studio. Ci-dessous, le GGUF Qwen3.6 2 bits a effectué plus de 30 appels d'outils, recherché 20 sites et exécuté du code Python :

⚡ Guide MTP

Le décodage spéculatif MTP (Multi Token Prediction) permet à des modèles comme Qwen3.6 d'avoir une génération ~1,4 à 2,2x plus rapide avec aucun changement de précision. Cela permet à Qwen3.6 27B et 35B-A3B d'avoir une accélération >1,4x par rapport à la base originale, ce qui est particulièrement utile pour les modèles locaux.

Les GGUF MTP Qwen3.6 d'Unsloth ne sont plus en mode expérimental, et llama.cpp a intégré la prise en charge de MTP. Exécutez-les directement dans l'interface d'Unsloth Studio ou via llama.cpp. Qwen3.6 27B MTP fonctionne désormais à 160 jetons/s en génération et Qwen3.6 35B-A3B à 240 jetons/s sur un GPU RTX 6000. Voir Qwen3.6.

Unsloth Studio définit automatiquement les paramètres MTP idéaux, optimisés pour votre matériel spécifique (Mac, CPU, GPU, etc.) - vous pouvez toujours les modifier plus tard.

MTP utilise légèrement plus de VRAM que les GGUF standard, prévoyez donc environ 1 Go de marge supplémentaire en RAM/VRAM.

Exécuter dans Unsloth StudioExécuter dans llama.cppExécuter NVFP4

En pratique, MTP prédit plusieurs jetons futurs, puis le modèle principal vérifie ces jetons en parallèle. Cela réduit le nombre de passes avant nécessaires pendant la génération et rend la sortie plus rapide. Nous avons constaté --spec-draft-n-max 2 comme étant le plus efficace dans la plupart des configurations. Cependant, ne supposez pas que 2 est optimal, car les performances dépendent du matériel. Essayez des valeurs de 1 à 6 et utilisez celle qui est la plus rapide pour votre système.

Nous avons également téléversé des GGUF MTP pour la Qwen3.5 famille de modèles comprenant : 0.8B, 2B, 4B, 9B, 27B, 35B-A3B, 122B-A10B et 397B-A17B. Llama.cpp améliore continuellement les performances de MTP, alors attendez-vous à ce qu'elles s'accélèrent avec le temps !

Tableau : exigences matérielles pour MTP (unités = mémoire totale : RAM + VRAM, ou mémoire unifiée)

Qwen3.6
3 bits
4 bits
6 bits
8 bits
BF16

27B

16 Go

19 Go

25 Go

31 Go

56 Go

35B-A3B

18 Go

24 Go

31 Go

39 Go

71 Go

🦥 Guide MTP d'Unsloth Studio

Unsloth Studio définit automatiquement les paramètres MTP idéaux, optimisés pour votre matériel spécifique (Mac, CPU, GPU, etc.) - vous pouvez toujours les modifier plus tard.

1

Installer Unsloth

Exécutez dans votre terminal :

MacOS, Linux, WSL :

Windows PowerShell :

2

Lancer Unsloth

MacOS, Linux, WSL et Windows :

Puis ouvrez http://127.0.0.1:8888 (ou votre URL spécifique) dans votre navigateur.

3

Rechercher et télécharger Qwen3.6 MTP

Au premier lancement, vous devrez créer un mot de passe pour sécuriser votre compte et vous reconnecter plus tard. Puis allez dans l onglet Unsloth Chat onglet et recherchez Qwen3.6 MTP dans la barre de recherche, puis téléchargez le modèle et la quantification souhaités.

4

Exécuter Qwen3.6 MTP

Les paramètres d'inférence devraient être définis automatiquement lors de l'utilisation d'Unsloth Studio, mais vous pouvez toujours les modifier manuellement. Vous pouvez également modifier la longueur du contexte, le modèle de chat et d'autres paramètres.

Pour plus d'informations, vous pouvez consulter notre guide d'inférence d'Unsloth Studio. Ci-dessous, le GGUF Qwen3.6 MTP 2 bits a effectué plus de 10 appels d'outils, recherché 10 sites et exécuté du code Python :

🦙 Guide MTP de Llama.cpp

1

Installez la dernière version de llama.cpp sur GitHub ici. Vous pouvez également suivre les instructions de compilation ci-dessous. Remplacez -DGGML_CUDA=ON par -DGGML_CUDA=OFF si vous n'avez pas de GPU ou si vous souhaitez simplement une inférence CPU. Pour les appareils Apple Mac / Metal, définissez -DGGML_CUDA=OFF puis continuez comme d'habitude - la prise en charge de Metal est activée par défaut.

2

Si vous voulez utiliser llama.cpp directement pour charger des modèles, vous pouvez faire ce qui suit : (:Q4_K_XL) est le type de quantification. Vous pouvez également télécharger via Hugging Face (point 3). C'est similaire à ollama run . Utilisez export LLAMA_CACHE="folder" pour forcer llama.cpp à enregistrer dans un emplacement spécifique. Le modèle a une longueur de contexte maximale de 256K.

Suivez l'une des commandes pour les modèles spécifiques :

27B MTP35-A3B MTP

MTP Qwen3.6-27B :

Mode de réflexion :

Veuillez consulter le nouveau Raisonnement préservé.

Tâches générales :

Pour les tâches de codage précises, remplacez : temperature=0.6

Mode sans réflexion :

Tâches générales :

MTP Qwen3.6-35B-A3B :

Mode de réflexion :

Veuillez consulter le nouveau Raisonnement préservé.

Tâches générales :

Pour les tâches de codage précises, remplacez : temperature=0.6

Mode sans réflexion :

Tâches générales :

3

Vous pouvez également télécharger le modèle manuellement via le code ci-dessous (après avoir installé pip install huggingface_hub). Vous pouvez choisir Q4_K_M ou d'autres versions quantifiées comme UD-Q4_K_XL . Nous recommandons d'utiliser au moins la quantification dynamique 2 bits UD-Q2_K_XL pour équilibrer taille et précision. Si les téléchargements se bloquent, voir : Hugging Face Hub, débogage XET

4

Puis exécutez le modèle en mode conversation :

🍎 Quants dynamiques MLX

Nous avons également téléversé des quantifications dynamiques Qwen3.6 4 bits et 8 bits pour les appareils macOS ! Notre algorithme de quantification MLX évolue encore, et nous l'affinons activement partout où des améliorations peuvent être apportées.

Vous pouvez exécuter tous les modèles MLX dans Unsloth Studio!

Qwen3.6-27B MLX :

Qwen3.6-35B-A3B MLX :

Pour les essayer, utilisez :

Voir ci-dessous les scores de divergence KL (KLD) et de perplexité (PPL) de Qwen3.6-27B (plus bas est meilleur) :

Modèle
KLD moyen
KLD médian
Perplexité
KLD P90
KLD P99,9
Taille

0.0028

0.0003

4.812

0.0019

0.192

34,7 Go

0.0037

0.0007

4.809

0.0032

0.343

30,5 Go

0.0227

0.0053

4.821

0.0293

2.339

26,2 Go

0.0325

0.0087

4.843

0.0466

3.693

26,2 Go

0.0479

0.0153

4.902

0.0769

4.035

25,6 Go

0.0734

0.0223

4.976

0.1261

5.529

24,1 Go

⚡️NVFP4

10 juillet 2026 : Nous publions de nouveaux quants NVFP4 dynamiques de Qwen3.6 qui s'exécutent à environ ~2,5× plus rapide que les autres quants NVFP4, avec de meilleures performances et des tailles de fichiers comparables. Exécutez Qwen3.6-27B NVFP4 2,5x plus rapide sur 24 Go de VRAM et Qwen3.6-35B-A3B 1,7x plus rapide sur 32 Go de VRAM. Nous avons aussi ajouté la calibration du cache KV FP8 pour des longueurs de contexte 2x plus longues ! NVFP4 nécessite les GPU Blackwell de NVIDIA comme les RTX 50X, DGX Spark (voir Qwen3.6), B200, B300. Pour les GPU plus anciens, nos GGUF fonctionnent bien !

Tous les benchmarks utilisent 1x B200 avec une concurrence de 128. Une concurrence plus élevée peut faire monter le 35B à 17 561 jetons / s. Nous publions aussi deux versions NVFP4 35B-A3B :

Pour les benchmarks de précision, nous avons réalisé MMLU-Pro, AIME 2025, GPQA pour FP8, BF16, le NVFP4 de NVIDIA et nos NVFP4 - nous montrons que nos quantifications plus rapides obtiennent des résultats similaires sur l'ensemble :

Qwen3.6-35B-A3B
Qwen3.6-27B

Qwen3.6-35B-A3B-NVFP4 (1,56x plus rapide)

Qwen3.6-27B-NVFP4 (2,5x plus rapide)

Qwen3.6-35B-A3B-NVFP4-Fast (1,79x plus rapide)

Les tenseurs MTP sont aussi intégrés directement dans les quants pour des gains de vitesse supplémentaires. Les gains de précision proviennent des améliorations apportées au modèle de chat et à la calibration du jeu de données de Qwen3.6. Nous utilisons nos précédentes mises à jour du modèle de chat pour améliorer la cohérence du code et de l'appel d'outils tout en réduisant les boucles et d'autres problèmes signalés. Notre calibration utilise un mélange de notre jeu de données optimisé pour le code, l'appel d'outils et le chat, ainsi qu'UltraChat.

Pour la vitesse de décodage (jetons / s), le nôtre est 1,03x plus rapide pour 27B et 1,17x et 1,22x plus rapide pour 35B.

Benchmarks NVFP4

NVFP4 exécute directement les poids 4 bits et les multiplications matricielles sur les Tensor Cores Blackwell. Nos quants Qwen3.6 NVFP4 utilisent W4A4, ils utilisent donc réellement les Tensor Cores FP4, et décodent plus vite que ceux de NVIDIA qui utilisent W4A16. Nous quantifions aussi dynamiquement les couches pour conserver la précision, et nous avons mené des benchmarks MMLU-Pro, AIME 2025, GPQA pour tous les quants, y compris une comparaison avec FP8 et BF16.

Benchmarks de précision Qwen3.6-27B NVFP4

Fournisseur
MMLU-Pro
GPQA
AIME 2025

Unsloth

86.25

86.34

93.12

NVIDIA

85.96

86.87

93.12

FP8

86.11

86.87

93.75

BF16

85.96

88.13

93.33

Benchmarks de précision Qwen3.6-35B-A3B NVFP4

Fournisseur
MMLU-Pro
GPQA
AIME 2025

Unsloth

85.85

86.74

92.29

Unsloth Fast

85.58

87.75

91.67

NVIDIA

85.60

87.12

91.88

FP8

85.75

86.74

93.12

BF16

85.75

86.36

92.50

Nous avons aussi vérifié la longueur de sortie de tous les benchmarks, et elles sont comparables, donc les nouveaux quants NVFP4 ne pensent pas plus longtemps, ce qui annule l'intérêt de les quantifier ! (Par exemple, si c'est 2x plus rapide, mais pense 2x plus, alors cela ne sert à rien)

Marlin vs Flashinfer vs cutlass vs cute-DSL

Nous avons aussi constaté que les kernels Marlin ne prennent pas bien en charge W4A4 - l'activer entraînera une dégradation des performances de 2,5x - utilisez donc CUTLASS, Flashinfer-TRTLLM ou Cute-DSL (activé automatiquement dans vLLM) ! Si vous avez un DGX Spark, voir Qwen3.6 vous devez utiliser --moe-backend flashinfer_b12x sinon vous obtiendrez une inférence 2,5x plus lente.

Donc ne définissez aucun backend - vLLM choisit automatiquement le meilleur.

Modèle
schéma
backend
jetons/s en décodage
jetons/s de débit

nvidia 27B

W4A16

marlin (auto)

115.6

2,403

unsloth 27B

W4A4

marlin

105.6

2,127

unsloth 27B

W4A4

cutlass

113.5

6,681

unsloth 27B

W4A4

flashinfer_trtllm

112.6

6,158

unsloth 27B

W4A4

cute-DSL (auto)

125.9

6,863

nvidia 35B-A3B

W4A4

marlin (auto)

240.8

8,721

unsloth 35B-A3B

W4A4

marlin

215.8

8,619

unsloth 35B-A3B

W4A4

cutlass

158.3

11,017

unsloth 35B-A3B

W4A4

cute-DSL (auto)

295.2

15,636

vLLM:

Pour exécuter les quants NVFP4, voyez ci-dessous les commandes pour lancer Qwen3.6-27B dans vLLM et SGLang (vous pouvez changer le nom du modèle en Qwen3.6-35-A3B-NVFP4). N'utilisez pas non plus de backend MoE - laissez vLLM le sélectionner - par exemple Marlin est 2,5x plus lent ! Voir Marlin vs Flashinfer vs cutlass vs cute-DSLSi vous avez un DGX Spark, voir Qwen3.6 vous devez utiliser --moe-backend flashinfer_b12x sinon vous obtiendrez une inférence beaucoup plus lente.

Pour installer vLLM dans un venv séparé :

Puis pour servir la variante 35B Fast :

Remplacez unsloth/Qwen3.6-35B-A3B-NVFP4-Fast par les noms de quantification NVFP4 !

Pour activer MTP / le décodage spéculatif (décodage plus rapide mais un débit un peu plus faible), utilisez :

Si vous rencontrez des problèmes avec Torchcodec, faites bien ce qui suit puis relancez vllm.

DGX Spark avec des quantifications NVFP4

Pour vous assurer que DGX Spark dispose des bons kernels (sinon vous obtiendrez une inférence 2x PLUS LENTE), vérifiez d'abord :

qui ne devrait PAS renvoyer d'erreur - si c'était le cas, veuillez mettre à jour vllm ou réinstaller via :

Puis pour servir dans vLLM sur DGX Spark :

Si vous rencontrez des problèmes avec Torchcodec, faites bien ce qui suit puis relancez vllm.

SGLang :

🦙 Guide Llama.cpp

Pour ce guide, nous utiliserons le 4 bits dynamique, qui fonctionne très bien sur un appareil Mac / 24 Go de RAM pour une inférence rapide sur llama.cpp. Comme le modèle ne fait qu'environ 72 Go en précision F16 complète, nous n'aurons pas trop à nous soucier des performances. Voir notre collection GGUF.

27B35-A3B

1

Obtenez la dernière llama.cpp sur GitHub ici. Vous pouvez également suivre les instructions de compilation ci-dessous. Remplacez -DGGML_CUDA=ON par -DGGML_CUDA=OFF si vous n'avez pas de GPU ou si vous souhaitez simplement une inférence CPU. Pour les appareils Apple Mac / Metal, définissez -DGGML_CUDA=OFF puis continuez comme d'habitude - la prise en charge de Metal est activée par défaut.

2

Si vous voulez utiliser llama.cpp directement pour charger des modèles, vous pouvez faire ce qui suit : (:Q4_K_XL) est le type de quantification. Vous pouvez également télécharger via Hugging Face (point 3). C'est similaire à ollama run . Utilisez export LLAMA_CACHE="folder" pour forcer llama.cpp à enregistrer dans un emplacement spécifique. Le modèle a une longueur de contexte maximale de 256K.

Suivez l'une des commandes pour les modèles spécifiques :

27B35-A3B

Qwen3.6-27B :

Mode de réflexion :

Veuillez consulter le nouveau Raisonnement préservé.

Tâches générales :

Pour les tâches de codage précises, remplacez : temperature=0.6

Mode sans réflexion :

Tâches générales :

Qwen3.6-35B-A3B :

Mode de réflexion :

Veuillez consulter le nouveau Raisonnement préservé.

Tâches générales :

Pour les tâches de codage précises, remplacez : temperature=0.6

Mode sans réflexion :

Tâches générales :

3

Vous pouvez également télécharger le modèle manuellement via le code ci-dessous (après avoir installé pip install huggingface_hub). Vous pouvez choisir Q4_K_M ou d'autres versions quantifiées comme UD-Q4_K_XL . Nous recommandons d'utiliser au moins la quantification dynamique 2 bits UD-Q2_K_XL pour équilibrer taille et précision. Si les téléchargements se bloquent, voir : Hugging Face Hub, débogage XET

4

Puis exécutez le modèle en mode conversation :

💡 Réflexion : activer/désactiver + préserver la réflexion

Qwen3.6 dispose également de Raisonnement préservé ce qui conserve la trace de raisonnement de la conversation précédente. Cela augmente le nombre de jetons utilisés, mais peut améliorer la précision dans les conversations poursuivies. Unsloth Studio propose des bascules 'Think' et 'Preserved Thinking' pour Qwen3.6 :

Unsloth Studio a la bascule Think par défaut et une nouvelle Raisonnement préservé bascule

Pour activer la préservation de la réflexion dans llama.cpp utilisez (changez en 'true' ou 'false') 'preserve_thinking' au lieu de 'enable_thinking' ou 'disable_thinking'.

Pour la réflexion normale, vous pouvez activer / désactiver la réflexion dans llama.cpp en suivant les commandes ci-dessous. Utilisez 'true' et 'false' de manière interchangeable.

Système d'exploitation de llama-server :
Activer la réflexion
Désactiver la réflexion

Linux, MacOS, WSL :

Windows / Powershell :

À titre d'exemple pour Qwen3.6-35B-A3B, pour activer la préservation de la réflexion (par défaut, elle est activée) :

Puis en Python :

👨‍💻 OpenAI Codex & Claude Code

Pour exécuter le modèle via des workloads de codage agentiques locaux, vous pouvez suivre notre guide. Utilisez le llama-server que nous venons de configurer, et définissez le nom du modèle sur l'identifiant exact qu'il indique dans GET /v1/models (la --alias valeur ci-dessus, par ex. unsloth/Qwen3.6-35B-A3B-GGUF). Suivez les paramètres et les instructions d'utilisation corrects de Qwen3.6.

Après avoir suivi les instructions pour Claude Code par exemple, vous verrez :

On peut alors demander par exemple Crée un jeu d'échecs en Python :

📊 Benchmarks

Benchmarks GGUF d'Unsloth

Nous avons effectué des benchmarks de divergence KL moyenne pour les GGUF Qwen3.6-35-A3B auprès de différents fournisseurs afin de vous aider à choisir la meilleure quantification.

  • La divergence KL place presque tous les GGUF d'Unsloth sur la frontière de Pareto SOTA

  • KLD montre à quel point un modèle quantifié correspond à la distribution de sortie BF16 originale, ce qui indique la précision conservée.

  • Cela place Unsloth en tête des performances pour 21 des 22 tailles

  • Seul Q6_K a été mis à jour pour davantage de couches dynamiques et nous avons introduit un nouveau UD-IQ4_NL_XL quantification

35B-A3B - benchmarks KLD (plus bas = meilleur)

Benchmarks MTP

Nous avons évalué les nouveaux quants que nous avons créés pour les MoE 27B et 35B. En général, les modèles denses sont beaucoup plus accélérés avec MTP (1,4-2x) qu'avec les modèles MoE (1,15-1,25x).

Avec cela, Qwen3.6 27B peut désormais générer 140 jetons/s avec UD-Q2_K_XL et Qwen3.6 35B-A3B 220 jetons/s ! Certaines valeurs de débit sont bruitées, donc n'en déduisez pas que certaines quantifications sont plus lentes que d'autres.

En termes d'accélération moyenne, on observe un facteur 1,4x pour les modèles denses avec draft tokens = 2 et, pour les MoE, environ 1,15 à 1,2x.

Nous ne recommandons pas plus de 2 draft tokens, car le taux d'acceptation chute brusquement de 83 % à 50 % avec 4 draft tokens, et les passes avant pour MTP deviennent moins avantageuses.

Benchmarks officiels de Qwen

Qwen3.6-27B

Qwen3.6-35B-A3B

Ces résultats simplifient le compromis : utilisez les GGUF dynamiques pour le meilleur équilibre entre mémoire et qualité, utilisez MTP lorsque vous voulez une génération plus rapide, et utilisez NVFP4 sur les GPU Blackwell pour un débit maximal. Si vous voulez la voie la plus simple, exécutez le modèle dans Unsloth Studio et conservez les valeurs par défaut recommandées.

Mis à jour

Ce contenu vous a-t-il été utile ?