For the complete documentation index, see llms.txt. This page is also available as Markdown.

💜Qwen3.5 - comment l'exécuter localement

Exécutez les nouveaux LLM Qwen3.5, y compris Medium : Qwen3.5-35B-A3B, 27B, 122B-A10B, et Small : Qwen3.5-0.8B, 2B, 4B, 9B et 397B-A17B sur votre appareil local !

Qwen3.5 est la nouvelle famille de modèles d’Alibaba, comprenant Qwen3.5-35B-A3B, 27B, 122B-A10B et 397B-A17B et la nouvelle Small série : Qwen3.5-0.8B, 2B, 4B et 9B. Les LLM multimodaux à raisonnement hybride offrent les meilleures performances pour leur taille. Ils prennent en charge contexte 256K dans 201 langues, ont raisonnement + sans raisonnement, et excellent dans le codage agentique, la vision, le chat et les tâches à long contexte. Les modèles 35B et 27B fonctionnent sur un appareil Mac / RAM de 22 Go. Voir tous les GGUF ici.

Tutoriels pour exécuter Qwen3.5Affinez Qwen3.5

Tous les téléversements utilisent Unsloth Dynamic 2.0 pour des performances de quantification SOTA - ainsi le 4 bits a des couches importantes remontées en 8 ou 16 bits. Merci à Qwen d’avoir fourni à Unsloth un accès dès le premier jour. Vous pouvez aussi affiner Qwen3.5 avec Unsloth.

Pour activer ou désactiver le raisonnement, voir Qwen3.5. Les modèles Qwen3.5 Small sont désactivés par défaut.

⚙️ Guide d’utilisation

Tableau : exigences matérielles pour l’inférence (unités = mémoire totale : RAM + VRAM, ou mémoire unifiée)

Qwen3.5
3 bits
4 bits
6 bits
8 bits
BF16

3 Go

3,5 Go

5 Go

7,5 Go

9 Go

4,5 Go

5,5 Go

7 Go

10 Go

14 Go

5,5 Go

6,5 Go

9 Go

13 Go

19 Go

14 Go

17 Go

24 Go

30 Go

54 Go

17 Go

22 Go

30 Go

38 Go

70 Go

60 Go

70 Go

106 Go

132 Go

245 Go

180 Go

214 Go

340 Go

512 Go

810 Go

Entre 27B et 35B-A3B, utilisez 27B si vous voulez des résultats légèrement plus précis et que cela ne rentre pas sur votre appareil. Optez pour 35B-A3B si vous voulez une inférence beaucoup plus rapide.

Paramètres recommandés

  • Fenêtre de contexte maximale : 262,144 (peut être étendue à 1M via YaRN)

  • presence_penalty = 0.0 à 2.0 par défaut, c’est désactivé, mais pour réduire les répétitions, vous pouvez l’utiliser ; cependant, une valeur plus élevée peut entraîner une légère baisse des performances

  • Longueur de sortie adéquate: 32,768 tokens pour la plupart des requêtes

Si vous obtenez du charabia, la longueur de contexte est peut-être trop faible. Ou essayez d’utiliser --cache-type-k bf16 --cache-type-v bf16 ce qui peut aider.

Comme Qwen3.5 est un modèle de raisonnement hybride, le mode raisonnement et le mode sans raisonnement ont des paramètres différents :

Mode raisonnement :

Tâches générales
Tâches de codage précises (par ex. WebDev)

temperature = 1.0

temperature = 0.6

top_p = 0.95

top_p = 0.95

top_k = 20

top_k = 20

min_p = 0.0

min_p = 0.0

presence_penalty = 1.5

presence_penalty = 0.0

repeat_penalty = désactivé ou 1.0

repeat_penalty = désactivé ou 1.0

Mode raisonnement pour les tâches générales :

Mode raisonnement pour les tâches de codage précises :

Paramètres du mode Instruct (sans raisonnement) :

Tâches générales
Tâches de raisonnement

temperature = 0.7

temperature = 1.0

top_p = 0.8

top_p = 0.95

top_k = 20

top_k = 20

min_p = 0.0

min_p = 0.0

presence_penalty = 1.5

presence_penalty = 1.5

repeat_penalty = désactivé ou 1.0

repeat_penalty = désactivé ou 1.0

Instruct (sans raisonnement) pour les tâches générales :

Instruct (sans raisonnement) pour les tâches de raisonnement :

Tutoriels d’inférence Qwen3.5 :

Comme Qwen3.5 existe en de nombreuses tailles différentes, nous utiliserons le Dynamic 4 bits MXFP4_MOE des variantes GGUF pour toutes les charges de travail d’inférence. Cliquez ci-dessous pour accéder aux instructions du modèle concerné :

Exécuter dans Unsloth StudioQwen3.5-35B-A3B27B122B-A10B397B-A17BSmall (0.8B - 9B)

Téléversements GGUF dynamiques d’Unsloth :

🦥 Guide d’Unsloth Studio

Qwen3.5 peut être exécuté et affiné dans Unsloth Desktop, notre nouvelle interface de bureau open source pour l’IA locale. Unsloth Studio vous permet d’exécuter des modèles localement sur macOS, Windows, Linux et :

1

Installer Unsloth

Le moyen le plus simple de commencer est de télécharger l’ application de bureau Unsloth Desktop. Fonctionne sur macOS, Windows, et Linux.

Télécharger Unsloth

Ou, si vous préférez installer manuellement :

macOS, Linux, WSL :

PowerShell sous Windows :

2

Lancer Unsloth

macOS, Linux, WSL et Windows :

Puis ouvrez http://localhost:8888 dans votre navigateur.

3

Recherchez et téléchargez Qwen3.5

Au premier lancement, vous devrez créer un mot de passe pour sécuriser votre compte et vous reconnecter plus tard. Puis allez dans l’ Unsloth Chat onglet et recherchez Qwen3.5 dans la barre de recherche, puis téléchargez le modèle et la quantification souhaités.

4

Exécuter Qwen3.5

Les paramètres d’inférence doivent être définis automatiquement lors de l’utilisation d’Unsloth Studio, cependant vous pouvez toujours les modifier manuellement. Vous pouvez aussi modifier la longueur du contexte, le modèle de chat et d’autres paramètres.

Pour plus d’informations, vous pouvez consulter notre guide d’inférence d’Unsloth Studio.

🦙 Guides Llama.cpp

Qwen3.5-35B-A3B

Pour ce guide, nous utiliserons le Dynamic 4 bits, qui fonctionne très bien sur un appareil Mac avec 24 Go de RAM pour une inférence rapide. Comme le modèle ne pèse qu’environ 72 Go en précision F16 complète, nous n’aurons pas trop à nous soucier des performances. GGUF : Qwen3.5-35B-A3B-GGUF

Pour ces tutoriels, nous utiliserons llama.cpp pour une inférence locale rapide, surtout si vous avez un CPU.

1

Obtenez la dernière version llama.cpp sur GitHub ici. Vous pouvez également suivre les instructions de compilation ci-dessous. Remplacez -DGGML_CUDA=ON par -DGGML_CUDA=OFF si vous n’avez pas de GPU ou si vous voulez simplement une inférence CPU. Pour les appareils Apple Mac / Metal, définissez -DGGML_CUDA=OFF puis continuez comme d’habitude - la prise en charge de Metal est activée par défaut.

2

Si vous souhaitez utiliser llama.cpp pour charger directement les modèles, vous pouvez faire ce qui suit : (:Q4_K_M) est le type de quantification. Vous pouvez aussi télécharger via Hugging Face (point 3). C’est similaire à ollama run . Utilisez export LLAMA_CACHE="folder" pour forcer llama.cpp à enregistrer dans un emplacement spécifique. Le modèle a une longueur de contexte maximale de 256K.

Suivez l’une des commandes spécifiques ci-dessous, selon votre cas d’utilisation :

Mode raisonnement :

Tâches de codage précises (par ex. WebDev) :

Tâches générales :

Mode sans raisonnement :

Tâches générales :

Tâches de raisonnement :

3

Téléchargez le modèle via (après avoir installé pip install huggingface_hub hf_transfer ). Vous pouvez choisir Q4_K_M ou d’autres versions quantifiées comme UD-Q4_K_XL . Nous recommandons d’utiliser au moins une quantification dynamique 2 bits UD-Q2_K_XL pour équilibrer la taille et la précision. Si les téléchargements se bloquent, voir : Hugging Face Hub, débogage XET

4

Puis exécutez le modèle en mode conversation :

Qwen3.5 Small (0.8B • 2B • 4B • 9B)

Pour la série Qwen3.5 Small, comme elle est très petite, il vous suffit de changer le nom du modèle dans les scripts pour la variante souhaitée. Pour ce guide précis, nous utiliserons la variante 9B. Pour les exécuter toutes en quasi pleine précision, vous n’aurez besoin que d’un appareil avec 12 Go de RAM / VRAM / mémoire unifiée. GGUF :

1

Obtenez la dernière version llama.cpp sur GitHub ici. Vous pouvez également suivre les instructions de compilation ci-dessous. Remplacez -DGGML_CUDA=ON par -DGGML_CUDA=OFF si vous n’avez pas de GPU ou si vous voulez simplement une inférence CPU.

2

Si vous souhaitez utiliser llama.cpp pour charger directement les modèles, vous pouvez faire ce qui suit : (:Q4_K_XL) est le type de quantification. Vous pouvez aussi télécharger via Hugging Face (point 3). C’est similaire à ollama run . Utilisez export LLAMA_CACHE="folder" pour forcer llama.cpp à enregistrer dans un emplacement spécifique. Le modèle a une longueur de contexte maximale de 256K.

Suivez l’une des commandes spécifiques ci-dessous, selon votre cas d’utilisation :

Mode raisonnement (désactivé par défaut)

Tâches générales :

Le mode sans raisonnement est déjà activé par défaut

Tâches générales :

Tâches de raisonnement :

3

Téléchargez le modèle via (après avoir installé pip install huggingface_hub hf_transfer ). Vous pouvez choisir Q4_K_M ou d’autres versions quantifiées comme UD-Q4_K_XL . Nous recommandons d’utiliser au moins une quantification dynamique 2 bits UD-Q2_K_XL pour équilibrer la taille et la précision. Si les téléchargements se bloquent, voir : Hugging Face Hub, débogage XET

4

Puis exécutez le modèle en mode conversation :

Qwen3.5-27B

Pour ce guide, nous utiliserons le Dynamic 4 bits, qui fonctionne très bien sur un appareil Mac avec 18 Go de RAM pour une inférence rapide. GGUF : Qwen3.5-27B-GGUF

1

Obtenez la dernière version llama.cpp sur GitHub ici. Vous pouvez également suivre les instructions de compilation ci-dessous. Remplacez -DGGML_CUDA=ON par -DGGML_CUDA=OFF si vous n’avez pas de GPU ou si vous voulez simplement une inférence CPU.

2

Si vous souhaitez utiliser llama.cpp pour charger directement les modèles, vous pouvez faire ce qui suit : (:Q4_K_M) est le type de quantification. Vous pouvez aussi télécharger via Hugging Face (point 3). C’est similaire à ollama run . Utilisez export LLAMA_CACHE="folder" pour forcer llama.cpp à enregistrer dans un emplacement spécifique. Le modèle a une longueur de contexte maximale de 256K.

Suivez l’une des commandes spécifiques ci-dessous, selon votre cas d’utilisation :

Mode raisonnement :

Tâches de codage précises (par ex. WebDev) :

Tâches générales :

Mode sans raisonnement :

Tâches générales :

Tâches de raisonnement :

3

Téléchargez le modèle via (après avoir installé pip install huggingface_hub hf_transfer ). Vous pouvez choisir MXFP4_MOE ou d’autres versions quantifiées comme UD-Q4_K_XL . Nous recommandons d’utiliser au moins une quantification dynamique 2 bits UD-Q2_K_XL pour équilibrer la taille et la précision. Si les téléchargements se bloquent, voir : Hugging Face Hub, débogage XET

4

Puis exécutez le modèle en mode conversation :

Qwen3.5-122B-A10B

Pour ce guide, nous utiliserons le Dynamic 4 bits, qui fonctionne très bien sur un appareil Mac avec 70 Go de RAM pour une inférence rapide. GGUF : Qwen3.5-122B-A10B-GGUF

1

Obtenez la dernière version llama.cpp sur GitHub ici. Vous pouvez également suivre les instructions de compilation ci-dessous. Remplacez -DGGML_CUDA=ON par -DGGML_CUDA=OFF si vous n’avez pas de GPU ou si vous voulez simplement une inférence CPU.

2

Si vous souhaitez utiliser llama.cpp pour charger directement les modèles, vous pouvez faire ce qui suit : (:Q4_K_M) est le type de quantification. Vous pouvez aussi télécharger via Hugging Face (point 3). C’est similaire à ollama run . Utilisez export LLAMA_CACHE="folder" pour forcer llama.cpp à enregistrer dans un emplacement spécifique. Le modèle a une longueur de contexte maximale de 256K.

Suivez l’une des commandes spécifiques ci-dessous, selon votre cas d’utilisation :

Mode raisonnement :

Tâches de codage précises (par ex. WebDev) :

Tâches générales :

Mode sans raisonnement :

Tâches générales :

Tâches de raisonnement :

3

Téléchargez le modèle via (après avoir installé pip install huggingface_hub hf_transfer ). Vous pouvez choisir MXFP4_MOE (4 bits dynamique) ou d'autres versions quantifiées comme UD-Q4_K_XL . Nous recommandons d’utiliser au moins une quantification dynamique 2 bits UD-Q2_K_XL pour équilibrer la taille et la précision. Si les téléchargements se bloquent, voir : Hugging Face Hub, débogage XET

4

Puis exécutez le modèle en mode conversation :

Qwen3.5-397B-A17B

Qwen3.5-397B-A17B se situe dans la même catégorie de performances que Gemini 3 Pro, Claude Opus 4.5 et GPT-5.2. Le checkpoint complet de 397B occupe environ 807 Go sur disque, mais via les GGUF 397B d'Unsloth vous pouvez exécuter :

  • 3 bits: tient sur des 192 Go de RAM systèmes (par exemple, un Mac avec 192 Go)

  • 4 bits (MXFP4): tient sur des 256 Go de RAM. Unsloth 4 bits dynamique UD-Q4_K_XL fait environ 214 Go sur disque - se charge directement sur un M3 Ultra avec 256 Go

  • S'exécute sur un seul GPU de 24 Go + 256 Go de RAM système via déport MoE, atteignant plus de 25 tokens/s

  • 8 bits nécessite environ 512 Go de RAM/VRAM

Voir les benchmarks de quantification 397B pour savoir comment se comportent les GGUF d'Unsloth.

1

Obtenez la dernière version llama.cpp sur GitHub ici. Vous pouvez également suivre les instructions de compilation ci-dessous. Remplacez -DGGML_CUDA=ON par -DGGML_CUDA=OFF si vous n’avez pas de GPU ou si vous voulez simplement une inférence CPU.

2

Si vous souhaitez utiliser llama.cpp pour charger directement les modèles, vous pouvez faire ce qui suit : (:Q4_K_M) est le type de quantification. Vous pouvez aussi télécharger via Hugging Face (point 3). C’est similaire à ollama run . Utilisez export LLAMA_CACHE="folder" pour forcer llama.cpp pour enregistrer dans un emplacement précis. N'oubliez pas que le modèle a une longueur de contexte maximale de seulement 256K.

Suivez ceci pour le raisonnement mode :

Suivez ceci pour le sans réflexion mode :

3

Téléchargez le modèle via (après avoir installé pip install huggingface_hub hf_transfer ). Vous pouvez choisir MXFP4_MOE (4 bits dynamique) ou d'autres versions quantifiées comme UD-Q4_K_XL . Nous recommandons d’utiliser au moins une quantification dynamique 2 bits UD-Q2_K_XL pour équilibrer la taille et la précision. Si les téléchargements se bloquent, voir : Hugging Face Hub, débogage XET

4

Vous pouvez modifier --threads 32 pour le nombre de threads CPU, --n-gpu-layers 2 pour le déport GPU sur un certain nombre de couches. Essayez de l'ajuster si votre GPU manque de mémoire. Supprimez-le également si vous faites une inférence uniquement sur CPU.

👾 Guide LM Studio

Pour ce guide, nous utiliserons LM Studio, une interface utilisateur unifiée pour exécuter des LLM. Le bouton « 💡Thinking » et « Non-thinking » peut ne pas apparaître par défaut, nous aurons donc besoin de quelques étapes supplémentaires pour le faire fonctionner.

1

Téléchargez LM Studio pour votre appareil. Ouvrez ensuite Model Search, recherchez « unsloth/qwen3.5 » et téléchargez le GGUF (quantification) souhaité.

2

Instructions pour le bouton Thinking : Après le téléchargement, ouvrez votre Terminal / PowerShell et essayez : lms --help. Ensuite, si LM Studio apparaît normalement avec de nombreuses commandes, exécutez :

Cela récupérera un fichier yaml qui permet à votre GGUF d'afficher le bouton « 💡Thinking » et « Non-thinking ». Vous pouvez remplacer 4b par la quantification souhaitée.

Sinon, vous pouvez aller sur notre page LM Studio et télécharger le fichier yaml spécifique.

3

Redémarrez LM Studio, puis chargez le modèle téléchargé (avec le bouton de réflexion spécifique que vous avez téléchargé). Vous devriez maintenant voir le bouton Thinking activé. N'oubliez pas de définir les paramètres corrects.

🦙 Service llama-server et bibliothèque de complétion d'OpenAI

Pour déployer Qwen3.5-397B-A17B en production, nous utilisons llama-server Dans un nouveau terminal, par exemple via tmux, déployez le modèle avec :

Puis dans un nouveau terminal, après avoir exécuté pip install openai, faites :

🤔 Comment activer ou désactiver le raisonnement et la réflexion

Pour les commandes ci-dessous, vous pouvez utiliser «true» et «false» de manière interchangeable.

Unsloth Studio dispose automatiquement d'un bouton « Think » pour les modèles de réflexion.

Pour avoir le bouton Think dans LM Studio, lisez notre guide.

Unsloth Studio dispose du bouton Think par défaut

Pour désactiver la réflexion / le raisonnement, utilisez dans llama-server :

Si vous êtes sur Windows ou PowerShell, utilisez : --chat-template-kwargs "{\"enable_thinking\":false}"

Pour activer la réflexion / le raisonnement, utilisez dans llama-server :

Si vous êtes sur Windows ou PowerShell, utilisez : --chat-template-kwargs "{\"enable_thinking\":true}"

Voici un exemple pour Qwen3.5-9B afin d'activer la réflexion (elle est désactivée par défaut) :

Et ensuite en Python :

👨‍💻 OpenAI Codex et Claude Code

Pour exécuter le modèle via des charges de travail locales de codage agentique, vous pouvez suivre notre guide. Utilisez le llama-server que nous venons tout juste de configurer, et définissez le nom du modèle sur l'identifiant exact qu'il renvoie dans GET /v1/models (la --alias valeur ci-dessus, par ex. unsloth/Qwen3.5-9B-GGUF). Suivez les paramètres et instructions d'utilisation appropriés de Qwen3.5.

Après avoir suivi les instructions pour Claude Code, par exemple, vous verrez :

Nous pouvons alors demander, par exemple, Créez un jeu Python d'échecs :

🔨Appel d'outils avec Qwen3.5

Voir Tool Calling Guide pour plus de détails sur la manière d'effectuer des appels d'outils. Dans un nouveau terminal (si vous utilisez tmux, faites CTRL+B+D), nous créons des outils tels que l'addition de 2 nombres, l'exécution de code Python, l'exécution de fonctions Linux et bien plus encore :

Nous utilisons ensuite les fonctions ci-dessous (copiez, collez et exécutez) qui analyseront automatiquement les appels de fonctions et appelleront le point de terminaison OpenAI pour n'importe quel modèle :

Après avoir lancé Qwen3.5 via llama-server comme dans Qwen3.5 ou consultez Tool Calling Guide pour plus de détails, nous pouvons alors effectuer des appels d'outils.

📊 Benchmarks

Benchmarks GGUF d'Unsloth

Nous avons mis à jour les quantifications dynamiques Unsloth de Qwen3.5-35B étant SOTA sur presque toutes les précisions. Nous avons réalisé plus de 150 benchmarks de divergence KL, représentant au total 9 To de GGUF. Nous avons téléversé tous les artefacts de recherche. Nous avons également corrigé un appel d’outils modèle de conversation bug (affecte tous les téléverseurs de quantifications)

  • Tous les GGUF sont désormais mis à jour avec un quantification améliorée algorithme.

  • Tous utilisent nos nouvelles données imatrix. Découvrez quelques améliorations dans les cas d’usage de chat, de codage, de long contexte et d’appel d’outils.

  • Les GGUF Qwen3.5-35B-A3B sont mis à jour pour utiliser les nouveaux correctifs (112B et 27B sont encore en conversion ; retéléchargez-les une fois mis à jour)

  • Une divergence KL de 99,9 % montre des performances SOTA sur la frontière de Pareto pour UD-Q4_K_XL, IQ3_XXS et plus encore.

  • Abandon de MXFP4 pour toutes les quantifications GGUF : Q2_K_XL, Q3_K_XL et Q4_K_XL, à l'exception du pur MXFP4_MOE.

35B-A3B - benchmarks KLD (plus bas est préférable)
122B-A10B - benchmarks KLD (plus bas est préférable)

LISEZ NOTRE ANALYSE DÉTAILLÉE ET NOS BENCHMARKS QWEN3.5 ICI :

Benchmarks Qwen3.5 GGUF

Benchmarks Qwen3.5-397B-A17B

Benjamin Marie (tiers) a évalué Qwen3.5-397B-A17B à l'aide des GGUF d'Unsloth sur une suite mixte de 750 prompts (LiveCodeBench v6, MMLU Pro, GPQA, Math500), en rapportant à la fois la précision globale et l'augmentation relative des erreurs (à quelle fréquence supplémentaire le modèle quantifié commet des erreurs par rapport à l'original).

Résultats clés (précision ; changement par rapport à l'original ; augmentation relative des erreurs) :

  • Poids originaux : 81.3%

  • UD-Q4_K_XL : 80.5% (−0,8 point ; +4,3 % d'augmentation relative des erreurs)

  • UD-Q3_K_XL : 80.7% (−0,6 point ; +3,5 % d'augmentation relative des erreurs)

UD-Q4_K_XL et UD-Q3_K_XL reste extrêmement proche de l'original, avec une baisse de précision bien inférieure à 1 point sur cette suite, ce qui, selon Ben, signifie que vous pouvez réduire fortement l'empreinte mémoire (environ 500 Go de moins) avec peu ou pas de perte pratique sur les tâches testées.

Comment choisir : Le fait que Q3 obtienne ici un score légèrement supérieur à Q4 est tout à fait plausible en raison de la variance normale d'une exécution à l'autre à cette échelle ; considérez donc Q3 et Q4 comme ayant une qualité effectivement similaire dans ce benchmark :

  • Choisissez Q3 si vous souhaitez la plus petite empreinte / les meilleures économies de mémoire

  • Choisissez Q4 si vous souhaitez une option légèrement plus prudente avec des résultats similaires

Toutes les quantifications listées utilisent notre méthodologie dynamique. Même UD-IQ2_M utilise la même méthodologie dynamique, mais le processus de conversion est différent de UD-Q2-K-XL où K-XL est généralement plus rapide que UD-IQ2_M même s'il est plus grand, c'est pourquoi UD-IQ2_M peut être plus performant que UD-Q2-K-XL.

Benchmarks officiels de Qwen

Benchmarks Qwen3.5-35B-A3B, 27B et 122B-A10B

Benchmarks Qwen3.5-4B et 9B

Benchmarks Qwen3.5-397B-A17B

Mis à jour

Ce contenu vous a-t-il été utile ?