💜Qwen3.6 - comment l'exécuter localement
Exécutez les nouveaux modèles Qwen3.6-27B et 35B-A3B localement !
Qwen3.6 est la nouvelle famille de modèles multimodaux à raisonnement hybride d’Alibaba, comprenant : Qwen3.6-27B et 35B-A3B. Il offre des performances de pointe pour sa taille, prend en charge un contexte de 256K sur 201 langues. Il excelle dans le codage agentique, la vision et les tâches de chat. Qwen3.6-27B fonctionne sur 18 Go de RAM des configurations et 35B-A3B fonctionne sur 22 Go. Vous pouvez désormais exécuter et entraîner les modèles dans Unsloth Desktop.
10 juillet : Nous avons publié de nouvelles NVFP4 quantifications pour exécuter Qwen3.6 2,5x plus vite sur les GPU.
Qwen3.6 MTP est là! MTP permet une inférence 1,4 à 2,2x plus rapide sans perte de précision. Exécutez MTP directement dans Unsloth StudioNous avons effectué des benchmarks GGUF de Qwen3.6 pour vous aider à choisir la meilleure quantification.
Les GGUF Qwen3.6 utilisent Unsloth Dynamic 2.0 pour des performances de quantification SOTA - les quantifications sont donc calibrées sur des jeux de données d'utilisation réels et les couches importantes sont remontées en précision. Merci à Qwen pour l'accès dès le premier jour.
Prise en charge du rôle développeur pour Codex, OpenCode et plus : Nos envois prennent désormais en charge le
rôle développeurpour les outils de codage agentique.Appel d'outils : Comme Qwen3.5, nous avons amélioré l'analyse des objets imbriqués pour faire davantage réussir les appels d'outils.

⚙️ Guide d'utilisation
Tableau : exigences matérielles pour l'inférence (unités = mémoire totale : RAM + VRAM, ou mémoire unifiée)
27B
15 Go
18 Go
24 Go
30 Go
55 Go
35B-A3B
17 Go
23 Go
30 Go
38 Go
70 Go
Pour de meilleures performances, assurez-vous que votre mémoire totale disponible (VRAM + RAM système) dépasse la taille du fichier du modèle quantifié que vous téléchargez. Si ce n'est pas le cas, vous pouvez quand même l'exécuter via un déchargement sur SSD/HDD, mais l'inférence sera plus lente.
Pour entraîner Qwen3.6, vous pouvez vous référer à notre précédent guide de fine-tuning Qwen3.5.
Paramètres recommandés
Fenêtre de contexte maximale :
262,144(peut être étendue à 1M via YaRN)presence_penalty = 0.0 à 2.0par défaut, cela est désactivé, mais pour réduire les répétitions, vous pouvez utiliser cela ; toutefois, utiliser une valeur plus élevée peut entraîner une légère baisse des performancesLongueur de sortie adéquate:
32,768jetons pour la plupart des requêtes
Comme Qwen3.6 est à raisonnement hybride, le mode de réflexion et le mode sans réflexion ont des paramètres différents :
Mode de réflexion :
Qwen3.6 dispose désormais de Raisonnement préservé.
temperature = 1.0
temperature = 0.6
top_p = 0.95
top_p = 0.95
top_k = 20
top_k = 20
min_p = 0.0
min_p = 0.0
presence_penalty = 0.0
presence_penalty = 0.0
repeat_penalty = désactivé ou 1.0
repeat_penalty = désactivé ou 1.0
Mode de réflexion pour les tâches générales :
Mode de réflexion pour les tâches de codage précises :
Paramètres du mode Instruct (sans réflexion) :
temperature = 0.7
top_p = 0.8
top_k = 20
min_p = 0.0
presence_penalty = 1.5
repeat_penalty = désactivé ou 1.0
Pour désactiver la réflexion / le raisonnement, utilisez --chat-template-kwargs '{"enable_thinking":false}'
Si vous êtes sur Windows PowerShell, utilisez : --chat-template-kwargs "{\"enable_thinking\":false}"
Utilisez 'true' et 'false' de manière interchangeable.
Mode Instruct (sans réflexion) pour les tâches générales :
Tutoriels d'inférence Qwen3.6 :
Nous allons utiliser du 4 bits dynamique UD-Q4_K_XL variantes GGUF pour les charges de travail d'inférence. Cliquez ci-dessous pour accéder aux instructions du modèle concerné :
N'utilisez PAS CUDA 13.2, car vous pourriez obtenir des sorties incohérentes. Utilisez une version inférieure à CUDA 13.2 ou CUDA 13.3.
🦥 Guide Unsloth
Qwen3.6 et Qwen3.6 MTP peuvent désormais être exécutés dans Unsloth Desktop, notre nouvelle interface open source pour l'IA locale. Unsloth Studio vous permet d'exécuter des modèles localement sur MacOS, Windows, Linux et :
Rechercher, télécharger, exécuter des GGUF et des modèles safetensor
Auto-réparation appel d'outils + recherche web
Exécution de code (Python, Bash)
Inférence automatique réglage des paramètres (temp, top-p, etc.)
Inférence rapide sur CPU + GPU via llama.cpp
Entraîner des LLM 2x plus vite avec 70 % de VRAM en moins

Installer Unsloth
La façon la plus simple de commencer est de télécharger l application Unsloth Desktop. Fonctionne sur macOS, Windows, et Linux.
Ou, si vous préférez installer manuellement :
MacOS, Linux, WSL :
Windows PowerShell :
L'installation sera rapide et prendra environ 20 secondes à 1 minute.
Lancer Unsloth
MacOS, Linux, WSL et Windows :

Puis ouvrez http://127.0.0.1:8888 (ou votre URL spécifique) dans votre navigateur.
Lancer Unsloth en toute sécurité avec HTTPS et Cloudflare
NOUVEAU ! Unsloth propose désormais un moyen sécurisé de lancer Unsloth via HTTPS grâce à un tunnel Cloudflare gratuit. Utilisez ce qui suit (fonctionne sous Windows, Mac et Linux) :
Rechercher et télécharger Qwen3.6 ou Qwen3.6 MTP
Au premier lancement, vous devrez créer un mot de passe pour sécuriser votre compte et vous reconnecter plus tard. Puis allez dans l onglet Unsloth Chat et recherchez Qwen3.6 ou Qwen3.6 MTP dans la barre de recherche, puis téléchargez le modèle et la quantification souhaités.

Exécuter Qwen3.6
Les paramètres d'inférence devraient être définis automatiquement lors de l'utilisation d'Unsloth Studio, mais vous pouvez toujours les modifier manuellement. Vous pouvez également modifier la longueur du contexte, le modèle de chat et d'autres paramètres.
Pour plus d'informations, vous pouvez consulter notre guide d'inférence d'Unsloth Studio. Ci-dessous, le GGUF Qwen3.6 2 bits a effectué plus de 30 appels d'outils, recherché 20 sites et exécuté du code Python :
⚡ Guide MTP
Le décodage spéculatif MTP (Multi Token Prediction) permet à des modèles comme Qwen3.6 d'avoir une génération ~1,4 à 2,2x plus rapide avec aucun changement de précision. Cela permet à Qwen3.6 27B et 35B-A3B d'avoir une accélération >1,4x par rapport à la base originale, ce qui est particulièrement utile pour les modèles locaux.
Les GGUF MTP Qwen3.6 d'Unsloth ne sont plus en mode expérimental, et llama.cpp a intégré la prise en charge de MTP. Exécutez-les directement dans l'interface d'Unsloth Studio ou via llama.cpp. Qwen3.6 27B MTP fonctionne désormais à 160 jetons/s en génération et Qwen3.6 35B-A3B à 240 jetons/s sur un GPU RTX 6000. Voir Qwen3.6.
Unsloth Studio définit automatiquement les paramètres MTP idéaux, optimisés pour votre matériel spécifique (Mac, CPU, GPU, etc.) - vous pouvez toujours les modifier plus tard.


En pratique, MTP prédit plusieurs jetons futurs, puis le modèle principal vérifie ces jetons en parallèle. Cela réduit le nombre de passes avant nécessaires pendant la génération et rend la sortie plus rapide. Nous avons constaté --spec-draft-n-max 2 comme étant le plus efficace dans la plupart des configurations. Cependant, ne supposez pas que 2 est optimal, car les performances dépendent du matériel. Essayez des valeurs de 1 à 6 et utilisez celle qui est la plus rapide pour votre système.
Nous avons également téléversé des GGUF MTP pour la Qwen3.5 famille de modèles comprenant : 0.8B, 2B, 4B, 9B, 27B, 35B-A3B, 122B-A10B et 397B-A17B. Llama.cpp améliore continuellement les performances de MTP, alors attendez-vous à ce qu'elles s'accélèrent avec le temps !
Tableau : exigences matérielles pour MTP (unités = mémoire totale : RAM + VRAM, ou mémoire unifiée)
27B
16 Go
19 Go
25 Go
31 Go
56 Go
35B-A3B
18 Go
24 Go
31 Go
39 Go
71 Go
🦥 Guide MTP d'Unsloth Studio
Unsloth Studio définit automatiquement les paramètres MTP idéaux, optimisés pour votre matériel spécifique (Mac, CPU, GPU, etc.) - vous pouvez toujours les modifier plus tard.
Rechercher et télécharger Qwen3.6 MTP
Au premier lancement, vous devrez créer un mot de passe pour sécuriser votre compte et vous reconnecter plus tard. Puis allez dans l onglet Unsloth Chat onglet et recherchez Qwen3.6 MTP dans la barre de recherche, puis téléchargez le modèle et la quantification souhaités.

Exécuter Qwen3.6 MTP
Les paramètres d'inférence devraient être définis automatiquement lors de l'utilisation d'Unsloth Studio, mais vous pouvez toujours les modifier manuellement. Vous pouvez également modifier la longueur du contexte, le modèle de chat et d'autres paramètres.
Pour plus d'informations, vous pouvez consulter notre guide d'inférence d'Unsloth Studio. Ci-dessous, le GGUF Qwen3.6 MTP 2 bits a effectué plus de 10 appels d'outils, recherché 10 sites et exécuté du code Python :

🦙 Guide MTP de Llama.cpp
Installez la dernière version de llama.cpp sur GitHub ici. Vous pouvez également suivre les instructions de compilation ci-dessous. Remplacez -DGGML_CUDA=ON par -DGGML_CUDA=OFF si vous n'avez pas de GPU ou si vous souhaitez simplement une inférence CPU. Pour les appareils Apple Mac / Metal, définissez -DGGML_CUDA=OFF puis continuez comme d'habitude - la prise en charge de Metal est activée par défaut.
Si vous voulez utiliser llama.cpp directement pour charger des modèles, vous pouvez faire ce qui suit : (:Q4_K_XL) est le type de quantification. Vous pouvez également télécharger via Hugging Face (point 3). C'est similaire à ollama run . Utilisez export LLAMA_CACHE="folder" pour forcer llama.cpp à enregistrer dans un emplacement spécifique. Le modèle a une longueur de contexte maximale de 256K.
Suivez l'une des commandes pour les modèles spécifiques :
MTP Qwen3.6-27B :
Mode de réflexion :
Tâches générales :
Pour les tâches de codage précises, remplacez : temperature=0.6
Mode sans réflexion :
Tâches générales :
MTP Qwen3.6-35B-A3B :
Mode de réflexion :
Tâches générales :
Pour les tâches de codage précises, remplacez : temperature=0.6
Mode sans réflexion :
Tâches générales :
Vous pouvez également télécharger le modèle manuellement via le code ci-dessous (après avoir installé pip install huggingface_hub). Vous pouvez choisir Q4_K_M ou d'autres versions quantifiées comme UD-Q4_K_XL . Nous recommandons d'utiliser au moins la quantification dynamique 2 bits UD-Q2_K_XL pour équilibrer taille et précision. Si les téléchargements se bloquent, voir : Hugging Face Hub, débogage XET
Puis exécutez le modèle en mode conversation :
🍎 Quants dynamiques MLX
Nous avons également téléversé des quantifications dynamiques Qwen3.6 4 bits et 8 bits pour les appareils macOS ! Notre algorithme de quantification MLX évolue encore, et nous l'affinons activement partout où des améliorations peuvent être apportées.
Vous pouvez exécuter tous les modèles MLX dans Unsloth Studio!
Qwen3.6-27B MLX :
Qwen3.6-35B-A3B MLX :
Pour les essayer, utilisez :
Voir ci-dessous les scores de divergence KL (KLD) et de perplexité (PPL) de Qwen3.6-27B (plus bas est meilleur) :
⚡️NVFP4
10 juillet 2026 : Nous publions de nouveaux quants NVFP4 dynamiques de Qwen3.6 qui s'exécutent à environ ~2,5× plus rapide que les autres quants NVFP4, avec de meilleures performances et des tailles de fichiers comparables. Exécutez Qwen3.6-27B NVFP4 2,5x plus rapide sur 24 Go de VRAM et Qwen3.6-35B-A3B 1,7x plus rapide sur 32 Go de VRAM. Nous avons aussi ajouté la calibration du cache KV FP8 pour des longueurs de contexte 2x plus longues ! NVFP4 nécessite les GPU Blackwell de NVIDIA comme les RTX 50X, DGX Spark (voir Qwen3.6), B200, B300. Pour les GPU plus anciens, nos GGUF fonctionnent bien !

Tous les benchmarks utilisent 1x B200 avec une concurrence de 128. Une concurrence plus élevée peut faire monter le 35B à 17 561 jetons / s. Nous publions aussi deux versions NVFP4 35B-A3B :
Qwen3.6-35B-A3B-NVFP4-Fast qui est une quantification W4A4 complète - 1,79x plus rapide
Qwen3.6-35B-A3B-NVFP4 qui est un peu plus volumineux mais plus précis et 1,56x plus rapide
Pour les benchmarks de précision, nous avons réalisé MMLU-Pro, AIME 2025, GPQA pour FP8, BF16, le NVFP4 de NVIDIA et nos NVFP4 - nous montrons que nos quantifications plus rapides obtiennent des résultats similaires sur l'ensemble :

Qwen3.6-35B-A3B-NVFP4 (1,56x plus rapide)
Qwen3.6-27B-NVFP4 (2,5x plus rapide)
Qwen3.6-35B-A3B-NVFP4-Fast (1,79x plus rapide)
Les tenseurs MTP sont aussi intégrés directement dans les quants pour des gains de vitesse supplémentaires. Les gains de précision proviennent des améliorations apportées au modèle de chat et à la calibration du jeu de données de Qwen3.6. Nous utilisons nos précédentes mises à jour du modèle de chat pour améliorer la cohérence du code et de l'appel d'outils tout en réduisant les boucles et d'autres problèmes signalés. Notre calibration utilise un mélange de notre jeu de données optimisé pour le code, l'appel d'outils et le chat, ainsi qu'UltraChat.
Pour la vitesse de décodage (jetons / s), le nôtre est 1,03x plus rapide pour 27B et 1,17x et 1,22x plus rapide pour 35B.

Benchmarks NVFP4
NVFP4 exécute directement les poids 4 bits et les multiplications matricielles sur les Tensor Cores Blackwell. Nos quants Qwen3.6 NVFP4 utilisent W4A4, ils utilisent donc réellement les Tensor Cores FP4, et décodent plus vite que ceux de NVIDIA qui utilisent W4A16. Nous quantifions aussi dynamiquement les couches pour conserver la précision, et nous avons mené des benchmarks MMLU-Pro, AIME 2025, GPQA pour tous les quants, y compris une comparaison avec FP8 et BF16.
Benchmarks de précision Qwen3.6-27B NVFP4
Unsloth
86.25
86.34
93.12
NVIDIA
85.96
86.87
93.12
FP8
86.11
86.87
93.75
BF16
85.96
88.13
93.33
Benchmarks de précision Qwen3.6-35B-A3B NVFP4
Unsloth
85.85
86.74
92.29
Unsloth Fast
85.58
87.75
91.67
NVIDIA
85.60
87.12
91.88
FP8
85.75
86.74
93.12
BF16
85.75
86.36
92.50
Nous avons aussi vérifié la longueur de sortie de tous les benchmarks, et elles sont comparables, donc les nouveaux quants NVFP4 ne pensent pas plus longtemps, ce qui annule l'intérêt de les quantifier ! (Par exemple, si c'est 2x plus rapide, mais pense 2x plus, alors cela ne sert à rien)

Marlin vs Flashinfer vs cutlass vs cute-DSL
Nous avons aussi constaté que les kernels Marlin ne prennent pas bien en charge W4A4 - l'activer entraînera une dégradation des performances de 2,5x - utilisez donc CUTLASS, Flashinfer-TRTLLM ou Cute-DSL (activé automatiquement dans vLLM) ! Si vous avez un DGX Spark, voir Qwen3.6 vous devez utiliser --moe-backend flashinfer_b12x sinon vous obtiendrez une inférence 2,5x plus lente.
Donc ne définissez aucun backend - vLLM choisit automatiquement le meilleur.
nvidia 27B
W4A16
marlin (auto)
115.6
2,403
unsloth 27B
W4A4
marlin
105.6
2,127
unsloth 27B
W4A4
cutlass
113.5
6,681
unsloth 27B
W4A4
flashinfer_trtllm
112.6
6,158
unsloth 27B
W4A4
cute-DSL (auto)
125.9
6,863
nvidia 35B-A3B
W4A4
marlin (auto)
240.8
8,721
unsloth 35B-A3B
W4A4
marlin
215.8
8,619
unsloth 35B-A3B
W4A4
cutlass
158.3
11,017
unsloth 35B-A3B
W4A4
cute-DSL (auto)
295.2
15,636
vLLM:
Pour exécuter les quants NVFP4, voyez ci-dessous les commandes pour lancer Qwen3.6-27B dans vLLM et SGLang (vous pouvez changer le nom du modèle en Qwen3.6-35-A3B-NVFP4). N'utilisez pas non plus de backend MoE - laissez vLLM le sélectionner - par exemple Marlin est 2,5x plus lent ! Voir Marlin vs Flashinfer vs cutlass vs cute-DSLSi vous avez un DGX Spark, voir Qwen3.6 vous devez utiliser --moe-backend flashinfer_b12x sinon vous obtiendrez une inférence beaucoup plus lente.
Pour installer vLLM dans un venv séparé :
Puis pour servir la variante 35B Fast :
Remplacez unsloth/Qwen3.6-35B-A3B-NVFP4-Fast par les noms de quantification NVFP4 !
Pour activer MTP / le décodage spéculatif (décodage plus rapide mais un débit un peu plus faible), utilisez :
Si vous rencontrez des problèmes avec Torchcodec, faites bien ce qui suit puis relancez vllm.
DGX Spark avec des quantifications NVFP4
Pour vous assurer que DGX Spark dispose des bons kernels (sinon vous obtiendrez une inférence 2x PLUS LENTE), vérifiez d'abord :
qui ne devrait PAS renvoyer d'erreur - si c'était le cas, veuillez mettre à jour vllm ou réinstaller via :
Puis pour servir dans vLLM sur DGX Spark :
Si vous rencontrez des problèmes avec Torchcodec, faites bien ce qui suit puis relancez vllm.
SGLang :
🦙 Guide Llama.cpp
Pour ce guide, nous utiliserons le 4 bits dynamique, qui fonctionne très bien sur un appareil Mac / 24 Go de RAM pour une inférence rapide sur llama.cpp. Comme le modèle ne fait qu'environ 72 Go en précision F16 complète, nous n'aurons pas trop à nous soucier des performances. Voir notre collection GGUF.
Obtenez la dernière llama.cpp sur GitHub ici. Vous pouvez également suivre les instructions de compilation ci-dessous. Remplacez -DGGML_CUDA=ON par -DGGML_CUDA=OFF si vous n'avez pas de GPU ou si vous souhaitez simplement une inférence CPU. Pour les appareils Apple Mac / Metal, définissez -DGGML_CUDA=OFF puis continuez comme d'habitude - la prise en charge de Metal est activée par défaut.
Si vous voulez utiliser llama.cpp directement pour charger des modèles, vous pouvez faire ce qui suit : (:Q4_K_XL) est le type de quantification. Vous pouvez également télécharger via Hugging Face (point 3). C'est similaire à ollama run . Utilisez export LLAMA_CACHE="folder" pour forcer llama.cpp à enregistrer dans un emplacement spécifique. Le modèle a une longueur de contexte maximale de 256K.
Suivez l'une des commandes pour les modèles spécifiques :
Qwen3.6-27B :
Mode de réflexion :
Tâches générales :
Pour les tâches de codage précises, remplacez : temperature=0.6
Mode sans réflexion :
Tâches générales :
Qwen3.6-35B-A3B :
Mode de réflexion :
Tâches générales :
Pour les tâches de codage précises, remplacez : temperature=0.6
Mode sans réflexion :
Tâches générales :
Vous pouvez également télécharger le modèle manuellement via le code ci-dessous (après avoir installé pip install huggingface_hub). Vous pouvez choisir Q4_K_M ou d'autres versions quantifiées comme UD-Q4_K_XL . Nous recommandons d'utiliser au moins la quantification dynamique 2 bits UD-Q2_K_XL pour équilibrer taille et précision. Si les téléchargements se bloquent, voir : Hugging Face Hub, débogage XET
Puis exécutez le modèle en mode conversation :
💡 Réflexion : activer/désactiver + préserver la réflexion
Qwen3.6 dispose également de Raisonnement préservé ce qui conserve la trace de raisonnement de la conversation précédente. Cela augmente le nombre de jetons utilisés, mais peut améliorer la précision dans les conversations poursuivies. Unsloth Studio propose des bascules 'Think' et 'Preserved Thinking' pour Qwen3.6 :

Pour activer la préservation de la réflexion dans llama.cpp utilisez (changez en 'true' ou 'false') 'preserve_thinking' au lieu de 'enable_thinking' ou 'disable_thinking'.
Pour la réflexion normale, vous pouvez activer / désactiver la réflexion dans llama.cpp en suivant les commandes ci-dessous. Utilisez 'true' et 'false' de manière interchangeable.
Linux, MacOS, WSL :
Windows / Powershell :
À titre d'exemple pour Qwen3.6-35B-A3B, pour activer la préservation de la réflexion (par défaut, elle est activée) :
Puis en Python :
👨💻 OpenAI Codex & Claude Code
Pour exécuter le modèle via des workloads de codage agentiques locaux, vous pouvez suivre notre guide. Utilisez le llama-server que nous venons de configurer, et définissez le nom du modèle sur l'identifiant exact qu'il indique dans GET /v1/models (la --alias valeur ci-dessus, par ex. unsloth/Qwen3.6-35B-A3B-GGUF). Suivez les paramètres et les instructions d'utilisation corrects de Qwen3.6.
Après avoir suivi les instructions pour Claude Code par exemple, vous verrez :

On peut alors demander par exemple Crée un jeu d'échecs en Python :



📊 Benchmarks
Benchmarks GGUF d'Unsloth
Nous avons effectué des benchmarks de divergence KL moyenne pour les GGUF Qwen3.6-35-A3B auprès de différents fournisseurs afin de vous aider à choisir la meilleure quantification.
La divergence KL place presque tous les GGUF d'Unsloth sur la frontière de Pareto SOTA
KLD montre à quel point un modèle quantifié correspond à la distribution de sortie BF16 originale, ce qui indique la précision conservée.
Cela place Unsloth en tête des performances pour 21 des 22 tailles
Seul Q6_K a été mis à jour pour davantage de couches dynamiques et nous avons introduit un nouveau
UD-IQ4_NL_XLquantification

Benchmarks MTP
Nous avons évalué les nouveaux quants que nous avons créés pour les MoE 27B et 35B. En général, les modèles denses sont beaucoup plus accélérés avec MTP (1,4-2x) qu'avec les modèles MoE (1,15-1,25x).
Avec cela, Qwen3.6 27B peut désormais générer 140 jetons/s avec UD-Q2_K_XL et Qwen3.6 35B-A3B 220 jetons/s ! Certaines valeurs de débit sont bruitées, donc n'en déduisez pas que certaines quantifications sont plus lentes que d'autres.

En termes d'accélération moyenne, on observe un facteur 1,4x pour les modèles denses avec draft tokens = 2 et, pour les MoE, environ 1,15 à 1,2x.

Nous ne recommandons pas plus de 2 draft tokens, car le taux d'acceptation chute brusquement de 83 % à 50 % avec 4 draft tokens, et les passes avant pour MTP deviennent moins avantageuses.

Benchmarks officiels de Qwen
Qwen3.6-27B

Qwen3.6-35B-A3B

Ces résultats simplifient le compromis : utilisez les GGUF dynamiques pour le meilleur équilibre entre mémoire et qualité, utilisez MTP lorsque vous voulez une génération plus rapide, et utilisez NVFP4 sur les GPU Blackwell pour un débit maximal. Si vous voulez la voie la plus simple, exécutez le modèle dans Unsloth Studio et conservez les valeurs par défaut recommandées.
Mis à jour
Ce contenu vous a-t-il été utile ?

