For the complete documentation index, see llms.txt. This page is also available as Markdown.

Exécutez des agents de codage avec des LLMs locaux en utilisant Unsloth Start

Unsloth vous permet de connecter Claude Code, Codex, Hermes, OpenCode et d'autres agents de codage à un modèle local via la commande unsloth start . L'ensemble du flux de travail peut s'exécuter hors ligne sur votre propre matériel. Unsloth configure automatiquement l'endpoint, la clé API, le fournisseur, le modèle et la longueur de contexte pour chaque lancement, afin que vous puissiez utiliser votre agent préféré sans les modifier. Ce guide vous montrera comment lancer des modèles depuis la ligne de commande pour une utilisation hors ligne, et vous connecter à Unsloth.

Démarrage rapide

D'abord, assurez-vous d'avoir Unsloth installé. Ouvrez ensuite Unsloth, chargez un modèle, allez dans le dossier de votre projet et exécutez la commande dans le terminal :

unsloth start claude

Vous pouvez remplacer claude par n'importe quel agent ci-dessous :

Claude Code s'exécutant localement avec Qwen3.5.
Agent
Commande

Claude Code

unsloth start claude

OpenAI Codex

unsloth start codex

DeepSeek Harness

unsloth start dsh

OpenCode

unsloth start opencode

Agent Hermes

unsloth start hermes

OpenClaw

unsloth start openclaw

Agent Pi

unsloth start pi

Unsloth utilise une configuration temporaire du fournisseur ou propre à la session. Il n'ajoute pas de fournisseur Unsloth aux fichiers de configuration normaux de l'agent.

Codex nécessite actuellement un modèle GGUF servi via le backend llama-server .

Guides des agents

Charger un modèle depuis la ligne de commande

unsloth start launching Codex with a local GGUF model in Unsloth Studio
Unsloth start trouve ou charge le modèle, configure l'agent de codage et le lance depuis le projet actuel.

Vous pouvez sélectionner et charger un modèle tout en lançant l'agent :

Le :UD-Q4_K_XL suffixe sélectionne la quantification GGUF.

Sur l'adresse locale par défaut, le fait de passer --model permet commande unsloth start de lancer un serveur temporaire quand Unsloth Studio n'est pas déjà en cours d'exécution. Le serveur temporaire s'arrête lorsque l'agent se ferme. Si Unsloth est déjà en cours d'exécution, la commande s'y connecte et le laisse en marche.

Voir ci-dessous des exemples d'agents connectés à un LLM local :

OpenCode

Hermes
Claude Code
Codex
Openclaw

Se connecter à un serveur Unsloth distant

Définissez l'URL Unsloth et la clé API avant de lancer un agent :

Vous pouvez également transmettre la clé avec --api-key. Pour un serveur Unsloth local vérifié, commande unsloth start crée ou réutilise automatiquement la clé API.

Options + paramètres

S'il n'y a aucun réglage/aucun paramètre d'échantillonnage défini, Unsloth sélectionne automatiquement les meilleurs réglages/recommandés pour le modèle, y compris la longueur de contexte, la température, etc.

Sinon, vous pouvez personnaliser ces options en conséquence :

Option
Ce que cela fait

--model, -m

Sélectionner un modèle. Sans cela, utiliser le premier modèle signalé par Unsloth.

--api-key

Fournir une clé API Unsloth. Vous pouvez aussi définir UNSLOTH_API_KEY.

--launch / --no-launch

Lancer l'agent ou afficher l'environnement et la commande générés.

--serve / --no-serve

Autoriser ou empêcher le démarrage automatique du serveur local.

--gguf-variant

Sélectionner une variante de quantification GGUF.

--reasoning

Utiliser le raisonnement dans le chat : on, off ou auto. Auto suit le modèle de chat du modèle, ce qui signifie généralement on.

--reasoning-effort

Effort de raisonnement transmis au modèle via son modèle de chat, par exemple medium. Les niveaux sont propres à chaque modèle, donc utilisez-en un que le modèle accepte. Si non défini, la valeur propre du modèle de chat est conservée.

--context-length, --max-seq-length

Définir la longueur de contexte demandée lors du chargement du modèle.

--load-in-4bit / --no-load-in-4bit

Contrôler le chargement en 4 bits pour les modèles Hugging Face non-GGUF.

--tensor-parallel / --no-tensor-parallel

Activer ou désactiver le chargement GGUF en parallèle de tenseurs pour les systèmes multi-GPU.

--persist / --no-persist

Conserver le répertoire de base géré par Unsloth, le cas échéant.

--yolo

Utiliser le mode confiance ou sans invite de l'agent sélectionné.

-h, --help

Afficher l'aide de la commande.

Les options de chargement sont utilisées lorsque Unsloth doit charger ou réconcilier le modèle demandé.

Passer les commandes normales à l'agent

Les arguments qui ne sont pas des options Unsloth sont transmis à l'agent sélectionné :

Utilisez la commande d'aide propre à l'agent pour obtenir la liste complète de ses options natives.

Sessions et --persist

--persist conserve le stockage géré. Il ne reprend pas une conversation tout seul ; transmettez aussi la commande normale de reprise de l'agent.

Agent

Avez-vous besoin --persist?

Exemple de reprise

Claude Code

Non. Claude utilise son magasin de sessions normal.

unsloth start claude --continue

OpenAI Codex

Oui. Son répertoire de base Codex géré est temporaire par défaut.

unsloth start codex --persist resume --last

OpenClaw

Oui. La configuration, l'espace de travail et les sessions gérés sont temporaires par défaut.

Utilisez --persist avec le même identifiant de session natif.

OpenCode

Non. OpenCode utilise son magasin de sessions normal.

unsloth start opencode run --continue "Continue"

Agent Hermes

Oui. Son répertoire de base Hermes géré est temporaire par défaut.

unsloth start hermes --persist --continue --oneshot "Continue"

Agent de codage Pi

Oui. Son répertoire de base Pi géré est temporaire par défaut.

unsloth start pi --persist --continue

Pour Codex, OpenClaw, Hermes et Pi, utilisez --persist depuis le premier lancement et à nouveau lorsque vous revenez à la session.

Utilisez un identifiant de session stable pour une session nommée :

Afficher la commande de lancement sans l'exécuter

Cela affiche l'environnement et la commande générés. La sortie peut contenir des identifiants de connexion, alors ne la publiez pas dans les journaux ou les captures d'écran.

Mode de contournement des autorisations

--yolo correspond au mode de confiance ou sans invite de l'agent sélectionné. Il peut réduire les demandes d'approbation et permettre à l'agent d'exécuter des commandes sans demander d'abord.

Problèmes courants

Aucun serveur Unsloth n'a été trouvé

Démarrez Unsloth et chargez un modèle, ou passez `--model` afin qu'Unsloth puisse démarrer un serveur local temporaire.

Codex ne se connecte pas

Utilisez un modèle GGUF exécuté via `llama-server`. L'intégration Codex actuelle n'utilise pas le backend transformers d'Unsloth.

Une session n'a pas été restaurée

Pour Codex, OpenClaw, Hermes et Pi, utilisez `--persist` au premier lancement et aux suivants, puis transmettez l'option native de reprise de l'agent.

Mis à jour

Ce contenu vous a-t-il été utile ?