Cline v4.1.21 · Ollama + LM Studio

Meilleur modèle local pour Cline : configuration Ollama et LM Studio

Quels modèles locaux tiennent vraiment la route pour le codage agentique dans Cline, comment connecter Cline à Ollama ou LM Studio, et les correctifs pour la longueur de contexte, le « connection refused » et une liste de modèles vide — 13 étapes vérifiées sur les enregistrements et la documentation officielle.

L'essentiel

  • La liste courte des modèles locaux pour Cline : qwen3-coder:30b (19GB, contexte 256K, appel d'outils), devstral:24b et gpt-oss:20b. Les trois portent un badge tools sur la page de modèle de leur runtime ; un modèle de code sans template d'appel d'outils vous parlera de votre code au lieu de le modifier.
  • Deux runtimes suffisent : Ollama sur http://localhost:11434 et LM Studio sur http://127.0.0.1:1234. Dans Cline Settings → API Configuration, choisissez l'API Provider correspondant et laissez Use custom base URL décoché, sauf si vous avez changé le port.
  • Presque tous les signalements « le modèle local ne marche pas dans Cline » se ramènent à trois causes : le serveur ne tourne pas (connection refused), le modèle n'est pas chargé (liste déroulante vide), ou la fenêtre de contexte est trop petite (l'agent oublie et repart dans son raisonnement).
  • La page d'intégration Cline d'Ollama fixe le plancher à 32K tokens de contexte pour le code, et le quick start de Cline lui-même se termine par l'activation de Use Compact Prompt. Cline v4.1.21 a ajouté une nouvelle tentative de compactage pour les modèles locaux à court de place, car llama.cpp, Ollama et LM Studio plafonnent la génération au contexte restant.

Quels modèles locaux sont vraiment à la hauteur du codage agentique dans Cline ?

Cline n'est pas une fenêtre de chat. Il envoie un gros prompt système d'appel d'outils, puis enchaîne appels d'outils, diffs de fichiers, sortie de terminal et relances. Un modèle ne fonctionne ici que si son template de chat expose l'appel d'outils via l'API du runtime et s'il tient une chaîne de raisonnement assez longue. Le tri se fait vite — vérifiez le badge tools sur la page du modèle avant de télécharger 19GB.

  • 1Conçus pour les agents — qwen3-coder:30b, c'est 30B au total avec 3,3B actifs par token, 19GB, une fenêtre de contexte de 256K et la prise en charge des outils ; c'est le meilleur codeur agentique que vous puissiez faire tourner sur une machine de 24-32GB. devstral:24b est le modèle d'agent de code de Mistral. gpt-oss:20b est le modèle à poids ouverts d'OpenAI, avec appel d'outils, raisonnement et un sweet spot à 16GB.
  • 2Utilisables avec le compact prompt activé — qwen3 dans ses tailles 4B à 14B et gemma3:12b prennent bien en charge les appels d'outils et peuvent finir de petites tâches comme le script, le renommage et le jeu de ce guide. Ils brûlent vite leur fenêtre : montez la longueur de contexte et gardez Use compact prompt activé.
  • 3À éviter pour le travail agentique — deepseek-coder-v2 est un très bon modèle de code, mais il n'a pas de badge tools sur Ollama, donc les appels d'outils de Cline ne lui parviennent jamais ; c'est aussi le cas des petits modèles sans outils et de tout tag « coder » dont la page ne montre aucun support des outils. Les benchmarks ne prédisent pas si la boucle d'outils se ferme.
  • 4Si vous cherchez la qualité agentique plutôt que la confidentialité hors ligne, réfléchissez à deux fois avant de payer la taxe matérielle du local : le niveau de modèles gratuits de Cline inclut déjà DeepSeek — DeepSeek V4 Flash y figure avec une fenêtre de contexte de 1M de tokens — donc la même boucle d'agent tourne sans téléchargement de 19GB ni passage à 32GB de RAM. Gardez l'inférence locale pour la confidentialité, le travail en réseau isolé et l'apprentissage, et voir le guide DeepSeek + Cline lié plus bas pour la voie hébergée.
  • 5Règle empirique de la page local-models de Cline : 16-32GB fait tourner des modèles petits ou quantifiés, 32-64GB des modèles de code intermédiaires, 64GB+ achète des modèles plus gros et des fenêtres de contexte plus larges. En pratique, c'est la longueur de contexte, pas le nombre de paramètres, qui casse en premier une boucle d'agent locale.

How to Use Cline with LM Studio for 100% Local AI Vibe Coding

Chaîne:Bootable USBs7:04

Ouvrir

Install Qwen 3 Locally in Minutes with Ollama

Chaîne:Bonverium Studio4:04

Ouvrir

Local models — Cline documentation

Documentation officielle:docs.cline.bot

Ouvrir

Cline with Ollama — Ollama integration guide

Documentation officielle:docs.ollama.com

Ouvrir

Cline v4.1.21 release notes (local model compaction)

Documentation officielle:github.com/cline/cline

Ouvrir

Les captures proviennent de deux enregistrements d'écran : le walkthrough LM Studio + Cline fournit toutes les images VS Code, Cline Settings et LM Studio, et un enregistrement Ollama distinct fournit les images de l'installeur, du sélecteur de modèles et du terminal. Les images avec incrustations de l'auteur, visages ou sous-titres incrustés ont été écartées, et une image sur la longueur de contexte a été réextraite à un horodatage exact après qu'un seek rapide soit tombé sur la mauvaise scène.

Les noms de produits, libellés de menus et numéros de version ont été vérifiés sur docs.cline.bot (Local models), docs.ollama.com/integrations/cline, les pages de modèles d'ollama.com et les notes de version cline/cline v4.1.21. Les captures citent de brefs extraits des enregistrements à titre de commentaire.

Configurer Cline sur des modèles locaux en 13 étapes

Installer Cline et le runtime Ollama

  1. 1

    Installer l'extension Cline dans VS Code

    Ouvrez la vue Extensions (Ctrl+Shift+X) et cherchez Cline, puis installez l'extension publiée par cline.bot. La liste du marketplace est saturée de faux jumeaux — Cline Chinese (Cline 中文版), Cline Max, Cline Pro - CodeAI, Bao Cline — et seule la fiche cline.bot est la fiche officielle. Cline Desktop et la CLI utilisent les mêmes réglages de fournisseur décrits plus bas.

    Cline extension installing in the VS Code marketplace search for cline, with the official cline.bot listing above Cline Chinese, Cline Max and Bao Cline look-alikes
    La fiche officielle est celle publiée par cline.bot, pas les faux jumeaux empilés en dessous.Voir à 0:50
  2. 2

    Installer Ollama avec l'assistant d'installation

    Téléchargez Ollama pour votre système et lancez l'installeur. L'assistant Windows est un seul écran de confirmation ; macOS et Linux se comportent pareil. À la fin, Ollama reste actif en service d'arrière-plan qui répond à une API compatible OpenAI sur le port 11434 — c'est ce service, pas la fenêtre de l'app, que Cline contacte.

    Ollama version 0.11.0 setup wizard on Windows telling you to click Install to get up and running with your own large language models
    Un écran, un bouton Install — l'assistant laisse un service d'arrière-plan à l'écoute sur 11434.Voir à 1:00
  3. 3

    Choisir un modèle capable d'appeler des outils

    L'app Ollama propose un sélecteur Find model… ; en terminal, l'équivalent est ollama pull <model>. Pour Cline, restez dans les familles qui gèrent l'appel d'outils — gpt-oss:20b, qwen3-coder:30b-a3b ou devstral:24b. Chaque page de modèle de la bibliothèque Ollama affiche des badges de capacités au-dessus des tags ; si le badge tools manque, comme pour deepseek-coder-v2, les appels d'outils de Cline ne seront pas traités.

    Ollama desktop app Find model picker listing gpt-oss 120b, gpt-oss 20b, deepseek-r1 8b and gemma3 tags while the model chip already reads gpt-oss 20b
    Le sélecteur de modèles de l'app liste gpt-oss, deepseek-r1 et gemma3 — c'est le badge tools de la page bibliothèque qui compte.Voir à 2:40
  4. 4

    Télécharger le modèle et vérifier ce qui est sur le disque

    ollama run qwen3 récupère le manifeste, vérifie le digest et vous dépose dans un prompt. ollama list affiche ensuite chaque modèle installé avec sa taille, le moyen le plus rapide de repérer un téléchargement inachevé. Les tailles varient énormément au sein d'une même famille : le plus petit tag qwen3 fait bien moins d'un gigaoctet, tandis que le tag coder 30B pèse 19GB.

    Windows Command Prompt running ollama run qwen3 with pulling manifest and verifying sha256 digest at 100 percent before dropping into a live qwen3 4b prompt
    Manifeste, digest, puis un prompt en direct — Cline n'a besoin que des deux premiers pour que ça marche.Voir à 3:20

Charger un modèle dans LM Studio et ouvrir son serveur

  1. 5

    Télécharger le modèle dans LM Studio

    L'onglet Discover de LM Studio explore son propre catalogue. Les Staff Picks sont étiquetés pour ce qu'ils savent faire — Qwen3 Coder Next est décrit comme un MoE 80B à 3B de paramètres actifs conçu pour les agents de code, excellent en raisonnement longue portée et en usage complexe des outils, et les résultats de la communauté incluent des builds DeepSeek-Coder-V2. Lisez la taille du téléchargement avant de valider : le build Q4_K_M montré ici pèse 48,49GB.

    LM Studio Discover search for coder showing staff picks Qwen3 Coder Next and Qwen3 Coder 30B beside community DeepSeek-Coder-V2 GGUF builds and a 48.49 GB download button
    Tool Use est une capacité étiquetée ici, tout comme la taille du téléchargement — vérifiez les deux avant de lancer le transfert.Voir à 1:45
  2. 6

    Démarrer le serveur local de LM Studio

    Ouvrez l'onglet Developer → Local Server et activez le serveur ; Status: Running signifie que d'autres applications peuvent se connecter. LM Studio annonce un endpoint compatible OpenAI sur http://127.0.0.1:1234 et liste les endpoints pris en charge (LM Studio API, OpenAI-compatible, Anthropic-compatible) juste sous l'interrupteur. Le serveur reste éteint tant que vous ne l'allumez pas : c'est la cause la plus fréquente d'une erreur de connexion dans Cline.

    LM Studio 0.4.2 Developer tab Local Server page with the Status Running toggle switched on above an empty Loaded Models panel and the OpenAI-compatible supported endpoints
    Status: Running est le feu vert — l'endpoint est compatible OpenAI sur 127.0.0.1:1234.Voir à 2:10

Pointer Cline vers le serveur local

  1. 7

    Définir le fournisseur d'API dans les réglages de Cline

    Ouvrez Cline Settings → API Configuration et réglez API Provider sur LM Studio (ou Ollama). Laissez Use custom base URL décoché tant que vous restez sur les ports locaux par défaut, et ne le remplissez que si le serveur a changé de port ou de machine. Lisez la note de Cline dans ce panneau : elle indique que Cline utilise des prompts complexes, fonctionne mieux avec les modèles Claude, et que les modèles moins capables peuvent ne pas se comporter comme prévu.

    Cline Settings API Configuration panel with API Provider set to LM Studio, Use custom base URL unchecked, an empty Model field and Context Window at zero
    Le fournisseur d'abord ; la base URL reste intacte sauf si vous avez réellement déplacé le serveur.Voir à 3:00
  2. 8

    Sélectionner le modèle servi par le serveur

    La liste déroulante Model se remplit depuis le serveur en cours d'exécution : elle liste donc ce que le runtime tient réellement — dans cet enregistrement qwen/qwen3-4b, qwen2.5-coder-7b-instruct, qwen2.5-coder-3b-claude_opus_4.6-distilled, gemma-3-27b-it-abliterated, meta-llama-3-8b-instruct, yi-coder-1.5b et un modèle d'embedding. Si votre modèle est absent de cette liste, il n'est pas chargé dans LM Studio, ou pas téléchargé dans Ollama ; sélectionner un modèle 1.5B ou d'embedding ici, c'est exactement comme ça que les gens concluent que les modèles locaux ne marchent pas.

    Cline Settings Model dropdown open over API Configuration listing qwen/qwen3-4b, qwen2.5-coder-7b-instruct, gemma-3-27b-it-abliterated and yi-coder-1.5b served by LM Studio
    Tout ce que le serveur annonce apparaît ici — un modèle d'embedding dans la liste est à laisser tranquille.Voir à 3:03
  3. 9

    Lire la Context Window et activer Use compact prompt

    Cline hérite de la taille de contexte chargée par le runtime : cette image montre Context Window 4096, reprise telle quelle du réglage 4K de qwen/qwen3-4b, bien trop petit pour une boucle d'agent. Le quick start local-models de Cline se termine par l'activation de Use compact prompt, et sa page d'intégration Ollama fixe le plancher du code à 32K tokens. Ce bouton bascule vers un prompt système calibré pour des fenêtres d'environ 8K ou moins, au prix du support MCP et Focus Chain — montez donc d'abord la fenêtre, et gardez-le en secours.

    Cline Settings showing Context Window inherited as 4096 for qwen/qwen3-4b beside the unchecked Use compact prompt toggle and its Does not support MCP warning
    4096 est le signal d'alerte. Remontez cette valeur dans le runtime, puis gardez le compact prompt activé si vous restez coincé vers 8K.Voir à 3:15

Lancer, puis corriger ce qui casse

  1. 10

    Lancer une petite tâche avec Auto-approve

    Demandez quelque chose de petit et vérifiable — lister les fichiers de ce dossier, écrire un script, l'exécuter. Avec Auto-approve réglé sur YOLO, l'agent écrit le fichier, vous montre le diff et continue sans s'arrêter à chaque étape ; l'éditeur, le panneau Problems et le terminal restent visibles pour que vous voyiez ce qu'il a réellement exécuté. Laissez Auto-approve désactivé tant que vous ne faites pas confiance au modèle chargé.

    VS Code with Cline editing list_files.py in a red and green diff beside its own reasoning, a 5.0k token count and Auto-approve set to YOLO
    Une vraie tâche en modèle local : le fichier existe, Cline veut le modifier, et le mode YOLO s'occupe des validations.Voir à 4:45
  2. 11

    Corriger « modèle absent de la liste » en le rechargeant

    La liste déroulante de Cline, c'est la liste de modèles du serveur, et LM Studio n'annonce que les modèles actuellement chargés. C'est pourquoi la page Developer → Local Server peut afficher Loaded Models sans rien en dessous alors que Cline n'affiche aucun modèle. Chargez-en un à nouveau (Ctrl + L ouvre le sélecteur dans LM Studio), puis rouvrez la liste Model de Cline. Dans Ollama, l'équivalent est ollama list en terminal — Cline accepte aussi un tag de modèle saisi à la main.

    LM Studio Developer tab Local Server page with Status Running and an empty Loaded Models panel prompting Ctrl plus L to load a model that Cline can then select
    Loaded Models, c'est le menu de Cline : rien de chargé, rien à sélectionner.Voir à 4:54
  3. 12

    Corriger la boucle de raisonnement avec une longueur de contexte plus grande

    Quand la fenêtre est trop petite, le modèle redémarre son raisonnement à chaque tour et l'agent semble oublier la tâche. Éjectez le modèle dans LM Studio, puis rechargez-le avec Manually choose model load parameters activé et montez Context Length avant de cliquer sur Load Model — cette boîte de dialogue restait à 2048 tout en signalant que le modèle supporte jusqu'à 262144 tokens. Cline v4.1.21 a aussi ajouté un filet de sécurité : une longue réponse sur llama.cpp, Ollama ou LM Studio qui atteint la limite de tokens de sortie compacte désormais la conversation et retente une fois, au lieu de terminer la tâche.

    LM Studio 0.4.8 load model dialog for Qwen3.5 9B with Context Length at 2048, the note that the model supports up to 262144 tokens and the Load Model button
    Context Length est le levier, et la note « supports up to » vous dit jusqu'où le modèle peut monter.Voir à 5:06
  4. 13

    Valider avec une tâche qui exige une longue boucle

    La même configuration a ensuite construit un jeu Snake fonctionnel avec compteur de meilleur score : créé du premier coup, révisé une fois après que l'auteur a signalé que le jeu ne répondait pas, et jouable dans le navigateur. Tout a tourné en local, sans clé API ni abonnement. Si un renommage réussit mais qu'un build échoue, la limite vient du contexte ou de l'appel d'outils — pas de la configuration de Cline.

    Snake Game page running in the browser with Score 10 and High Score 210, the grid and a snake built end to end by Cline on a local LM Studio model
    L'état final : un jeu construit par l'agent et qui tourne en local, sans clé ni abonnement.Voir à 5:44

Longueur de contexte Cline + LM Studio : pourquoi l'agent oublie

Cline envoie un gros prompt système, plus votre tâche, chaque résultat d'outil et le raisonnement du modèle. Un runtime local charge le modèle avec la longueur de contexte qu'il choisit — la valeur par défaut de LM Studio pour un GGUF fraîchement téléchargé est petite, l'enregistrement montre 2048 dans la boîte de chargement et 4096 hérités dans le champ Context Window de Cline — et le serveur refuse tout ce qui dépasse. L'échec se traduit rarement par un message d'erreur : le modèle perd simplement le fil et répond à nouveau à sa propre première idée.

Le correctif se situe côté runtime. Éjectez le modèle, rechargez-le avec l'option de paramètres manuels et réglez Context Length aussi haut que votre mémoire le permet ; la page d'intégration Cline d'Ollama fixe le plancher du code à 32K tokens, et la page local-models de Cline renvoie au même réglage de fenêtre de contexte. Vérifiez ensuite ce que Cline affiche dans Context Window et gardez Use compact prompt activé quand vous ne pouvez pas augmenter la taille de chargement.

La version compte ici. Avant la v4.1.21, une longue réponse qui épuisait le contexte du serveur local terminait la tâche ; depuis la v4.1.21, Cline compacte la conversation et retente une fois, puis retombe sur sa nouvelle tentative concise et conserve la réponse partielle. Les notes de version sont explicites sur la cause — ces serveurs plafonnent la génération au contexte restant, quel que soit le budget de sortie configuré. Augmenter la longueur de contexte chargée reste le vrai correctif ; le compactage ne vous offre qu'une seconde tentative.

Cline + Ollama ne marche plus après une mise à jour : les trois vraies causes

Presque tous les signalements se ramènent à l'une de ces trois causes, et seule la première est un problème de Cline.

  1. 1Dérive du format d'appel d'outils. Cline 4.1.x a encore changé sa syntaxe d'outils, et l'issue ouverte cline#13008 documente la casse d'Ollama en local avec Qwen3.6 comme conséquence directe ; le travail de tolérance correspondant est arrivé côté Ollama pour les formats d'appel d'outils qwen3.6 et qwen3-coder. Mettez à jour l'extension et le runtime, puis retestez avec un modèle dont le template convient aux deux côtés — gpt-oss, qwen3-coder ou devstral.
  2. 2Connection refused. Rien n'écoute. Le serveur local de LM Studio est éteint tant que vous ne l'activez pas dans Developer → Local Server, et le service d'arrière-plan d'Ollama doit tourner sur 11434. Si vous avez changé le port, cochez Use custom base URL dans Cline et saisissez l'adresse complète ; si le runtime est sur une autre machine, activez Serve on Local Network dans LM Studio et ouvrez le port dans votre pare-feu.
  3. 3Modèle absent de la liste. Cline demande sa liste de modèles au serveur : LM Studio ne renvoie donc que les modèles chargés et Ollama que les modèles téléchargés. Chargez ou téléchargez le modèle, puis rouvrez la liste déroulante — la page Cline d'Ollama permet aussi de saisir un tag de modèle à la main, le moyen le plus rapide de contourner une liste obsolète.
  4. 4L'avertissement du runtime lui-même mérite d'être pris au sérieux. Le panneau LM Studio de Cline indique que Cline utilise des prompts complexes, fonctionne mieux avec les modèles Claude, et que les modèles moins capables peuvent ne pas se comporter comme prévu. Un codeur 1.5B est un modèle de complétion, pas un modèle d'agent — aucun réglage ne le transformera en agent.

Configuration requise (runtime et matériel) pour Cline en local

Cline lui-même est la même extension VS Code que vous utiliseriez avec un fournisseur hébergé ; le modèle tourne derrière un runtime que vous installez. La page local-models de Cline nomme trois runtimes pris en charge — Ollama, LM Studio et Atomic Chat — et résume toute la configuration en cinq lignes : installer un runtime, démarrer son serveur local, choisir le fournisseur correspondant dans Cline Settings, sélectionner un modèle local et activer Use Compact Prompt.

Endpoints et ports : Ollama répond à une API compatible OpenAI sur http://localhost:11434 et LM Studio sur http://127.0.0.1:1234, sous /v1. Les deux écoutent sur localhost par défaut, donc rien ne quitte votre machine sauf si vous exposez explicitement le serveur au réseau.

  • 116-32GB de RAM — modèles petits ou quantifiés dans la plage 7B-14B, fenêtres de contexte modestes, l'inférence CPU seule est possible mais lente.
  • 232-64GB de RAM — modèles de code intermédiaires comme qwen3-coder:30b-a3b (19GB) ou devstral:24b, avec de la marge pour une fenêtre de 32K ou plus.
  • 364GB+ de RAM ou un gros GPU — modèles plus gros et fenêtres de contexte plus grandes ensemble ; un modèle 30B sur une fenêtre 64K exige la mémoire et assez de VRAM pour le déporter.

L'enregistrement dit la même chose que la doc : vous pouvez faire tourner tout ça sur CPU, mais un GPU plus costaud donne des performances nettement meilleures, et la RAM système totale décide à la fois de la taille du modèle et de celle de la fenêtre de contexte que vous pouvez charger. Budgétez pour la fenêtre, pas seulement pour les poids.

FAQ sur les modèles locaux pour Cline

Poursuivre l'exploration