Cline v4.1.21 · Ollama + LM Studio

Bestes lokales Modell für Cline: Ollama- und LM-Studio-Einrichtung

Welche lokalen Modelle für agentisches Coding in Cline wirklich gut genug sind, wie Sie Cline mit Ollama oder LM Studio verbinden und die Fixes für Kontextlänge, „Connection refused“ und eine fehlende Modellliste — 13 Schritte, geprüft an den Aufnahmen und der offiziellen Doku.

Kurzfassung

  • Die Shortlist lokaler Modelle für Cline: qwen3-coder:30b (19GB, 256K Kontext, Tool Calling), devstral:24b und gpt-oss:20b. Alle drei tragen ein Tools-Badge auf der Modellseite ihrer Runtime; ein Code-Modell ohne Tool-Calling-Template redet über Ihren Code, statt ihn zu bearbeiten.
  • Zwei Runtimes decken alles ab: Ollama auf http://localhost:11434 und LM Studio auf http://127.0.0.1:1234. Stellen Sie in Cline Settings → API Configuration den passenden API Provider ein und lassen Sie Use custom base URL aus, außer Sie haben den Port verschoben.
  • Fast jeder Bericht „Cline lokales Modell funktioniert nicht“ ist eine von drei Sachen: Der Server läuft nicht (connection refused), das Modell ist nicht geladen (leeres Dropdown) oder das Kontextfenster ist zu klein (der Agent vergisst und startet sein Reasoning neu).
  • Ollamas Cline-Integrationsseite setzt die Untergrenze bei 32K Token Kontext fürs Coding, und Clines eigener Quick Start endet mit dem Aktivieren von Use Compact Prompt. Cline v4.1.21 hat einen Compaction-Retry für lokale Modelle ergänzt, denen der Platz ausgeht, weil llama.cpp, Ollama und LM Studio die Generierung auf den verbleibenden Kontext deckeln.

Welche lokalen Modelle sind für agentisches Coding in Cline wirklich gut genug?

Cline ist keine Chat-Box. Es schickt einen großen Tool-Calling-Systemprompt los und durchläuft dann Tool Calls, Datei-Diffs, Terminal-Ausgaben und Rückfragen. Ein Modell funktioniert hier nur, wenn sein Chat-Template Tool Calling über die API der Runtime anbietet und es eine ausreichend lange Gedankenkette halten kann. Das filtert das Feld schnell — prüfen Sie das Tools-Badge auf der Modellseite, bevor Sie 19GB herunterladen.

  • 1Für Agenten gebaut — qwen3-coder:30b hat 30B gesamt mit 3,3B aktiv pro Token, 19GB, ein 256K-Kontextfenster und Tool-Support; es ist der stärkste agentische Coder, den Sie auf einer 24-32GB-Maschine betreiben können. devstral:24b ist Mistrals Coding-Agent-Modell. gpt-oss:20b ist OpenAIs Open-Weight-Modell mit Tool Calling, Reasoning und einem 16GB-Sweetspot.
  • 2Nutzbar mit aktiviertem Compact Prompt — qwen3 in seinen 4B- bis 14B-Tags und gemma3:12b unterstützen Tool Calls und können kleine Aufgaben wie das Skript, das Umbenennen und das Spiel in dieser Anleitung abschließen. Sie verbrennen ihr Fenster schnell: Erhöhen Sie die Kontextlänge und lassen Sie Use compact prompt aktiviert.
  • 3Für Agentenarbeit überspringen — deepseek-coder-v2 ist ein wirklich starkes Code-Modell, hat auf Ollama aber kein Tools-Badge, sodass Clines Tool Calls es nie erreichen; dasselbe gilt für kleine Nicht-Tool-Modelle und für jeden „coder“-Tag, dessen Modellseite keinen Tool-Support zeigt. Benchmarks sagen nicht voraus, ob die Tool-Schleife sich schließt.
  • 4Wenn Sie agentische Qualität statt Offline-Privatsphäre wollen, überlegen Sie zweimal, ob Sie die lokale Hardware-Steuer zahlen: Clines kostenlose Modellstufe enthält bereits DeepSeek — DeepSeek V4 Flash ist dort mit einem 1M-Token-Kontextfenster gelistet — dieselbe Agent-Schleife läuft also ohne 19GB-Download oder 32GB-RAM-Upgrade. Behalten Sie lokale Inferenz für Privatsphäre, Air-Gapped-Arbeit und Lernen und sehen Sie die unten verlinkte Anleitung DeepSeek + Cline für den gehosteten Weg.
  • 5Faustregel von Clines local-models-Seite: 16-32GB betreibt kleine oder quantisierte Modelle, 32-64GB mittelgroße Coding-Modelle, 64GB+ kauft größere Modelle und größere Kontextfenster. In der Praxis ist es die Kontextlänge, nicht die Parameterzahl, die eine lokale Agent-Schleife zuerst sprengt.

How to Use Cline with LM Studio for 100% Local AI Vibe Coding

Kanal:Bootable USBs7:04

Öffnen

Install Qwen 3 Locally in Minutes with Ollama

Kanal:Bonverium Studio4:04

Öffnen

Local models — Cline documentation

Offizielle Dokumentation:docs.cline.bot

Öffnen

Cline with Ollama — Ollama integration guide

Offizielle Dokumentation:docs.ollama.com

Öffnen

Cline v4.1.21 release notes (local model compaction)

Offizielle Dokumentation:github.com/cline/cline

Öffnen

Die Stills stammen aus zwei Bildschirmaufnahmen: Der LM-Studio-+-Cline-Walkthrough liefert alle VS-Code-, Cline-Settings- und LM-Studio-Frames, eine separate Ollama-Aufnahme liefert die Installer-, Modellauswahl- und Terminal-Frames. Frames mit Creator-Overlays, Gesichtern oder eingebrannten Untertiteln wurden verworfen, und ein Kontextlängen-Frame wurde nach einem Fast-Seek auf die falsche Szene mit exaktem Zeitstempel neu extrahiert.

Produktnamen, Menübeschriftungen und Versionsnummern wurden gegen docs.cline.bot (Local models), docs.ollama.com/integrations/cline, die Modellseiten auf ollama.com und die Release Notes zu cline/cline v4.1.21 geprüft. Die Stills zitieren kurze Auszüge aus den Aufnahmen zur Kommentierung.

Cline in 13 Schritten auf lokale Modelle einrichten

Cline und die Ollama-Runtime installieren

  1. 1

    Die Cline-Erweiterung in VS Code installieren

    Öffnen Sie die Extensions-Ansicht (Ctrl+Shift+X) und suchen Sie nach Cline, dann installieren Sie die von cline.bot veröffentlichte Erweiterung. Die Marketplace-Liste ist voll von Nachahmern — Cline Chinese (Cline 中文版), Cline Max, Cline Pro - CodeAI, Bao Cline — und nur der cline.bot-Eintrag ist der offizielle. Cline Desktop und die CLI nutzen dieselben Provider-Einstellungen, die unten beschrieben sind.

    Cline extension installing in the VS Code marketplace search for cline, with the official cline.bot listing above Cline Chinese, Cline Max and Bao Cline look-alikes
    Der offizielle Eintrag ist der von cline.bot veröffentlichte, nicht die darunter gestapelten Nachahmer.Ansehen ab 0:50
  2. 2

    Ollama mit dem Setup-Assistenten installieren

    Laden Sie Ollama für Ihr Betriebssystem herunter und starten Sie den Installer. Der Windows-Assistent ist ein einziger Bestätigungsbildschirm; macOS und Linux verhalten sich gleich. Danach läuft Ollama als Hintergrunddienst weiter und beantwortet eine OpenAI-kompatible API auf Port 11434 — mit diesem Dienst, nicht mit dem App-Fenster, spricht Cline.

    Ollama version 0.11.0 setup wizard on Windows telling you to click Install to get up and running with your own large language models
    Ein Bildschirm, ein Install-Button — der Assistent hinterlässt einen Hintergrunddienst, der auf 11434 lauscht.Ansehen ab 1:00
  3. 3

    Ein Modell wählen, das Tools aufrufen kann

    Die Ollama-App hat eine Find model…-Auswahl; im Terminal ist dasselbe ollama pull <model>. Bleiben Sie für Cline in den Tool-Calling-Familien — gpt-oss:20b, qwen3-coder:30b-a3b oder devstral:24b. Jede Modellseite der Ollama-Bibliothek zeigt Fähigkeits-Badges über den Tags; fehlt das Tools-Badge, wie bei deepseek-coder-v2, werden Clines Tool Calls nicht verarbeitet.

    Ollama desktop app Find model picker listing gpt-oss 120b, gpt-oss 20b, deepseek-r1 8b and gemma3 tags while the model chip already reads gpt-oss 20b
    Die Modellauswahl der App listet gpt-oss, deepseek-r1 und gemma3 — entscheidend ist das Tools-Badge auf der Bibliotheksseite.Ansehen ab 2:40
  4. 4

    Herunterladen und prüfen, was auf der Platte liegt

    ollama run qwen3 lädt das Manifest, verifiziert den Digest und setzt Sie in einen Prompt. ollama list zeigt danach jedes installierte Modell mit seiner Größe — der schnellste Weg, einen nie beendeten Download zu erkennen. Die Größen schwanken innerhalb einer Familie stark: Der kleinste qwen3-Tag liegt deutlich unter einem Gigabyte, der 30B-Coder-Tag bei 19GB.

    Windows Command Prompt running ollama run qwen3 with pulling manifest and verifying sha256 digest at 100 percent before dropping into a live qwen3 4b prompt
    Manifest, Digest, dann ein Live-Prompt — Cline braucht nur, dass die ersten beiden geklappt haben.Ansehen ab 3:20

Ein Modell in LM Studio laden und seinen Server öffnen

  1. 5

    Das Modell in LM Studio herunterladen

    LM Studios Discover-Tab durchsucht den eigenen Katalog. Staff Picks sind danach beschriftet, worin sie gut sind — Qwen3 Coder Next wird als 80B-MoE mit 3B aktiven Parametern für Coding-Agenten beschrieben, stark im Long-Horizon-Reasoning und bei komplexer Tool-Nutzung, und die Community-Ergebnisse enthalten DeepSeek-Coder-V2-Builds. Lesen Sie die Downloadgröße, bevor Sie sich festlegen: Der hier gezeigte Q4_K_M-Build ist 48,49GB groß.

    LM Studio Discover search for coder showing staff picks Qwen3 Coder Next and Qwen3 Coder 30B beside community DeepSeek-Coder-V2 GGUF builds and a 48.49 GB download button
    Tool Use ist hier eine ausgewiesene Fähigkeit — und die Downloadgröße auch. Prüfen Sie beides, bevor der Transfer startet.Ansehen ab 1:45
  2. 6

    LM Studios lokalen Server starten

    Öffnen Sie den Developer-Tab → Local Server und schalten Sie den Server ein; Status: Running heißt, dass andere Anwendungen sich verbinden können. LM Studio bewirbt einen OpenAI-kompatiblen Endpoint auf http://127.0.0.1:1234 und listet die unterstützten Endpoints (LM Studio API, OpenAI-compatible, Anthropic-compatible) direkt unter dem Schalter. Der Server ist aus, bis Sie ihn einschalten — die häufigste Ursache für einen Verbindungsfehler in Cline.

    LM Studio 0.4.2 Developer tab Local Server page with the Status Running toggle switched on above an empty Loaded Models panel and the OpenAI-compatible supported endpoints
    Status: Running ist das grüne Licht — der Endpoint ist OpenAI-kompatibel auf 127.0.0.1:1234.Ansehen ab 2:10

Cline auf den lokalen Server zeigen lassen

  1. 7

    Den API Provider in Cline Settings einstellen

    Öffnen Sie Cline Settings → API Configuration und stellen Sie API Provider auf LM Studio (oder Ollama). Lassen Sie Use custom base URL deaktiviert, solange Sie auf den Standard-Ports lokal arbeiten, und füllen Sie es nur aus, wenn der Server auf einen anderen Port oder eine andere Maschine umgezogen ist. Lesen Sie Clines eigenen Hinweis in diesem Panel: Cline nutzt komplexe Prompts, funktioniert am besten mit Claude-Modellen, und weniger fähige Modelle funktionieren möglicherweise nicht wie erwartet.

    Cline Settings API Configuration panel with API Provider set to LM Studio, Use custom base URL unchecked, an empty Model field and Context Window at zero
    Erst der Provider; die Base-URL bleibt unangetastet, außer Sie haben den Server wirklich verschoben.Ansehen ab 3:00
  2. 8

    Das Modell auswählen, das der Server ausliefert

    Das Model-Dropdown wird vom laufenden Server gefüllt und listet daher, was die Runtime tatsächlich hält — in dieser Aufnahme qwen/qwen3-4b, qwen2.5-coder-7b-instruct, qwen2.5-coder-3b-claude_opus_4.6-distilled, gemma-3-27b-it-abliterated, meta-llama-3-8b-instruct, yi-coder-1.5b und ein Embedding-Modell. Fehlt Ihr Modell in dieser Liste, ist es nicht in LM Studio geladen oder nicht in Ollama gepullt; hier ein 1.5B- oder Embedding-Modell auszuwählen, ist genau der Weg, auf dem Leute schließen, lokale Modelle funktionierten nicht.

    Cline Settings Model dropdown open over API Configuration listing qwen/qwen3-4b, qwen2.5-coder-7b-instruct, gemma-3-27b-it-abliterated and yi-coder-1.5b served by LM Studio
    Alles, was der Server meldet, taucht hier auf — ein Embedding-Modell in der Liste lässt man besser in Ruhe.Ansehen ab 3:03
  3. 9

    Das Kontextfenster lesen und Use compact prompt aktivieren

    Cline übernimmt die Kontextgröße, mit der die Runtime geladen hat: Dieser Frame zeigt Context Window 4096, direkt aus der 4K-Ladeeinstellung von qwen/qwen3-4b übernommen, was für eine Agent-Schleife viel zu klein ist. Clines local-models-Quick-Start endet mit dem Aktivieren von Use compact prompt, und seine Ollama-Integrationsseite setzt die Untergrenze fürs Coding bei 32K Token. Dieser Schalter tauscht einen Systemprompt ein, der für Fenster um 8K oder weniger passt, und kostet MCP- und Focus-Chain-Support — erhöhen Sie also zuerst das Fenster und nutzen Sie ihn als Fallback.

    Cline Settings showing Context Window inherited as 4096 for qwen/qwen3-4b beside the unchecked Use compact prompt toggle and its Does not support MCP warning
    4096 ist das Warnsignal. Erhöhen Sie den Wert in der Runtime und lassen Sie den Compact Prompt an, wenn Sie bei etwa 8K festhängen.Ansehen ab 3:15

Ausführen und dann reparieren, was bricht

  1. 10

    Eine kleine Aufgabe mit Auto-approve ausführen

    Verlangen Sie etwas Kleines und Überprüfbares — die Dateien in diesem Ordner auflisten, ein Skript schreiben, es ausführen. Mit Auto-approve auf YOLO schreibt der Agent die Datei, zeigt den Diff und macht weiter, ohne bei jedem Schritt anzuhalten; Editor, Problems-Panel und Terminal bleiben sichtbar, sodass Sie sehen, was er tatsächlich ausgeführt hat. Lassen Sie Auto-approve aus, bis Sie dem geladenen Modell vertrauen.

    VS Code with Cline editing list_files.py in a red and green diff beside its own reasoning, a 5.0k token count and Auto-approve set to YOLO
    Eine echte Aufgabe mit lokalem Modell: Die Datei existiert, Cline will sie bearbeiten, und der YOLO-Modus übernimmt die Freigaben.Ansehen ab 4:45
  2. 11

    „Modell nicht gelistet“ beheben, indem Sie es erneut laden

    Clines Dropdown ist die Modellliste des Servers, und LM Studio meldet nur aktuell geladene Modelle. Deshalb kann die Seite Developer → Local Server Loaded Models ohne Inhalt anzeigen, während Cline gar keine Modelle zeigt. Laden Sie eines erneut (Ctrl + L öffnet die Auswahl in LM Studio) und öffnen Sie dann Clines Model-Dropdown neu. In Ollama ist die entsprechende Prüfung ollama list im Terminal — Cline akzeptiert auch einen von Hand getippten Modell-Tag.

    LM Studio Developer tab Local Server page with Status Running and an empty Loaded Models panel prompting Ctrl plus L to load a model that Cline can then select
    Loaded Models ist Clines Menü: nichts geladen, nichts auszuwählen.Ansehen ab 4:54
  3. 12

    Die Reasoning-Schleife mit einer größeren Kontextlänge beheben

    Ist das Fenster zu klein, startet das Modell sein Reasoning in jedem Turn neu und der Agent scheint die Aufgabe zu vergessen. Werfen Sie das Modell in LM Studio raus und laden Sie es erneut mit aktiviertem Manually choose model load parameters, und erhöhen Sie Context Length, bevor Sie auf Load Model drücken — dieser Dialog stand auf 2048 und vermerkte zugleich, dass das Modell bis zu 262144 Token unterstützt. Cline v4.1.21 hat außerdem ein Sicherheitsnetz ergänzt: Eine lange Antwort auf llama.cpp, Ollama oder LM Studio, die das Output-Token-Limit erreicht, kompaktiert jetzt die Konversation und versucht es einmal erneut, statt die Aufgabe zu beenden.

    LM Studio 0.4.8 load model dialog for Qwen3.5 9B with Context Length at 2048, the note that the model supports up to 262144 tokens and the Load Model button
    Context Length ist der Hebel, und der Hinweis „supports up to“ sagt Ihnen, wie viel Spielraum das Modell hat.Ansehen ab 5:06
  4. 13

    Mit einer Aufgabe bestätigen, die eine lange Schleife braucht

    Dasselbe Setup baute anschließend ein funktionierendes Snake-Spiel mit Highscore-Zähler: im ersten Durchlauf erstellt, einmal überarbeitet, nachdem der Autor meldete, das Spiel reagiere nicht, und im Browser spielbar. Alles lief lokal, ohne API-Key und ohne Abo. Wenn ein Rename klappt, ein Build aber scheitert, liegt die Grenze beim Kontext oder beim Tool Calling — nicht an Clines Konfiguration.

    Snake Game page running in the browser with Score 10 and High Score 210, the grid and a snake built end to end by Cline on a local LM Studio model
    Der Endzustand: ein vom Agenten gebautes Spiel, das lokal läuft — ohne Key und ohne Abo.Ansehen ab 5:44

Cline + LM Studio Kontextlänge: Warum der Agent vergisst

Cline schickt einen großen Systemprompt plus Ihre Aufgabe, jedes Tool-Ergebnis und das Reasoning des Modells. Eine lokale Runtime lädt das Modell mit einer selbst gewählten Kontextlänge — LM Studios Standard für ein frisch heruntergeladenes GGUF ist klein, die Aufnahme zeigt 2048 im Ladedialog und 4096, die in Clines Feld Context Window übernommen wurden — und der Server lehnt alles darüber ab. Der Fehler ist selten eine Fehlermeldung: Das Modell verliert einfach den Faden und antwortet erneut auf seinen eigenen ersten Gedanken.

Der Fix liegt auf der Runtime-Seite. Werfen Sie das Modell raus, laden Sie es mit der manuellen Parameteroption neu und setzen Sie Context Length so hoch, wie es Ihr Speicher erlaubt; Ollamas Cline-Integrationsseite setzt die Untergrenze fürs Coding bei 32K Token, und Clines local-models-Seite verweist auf dieselbe Kontextfenster-Einstellung. Prüfen Sie dann, was Cline in Context Window anzeigt, und lassen Sie Use compact prompt an, wenn Sie die Ladegröße nicht erhöhen können.

Die Version ist hier wichtig. Vor v4.1.21 beendete eine lange Antwort, die den Kontext des lokalen Servers erschöpfte, die Aufgabe; seit v4.1.21 kompaktiert Cline die Konversation und versucht es einmal erneut, fällt dann auf seinen Concise-Retry zurück und behält die Teilantwort. Die Release Notes sind explizit zur Ursache — diese Server deckeln die Generierung auf den verbleibenden Kontext, unabhängig vom konfigurierten Output-Budget. Die geladene Kontextlänge zu erhöhen bleibt der eigentliche Fix; Compaction verschafft Ihnen nur einen zweiten Versuch.

Cline + Ollama funktioniert nach einem Update nicht mehr: die drei echten Ursachen

Fast jeder Bericht läuft auf eine dieser drei Ursachen hinaus, und nur die erste ist Clines Problem.

  1. 1Drift beim Tool-Call-Format. Cline 4.1.x hat seine Tool-Syntax erneut geändert, und das offene Issue cline#13008 dokumentiert lokales Ollama mit Qwen3.6 als direkte Folge; die passende Toleranzarbeit landete auf der Ollama-Seite für die Tool-Call-Formate von qwen3.6 und qwen3-coder. Aktualisieren Sie Erweiterung und Runtime und testen Sie dann mit einem Modell neu, dessen Template beide Seiten akzeptieren — gpt-oss, qwen3-coder oder devstral.
  2. 2Connection refused. Es lauscht nichts. LM Studios lokaler Server ist aus, bis Sie ihn in Developer → Local Server einschalten, und Ollamas Hintergrunddienst muss auf 11434 laufen. Haben Sie den Port verschoben, aktivieren Sie Use custom base URL in Cline und geben Sie die vollständige Adresse ein; läuft die Runtime auf einer anderen Maschine, schalten Sie LM Studios Serve on Local Network ein und öffnen Sie den Port in Ihrer Firewall.
  3. 3Modell nicht gelistet. Cline fragt den Server nach seiner Modellliste, daher liefert LM Studio nur geladene und Ollama nur gepullte Modelle. Laden oder pullen Sie das Modell und öffnen Sie das Dropdown neu — Ollamas Cline-Seite erlaubt auch das Eintippen eines Modell-Tags von Hand, der schnellste Weg an einer veralteten Liste vorbei.
  4. 4Die Warnung der Runtime selbst sollten Sie ernst nehmen. Clines LM-Studio-Panel stellt fest, dass Cline komplexe Prompts nutzt, am besten mit Claude-Modellen funktioniert und weniger fähige Modelle möglicherweise nicht wie erwartet arbeiten. Ein 1.5B-Coder ist ein Completion-Modell, kein Agent-Modell — keine Einstellung macht eines daraus.

Runtime- und Hardware-Anforderungen für lokales Cline

Cline selbst ist dieselbe VS-Code-Erweiterung, die Sie mit einem gehosteten Provider nutzen würden; das Modell läuft hinter einer Runtime, die Sie installieren. Clines local-models-Seite nennt drei unterstützte Runtimes — Ollama, LM Studio und Atomic Chat — und reduziert das ganze Setup auf fünf Zeilen: Runtime installieren, ihren lokalen Server starten, den passenden Provider in Cline Settings wählen, ein lokales Modell auswählen und Use Compact Prompt aktivieren.

Endpoints und Ports: Ollama beantwortet eine OpenAI-kompatible API auf http://localhost:11434, LM Studio auf http://127.0.0.1:1234 unter /v1. Beide binden standardmäßig an localhost, es verlässt also nichts Ihre Maschine, außer Sie geben den Server explizit im Netzwerk frei.

  • 116-32GB RAM — kleine oder quantisierte Modelle im Bereich 7B-14B, bescheidene Kontextfenster, CPU-only-Inferenz ist möglich, aber langsam.
  • 232-64GB RAM — mittelgroße Coding-Modelle wie qwen3-coder:30b-a3b (19GB) oder devstral:24b, mit Platz für ein 32K- oder größeres Fenster.
  • 364GB+ RAM oder eine große GPU — größere Modelle und größere Kontextfenster zusammen; ein 30B-Modell mit 64K-Fenster braucht den Speicher und genug VRAM zum Auslagern.

Die Aufnahme sagt dasselbe wie die Doku: Sie können das auf einer CPU laufen lassen, aber eine stärkere GPU bringt spürbar bessere Leistung, und der gesamte System-RAM entscheidet, wie groß ein Modell und wie groß ein Kontextfenster sein kann. Planen Sie das Fenster ein, nicht nur die Gewichte.

FAQ zu lokalen Modellen in Cline

Weiter entdecken