Bestes lokales Modell für Cline: Ollama- und LM-Studio-Einrichtung
Welche lokalen Modelle für agentisches Coding in Cline wirklich gut genug sind, wie Sie Cline mit Ollama oder LM Studio verbinden und die Fixes für Kontextlänge, „Connection refused“ und eine fehlende Modellliste — 13 Schritte, geprüft an den Aufnahmen und der offiziellen Doku.
Kurzfassung
- Die Shortlist lokaler Modelle für Cline: qwen3-coder:30b (19GB, 256K Kontext, Tool Calling), devstral:24b und gpt-oss:20b. Alle drei tragen ein Tools-Badge auf der Modellseite ihrer Runtime; ein Code-Modell ohne Tool-Calling-Template redet über Ihren Code, statt ihn zu bearbeiten.
- Zwei Runtimes decken alles ab: Ollama auf http://localhost:11434 und LM Studio auf http://127.0.0.1:1234. Stellen Sie in Cline Settings → API Configuration den passenden API Provider ein und lassen Sie Use custom base URL aus, außer Sie haben den Port verschoben.
- Fast jeder Bericht „Cline lokales Modell funktioniert nicht“ ist eine von drei Sachen: Der Server läuft nicht (connection refused), das Modell ist nicht geladen (leeres Dropdown) oder das Kontextfenster ist zu klein (der Agent vergisst und startet sein Reasoning neu).
- Ollamas Cline-Integrationsseite setzt die Untergrenze bei 32K Token Kontext fürs Coding, und Clines eigener Quick Start endet mit dem Aktivieren von Use Compact Prompt. Cline v4.1.21 hat einen Compaction-Retry für lokale Modelle ergänzt, denen der Platz ausgeht, weil llama.cpp, Ollama und LM Studio die Generierung auf den verbleibenden Kontext deckeln.
Welche lokalen Modelle sind für agentisches Coding in Cline wirklich gut genug?
Cline ist keine Chat-Box. Es schickt einen großen Tool-Calling-Systemprompt los und durchläuft dann Tool Calls, Datei-Diffs, Terminal-Ausgaben und Rückfragen. Ein Modell funktioniert hier nur, wenn sein Chat-Template Tool Calling über die API der Runtime anbietet und es eine ausreichend lange Gedankenkette halten kann. Das filtert das Feld schnell — prüfen Sie das Tools-Badge auf der Modellseite, bevor Sie 19GB herunterladen.
- 1Für Agenten gebaut — qwen3-coder:30b hat 30B gesamt mit 3,3B aktiv pro Token, 19GB, ein 256K-Kontextfenster und Tool-Support; es ist der stärkste agentische Coder, den Sie auf einer 24-32GB-Maschine betreiben können. devstral:24b ist Mistrals Coding-Agent-Modell. gpt-oss:20b ist OpenAIs Open-Weight-Modell mit Tool Calling, Reasoning und einem 16GB-Sweetspot.
- 2Nutzbar mit aktiviertem Compact Prompt — qwen3 in seinen 4B- bis 14B-Tags und gemma3:12b unterstützen Tool Calls und können kleine Aufgaben wie das Skript, das Umbenennen und das Spiel in dieser Anleitung abschließen. Sie verbrennen ihr Fenster schnell: Erhöhen Sie die Kontextlänge und lassen Sie Use compact prompt aktiviert.
- 3Für Agentenarbeit überspringen — deepseek-coder-v2 ist ein wirklich starkes Code-Modell, hat auf Ollama aber kein Tools-Badge, sodass Clines Tool Calls es nie erreichen; dasselbe gilt für kleine Nicht-Tool-Modelle und für jeden „coder“-Tag, dessen Modellseite keinen Tool-Support zeigt. Benchmarks sagen nicht voraus, ob die Tool-Schleife sich schließt.
- 4Wenn Sie agentische Qualität statt Offline-Privatsphäre wollen, überlegen Sie zweimal, ob Sie die lokale Hardware-Steuer zahlen: Clines kostenlose Modellstufe enthält bereits DeepSeek — DeepSeek V4 Flash ist dort mit einem 1M-Token-Kontextfenster gelistet — dieselbe Agent-Schleife läuft also ohne 19GB-Download oder 32GB-RAM-Upgrade. Behalten Sie lokale Inferenz für Privatsphäre, Air-Gapped-Arbeit und Lernen und sehen Sie die unten verlinkte Anleitung DeepSeek + Cline für den gehosteten Weg.
- 5Faustregel von Clines local-models-Seite: 16-32GB betreibt kleine oder quantisierte Modelle, 32-64GB mittelgroße Coding-Modelle, 64GB+ kauft größere Modelle und größere Kontextfenster. In der Praxis ist es die Kontextlänge, nicht die Parameterzahl, die eine lokale Agent-Schleife zuerst sprengt.
How to Use Cline with LM Studio for 100% Local AI Vibe Coding
Kanal:Bootable USBs7:04
Install Qwen 3 Locally in Minutes with Ollama
Kanal:Bonverium Studio4:04
Local models — Cline documentation
Offizielle Dokumentation:docs.cline.bot
Cline with Ollama — Ollama integration guide
Offizielle Dokumentation:docs.ollama.com
Cline v4.1.21 release notes (local model compaction)
Offizielle Dokumentation:github.com/cline/cline
Die Stills stammen aus zwei Bildschirmaufnahmen: Der LM-Studio-+-Cline-Walkthrough liefert alle VS-Code-, Cline-Settings- und LM-Studio-Frames, eine separate Ollama-Aufnahme liefert die Installer-, Modellauswahl- und Terminal-Frames. Frames mit Creator-Overlays, Gesichtern oder eingebrannten Untertiteln wurden verworfen, und ein Kontextlängen-Frame wurde nach einem Fast-Seek auf die falsche Szene mit exaktem Zeitstempel neu extrahiert.
Produktnamen, Menübeschriftungen und Versionsnummern wurden gegen docs.cline.bot (Local models), docs.ollama.com/integrations/cline, die Modellseiten auf ollama.com und die Release Notes zu cline/cline v4.1.21 geprüft. Die Stills zitieren kurze Auszüge aus den Aufnahmen zur Kommentierung.
Cline in 13 Schritten auf lokale Modelle einrichten
Cline und die Ollama-Runtime installieren
- 1
Die Cline-Erweiterung in VS Code installieren
Öffnen Sie die Extensions-Ansicht (Ctrl+Shift+X) und suchen Sie nach Cline, dann installieren Sie die von cline.bot veröffentlichte Erweiterung. Die Marketplace-Liste ist voll von Nachahmern — Cline Chinese (Cline 中文版), Cline Max, Cline Pro - CodeAI, Bao Cline — und nur der cline.bot-Eintrag ist der offizielle. Cline Desktop und die CLI nutzen dieselben Provider-Einstellungen, die unten beschrieben sind.

Der offizielle Eintrag ist der von cline.bot veröffentlichte, nicht die darunter gestapelten Nachahmer.Ansehen ab 0:50 - 2
Ollama mit dem Setup-Assistenten installieren
Laden Sie Ollama für Ihr Betriebssystem herunter und starten Sie den Installer. Der Windows-Assistent ist ein einziger Bestätigungsbildschirm; macOS und Linux verhalten sich gleich. Danach läuft Ollama als Hintergrunddienst weiter und beantwortet eine OpenAI-kompatible API auf Port 11434 — mit diesem Dienst, nicht mit dem App-Fenster, spricht Cline.

Ein Bildschirm, ein Install-Button — der Assistent hinterlässt einen Hintergrunddienst, der auf 11434 lauscht.Ansehen ab 1:00 - 3
Ein Modell wählen, das Tools aufrufen kann
Die Ollama-App hat eine Find model…-Auswahl; im Terminal ist dasselbe ollama pull <model>. Bleiben Sie für Cline in den Tool-Calling-Familien — gpt-oss:20b, qwen3-coder:30b-a3b oder devstral:24b. Jede Modellseite der Ollama-Bibliothek zeigt Fähigkeits-Badges über den Tags; fehlt das Tools-Badge, wie bei deepseek-coder-v2, werden Clines Tool Calls nicht verarbeitet.

Die Modellauswahl der App listet gpt-oss, deepseek-r1 und gemma3 — entscheidend ist das Tools-Badge auf der Bibliotheksseite.Ansehen ab 2:40 - 4
Herunterladen und prüfen, was auf der Platte liegt
ollama run qwen3 lädt das Manifest, verifiziert den Digest und setzt Sie in einen Prompt. ollama list zeigt danach jedes installierte Modell mit seiner Größe — der schnellste Weg, einen nie beendeten Download zu erkennen. Die Größen schwanken innerhalb einer Familie stark: Der kleinste qwen3-Tag liegt deutlich unter einem Gigabyte, der 30B-Coder-Tag bei 19GB.

Manifest, Digest, dann ein Live-Prompt — Cline braucht nur, dass die ersten beiden geklappt haben.Ansehen ab 3:20
Ein Modell in LM Studio laden und seinen Server öffnen
- 5
Das Modell in LM Studio herunterladen
LM Studios Discover-Tab durchsucht den eigenen Katalog. Staff Picks sind danach beschriftet, worin sie gut sind — Qwen3 Coder Next wird als 80B-MoE mit 3B aktiven Parametern für Coding-Agenten beschrieben, stark im Long-Horizon-Reasoning und bei komplexer Tool-Nutzung, und die Community-Ergebnisse enthalten DeepSeek-Coder-V2-Builds. Lesen Sie die Downloadgröße, bevor Sie sich festlegen: Der hier gezeigte Q4_K_M-Build ist 48,49GB groß.

Tool Use ist hier eine ausgewiesene Fähigkeit — und die Downloadgröße auch. Prüfen Sie beides, bevor der Transfer startet.Ansehen ab 1:45 - 6
LM Studios lokalen Server starten
Öffnen Sie den Developer-Tab → Local Server und schalten Sie den Server ein; Status: Running heißt, dass andere Anwendungen sich verbinden können. LM Studio bewirbt einen OpenAI-kompatiblen Endpoint auf http://127.0.0.1:1234 und listet die unterstützten Endpoints (LM Studio API, OpenAI-compatible, Anthropic-compatible) direkt unter dem Schalter. Der Server ist aus, bis Sie ihn einschalten — die häufigste Ursache für einen Verbindungsfehler in Cline.

Status: Running ist das grüne Licht — der Endpoint ist OpenAI-kompatibel auf 127.0.0.1:1234.Ansehen ab 2:10
Cline auf den lokalen Server zeigen lassen
- 7
Den API Provider in Cline Settings einstellen
Öffnen Sie Cline Settings → API Configuration und stellen Sie API Provider auf LM Studio (oder Ollama). Lassen Sie Use custom base URL deaktiviert, solange Sie auf den Standard-Ports lokal arbeiten, und füllen Sie es nur aus, wenn der Server auf einen anderen Port oder eine andere Maschine umgezogen ist. Lesen Sie Clines eigenen Hinweis in diesem Panel: Cline nutzt komplexe Prompts, funktioniert am besten mit Claude-Modellen, und weniger fähige Modelle funktionieren möglicherweise nicht wie erwartet.

Erst der Provider; die Base-URL bleibt unangetastet, außer Sie haben den Server wirklich verschoben.Ansehen ab 3:00 - 8
Das Modell auswählen, das der Server ausliefert
Das Model-Dropdown wird vom laufenden Server gefüllt und listet daher, was die Runtime tatsächlich hält — in dieser Aufnahme qwen/qwen3-4b, qwen2.5-coder-7b-instruct, qwen2.5-coder-3b-claude_opus_4.6-distilled, gemma-3-27b-it-abliterated, meta-llama-3-8b-instruct, yi-coder-1.5b und ein Embedding-Modell. Fehlt Ihr Modell in dieser Liste, ist es nicht in LM Studio geladen oder nicht in Ollama gepullt; hier ein 1.5B- oder Embedding-Modell auszuwählen, ist genau der Weg, auf dem Leute schließen, lokale Modelle funktionierten nicht.

Alles, was der Server meldet, taucht hier auf — ein Embedding-Modell in der Liste lässt man besser in Ruhe.Ansehen ab 3:03 - 9
Das Kontextfenster lesen und Use compact prompt aktivieren
Cline übernimmt die Kontextgröße, mit der die Runtime geladen hat: Dieser Frame zeigt Context Window 4096, direkt aus der 4K-Ladeeinstellung von qwen/qwen3-4b übernommen, was für eine Agent-Schleife viel zu klein ist. Clines local-models-Quick-Start endet mit dem Aktivieren von Use compact prompt, und seine Ollama-Integrationsseite setzt die Untergrenze fürs Coding bei 32K Token. Dieser Schalter tauscht einen Systemprompt ein, der für Fenster um 8K oder weniger passt, und kostet MCP- und Focus-Chain-Support — erhöhen Sie also zuerst das Fenster und nutzen Sie ihn als Fallback.

4096 ist das Warnsignal. Erhöhen Sie den Wert in der Runtime und lassen Sie den Compact Prompt an, wenn Sie bei etwa 8K festhängen.Ansehen ab 3:15
Ausführen und dann reparieren, was bricht
- 10
Eine kleine Aufgabe mit Auto-approve ausführen
Verlangen Sie etwas Kleines und Überprüfbares — die Dateien in diesem Ordner auflisten, ein Skript schreiben, es ausführen. Mit Auto-approve auf YOLO schreibt der Agent die Datei, zeigt den Diff und macht weiter, ohne bei jedem Schritt anzuhalten; Editor, Problems-Panel und Terminal bleiben sichtbar, sodass Sie sehen, was er tatsächlich ausgeführt hat. Lassen Sie Auto-approve aus, bis Sie dem geladenen Modell vertrauen.

Eine echte Aufgabe mit lokalem Modell: Die Datei existiert, Cline will sie bearbeiten, und der YOLO-Modus übernimmt die Freigaben.Ansehen ab 4:45 - 11
„Modell nicht gelistet“ beheben, indem Sie es erneut laden
Clines Dropdown ist die Modellliste des Servers, und LM Studio meldet nur aktuell geladene Modelle. Deshalb kann die Seite Developer → Local Server Loaded Models ohne Inhalt anzeigen, während Cline gar keine Modelle zeigt. Laden Sie eines erneut (Ctrl + L öffnet die Auswahl in LM Studio) und öffnen Sie dann Clines Model-Dropdown neu. In Ollama ist die entsprechende Prüfung ollama list im Terminal — Cline akzeptiert auch einen von Hand getippten Modell-Tag.

Loaded Models ist Clines Menü: nichts geladen, nichts auszuwählen.Ansehen ab 4:54 - 12
Die Reasoning-Schleife mit einer größeren Kontextlänge beheben
Ist das Fenster zu klein, startet das Modell sein Reasoning in jedem Turn neu und der Agent scheint die Aufgabe zu vergessen. Werfen Sie das Modell in LM Studio raus und laden Sie es erneut mit aktiviertem Manually choose model load parameters, und erhöhen Sie Context Length, bevor Sie auf Load Model drücken — dieser Dialog stand auf 2048 und vermerkte zugleich, dass das Modell bis zu 262144 Token unterstützt. Cline v4.1.21 hat außerdem ein Sicherheitsnetz ergänzt: Eine lange Antwort auf llama.cpp, Ollama oder LM Studio, die das Output-Token-Limit erreicht, kompaktiert jetzt die Konversation und versucht es einmal erneut, statt die Aufgabe zu beenden.

Context Length ist der Hebel, und der Hinweis „supports up to“ sagt Ihnen, wie viel Spielraum das Modell hat.Ansehen ab 5:06 - 13
Mit einer Aufgabe bestätigen, die eine lange Schleife braucht
Dasselbe Setup baute anschließend ein funktionierendes Snake-Spiel mit Highscore-Zähler: im ersten Durchlauf erstellt, einmal überarbeitet, nachdem der Autor meldete, das Spiel reagiere nicht, und im Browser spielbar. Alles lief lokal, ohne API-Key und ohne Abo. Wenn ein Rename klappt, ein Build aber scheitert, liegt die Grenze beim Kontext oder beim Tool Calling — nicht an Clines Konfiguration.

Der Endzustand: ein vom Agenten gebautes Spiel, das lokal läuft — ohne Key und ohne Abo.Ansehen ab 5:44
Cline + LM Studio Kontextlänge: Warum der Agent vergisst
Cline schickt einen großen Systemprompt plus Ihre Aufgabe, jedes Tool-Ergebnis und das Reasoning des Modells. Eine lokale Runtime lädt das Modell mit einer selbst gewählten Kontextlänge — LM Studios Standard für ein frisch heruntergeladenes GGUF ist klein, die Aufnahme zeigt 2048 im Ladedialog und 4096, die in Clines Feld Context Window übernommen wurden — und der Server lehnt alles darüber ab. Der Fehler ist selten eine Fehlermeldung: Das Modell verliert einfach den Faden und antwortet erneut auf seinen eigenen ersten Gedanken.
Der Fix liegt auf der Runtime-Seite. Werfen Sie das Modell raus, laden Sie es mit der manuellen Parameteroption neu und setzen Sie Context Length so hoch, wie es Ihr Speicher erlaubt; Ollamas Cline-Integrationsseite setzt die Untergrenze fürs Coding bei 32K Token, und Clines local-models-Seite verweist auf dieselbe Kontextfenster-Einstellung. Prüfen Sie dann, was Cline in Context Window anzeigt, und lassen Sie Use compact prompt an, wenn Sie die Ladegröße nicht erhöhen können.
Die Version ist hier wichtig. Vor v4.1.21 beendete eine lange Antwort, die den Kontext des lokalen Servers erschöpfte, die Aufgabe; seit v4.1.21 kompaktiert Cline die Konversation und versucht es einmal erneut, fällt dann auf seinen Concise-Retry zurück und behält die Teilantwort. Die Release Notes sind explizit zur Ursache — diese Server deckeln die Generierung auf den verbleibenden Kontext, unabhängig vom konfigurierten Output-Budget. Die geladene Kontextlänge zu erhöhen bleibt der eigentliche Fix; Compaction verschafft Ihnen nur einen zweiten Versuch.
Cline + Ollama funktioniert nach einem Update nicht mehr: die drei echten Ursachen
Fast jeder Bericht läuft auf eine dieser drei Ursachen hinaus, und nur die erste ist Clines Problem.
- 1Drift beim Tool-Call-Format. Cline 4.1.x hat seine Tool-Syntax erneut geändert, und das offene Issue cline#13008 dokumentiert lokales Ollama mit Qwen3.6 als direkte Folge; die passende Toleranzarbeit landete auf der Ollama-Seite für die Tool-Call-Formate von qwen3.6 und qwen3-coder. Aktualisieren Sie Erweiterung und Runtime und testen Sie dann mit einem Modell neu, dessen Template beide Seiten akzeptieren — gpt-oss, qwen3-coder oder devstral.
- 2Connection refused. Es lauscht nichts. LM Studios lokaler Server ist aus, bis Sie ihn in Developer → Local Server einschalten, und Ollamas Hintergrunddienst muss auf 11434 laufen. Haben Sie den Port verschoben, aktivieren Sie Use custom base URL in Cline und geben Sie die vollständige Adresse ein; läuft die Runtime auf einer anderen Maschine, schalten Sie LM Studios Serve on Local Network ein und öffnen Sie den Port in Ihrer Firewall.
- 3Modell nicht gelistet. Cline fragt den Server nach seiner Modellliste, daher liefert LM Studio nur geladene und Ollama nur gepullte Modelle. Laden oder pullen Sie das Modell und öffnen Sie das Dropdown neu — Ollamas Cline-Seite erlaubt auch das Eintippen eines Modell-Tags von Hand, der schnellste Weg an einer veralteten Liste vorbei.
- 4Die Warnung der Runtime selbst sollten Sie ernst nehmen. Clines LM-Studio-Panel stellt fest, dass Cline komplexe Prompts nutzt, am besten mit Claude-Modellen funktioniert und weniger fähige Modelle möglicherweise nicht wie erwartet arbeiten. Ein 1.5B-Coder ist ein Completion-Modell, kein Agent-Modell — keine Einstellung macht eines daraus.
Runtime- und Hardware-Anforderungen für lokales Cline
Cline selbst ist dieselbe VS-Code-Erweiterung, die Sie mit einem gehosteten Provider nutzen würden; das Modell läuft hinter einer Runtime, die Sie installieren. Clines local-models-Seite nennt drei unterstützte Runtimes — Ollama, LM Studio und Atomic Chat — und reduziert das ganze Setup auf fünf Zeilen: Runtime installieren, ihren lokalen Server starten, den passenden Provider in Cline Settings wählen, ein lokales Modell auswählen und Use Compact Prompt aktivieren.
Endpoints und Ports: Ollama beantwortet eine OpenAI-kompatible API auf http://localhost:11434, LM Studio auf http://127.0.0.1:1234 unter /v1. Beide binden standardmäßig an localhost, es verlässt also nichts Ihre Maschine, außer Sie geben den Server explizit im Netzwerk frei.
- 116-32GB RAM — kleine oder quantisierte Modelle im Bereich 7B-14B, bescheidene Kontextfenster, CPU-only-Inferenz ist möglich, aber langsam.
- 232-64GB RAM — mittelgroße Coding-Modelle wie qwen3-coder:30b-a3b (19GB) oder devstral:24b, mit Platz für ein 32K- oder größeres Fenster.
- 364GB+ RAM oder eine große GPU — größere Modelle und größere Kontextfenster zusammen; ein 30B-Modell mit 64K-Fenster braucht den Speicher und genug VRAM zum Auslagern.
Die Aufnahme sagt dasselbe wie die Doku: Sie können das auf einer CPU laufen lassen, aber eine stärkere GPU bringt spürbar bessere Leistung, und der gesamte System-RAM entscheidet, wie groß ein Modell und wie groß ein Kontextfenster sein kann. Planen Sie das Fenster ein, nicht nur die Gewichte.
