Cline v4.1.21 · Ollama + LM Studio

Cline のローカルモデルはどれを選ぶ?Ollama・LM Studio 設定ガイド

Cline のエージェント型コーディングで実用に耐えるローカルモデルはどれか、Ollama / LM Studio に接続する手順、コンテキスト長不足・接続拒否・モデル一覧が空という3つのトラブルの直し方を、録画と公式ドキュメントで確認した 13 ステップで解説します。

要点まとめ

  • Cline で使うローカルモデルの候補は qwen3-coder:30b(19GB・256K コンテキスト・ツール呼び出し対応)、devstral:24b、gpt-oss:20b の3つです。いずれも各ランタイムのモデルページに tools バッジが付いています。ツール呼び出し用テンプレートを持たないコードモデルは、コードを編集せずに語りかけてくるだけです。
  • ランタイムは2つで足ります。Ollama が http://localhost:11434、LM Studio が http://127.0.0.1:1234 です。Cline Settings → API Configuration で対応する API Provider を選び、ポートを変えていない限り Use custom base URL はオフのままにします。
  • 「Cline のローカルモデルが動かない」という報告はほぼ3つに集約されます。サーバーが起動していない(接続拒否)、モデルが読み込まれていない(ドロップダウンが空)、コンテキストウィンドウが小さすぎる(エージェントが忘れて推論をやり直す)のいずれかです。
  • Ollama の Cline 連携ページはコーディングに必要な下限を 32K トークンとし、Cline 自身のクイックスタートも Use Compact Prompt の有効化で締めくくっています。Cline v4.1.21 では、コンテキストを使い切るローカルモデル向けに圧縮リトライが1回追加されました。llama.cpp・Ollama・LM Studio は残っているコンテキスト分しか生成できないためです。

Cline のエージェント型コーディングに本当に使えるローカルモデルは?

Cline はチャット欄ではありません。大きなツール呼び出し用システムプロンプトを送り、ツール呼び出し・ファイル diff・ターミナル出力・追加指示をループで処理します。ここで使えるのは、チャットテンプレートがランタイムの API 経由でツール呼び出しを公開し、十分に長い思考の連鎖を保てるモデルだけです。この時点で候補は一気に絞られます。19GB をダウンロードする前に、モデルページの tools バッジを確認してください。

  • 1エージェント向け — qwen3-coder:30b は総パラメータ 30B・1トークンあたり 3.3B が有効、19GB、256K コンテキストウィンドウでツールにも対応し、24〜32GB のマシンで動かせる最強のエージェント型コーダーです。devstral:24b は Mistral のコーディングエージェントモデル。gpt-oss:20b は OpenAI のオープンウェイトモデルで、ツール呼び出しと推論に対応し、16GB が快適ラインです。
  • 2compact prompt を有効にすれば実用 — qwen3 の 4B〜14B タグと gemma3:12b はツール呼び出しに対応しており、本ガイドのスクリプト・リネーム・ゲームといった小さなタスクはこなせます。ただしウィンドウをすぐ消費するため、コンテキスト長を上げ、Use compact prompt は有効のままにしてください。
  • 3エージェント用途では見送り — deepseek-coder-v2 は本当に強力なコードモデルですが、Ollama に tools バッジがなく、Cline のツール呼び出しが届きません。ツール非対応の小型モデルや、モデルページにツール対応の表示がない「coder」タグも同様です。ベンチマークのスコアはツールループが回るかどうかを教えてくれません。
  • 4オフラインのプライバシーよりエージェント性能を求めるなら、ローカルハードウェアのコストは一度考えてください。Cline の無料枠にはすでに DeepSeek が含まれており、DeepSeek V4 Flash は 1M トークンのコンテキストウィンドウ付きで一覧にあります。19GB のダウンロードも 32GB のメモリ増設もなしに、同じエージェントループが回ります。ローカル推論はプライバシー、エアギャップ環境、学習用途に残し、ホスト型のルートは下にリンクした DeepSeek + Cline ガイドをご覧ください。
  • 5Cline のローカルモデルページによるハードウェアの目安は、16〜32GB が小型または量子化モデル、32〜64GB が中規模のコーディングモデル、64GB 以上でより大きなモデルとより広いコンテキストウィンドウです。実際に先に破綻するのはパラメータ数ではなくコンテキスト長のほうです。

How to Use Cline with LM Studio for 100% Local AI Vibe Coding

チャンネル:Bootable USBs7:04

開く

Install Qwen 3 Locally in Minutes with Ollama

チャンネル:Bonverium Studio4:04

開く

Local models — Cline documentation

ドキュメント:docs.cline.bot

開く

Cline with Ollama — Ollama integration guide

ドキュメント:docs.ollama.com

開く

Cline v4.1.21 release notes (local model compaction)

ドキュメント:github.com/cline/cline

開く

画像は2本の画面録画から取得しています。LM Studio + Cline の実演が VS Code・Cline Settings・LM Studio の全フレームを、別の Ollama 録画がインストーラー・モデルピッカー・ターミナルのフレームを提供しています。作者のオーバーレイ、顔、焼き込み字幕が入ったフレームは除外し、コンテキスト長の1フレームは高速シークで別シーンに着地したため、正確なタイムスタンプで再抽出しました。

製品名・メニュー名・バージョン番号は docs.cline.bot(Local models)、docs.ollama.com/integrations/cline、ollama.com の各モデルページ、cline/cline v4.1.21 のリリースノートと照合しています。画像は解説目的で録画から短い抜粋を引用したものです。

13 ステップで Cline をローカルモデルに接続する

Cline と Ollama ランタイムをインストールする

  1. 1

    VS Code に Cline 拡張機能をインストールする

    拡張機能ビュー(Ctrl+Shift+X)を開いて Cline を検索し、cline.bot が公開している拡張機能をインストールします。マーケットプレイスには似た名前の偽物が溢れています — Cline 中文版、Cline Max、Cline Pro - CodeAI、Bao Cline — 公式は cline.bot の掲載だけです。Cline Desktop と CLI も、以下で説明する同じプロバイダー設定を使います。

    Cline extension installing in the VS Code marketplace search for cline, with the official cline.bot listing above Cline Chinese, Cline Max and Bao Cline look-alikes
    公式なのは cline.bot が公開している掲載で、その下に並ぶ類似品ではありません。0:50 から再生
  2. 2

    セットアップウィザードで Ollama をインストールする

    お使いの OS 用の Ollama をダウンロードしてインストーラーを実行します。Windows のウィザードは確認画面が1枚だけで、macOS と Linux も同じです。完了すると Ollama はバックグラウンドサービスとして常駐し、ポート 11434 で OpenAI 互換 API に応答します。Cline が話す相手はアプリのウィンドウではなく、このサービスです。

    Ollama version 0.11.0 setup wizard on Windows telling you to click Install to get up and running with your own large language models
    画面は1枚、ボタンは Install ひとつ — ウィザードは 11434 で待ち受けるバックグラウンドサービスを残します。1:00 から再生
  3. 3

    ツール呼び出しができるモデルを選ぶ

    Ollama アプリには Find model… ピッカーがあります。ターミナルでは同じ操作が ollama pull <model> です。Cline で使うならツール呼び出し対応ファミリーの中から選びます — gpt-oss:20b、qwen3-coder:30b-a3b、devstral:24b。Ollama ライブラリの各モデルページはタグの上にケイパビリティバッジを表示します。deepseek-coder-v2 のように tools バッジがなければ、Cline のツール呼び出しは処理されません。

    Ollama desktop app Find model picker listing gpt-oss 120b, gpt-oss 20b, deepseek-r1 8b and gemma3 tags while the model chip already reads gpt-oss 20b
    アプリのモデルピッカーには gpt-oss、deepseek-r1、gemma3 が並びます — 重要なのはライブラリページの tools バッジです。2:40 から再生
  4. 4

    pull して、ディスク上にあるものを確認する

    ollama run qwen3 はマニフェストを取得してダイジェストを検証し、プロンプトに入ります。続けて ollama list を実行すると、インストール済みのモデルとサイズが一覧表示され、ダウンロードが途中で止まっていないかを最も早く確認できます。同じファミリーでもサイズは大きく異なり、最小の qwen3 タグは 1GB 未満、30B の coder タグは 19GB です。

    Windows Command Prompt running ollama run qwen3 with pulling manifest and verifying sha256 digest at 100 percent before dropping into a live qwen3 4b prompt
    マニフェスト、ダイジェスト、そして対話プロンプト — Cline に必要なのは最初の2つが成功していることだけです。3:20 から再生

LM Studio でモデルを読み込み、サーバーを起動する

  1. 5

    LM Studio 内でモデルをダウンロードする

    LM Studio の Discover タブは独自カタログを検索します。Staff Picks には得意分野がラベル付けされています — Qwen3 Coder Next は 80B MoE・有効パラメータ 3B でコーディングエージェント向けに設計され、長期的な推論と複雑なツール使用に優れると説明されています。コミュニティの結果には DeepSeek-Coder-V2 のビルドもあります。始める前にダウンロードサイズを確認してください。ここに表示されている Q4_K_M ビルドは 48.49GB です。

    LM Studio Discover search for coder showing staff picks Qwen3 Coder Next and Qwen3 Coder 30B beside community DeepSeek-Coder-V2 GGUF builds and a 48.49 GB download button
    ここでは Tool Use が明示された能力で、ダウンロードサイズも同じです — 転送が始まる前に両方を確認しましょう。1:45 から再生
  2. 6

    LM Studio のローカルサーバーを起動する

    Developer タブ → Local Server を開き、サーバーをオンにします。Status: Running なら他のアプリケーションから接続できます。LM Studio は http://127.0.0.1:1234 で OpenAI 互換エンドポイントを公開し、トグルの下に対応エンドポイント(LM Studio API、OpenAI-compatible、Anthropic-compatible)を表示します。このサーバーは自分でオンにするまで停止しており、これが Cline の接続エラーで最も多い原因です。

    LM Studio 0.4.2 Developer tab Local Server page with the Status Running toggle switched on above an empty Loaded Models panel and the OpenAI-compatible supported endpoints
    Status: Running が青信号です — エンドポイントは 127.0.0.1:1234 の OpenAI 互換です。2:10 から再生

Cline をローカルサーバーに向ける

  1. 7

    Cline Settings で API プロバイダーを設定する

    Cline の Settings → API Configuration を開き、API Provider を LM Studio(または Ollama)に設定します。ローカルの既定ポートを使っている間は Use custom base URL をオフのままにし、サーバーを別のポートや別のマシンへ移した場合だけ入力します。このパネルにある Cline 自身の注記も読んでください。Cline は複雑なプロンプトを使い、Claude モデルとの相性が最も良く、能力の低いモデルでは期待どおりに動作しない可能性がある、と書かれています。

    Cline Settings API Configuration panel with API Provider set to LM Studio, Use custom base URL unchecked, an empty Model field and Context Window at zero
    まずプロバイダーです。実際にサーバーを移していない限り、base URL は触りません。3:00 から再生
  2. 8

    サーバーが提供しているモデルを選ぶ

    Model ドロップダウンは稼働中のサーバーから供給されるため、ランタイムが実際に保持しているモデルが並びます — この録画では qwen/qwen3-4b、qwen2.5-coder-7b-instruct、qwen2.5-coder-3b-claude_opus_4.6-distilled、gemma-3-27b-it-abliterated、meta-llama-3-8b-instruct、yi-coder-1.5b、そして embedding モデルです。一覧に自分のモデルがないなら、LM Studio で読み込まれていないか、Ollama で pull されていません。ここで 1.5B や embedding モデルを選んでしまうのが、「ローカルモデルは使えない」と結論づける原因です。

    Cline Settings Model dropdown open over API Configuration listing qwen/qwen3-4b, qwen2.5-coder-7b-instruct, gemma-3-27b-it-abliterated and yi-coder-1.5b served by LM Studio
    サーバーが報告したものがそのまま並びます — 一覧の embedding モデルは選ばないでください。3:03 から再生
  3. 9

    Context Window を確認し、Use compact prompt を有効にする

    Cline はランタイムが読み込んだコンテキストサイズをそのまま引き継ぎます。このフレームでは Context Window 4096 で、qwen/qwen3-4b の 4K ロード設定がそのまま入っており、エージェントループには小さすぎます。Cline のローカルモデル クイックスタートは Use compact prompt の有効化で終わり、Ollama 連携ページはコーディングの下限を 32K トークンとしています。このトグルは約 8K 以下のウィンドウ向けのシステムプロンプトに差し替えるもので、MCP と Focus Chain のサポートを失います。まずウィンドウを広げ、これは最後の手段にしてください。

    Cline Settings showing Context Window inherited as 4096 for qwen/qwen3-4b beside the unchecked Use compact prompt toggle and its Does not support MCP warning
    4096 がそのサインです。まずランタイム側で上げ、8K 付近から動けないなら compact prompt を有効のままにしてください。3:15 から再生

実行して、つまずいた箇所を直す

  1. 10

    自動承認をオンにして小さなタスクを実行する

    小さく検証しやすい依頼をします — このフォルダー内のファイル一覧、スクリプトの作成、その実行などです。auto-approve を YOLO にすると、エージェントはファイルを書き、diff を見せ、毎ステップ止まらずに進みます。エディター、Problems パネル、ターミナルは表示されたままなので、実際に何を実行したかを確認できます。読み込んだモデルを信頼できるまでは auto-approve をオフにしておきましょう。

    VS Code with Cline editing list_files.py in a red and green diff beside its own reasoning, a 5.0k token count and Auto-approve set to YOLO
    実際のローカルモデルタスクです。ファイルが存在し、Cline が編集しようとし、YOLO モードが承認を担っています。4:45 から再生
  2. 11

    「モデルが一覧にない」ときは読み込み直す

    Cline のドロップダウンはサーバーのモデル一覧そのもので、LM Studio は現在読み込まれているモデルしか公開しません。だから Developer → Local Server ページの Loaded Models が空のまま、Cline にはモデルが1つも表示されない、ということが起きます。もう一度読み込み(LM Studio では Ctrl + L でピッカーが開きます)、Cline の Model ドロップダウンを開き直します。Ollama ではターミナルで ollama list が同じ確認にあたり、Cline 側でモデルタグを手入力することもできます。

    LM Studio Developer tab Local Server page with Status Running and an empty Loaded Models panel prompting Ctrl plus L to load a model that Cline can then select
    Loaded Models は Cline のメニューそのものです。何も読み込まれていなければ、選ぶものもありません。4:54 から再生
  3. 12

    コンテキスト長を上げて推論ループを直す

    ウィンドウが小さすぎると、モデルは毎ターン推論をやり直し、エージェントはタスクを忘れたように見えます。LM Studio でモデルを Eject し、Manually choose model load parameters を有効にして読み込み直し、Load Model を押す前に Context Length を上げます — このダイアログは 2048 のまま止まっており、モデルが最大 262144 トークンまで対応する旨が併記されています。Cline v4.1.21 は安全網も追加しました。llama.cpp、Ollama、LM Studio で長い応答が出力トークン上限に達した場合、タスクを終了せず会話を圧縮して1回だけ再試行します。

    LM Studio 0.4.8 load model dialog for Qwen3.5 9B with Context Length at 2048, the note that the model supports up to 262144 tokens and the Load Model button
    Context Length がレバーで、「supports up to」の注記がモデルの天井を教えてくれます。5:06 から再生
  4. 13

    長いループが必要なタスクで確認する

    同じ構成で、ハイスコア記録付きの動くスネークゲームを作りました。一発目で作成され、作者がゲームが反応しないと報告した後に一度だけ修正され、ブラウザーで遊べる状態になりました。すべて API キーもサブスクリプションもなしにローカルで動作しています。リネームは成功するのにビルドが失敗するなら、制限はコンテキストかツール呼び出しであって、Cline の設定ではありません。

    Snake Game page running in the browser with Score 10 and High Score 210, the grid and a snake built end to end by Cline on a local LM Studio model
    最終形です。エージェントが作ったゲームがローカルで動作し、キーもサブスクリプションもありません。5:44 から再生

Cline + LM Studio のコンテキスト長:エージェントが忘れる理由

Cline は大きなシステムプロンプトに加えて、あなたのタスク、すべてのツール実行結果、モデル自身の推論を毎回送信します。ローカルランタイムは独自に決めたコンテキスト長でモデルを読み込みます — LM Studio はダウンロード直後の GGUF では既定値が小さく、録画ではロードダイアログが 2048、Cline の Context Window フィールドには 4096 が引き継がれています — そしてサーバーはそれを超える分を拒否します。エラーメッセージが出ることはほとんどなく、モデルは単に筋を見失い、最初に考えたことをもう一度答えます。

直し方はランタイム側にあります。モデルを Eject し、手動パラメータのオプションで読み込み直し、Context Length をメモリが許す限り高く設定します。Ollama の Cline 連携ページはコーディングの下限を 32K トークンとしており、Cline のローカルモデルページも同じコンテキストウィンドウ設定を指しています。そのうえで Cline の Context Window の表示を確認し、ロードサイズを上げられないときは Use compact prompt を有効のままにします。

ここではバージョンが重要です。v4.1.21 より前は、ローカルサーバーのコンテキストを使い切る長い応答でタスクが終了していました。v4.1.21 以降は会話を圧縮して1回再試行し、それでもだめなら簡潔リトライの復旧が走って部分的な回答を保持します。原因についてリリースノートは明快です — これらのサーバーは設定した出力予算に関係なく、残っているコンテキスト分しか生成できないからです。本当の解決策は今もロード時のコンテキスト長を上げることです。圧縮は再試行の機会を1回増やすだけです。

Cline + Ollama がアップデート後に動かない:本当の3つの原因

報告のほとんどは3つの原因のどれかに集約され、Cline 側の問題は1つ目だけです。

  1. 1ツール呼び出しフォーマットのずれ。Cline 4.1.x はツール構文を再び変更し、未解決の issue cline#13008 はローカル Ollama と Qwen3.6 の組み合わせがその影響で壊れることを記録しています。qwen3.6 と qwen3-coder のツール呼び出しフォーマットに対する互換対応は Ollama 側に入りました。拡張機能とランタイムの両方を更新し、双方のテンプレートが一致するモデルで再テストしてください — gpt-oss、qwen3-coder、devstral です。
  2. 2接続拒否(Connection refused)。何もリッスンしていません。LM Studio のローカルサーバーは Developer → Local Server でオンにするまで停止しており、Ollama のバックグラウンドサービスは 11434 で動いている必要があります。ポートを変更した場合は Cline で Use custom base URL をオンにして完全なアドレスを入力します。ランタイムが別マシンなら、LM Studio の Serve on Local Network を有効にし、ファイアウォールでポートを開けてください。
  3. 3モデルが一覧にない。Cline はサーバーにモデル一覧を問い合わせるため、LM Studio は読み込み済みのモデルだけを返し、Ollama は pull 済みのモデルだけを返します。モデルを読み込むか pull してからドロップダウンを開き直してください。Ollama の Cline ページではモデルタグの手入力もでき、古い一覧を抜ける最短ルートです。
  4. 4ランタイム自身の警告は信じる価値があります。Cline の LM Studio パネルには、Cline は複雑なプロンプトを使い、Claude モデルとの相性が最も良く、能力の低いモデルでは期待どおりに動作しない可能性があると明記されています。1.5B のコーダーは補完モデルであってエージェントモデルではありません — どんな設定でもそうはなりません。

ローカル Cline のランタイムとハードウェア要件

Cline 自体はホスト型プロバイダーで使うのと同じ VS Code 拡張機能で、モデルは自分でインストールしたランタイムの背後で動きます。Cline のローカルモデルページは対応ランタイムを3つ挙げています — Ollama、LM Studio、Atomic Chat — そして設定全体を5行に要約しています。ランタイムをインストールし、ローカルサーバーを起動し、Cline Settings で対応するプロバイダーを選び、ローカルモデルを選択し、Use Compact Prompt を有効にする、という流れです。

エンドポイントとポート:Ollama は http://localhost:11434、LM Studio は http://127.0.0.1:1234 で OpenAI 互換 API に応答し、パスは /v1 配下です。どちらも既定で localhost にのみバインドするため、明示的にサーバーをネットワークへ公開しない限り、データがマシンの外に出ることはありません。

  • 116〜32GB RAM — 7B〜14B の小型または量子化モデル、控えめなコンテキストウィンドウ。CPU のみの推論も可能ですが遅くなります。
  • 232〜64GB RAM — qwen3-coder:30b-a3b(19GB)や devstral:24b など中規模のコーディングモデル。32K 以上のウィンドウを確保できます。
  • 364GB 以上の RAM または大容量 GPU — より大きなモデルとより広いコンテキストウィンドウを同時に。30B モデルを 64K ウィンドウで動かすにはメモリと、オフロードするための十分な VRAM が必要です。

録画もドキュメントと同じ点を指摘しています。CPU でも動かせますが、より強力な GPU のほうが体感性能は明らかに良くなり、システム RAM の総量がモデルの大きさとコンテキストウィンドウの広さの両方を決めます。重みだけでなくウィンドウ分も見積もってください。

Cline のローカルモデル FAQ

関連ガイド