Cline v4.1.21 · Ollama + LM Studio

Cline 本地模型怎么选:Ollama 与 LM Studio 配置教程

Cline 跑代理式编程到底能用哪些本地模型、怎么把 Cline 接到 Ollama 或 LM Studio,以及上下文长度太短、连接被拒、模型列表为空这三个常见问题怎么修——13 步对照录屏和官方文档逐帧核对。

太长不看

  • Cline 的本地模型候选就三个:qwen3-coder:30b(19GB、256K 上下文、支持工具调用)、devstral:24b 和 gpt-oss:20b。三者在各自运行时的模型页上都带 tools 徽章;没有工具调用模板的代码模型,只会跟你讨论代码,不会动手改。
  • 两个运行时就能覆盖全部:Ollama 在 http://localhost:11434,LM Studio 在 http://127.0.0.1:1234。在 Cline Settings → API Configuration 里选对应的 API Provider,只要没改端口就别勾 Use custom base URL。
  • 网上绝大多数「Cline 本地模型用不了」的案例,原因就三个:服务没启动(连接被拒)、模型没加载(下拉列表是空的)、上下文窗口太小(代理忘事,推理从头再来)。
  • Ollama 的 Cline 集成文档把编码的下限定在 32K token,Cline 自己的快速上手也以启用 Use Compact Prompt 收尾。Cline v4.1.21 为上下文不够用的本地模型加了一次压缩重试,因为 llama.cpp、Ollama 和 LM Studio 只会按剩余上下文来生成。

Cline 跑代理式编程,哪些本地模型真的够用?

Cline 不是聊天框。它会先发一大段带工具调用的 system prompt,然后在工具调用、文件 diff、终端输出和后续追问之间循环。模型要在这里跑得动,聊天模板必须通过运行时的 API 暴露工具调用能力,还得撑得住足够长的思维链。这一条就能筛掉大半——下载 19GB 之前,先去模型页看有没有 tools 徽章。

  • 1为代理而生——qwen3-coder:30b 总参数 30B、每 token 激活 3.3B,19GB,256K 上下文窗口并支持工具调用,是 24-32GB 机器上能跑的最强代理式编码模型。devstral:24b 是 Mistral 的编码代理模型。gpt-oss:20b 是 OpenAI 的开源权重模型,支持工具调用和推理,16GB 就能跑得舒服。
  • 2开着压缩提示词就能用——qwen3 的 4B 到 14B 档位和 gemma3:12b 确实支持工具调用,能完成本攻略里写脚本、重命名、做游戏这类小任务。但它们很快就把窗口烧光,所以要调大上下文长度,并保持 Use compact prompt 开着。
  • 3做代理任务别选——deepseek-coder-v2 是真正能打的代码模型,但在 Ollama 上没有 tools 徽章,Cline 的工具调用根本传不到它那里;小型非工具模型,以及任何模型页上不显示工具支持的「coder」标签,同样如此。跑分高低预测不了工具循环能不能闭合。
  • 4如果你要的是代理效果而不是离线隐私,先算算本地硬件的账:Cline 免费档里已经有 DeepSeek——DeepSeek V4 Flash 就在列表里,带 1M token 上下文窗口——同一套代理循环不用下 19GB,也不用加 32GB 内存。本地推理留给隐私、离线环境和学习用途,托管路线可以看下面链接的 DeepSeek + Cline 攻略。
  • 5Cline 本地模型文档给的硬件经验值:16-32GB 跑小模型或量化模型,32-64GB 跑中等编码模型,64GB+ 才能上更大的模型和更大的上下文窗口。实际用下来,先崩掉的往往是上下文长度,而不是参数量。

How to Use Cline with LM Studio for 100% Local AI Vibe Coding

频道:Bootable USBs7:04

打开

Install Qwen 3 Locally in Minutes with Ollama

频道:Bonverium Studio4:04

打开

Local models — Cline documentation

文档:docs.cline.bot

打开

Cline with Ollama — Ollama integration guide

文档:docs.ollama.com

打开

Cline v4.1.21 release notes (local model compaction)

文档:github.com/cline/cline

打开

截图来自两段录屏:LM Studio + Cline 的实操视频提供了全部 VS Code、Cline Settings 和 LM Studio 画面,另一段 Ollama 录屏提供了安装器、模型选择器和终端画面。带作者浮层、人脸或内嵌字幕的画面一律弃用;有一帧上下文长度的画面因为快速跳转定位到了错误场景,后来按精确时间戳重新截取。

产品名、菜单名和版本号均对照 docs.cline.bot(Local models)、docs.ollama.com/integrations/cline、ollama.com 各模型页和 cline/cline v4.1.21 发布说明核对过。截图仅为评论目的引用录屏中的少量画面。

13 步把 Cline 接到本地模型上

安装 Cline 和 Ollama 运行时

  1. 1

    在 VS Code 里安装 Cline 扩展

    打开扩展视图(Ctrl+Shift+X),搜索 Cline,安装由 cline.bot 发布的那个扩展。市场上挤满了山寨货——Cline 中文版、Cline Max、Cline Pro - CodeAI、Bao Cline——只有 cline.bot 那个才是官方版。Cline Desktop 和 CLI 用的是下文同一套提供商设置。

    Cline extension installing in the VS Code marketplace search for cline, with the official cline.bot listing above Cline Chinese, Cline Max and Bao Cline look-alikes
    官方版本是 cline.bot 发布的那个,不是底下堆着的那些山寨货。在 0:50 处观看
  2. 2

    用安装向导装好 Ollama

    下载对应系统的 Ollama 并运行安装程序。Windows 向导只有一个确认界面,macOS 和 Linux 也一样。装完后 Ollama 会留在后台作为服务运行,在 11434 端口上提供 OpenAI 兼容 API——Cline 连的是这个服务,不是它的应用窗口。

    Ollama version 0.11.0 setup wizard on Windows telling you to click Install to get up and running with your own large language models
    一个界面、一个 Install 按钮——向导留下一个监听 11434 的后台服务。在 1:00 处观看
  3. 3

    挑一个能调用工具的模型

    Ollama 应用里有 Find model… 选择器;在终端里,同样的操作是 ollama pull <model>。给 Cline 用,就待在支持工具调用的家族里——gpt-oss:20b、qwen3-coder:30b-a3b 或 devstral:24b。Ollama 模型库的每个模型页都会在标签上方显示能力徽章;如果缺了 tools 徽章(deepseek-coder-v2 就是),Cline 的工具调用就不会被处理。

    Ollama desktop app Find model picker listing gpt-oss 120b, gpt-oss 20b, deepseek-r1 8b and gemma3 tags while the model chip already reads gpt-oss 20b
    应用里的模型选择器列出 gpt-oss、deepseek-r1 和 gemma3——真正要看的是模型库页面上的 tools 徽章。在 2:40 处观看
  4. 4

    拉取模型并确认落盘情况

    ollama run qwen3 会拉取 manifest、校验摘要,然后把你带进一个对话提示符。接着 ollama list 会列出每个已安装模型及其体积,这是发现下载没下完最快的方法。同一个家族里的体积差别很大:最小的 qwen3 标签不到 1GB,而 30B 的 coder 标签有 19GB。

    Windows Command Prompt running ollama run qwen3 with pulling manifest and verifying sha256 digest at 100 percent before dropping into a live qwen3 4b prompt
    先 manifest,再摘要,然后才是能对话的提示符——Cline 只要求前两步成功。在 3:20 处观看

在 LM Studio 里加载模型并打开本地服务

  1. 5

    在 LM Studio 里下载模型

    LM Studio 的 Discover 标签页搜的是它自己的目录。Staff Picks 会标注各自的强项——Qwen3 Coder Next 被描述为 80B MoE、激活参数 3B、专为编码代理设计,擅长长程推理和复杂工具调用;社区结果里还有 DeepSeek-Coder-V2 的各种构建。动手之前先看清下载体积:截图里这个 Q4_K_M 构建是 48.49GB。

    LM Studio Discover search for coder showing staff picks Qwen3 Coder Next and Qwen3 Coder 30B beside community DeepSeek-Coder-V2 GGUF builds and a 48.49 GB download button
    这里 Tool Use 是明确标注的能力,下载体积也是——传输开始前两个都要看。在 1:45 处观看
  2. 6

    启动 LM Studio 的本地服务

    打开 Developer 标签页 → Local Server,把服务开关打开;Status: Running 表示其他应用可以连接了。LM Studio 在 http://127.0.0.1:1234 上提供 OpenAI 兼容端点,开关下面还会列出支持的端点类型(LM Studio API、OpenAI-compatible、Anthropic-compatible)。这个服务默认是关的,要手动打开——这正是 Cline 报连接错误最常见的原因。

    LM Studio 0.4.2 Developer tab Local Server page with the Status Running toggle switched on above an empty Loaded Models panel and the OpenAI-compatible supported endpoints
    Status: Running 就是绿灯——端点在 127.0.0.1:1234,兼容 OpenAI 格式。在 2:10 处观看

把 Cline 指向本地服务

  1. 7

    在 Cline Settings 里设置 API 提供商

    打开 Cline 的 Settings → API Configuration,把 API Provider 设为 LM Studio(或 Ollama)。只要还用本机默认端口,就别勾 Use custom base URL;只有服务换了端口或换到另一台机器时才填。注意这个面板里 Cline 自己的提示:它写着 Cline 使用复杂提示词、搭配 Claude 模型效果最好,能力较弱的模型可能无法按预期工作。

    Cline Settings API Configuration panel with API Provider set to LM Studio, Use custom base URL unchecked, an empty Model field and Context Window at zero
    先选提供商;只要没真的搬走服务,base URL 就别动。在 3:00 处观看
  2. 8

    选中服务正在提供的模型

    Model 下拉框的内容来自正在运行的服务,所以列出的就是运行时实际持有的模型——这段录屏里是 qwen/qwen3-4b、qwen2.5-coder-7b-instruct、qwen2.5-coder-3b-claude_opus_4.6-distilled、gemma-3-27b-it-abliterated、meta-llama-3-8b-instruct、yi-coder-1.5b,还有一个 embedding 模型。列表里没有你的模型,说明它在 LM Studio 里没加载,或在 Ollama 里没拉取;在这里选中 1.5B 或 embedding 模型,正是很多人得出「本地模型不能用」结论的原因。

    Cline Settings Model dropdown open over API Configuration listing qwen/qwen3-4b, qwen2.5-coder-7b-instruct, gemma-3-27b-it-abliterated and yi-coder-1.5b served by LM Studio
    服务上报什么,这里就显示什么——列表里的 embedding 模型别去选它。在 3:03 处观看
  3. 9

    看清 Context Window,并开启 Use compact prompt

    Cline 继承的是运行时加载时的上下文大小:这一帧显示 Context Window 4096,直接来自 qwen/qwen3-4b 的 4K 加载设置,对代理循环来说远远不够。Cline 的本地模型快速上手最后一步就是启用 Use compact prompt,它的 Ollama 集成文档则把编码下限定在 32K token。打开这个开关会换上一份为 8K 以下窗口准备的 system prompt,代价是失去 MCP 和 Focus Chain 支持——所以先把窗口调大,再拿它当兜底。

    Cline Settings showing Context Window inherited as 4096 for qwen/qwen3-4b beside the unchecked Use compact prompt toggle and its Does not support MCP warning
    4096 就是症结。先去运行时里调大,实在只能在 8K 附近打转,再开着压缩提示词。在 3:15 处观看

跑起来,再修掉报错

  1. 10

    打开自动批准,跑一个小任务

    让它做件小而可验证的事——列出这个文件夹里的文件、写个脚本、跑一下。把 auto-approve 设成 YOLO,代理会写文件、给你看 diff、一路不停,不用每一步都点确认;编辑器、Problems 面板和终端都留在视野里,你能看到它到底执行了什么。在你信任所加载的模型之前,先别开自动批准。

    VS Code with Cline editing list_files.py in a red and green diff beside its own reasoning, a 5.0k token count and Auto-approve set to YOLO
    一次真实的本地模型任务:文件已经存在,Cline 想改它,YOLO 模式正在替你做批准。在 4:45 处观看
  2. 11

    模型列表里没有?重新加载一次

    Cline 的下拉框就是服务端的模型列表,而 LM Studio 只上报当前已加载的模型。所以 Developer → Local Server 页面里的 Loaded Models 可能空空如也,Cline 里也就一个模型都看不到。重新加载一个(LM Studio 里 Ctrl + L 打开选择器),再打开 Cline 的 Model 下拉框。在 Ollama 里,对应的检查是在终端跑 ollama list——Cline 也支持手动输入模型标签。

    LM Studio Developer tab Local Server page with Status Running and an empty Loaded Models panel prompting Ctrl plus L to load a model that Cline can then select
    Loaded Models 就是 Cline 的菜单:没加载,就没得选。在 4:54 处观看
  3. 12

    上下文长度调大,修掉推理打转

    窗口太小的时候,模型每一轮都会从头开始推理,代理看起来就像忘了任务。在 LM Studio 里 Eject 模型,然后勾上 Manually choose model load parameters 重新加载,按下 Load Model 之前先把 Context Length 调大——截图里这个对话框停在 2048,同时注明模型最高支持 262144 token。Cline v4.1.21 还加了一层保险:在 llama.cpp、Ollama 或 LM Studio 上,长回复撞到输出 token 上限时,现在会压缩对话并重试一次,而不是直接结束任务。

    LM Studio 0.4.8 load model dialog for Qwen3.5 9B with Context Length at 2048, the note that the model supports up to 262144 tokens and the Load Model button
    Context Length 就是那个旋钮,而「supports up to」那行注明了模型还有多少上限空间。在 5:06 处观看
  4. 13

    用一个需要长循环的任务来验证

    同一套配置接着做出了一个能跑、带最高分记录的贪吃蛇游戏:一次成型,作者反馈游戏没响应后又改了一版,最后在浏览器里玩得起来。全程本地运行,没有 API Key,也没有订阅。如果重命名能成功、构建却失败,那瓶颈是上下文或工具调用,不是 Cline 的配置。

    Snake Game page running in the browser with Score 10 and High Score 210, the grid and a snake built end to end by Cline on a local LM Studio model
    最终状态:一个由代理做出来的游戏跑在本地,没有 Key,也没有订阅。在 5:44 处观看

Cline + LM Studio 上下文长度:代理为什么会忘事

Cline 每轮都会发一大段 system prompt,加上你的任务、每一次工具返回结果和模型自己的推理。本地运行时加载模型时用的是它自己定的上下文长度——LM Studio 对新下载的 GGUF 默认值很小,录屏里加载对话框是 2048,继承进 Cline 的 Context Window 字段就成了 4096——超出这个长度的内容服务端一律拒绝。报错信息反而少见:模型就是丢了线索,把自己最初的想法又答了一遍。

解法在运行时这边。Eject 模型,用手动参数选项重新加载,把 Context Length 调到内存允许的最高值;Ollama 的 Cline 集成文档把编码下限定在 32K token,Cline 的本地模型页面也指向同一个上下文窗口设置。然后回头看 Cline 的 Context Window 显示多少,实在加不上去时就保持 Use compact prompt 开着。

版本在这里很关键。v4.1.21 之前,一条超长回复耗尽本地服务端上下文,任务就直接结束了;从 v4.1.21 起,Cline 会压缩对话并重试一次,再退回到简洁重试,并保留已经拿到的部分答案。发布说明把原因写得很明白——这些服务端只按剩余上下文来生成,跟你配置的输出预算无关。把加载时的上下文长度调大仍是真正的解法,压缩只是多给你一次机会。

Cline + Ollama 更新后用不了:三个真正的原因

几乎所有反馈都能归到三个原因之一,而且只有第一个算 Cline 的问题。

  1. 1工具调用格式漂移。Cline 4.1.x 又改了工具语法,未关闭的 issue cline#13008 记录了本地 Ollama 配 Qwen3.6 因此直接报错;Ollama 这边随后补上了对 qwen3.6 和 qwen3-coder 工具调用格式的兼容处理。扩展和运行时都要更新,然后用一个双方模板都认可的模型复测——gpt-oss、qwen3-coder 或 devstral。
  2. 2连接被拒(Connection refused)。根本没有进程在监听。LM Studio 的本地服务默认关闭,要在 Developer → Local Server 里手动打开;Ollama 的后台服务必须跑在 11434 上。如果你换了端口,就在 Cline 里勾选 Use custom base URL 并填完整地址;如果运行时在另一台机器上,打开 LM Studio 的 Serve on Local Network,并在防火墙里放行该端口。
  3. 3模型不在列表里。Cline 是向服务端要模型列表的,所以 LM Studio 只返回已加载的模型,Ollama 只返回已拉取的模型。加载或拉取模型后重新打开下拉框——Ollama 的 Cline 文档页也允许手动输入模型标签,这是绕过过期列表最快的办法。
  4. 4运行时自己的警告值得当真。Cline 的 LM Studio 面板明确写着:Cline 使用复杂提示词、搭配 Claude 模型效果最好、能力较弱的模型可能无法按预期工作。1.5B 的 coder 是补全模型,不是代理模型——没有任何设置能把它变成代理模型。

本地跑 Cline 的运行时与硬件要求

Cline 本身还是那个 VS Code 扩展,跟你接托管提供商时用的是同一个;模型则在你自己安装的运行时后面跑。Cline 的本地模型页面列出三个受支持的运行时——Ollama、LM Studio 和 Atomic Chat——并把整套配置压缩成五行:装一个运行时、启动它的本地服务、在 Cline Settings 里选对应的提供商、选一个本地模型、启用 Use Compact Prompt。

端点与端口:Ollama 在 http://localhost:11434 提供 OpenAI 兼容 API,LM Studio 在 http://127.0.0.1:1234,路径在 /v1 下。两者默认都只绑定 localhost,除非你主动把服务暴露到网络,否则数据不会离开你的机器。

  • 116-32GB 内存——跑 7B-14B 的小模型或量化模型,上下文窗口比较有限;纯 CPU 推理能用,但很慢。
  • 232-64GB 内存——跑 qwen3-coder:30b-a3b(19GB)或 devstral:24b 这类中等编码模型,还有空间开 32K 以上的窗口。
  • 364GB+ 内存或大显存 GPU——更大的模型和更大的上下文窗口一起上;30B 模型配 64K 窗口,既需要内存,也需要足够的显存来卸载。

录屏和文档说的是同一件事:这些模型用 CPU 也能跑,但显存更强的 GPU 性能明显更好,而系统内存总量同时决定你能加载多大的模型和多大的上下文窗口。预算要按窗口来算,不能只算权重。

Cline 本地模型常见问题

继续探索