太长不看
- Cline 的本地模型候选就三个:qwen3-coder:30b(19GB、256K 上下文、支持工具调用)、devstral:24b 和 gpt-oss:20b。三者在各自运行时的模型页上都带 tools 徽章;没有工具调用模板的代码模型,只会跟你讨论代码,不会动手改。
- 两个运行时就能覆盖全部:Ollama 在 http://localhost:11434,LM Studio 在 http://127.0.0.1:1234。在 Cline Settings → API Configuration 里选对应的 API Provider,只要没改端口就别勾 Use custom base URL。
- 网上绝大多数「Cline 本地模型用不了」的案例,原因就三个:服务没启动(连接被拒)、模型没加载(下拉列表是空的)、上下文窗口太小(代理忘事,推理从头再来)。
- Ollama 的 Cline 集成文档把编码的下限定在 32K token,Cline 自己的快速上手也以启用 Use Compact Prompt 收尾。Cline v4.1.21 为上下文不够用的本地模型加了一次压缩重试,因为 llama.cpp、Ollama 和 LM Studio 只会按剩余上下文来生成。
Cline 跑代理式编程,哪些本地模型真的够用?
Cline 不是聊天框。它会先发一大段带工具调用的 system prompt,然后在工具调用、文件 diff、终端输出和后续追问之间循环。模型要在这里跑得动,聊天模板必须通过运行时的 API 暴露工具调用能力,还得撑得住足够长的思维链。这一条就能筛掉大半——下载 19GB 之前,先去模型页看有没有 tools 徽章。
- 1为代理而生——qwen3-coder:30b 总参数 30B、每 token 激活 3.3B,19GB,256K 上下文窗口并支持工具调用,是 24-32GB 机器上能跑的最强代理式编码模型。devstral:24b 是 Mistral 的编码代理模型。gpt-oss:20b 是 OpenAI 的开源权重模型,支持工具调用和推理,16GB 就能跑得舒服。
- 2开着压缩提示词就能用——qwen3 的 4B 到 14B 档位和 gemma3:12b 确实支持工具调用,能完成本攻略里写脚本、重命名、做游戏这类小任务。但它们很快就把窗口烧光,所以要调大上下文长度,并保持 Use compact prompt 开着。
- 3做代理任务别选——deepseek-coder-v2 是真正能打的代码模型,但在 Ollama 上没有 tools 徽章,Cline 的工具调用根本传不到它那里;小型非工具模型,以及任何模型页上不显示工具支持的「coder」标签,同样如此。跑分高低预测不了工具循环能不能闭合。
- 4如果你要的是代理效果而不是离线隐私,先算算本地硬件的账:Cline 免费档里已经有 DeepSeek——DeepSeek V4 Flash 就在列表里,带 1M token 上下文窗口——同一套代理循环不用下 19GB,也不用加 32GB 内存。本地推理留给隐私、离线环境和学习用途,托管路线可以看下面链接的 DeepSeek + Cline 攻略。
- 5Cline 本地模型文档给的硬件经验值:16-32GB 跑小模型或量化模型,32-64GB 跑中等编码模型,64GB+ 才能上更大的模型和更大的上下文窗口。实际用下来,先崩掉的往往是上下文长度,而不是参数量。
How to Use Cline with LM Studio for 100% Local AI Vibe Coding
频道:Bootable USBs7:04
Install Qwen 3 Locally in Minutes with Ollama
频道:Bonverium Studio4:04
Local models — Cline documentation
文档:docs.cline.bot
Cline with Ollama — Ollama integration guide
文档:docs.ollama.com
Cline v4.1.21 release notes (local model compaction)
文档:github.com/cline/cline
截图来自两段录屏:LM Studio + Cline 的实操视频提供了全部 VS Code、Cline Settings 和 LM Studio 画面,另一段 Ollama 录屏提供了安装器、模型选择器和终端画面。带作者浮层、人脸或内嵌字幕的画面一律弃用;有一帧上下文长度的画面因为快速跳转定位到了错误场景,后来按精确时间戳重新截取。
产品名、菜单名和版本号均对照 docs.cline.bot(Local models)、docs.ollama.com/integrations/cline、ollama.com 各模型页和 cline/cline v4.1.21 发布说明核对过。截图仅为评论目的引用录屏中的少量画面。
13 步把 Cline 接到本地模型上
安装 Cline 和 Ollama 运行时
- 1
在 VS Code 里安装 Cline 扩展
打开扩展视图(Ctrl+Shift+X),搜索 Cline,安装由 cline.bot 发布的那个扩展。市场上挤满了山寨货——Cline 中文版、Cline Max、Cline Pro - CodeAI、Bao Cline——只有 cline.bot 那个才是官方版。Cline Desktop 和 CLI 用的是下文同一套提供商设置。

官方版本是 cline.bot 发布的那个,不是底下堆着的那些山寨货。在 0:50 处观看 - 2
用安装向导装好 Ollama
下载对应系统的 Ollama 并运行安装程序。Windows 向导只有一个确认界面,macOS 和 Linux 也一样。装完后 Ollama 会留在后台作为服务运行,在 11434 端口上提供 OpenAI 兼容 API——Cline 连的是这个服务,不是它的应用窗口。

一个界面、一个 Install 按钮——向导留下一个监听 11434 的后台服务。在 1:00 处观看 - 3
挑一个能调用工具的模型
Ollama 应用里有 Find model… 选择器;在终端里,同样的操作是 ollama pull <model>。给 Cline 用,就待在支持工具调用的家族里——gpt-oss:20b、qwen3-coder:30b-a3b 或 devstral:24b。Ollama 模型库的每个模型页都会在标签上方显示能力徽章;如果缺了 tools 徽章(deepseek-coder-v2 就是),Cline 的工具调用就不会被处理。

应用里的模型选择器列出 gpt-oss、deepseek-r1 和 gemma3——真正要看的是模型库页面上的 tools 徽章。在 2:40 处观看 - 4
拉取模型并确认落盘情况
ollama run qwen3 会拉取 manifest、校验摘要,然后把你带进一个对话提示符。接着 ollama list 会列出每个已安装模型及其体积,这是发现下载没下完最快的方法。同一个家族里的体积差别很大:最小的 qwen3 标签不到 1GB,而 30B 的 coder 标签有 19GB。

先 manifest,再摘要,然后才是能对话的提示符——Cline 只要求前两步成功。在 3:20 处观看
在 LM Studio 里加载模型并打开本地服务
- 5
在 LM Studio 里下载模型
LM Studio 的 Discover 标签页搜的是它自己的目录。Staff Picks 会标注各自的强项——Qwen3 Coder Next 被描述为 80B MoE、激活参数 3B、专为编码代理设计,擅长长程推理和复杂工具调用;社区结果里还有 DeepSeek-Coder-V2 的各种构建。动手之前先看清下载体积:截图里这个 Q4_K_M 构建是 48.49GB。

这里 Tool Use 是明确标注的能力,下载体积也是——传输开始前两个都要看。在 1:45 处观看 - 6
启动 LM Studio 的本地服务
打开 Developer 标签页 → Local Server,把服务开关打开;Status: Running 表示其他应用可以连接了。LM Studio 在 http://127.0.0.1:1234 上提供 OpenAI 兼容端点,开关下面还会列出支持的端点类型(LM Studio API、OpenAI-compatible、Anthropic-compatible)。这个服务默认是关的,要手动打开——这正是 Cline 报连接错误最常见的原因。

Status: Running 就是绿灯——端点在 127.0.0.1:1234,兼容 OpenAI 格式。在 2:10 处观看
把 Cline 指向本地服务
- 7
在 Cline Settings 里设置 API 提供商
打开 Cline 的 Settings → API Configuration,把 API Provider 设为 LM Studio(或 Ollama)。只要还用本机默认端口,就别勾 Use custom base URL;只有服务换了端口或换到另一台机器时才填。注意这个面板里 Cline 自己的提示:它写着 Cline 使用复杂提示词、搭配 Claude 模型效果最好,能力较弱的模型可能无法按预期工作。

先选提供商;只要没真的搬走服务,base URL 就别动。在 3:00 处观看 - 8
选中服务正在提供的模型
Model 下拉框的内容来自正在运行的服务,所以列出的就是运行时实际持有的模型——这段录屏里是 qwen/qwen3-4b、qwen2.5-coder-7b-instruct、qwen2.5-coder-3b-claude_opus_4.6-distilled、gemma-3-27b-it-abliterated、meta-llama-3-8b-instruct、yi-coder-1.5b,还有一个 embedding 模型。列表里没有你的模型,说明它在 LM Studio 里没加载,或在 Ollama 里没拉取;在这里选中 1.5B 或 embedding 模型,正是很多人得出「本地模型不能用」结论的原因。

服务上报什么,这里就显示什么——列表里的 embedding 模型别去选它。在 3:03 处观看 - 9
看清 Context Window,并开启 Use compact prompt
Cline 继承的是运行时加载时的上下文大小:这一帧显示 Context Window 4096,直接来自 qwen/qwen3-4b 的 4K 加载设置,对代理循环来说远远不够。Cline 的本地模型快速上手最后一步就是启用 Use compact prompt,它的 Ollama 集成文档则把编码下限定在 32K token。打开这个开关会换上一份为 8K 以下窗口准备的 system prompt,代价是失去 MCP 和 Focus Chain 支持——所以先把窗口调大,再拿它当兜底。

4096 就是症结。先去运行时里调大,实在只能在 8K 附近打转,再开着压缩提示词。在 3:15 处观看
跑起来,再修掉报错
- 10
打开自动批准,跑一个小任务
让它做件小而可验证的事——列出这个文件夹里的文件、写个脚本、跑一下。把 auto-approve 设成 YOLO,代理会写文件、给你看 diff、一路不停,不用每一步都点确认;编辑器、Problems 面板和终端都留在视野里,你能看到它到底执行了什么。在你信任所加载的模型之前,先别开自动批准。

一次真实的本地模型任务:文件已经存在,Cline 想改它,YOLO 模式正在替你做批准。在 4:45 处观看 - 11
模型列表里没有?重新加载一次
Cline 的下拉框就是服务端的模型列表,而 LM Studio 只上报当前已加载的模型。所以 Developer → Local Server 页面里的 Loaded Models 可能空空如也,Cline 里也就一个模型都看不到。重新加载一个(LM Studio 里 Ctrl + L 打开选择器),再打开 Cline 的 Model 下拉框。在 Ollama 里,对应的检查是在终端跑 ollama list——Cline 也支持手动输入模型标签。

Loaded Models 就是 Cline 的菜单:没加载,就没得选。在 4:54 处观看 - 12
上下文长度调大,修掉推理打转
窗口太小的时候,模型每一轮都会从头开始推理,代理看起来就像忘了任务。在 LM Studio 里 Eject 模型,然后勾上 Manually choose model load parameters 重新加载,按下 Load Model 之前先把 Context Length 调大——截图里这个对话框停在 2048,同时注明模型最高支持 262144 token。Cline v4.1.21 还加了一层保险:在 llama.cpp、Ollama 或 LM Studio 上,长回复撞到输出 token 上限时,现在会压缩对话并重试一次,而不是直接结束任务。

Context Length 就是那个旋钮,而「supports up to」那行注明了模型还有多少上限空间。在 5:06 处观看 - 13
用一个需要长循环的任务来验证
同一套配置接着做出了一个能跑、带最高分记录的贪吃蛇游戏:一次成型,作者反馈游戏没响应后又改了一版,最后在浏览器里玩得起来。全程本地运行,没有 API Key,也没有订阅。如果重命名能成功、构建却失败,那瓶颈是上下文或工具调用,不是 Cline 的配置。

最终状态:一个由代理做出来的游戏跑在本地,没有 Key,也没有订阅。在 5:44 处观看
Cline + LM Studio 上下文长度:代理为什么会忘事
Cline 每轮都会发一大段 system prompt,加上你的任务、每一次工具返回结果和模型自己的推理。本地运行时加载模型时用的是它自己定的上下文长度——LM Studio 对新下载的 GGUF 默认值很小,录屏里加载对话框是 2048,继承进 Cline 的 Context Window 字段就成了 4096——超出这个长度的内容服务端一律拒绝。报错信息反而少见:模型就是丢了线索,把自己最初的想法又答了一遍。
解法在运行时这边。Eject 模型,用手动参数选项重新加载,把 Context Length 调到内存允许的最高值;Ollama 的 Cline 集成文档把编码下限定在 32K token,Cline 的本地模型页面也指向同一个上下文窗口设置。然后回头看 Cline 的 Context Window 显示多少,实在加不上去时就保持 Use compact prompt 开着。
版本在这里很关键。v4.1.21 之前,一条超长回复耗尽本地服务端上下文,任务就直接结束了;从 v4.1.21 起,Cline 会压缩对话并重试一次,再退回到简洁重试,并保留已经拿到的部分答案。发布说明把原因写得很明白——这些服务端只按剩余上下文来生成,跟你配置的输出预算无关。把加载时的上下文长度调大仍是真正的解法,压缩只是多给你一次机会。
Cline + Ollama 更新后用不了:三个真正的原因
几乎所有反馈都能归到三个原因之一,而且只有第一个算 Cline 的问题。
- 1工具调用格式漂移。Cline 4.1.x 又改了工具语法,未关闭的 issue cline#13008 记录了本地 Ollama 配 Qwen3.6 因此直接报错;Ollama 这边随后补上了对 qwen3.6 和 qwen3-coder 工具调用格式的兼容处理。扩展和运行时都要更新,然后用一个双方模板都认可的模型复测——gpt-oss、qwen3-coder 或 devstral。
- 2连接被拒(Connection refused)。根本没有进程在监听。LM Studio 的本地服务默认关闭,要在 Developer → Local Server 里手动打开;Ollama 的后台服务必须跑在 11434 上。如果你换了端口,就在 Cline 里勾选 Use custom base URL 并填完整地址;如果运行时在另一台机器上,打开 LM Studio 的 Serve on Local Network,并在防火墙里放行该端口。
- 3模型不在列表里。Cline 是向服务端要模型列表的,所以 LM Studio 只返回已加载的模型,Ollama 只返回已拉取的模型。加载或拉取模型后重新打开下拉框——Ollama 的 Cline 文档页也允许手动输入模型标签,这是绕过过期列表最快的办法。
- 4运行时自己的警告值得当真。Cline 的 LM Studio 面板明确写着:Cline 使用复杂提示词、搭配 Claude 模型效果最好、能力较弱的模型可能无法按预期工作。1.5B 的 coder 是补全模型,不是代理模型——没有任何设置能把它变成代理模型。
本地跑 Cline 的运行时与硬件要求
Cline 本身还是那个 VS Code 扩展,跟你接托管提供商时用的是同一个;模型则在你自己安装的运行时后面跑。Cline 的本地模型页面列出三个受支持的运行时——Ollama、LM Studio 和 Atomic Chat——并把整套配置压缩成五行:装一个运行时、启动它的本地服务、在 Cline Settings 里选对应的提供商、选一个本地模型、启用 Use Compact Prompt。
端点与端口:Ollama 在 http://localhost:11434 提供 OpenAI 兼容 API,LM Studio 在 http://127.0.0.1:1234,路径在 /v1 下。两者默认都只绑定 localhost,除非你主动把服务暴露到网络,否则数据不会离开你的机器。
- 116-32GB 内存——跑 7B-14B 的小模型或量化模型,上下文窗口比较有限;纯 CPU 推理能用,但很慢。
- 232-64GB 内存——跑 qwen3-coder:30b-a3b(19GB)或 devstral:24b 这类中等编码模型,还有空间开 32K 以上的窗口。
- 364GB+ 内存或大显存 GPU——更大的模型和更大的上下文窗口一起上;30B 模型配 64K 窗口,既需要内存,也需要足够的显存来卸载。
录屏和文档说的是同一件事:这些模型用 CPU 也能跑,但显存更强的 GPU 性能明显更好,而系统内存总量同时决定你能加载多大的模型和多大的上下文窗口。预算要按窗口来算,不能只算权重。
