Melhor modelo local para o Cline: configuração de Ollama e LM Studio
Quais modelos locais são realmente bons o bastante para programação agêntica no Cline, como apontar o Cline para o Ollama ou o LM Studio e as correções para comprimento de contexto, connection refused e lista de modelos vazia — 13 passos verificados nas gravações e na documentação oficial.
Resumo
- A lista curta de modelos locais para o Cline é qwen3-coder:30b (19GB, contexto de 256K, chamadas de ferramentas), devstral:24b e gpt-oss:20b. Os três têm o selo tools na página de modelo do seu runtime; um modelo de código sem template de chamadas de ferramentas vai conversar sobre o seu código em vez de editá-lo.
- Dois runtimes cobrem tudo: Ollama em http://localhost:11434 e LM Studio em http://127.0.0.1:1234. Em Cline Settings → API Configuration, defina o API Provider correspondente e deixe Use custom base URL desmarcado, a menos que você tenha mudado a porta.
- Quase todo relato de “modelo local não funciona no Cline” é uma de três coisas: o servidor não está rodando (connection refused), o modelo não está carregado (lista suspensa vazia) ou a janela de contexto é pequena demais (o agente esquece e reinicia o raciocínio).
- A página de integração do Cline no Ollama coloca o piso em 32K tokens de contexto para programar, e o quick start do próprio Cline termina com ativar Use Compact Prompt. O Cline v4.1.21 adicionou uma nova tentativa de compactação para modelos locais sem espaço, porque llama.cpp, Ollama e LM Studio limitam a geração ao contexto que sobra.
Quais modelos locais são realmente bons o bastante para programação agêntica no Cline?
O Cline não é uma caixa de chat. Ele envia um grande prompt de sistema de chamadas de ferramentas e depois encadeia chamadas, diffs de arquivos, saída de terminal e continuações. Um modelo só funciona aqui se o template de chat expõe chamadas de ferramentas pela API do runtime e aguenta uma cadeia de raciocínio longa o suficiente. Isso filtra o campo rápido — confira o selo tools na página do modelo antes de baixar 19GB.
- 1Feitos para agentes — o qwen3-coder:30b tem 30B no total com 3,3B ativos por token, 19GB, janela de contexto de 256K e suporte a ferramentas; é o programador agêntico mais forte que você consegue rodar numa máquina de 24-32GB. O devstral:24b é o modelo de agente de programação da Mistral. O gpt-oss:20b é o modelo de pesos abertos da OpenAI, com chamadas de ferramentas, raciocínio e um ponto ideal de 16GB.
- 2Usáveis com o compact prompt ativado — o qwen3 nas tags de 4B a 14B e o gemma3:12b suportam chamadas de ferramentas e conseguem concluir tarefas pequenas como o script, a renomeação e o jogo deste guia. Eles queimam a janela rápido, então aumente o comprimento do contexto e mantenha Use compact prompt ativado.
- 3Pule para trabalho de agente — o deepseek-coder-v2 é um modelo de código genuinamente forte, mas não tem selo tools no Ollama, então as chamadas de ferramentas do Cline nunca chegam até ele; o mesmo vale para modelos pequenos sem ferramentas e para qualquer tag “coder” cuja página não mostre suporte a ferramentas. Benchmarks não preveem se o ciclo de ferramentas fecha.
- 4Se o que você quer é qualidade agêntica em vez de privacidade offline, pense duas vezes antes de pagar o imposto do hardware local: a faixa de modelos gratuitos do Cline já inclui DeepSeek — o DeepSeek V4 Flash aparece lá com uma janela de contexto de 1M de tokens — então o mesmo ciclo de agente roda sem um download de 19GB nem um upgrade para 32GB de RAM. Guarde a inferência local para privacidade, trabalho em rede isolada e aprendizado, e veja o guia DeepSeek + Cline linkado abaixo para o caminho hospedado.
- 5Regra prática da página local-models do Cline: 16-32GB roda modelos pequenos ou quantizados, 32-64GB modelos de código intermediários, 64GB+ compra modelos maiores e janelas de contexto maiores. Na prática, é o comprimento do contexto, e não o número de parâmetros, que quebra um ciclo de agente local primeiro.
How to Use Cline with LM Studio for 100% Local AI Vibe Coding
Canal:Bootable USBs7:04
Install Qwen 3 Locally in Minutes with Ollama
Canal:Bonverium Studio4:04
Local models — Cline documentation
Documentação oficial:docs.cline.bot
Cline with Ollama — Ollama integration guide
Documentação oficial:docs.ollama.com
Cline v4.1.21 release notes (local model compaction)
Documentação oficial:github.com/cline/cline
As capturas vêm de duas gravações de tela: o passo a passo de LM Studio + Cline fornece todos os quadros de VS Code, Cline Settings e LM Studio, e uma gravação separada do Ollama fornece os quadros do instalador, do seletor de modelos e do terminal. Quadros com sobreposições do criador, rostos ou legendas embutidas foram descartados, e um quadro de comprimento de contexto foi reextraído num instante exato depois que o avanço rápido caiu na cena errada.
Nomes de produtos, rótulos de menu e números de versão foram conferidos em docs.cline.bot (Local models), docs.ollama.com/integrations/cline, nas páginas de modelo do ollama.com e nas notas de versão do cline/cline v4.1.21. As capturas citam breves trechos das gravações a título de comentário.
Configure o Cline com modelos locais em 13 passos
Instalar o Cline e o runtime do Ollama
- 1
Instalar a extensão Cline no VS Code
Abra a visão de Extensões (Ctrl+Shift+X) e procure Cline, depois instale a extensão publicada pela cline.bot. A lista do marketplace está cheia de sósias — Cline Chinese (Cline 中文版), Cline Max, Cline Pro - CodeAI, Bao Cline — e só a ficha da cline.bot é a oficial. O Cline Desktop e a CLI usam as mesmas configurações de provedor descritas abaixo.

A ficha oficial é a publicada pela cline.bot, não os sósias empilhados embaixo dela.Assistir em 0:50 - 2
Instalar o Ollama com o assistente de configuração
Baixe o Ollama para o seu sistema e execute o instalador. O assistente do Windows é uma única tela de confirmação; macOS e Linux se comportam do mesmo jeito. Ao terminar, o Ollama fica rodando como serviço em segundo plano que responde a uma API compatível com a OpenAI na porta 11434 — é com esse serviço, e não com a janela do app, que o Cline conversa.

Uma tela, um botão Install — o assistente deixa um serviço em segundo plano escutando na 11434.Assistir em 1:00 - 3
Escolher um modelo que saiba chamar ferramentas
O app do Ollama tem um seletor Find model…; no terminal, o equivalente é ollama pull <model>. Para o Cline, fique nas famílias com chamadas de ferramentas — gpt-oss:20b, qwen3-coder:30b-a3b ou devstral:24b. Toda página de modelo da biblioteca do Ollama mostra selos de capacidade acima das tags; se o selo tools faltar, como acontece com o deepseek-coder-v2, as chamadas de ferramentas do Cline não serão atendidas.

O seletor de modelos do app lista gpt-oss, deepseek-r1 e gemma3 — o que importa é o selo tools na página da biblioteca.Assistir em 2:40 - 4
Baixar e confirmar o que está no disco
ollama run qwen3 baixa o manifesto, verifica o digest e coloca você num prompt. Depois, ollama list mostra cada modelo instalado com o tamanho, o jeito mais rápido de pegar um download que nunca terminou. Os tamanhos variam demais dentro de uma mesma família: a menor tag do qwen3 fica bem abaixo de um gigabyte, enquanto a tag coder de 30B pesa 19GB.

Manifesto, digest e então um prompt ao vivo — o Cline só precisa que os dois primeiros tenham dado certo.Assistir em 3:20
Carregar um modelo no LM Studio e abrir o servidor
- 5
Baixar o modelo dentro do LM Studio
A aba Discover do LM Studio pesquisa no próprio catálogo. Os Staff Picks são rotulados pelo que fazem bem — o Qwen3 Coder Next é descrito como um MoE de 80B com 3B de parâmetros ativos feito para agentes de programação, excelente em raciocínio de longo alcance e uso complexo de ferramentas, e os resultados da comunidade incluem builds do DeepSeek-Coder-V2. Leia o tamanho do download antes de decidir: o build Q4_K_M mostrado aqui tem 48,49GB.

Tool Use é uma capacidade rotulada aqui, e o tamanho do download também — confira os dois antes de a transferência começar.Assistir em 1:45 - 6
Iniciar o servidor local do LM Studio
Abra a aba Developer → Local Server e ligue o servidor; Status: Running significa que outros aplicativos podem se conectar. O LM Studio anuncia um endpoint compatível com a OpenAI em http://127.0.0.1:1234 e lista os endpoints suportados (LM Studio API, OpenAI-compatible, Anthropic-compatible) logo abaixo do botão. O servidor fica desligado até você ligá-lo, e essa é a causa mais comum de erro de conexão no Cline.

Status: Running é o sinal verde — o endpoint é compatível com a OpenAI em 127.0.0.1:1234.Assistir em 2:10
Apontar o Cline para o servidor local
- 7
Definir o provedor de API no Cline Settings
Abra Cline Settings → API Configuration e defina API Provider como LM Studio (ou Ollama). Deixe Use custom base URL desmarcado enquanto estiver nas portas locais padrão, e só preencha se o servidor mudou de porta ou de máquina. Leia a nota do próprio Cline neste painel: ela diz que o Cline usa prompts complexos, funciona melhor com modelos Claude e que modelos menos capazes podem não funcionar como esperado.

Primeiro o provedor; a base URL fica intocada a menos que você tenha mesmo movido o servidor.Assistir em 3:00 - 8
Selecionar o modelo que o servidor está servindo
A lista suspensa Model é preenchida pelo servidor em execução, então ela lista o que o runtime está realmente segurando — nesta gravação, qwen/qwen3-4b, qwen2.5-coder-7b-instruct, qwen2.5-coder-3b-claude_opus_4.6-distilled, gemma-3-27b-it-abliterated, meta-llama-3-8b-instruct, yi-coder-1.5b e um modelo de embedding. Se o seu modelo não está nessa lista, ele não está carregado no LM Studio nem baixado no Ollama; escolher aqui um modelo de 1.5B ou de embedding é exatamente como as pessoas concluem que modelos locais não funcionam.

Tudo o que o servidor informa aparece aqui — um modelo de embedding na lista é um para deixar em paz.Assistir em 3:03 - 9
Ler a Context Window e ativar Use compact prompt
O Cline herda o tamanho de contexto com que o runtime carregou: este quadro mostra Context Window 4096, tirado direto da configuração de carga 4K do qwen/qwen3-4b, pequeno demais para um ciclo de agente. O quick start local-models do Cline termina ativando Use compact prompt, e a página de integração dele com o Ollama coloca o piso para programar em 32K tokens. Esse botão troca por um prompt de sistema dimensionado para janelas de cerca de 8K ou menos, e custa o suporte a MCP e Focus Chain — então aumente a janela primeiro e use-o como reserva.

4096 é o sinal. Aumente no runtime e depois mantenha o compact prompt ativado se você ficar preso perto de 8K.Assistir em 3:15
Rodar e depois corrigir o que quebrar
- 10
Rodar uma tarefa pequena com o Auto-approve ligado
Peça algo pequeno e verificável — listar os arquivos desta pasta, escrever um script, executá-lo. Com o Auto-approve em YOLO, o agente escreve o arquivo, mostra o diff e continua sem parar em cada passo; o editor, o painel Problems e o terminal ficam visíveis para você ver o que ele realmente executou. Deixe o Auto-approve desligado até confiar no modelo que carregou.

Uma tarefa real com modelo local: o arquivo existe, o Cline quer editá-lo e o modo YOLO está fazendo as aprovações.Assistir em 4:45 - 11
Corrigir “modelo não listado” carregando-o de novo
A lista suspensa do Cline é a lista de modelos do servidor, e o LM Studio só anuncia os modelos carregados no momento. É por isso que a página Developer → Local Server pode mostrar Loaded Models sem nada embaixo enquanto o Cline não mostra modelo nenhum. Carregue um de novo (Ctrl + L abre o seletor no LM Studio) e reabra a lista Model do Cline. No Ollama, a verificação equivalente é ollama list num terminal — o Cline também aceita uma tag de modelo digitada à mão.

Loaded Models é o menu do Cline: nada carregado, nada para selecionar.Assistir em 4:54 - 12
Corrigir o ciclo de raciocínio com um comprimento de contexto maior
Quando a janela é pequena demais, o modelo reinicia o raciocínio a cada turno e o agente parece esquecer a tarefa. Ejete o modelo no LM Studio e carregue-o de novo com Manually choose model load parameters ativado, e aumente Context Length antes de clicar em Load Model — este diálogo estava em 2048 enquanto indicava que o modelo suporta até 262144 tokens. O Cline v4.1.21 também adicionou uma rede de segurança: uma resposta longa no llama.cpp, Ollama ou LM Studio que atinge o limite de tokens de saída agora compacta a conversa e tenta uma vez de novo, em vez de encerrar a tarefa.

Context Length é a alavanca, e a nota “supports up to” diz quanto teto o modelo tem.Assistir em 5:06 - 13
Confirmar com uma tarefa que exige um ciclo longo
A mesma configuração construiu depois um jogo Snake funcional com contador de recorde: criado de primeira, revisado uma vez após o autor relatar que o jogo não respondia, e jogável no navegador. Tudo rodou localmente, sem chave de API e sem assinatura. Se uma renomeação dá certo mas um build falha, o limite é o contexto ou as chamadas de ferramentas — não a configuração do Cline.

O estado final: um jogo criado pelo agente rodando localmente, sem chave e sem assinatura.Assistir em 5:44
Comprimento de contexto do Cline + LM Studio: por que o agente esquece
O Cline envia um grande prompt de sistema mais a sua tarefa, cada resultado de ferramenta e o próprio raciocínio do modelo. Um runtime local carrega o modelo com o comprimento de contexto que ele escolhe — o padrão do LM Studio para um GGUF recém-baixado é pequeno, a gravação mostra 2048 no diálogo de carga e 4096 herdados no campo Context Window do Cline — e o servidor recusa tudo além disso. A falha raramente é uma mensagem de erro: o modelo simplesmente perde o fio e responde de novo ao seu próprio primeiro pensamento.
A correção fica do lado do runtime. Ejete o modelo, recarregue-o com a opção de parâmetros manuais e defina Context Length o mais alto que a memória permitir; a página de integração do Cline no Ollama coloca o piso para programar em 32K tokens, e a página local-models do Cline aponta para a mesma configuração de janela de contexto. Depois confira o que o Cline mostra em Context Window e mantenha Use compact prompt ativado quando não conseguir aumentar o tamanho de carga.
A versão importa aqui. Antes da v4.1.21, uma resposta longa que esgotava o contexto do servidor local encerrava a tarefa; desde a v4.1.21 o Cline compacta a conversa e tenta uma vez de novo, depois recorre à tentativa concisa e mantém a resposta parcial. As notas de versão são explícitas sobre a causa — esses servidores limitam a geração ao contexto que sobra, independentemente do orçamento de saída que você configurou. Aumentar o comprimento de contexto carregado continua sendo a correção real; a compactação só compra uma segunda tentativa.
Cline + Ollama parou de funcionar depois de uma atualização: as três causas reais
Quase todo relato se resume a uma dessas três causas, e só a primeira é problema do Cline.
- 1Desvio no formato de chamadas de ferramentas. O Cline 4.1.x mudou a sintaxe de ferramentas outra vez, e a issue aberta cline#13008 documenta o Ollama local com Qwen3.6 quebrando como consequência direta; o trabalho de tolerância correspondente chegou ao lado do Ollama para os formatos de chamadas do qwen3.6 e do qwen3-coder. Atualize a extensão e o runtime e teste de novo com um modelo cujo template os dois lados aceitem — gpt-oss, qwen3-coder ou devstral.
- 2Connection refused. Não há nada escutando. O servidor local do LM Studio fica desligado até você ativá-lo em Developer → Local Server, e o serviço em segundo plano do Ollama precisa estar rodando na 11434. Se você mudou a porta, marque Use custom base URL no Cline e informe o endereço completo; se o runtime está em outra máquina, ligue o Serve on Local Network do LM Studio e abra a porta no firewall.
- 3Modelo não listado. O Cline pede ao servidor a lista de modelos, então o LM Studio devolve só os carregados e o Ollama só os baixados. Carregue ou baixe o modelo e reabra a lista suspensa — a página do Cline no Ollama também permite digitar uma tag de modelo à mão, o jeito mais rápido de passar por uma lista desatualizada.
- 4Vale a pena acreditar no aviso do próprio runtime. O painel de LM Studio do Cline afirma que o Cline usa prompts complexos, funciona melhor com modelos Claude e que modelos menos capazes podem não funcionar como esperado. Um coder de 1.5B é um modelo de completude, não um modelo de agente — nenhuma configuração o transforma em um.
Requisitos de runtime e hardware para o Cline local
O Cline em si é a mesma extensão de VS Code que você usaria com um provedor hospedado; o modelo roda atrás de um runtime que você instala. A página local-models do Cline nomeia três runtimes suportados — Ollama, LM Studio e Atomic Chat — e resume toda a configuração em cinco linhas: instale um runtime, inicie o servidor local dele, escolha o provedor correspondente no Cline Settings, selecione um modelo local e ative Use Compact Prompt.
Endpoints e portas: o Ollama responde a uma API compatível com a OpenAI em http://localhost:11434 e o LM Studio em http://127.0.0.1:1234, sob /v1. Ambos escutam em localhost por padrão, então nada sai da sua máquina a menos que você exponha o servidor à rede de propósito.
- 116-32GB de RAM — modelos pequenos ou quantizados na faixa de 7B-14B, janelas de contexto modestas; inferência só na CPU é possível, mas lenta.
- 232-64GB de RAM — modelos de código intermediários como o qwen3-coder:30b-a3b (19GB) ou o devstral:24b, com espaço para uma janela de 32K ou maior.
- 364GB+ de RAM ou uma GPU grande — modelos maiores e janelas de contexto maiores juntos; um modelo de 30B numa janela de 64K precisa da memória e de VRAM suficiente para descarregá-lo.
A gravação aponta o mesmo que a documentação: dá para rodar isso numa CPU, mas uma GPU mais forte dá um desempenho bem melhor, e a RAM total do sistema decide tanto o tamanho do modelo quanto o da janela de contexto que você consegue carregar. Orce pela janela, não só pelos pesos.
