Cline v4.1.21 · Ollama + LM Studio

Melhor modelo local para o Cline: configuração de Ollama e LM Studio

Quais modelos locais são realmente bons o bastante para programação agêntica no Cline, como apontar o Cline para o Ollama ou o LM Studio e as correções para comprimento de contexto, connection refused e lista de modelos vazia — 13 passos verificados nas gravações e na documentação oficial.

Resumo

  • A lista curta de modelos locais para o Cline é qwen3-coder:30b (19GB, contexto de 256K, chamadas de ferramentas), devstral:24b e gpt-oss:20b. Os três têm o selo tools na página de modelo do seu runtime; um modelo de código sem template de chamadas de ferramentas vai conversar sobre o seu código em vez de editá-lo.
  • Dois runtimes cobrem tudo: Ollama em http://localhost:11434 e LM Studio em http://127.0.0.1:1234. Em Cline Settings → API Configuration, defina o API Provider correspondente e deixe Use custom base URL desmarcado, a menos que você tenha mudado a porta.
  • Quase todo relato de “modelo local não funciona no Cline” é uma de três coisas: o servidor não está rodando (connection refused), o modelo não está carregado (lista suspensa vazia) ou a janela de contexto é pequena demais (o agente esquece e reinicia o raciocínio).
  • A página de integração do Cline no Ollama coloca o piso em 32K tokens de contexto para programar, e o quick start do próprio Cline termina com ativar Use Compact Prompt. O Cline v4.1.21 adicionou uma nova tentativa de compactação para modelos locais sem espaço, porque llama.cpp, Ollama e LM Studio limitam a geração ao contexto que sobra.

Quais modelos locais são realmente bons o bastante para programação agêntica no Cline?

O Cline não é uma caixa de chat. Ele envia um grande prompt de sistema de chamadas de ferramentas e depois encadeia chamadas, diffs de arquivos, saída de terminal e continuações. Um modelo só funciona aqui se o template de chat expõe chamadas de ferramentas pela API do runtime e aguenta uma cadeia de raciocínio longa o suficiente. Isso filtra o campo rápido — confira o selo tools na página do modelo antes de baixar 19GB.

  • 1Feitos para agentes — o qwen3-coder:30b tem 30B no total com 3,3B ativos por token, 19GB, janela de contexto de 256K e suporte a ferramentas; é o programador agêntico mais forte que você consegue rodar numa máquina de 24-32GB. O devstral:24b é o modelo de agente de programação da Mistral. O gpt-oss:20b é o modelo de pesos abertos da OpenAI, com chamadas de ferramentas, raciocínio e um ponto ideal de 16GB.
  • 2Usáveis com o compact prompt ativado — o qwen3 nas tags de 4B a 14B e o gemma3:12b suportam chamadas de ferramentas e conseguem concluir tarefas pequenas como o script, a renomeação e o jogo deste guia. Eles queimam a janela rápido, então aumente o comprimento do contexto e mantenha Use compact prompt ativado.
  • 3Pule para trabalho de agente — o deepseek-coder-v2 é um modelo de código genuinamente forte, mas não tem selo tools no Ollama, então as chamadas de ferramentas do Cline nunca chegam até ele; o mesmo vale para modelos pequenos sem ferramentas e para qualquer tag “coder” cuja página não mostre suporte a ferramentas. Benchmarks não preveem se o ciclo de ferramentas fecha.
  • 4Se o que você quer é qualidade agêntica em vez de privacidade offline, pense duas vezes antes de pagar o imposto do hardware local: a faixa de modelos gratuitos do Cline já inclui DeepSeek — o DeepSeek V4 Flash aparece lá com uma janela de contexto de 1M de tokens — então o mesmo ciclo de agente roda sem um download de 19GB nem um upgrade para 32GB de RAM. Guarde a inferência local para privacidade, trabalho em rede isolada e aprendizado, e veja o guia DeepSeek + Cline linkado abaixo para o caminho hospedado.
  • 5Regra prática da página local-models do Cline: 16-32GB roda modelos pequenos ou quantizados, 32-64GB modelos de código intermediários, 64GB+ compra modelos maiores e janelas de contexto maiores. Na prática, é o comprimento do contexto, e não o número de parâmetros, que quebra um ciclo de agente local primeiro.

How to Use Cline with LM Studio for 100% Local AI Vibe Coding

Canal:Bootable USBs7:04

Abrir

Install Qwen 3 Locally in Minutes with Ollama

Canal:Bonverium Studio4:04

Abrir

Local models — Cline documentation

Documentação oficial:docs.cline.bot

Abrir

Cline with Ollama — Ollama integration guide

Documentação oficial:docs.ollama.com

Abrir

Cline v4.1.21 release notes (local model compaction)

Documentação oficial:github.com/cline/cline

Abrir

As capturas vêm de duas gravações de tela: o passo a passo de LM Studio + Cline fornece todos os quadros de VS Code, Cline Settings e LM Studio, e uma gravação separada do Ollama fornece os quadros do instalador, do seletor de modelos e do terminal. Quadros com sobreposições do criador, rostos ou legendas embutidas foram descartados, e um quadro de comprimento de contexto foi reextraído num instante exato depois que o avanço rápido caiu na cena errada.

Nomes de produtos, rótulos de menu e números de versão foram conferidos em docs.cline.bot (Local models), docs.ollama.com/integrations/cline, nas páginas de modelo do ollama.com e nas notas de versão do cline/cline v4.1.21. As capturas citam breves trechos das gravações a título de comentário.

Configure o Cline com modelos locais em 13 passos

Instalar o Cline e o runtime do Ollama

  1. 1

    Instalar a extensão Cline no VS Code

    Abra a visão de Extensões (Ctrl+Shift+X) e procure Cline, depois instale a extensão publicada pela cline.bot. A lista do marketplace está cheia de sósias — Cline Chinese (Cline 中文版), Cline Max, Cline Pro - CodeAI, Bao Cline — e só a ficha da cline.bot é a oficial. O Cline Desktop e a CLI usam as mesmas configurações de provedor descritas abaixo.

    Cline extension installing in the VS Code marketplace search for cline, with the official cline.bot listing above Cline Chinese, Cline Max and Bao Cline look-alikes
    A ficha oficial é a publicada pela cline.bot, não os sósias empilhados embaixo dela.Assistir em 0:50
  2. 2

    Instalar o Ollama com o assistente de configuração

    Baixe o Ollama para o seu sistema e execute o instalador. O assistente do Windows é uma única tela de confirmação; macOS e Linux se comportam do mesmo jeito. Ao terminar, o Ollama fica rodando como serviço em segundo plano que responde a uma API compatível com a OpenAI na porta 11434 — é com esse serviço, e não com a janela do app, que o Cline conversa.

    Ollama version 0.11.0 setup wizard on Windows telling you to click Install to get up and running with your own large language models
    Uma tela, um botão Install — o assistente deixa um serviço em segundo plano escutando na 11434.Assistir em 1:00
  3. 3

    Escolher um modelo que saiba chamar ferramentas

    O app do Ollama tem um seletor Find model…; no terminal, o equivalente é ollama pull <model>. Para o Cline, fique nas famílias com chamadas de ferramentas — gpt-oss:20b, qwen3-coder:30b-a3b ou devstral:24b. Toda página de modelo da biblioteca do Ollama mostra selos de capacidade acima das tags; se o selo tools faltar, como acontece com o deepseek-coder-v2, as chamadas de ferramentas do Cline não serão atendidas.

    Ollama desktop app Find model picker listing gpt-oss 120b, gpt-oss 20b, deepseek-r1 8b and gemma3 tags while the model chip already reads gpt-oss 20b
    O seletor de modelos do app lista gpt-oss, deepseek-r1 e gemma3 — o que importa é o selo tools na página da biblioteca.Assistir em 2:40
  4. 4

    Baixar e confirmar o que está no disco

    ollama run qwen3 baixa o manifesto, verifica o digest e coloca você num prompt. Depois, ollama list mostra cada modelo instalado com o tamanho, o jeito mais rápido de pegar um download que nunca terminou. Os tamanhos variam demais dentro de uma mesma família: a menor tag do qwen3 fica bem abaixo de um gigabyte, enquanto a tag coder de 30B pesa 19GB.

    Windows Command Prompt running ollama run qwen3 with pulling manifest and verifying sha256 digest at 100 percent before dropping into a live qwen3 4b prompt
    Manifesto, digest e então um prompt ao vivo — o Cline só precisa que os dois primeiros tenham dado certo.Assistir em 3:20

Carregar um modelo no LM Studio e abrir o servidor

  1. 5

    Baixar o modelo dentro do LM Studio

    A aba Discover do LM Studio pesquisa no próprio catálogo. Os Staff Picks são rotulados pelo que fazem bem — o Qwen3 Coder Next é descrito como um MoE de 80B com 3B de parâmetros ativos feito para agentes de programação, excelente em raciocínio de longo alcance e uso complexo de ferramentas, e os resultados da comunidade incluem builds do DeepSeek-Coder-V2. Leia o tamanho do download antes de decidir: o build Q4_K_M mostrado aqui tem 48,49GB.

    LM Studio Discover search for coder showing staff picks Qwen3 Coder Next and Qwen3 Coder 30B beside community DeepSeek-Coder-V2 GGUF builds and a 48.49 GB download button
    Tool Use é uma capacidade rotulada aqui, e o tamanho do download também — confira os dois antes de a transferência começar.Assistir em 1:45
  2. 6

    Iniciar o servidor local do LM Studio

    Abra a aba Developer → Local Server e ligue o servidor; Status: Running significa que outros aplicativos podem se conectar. O LM Studio anuncia um endpoint compatível com a OpenAI em http://127.0.0.1:1234 e lista os endpoints suportados (LM Studio API, OpenAI-compatible, Anthropic-compatible) logo abaixo do botão. O servidor fica desligado até você ligá-lo, e essa é a causa mais comum de erro de conexão no Cline.

    LM Studio 0.4.2 Developer tab Local Server page with the Status Running toggle switched on above an empty Loaded Models panel and the OpenAI-compatible supported endpoints
    Status: Running é o sinal verde — o endpoint é compatível com a OpenAI em 127.0.0.1:1234.Assistir em 2:10

Apontar o Cline para o servidor local

  1. 7

    Definir o provedor de API no Cline Settings

    Abra Cline Settings → API Configuration e defina API Provider como LM Studio (ou Ollama). Deixe Use custom base URL desmarcado enquanto estiver nas portas locais padrão, e só preencha se o servidor mudou de porta ou de máquina. Leia a nota do próprio Cline neste painel: ela diz que o Cline usa prompts complexos, funciona melhor com modelos Claude e que modelos menos capazes podem não funcionar como esperado.

    Cline Settings API Configuration panel with API Provider set to LM Studio, Use custom base URL unchecked, an empty Model field and Context Window at zero
    Primeiro o provedor; a base URL fica intocada a menos que você tenha mesmo movido o servidor.Assistir em 3:00
  2. 8

    Selecionar o modelo que o servidor está servindo

    A lista suspensa Model é preenchida pelo servidor em execução, então ela lista o que o runtime está realmente segurando — nesta gravação, qwen/qwen3-4b, qwen2.5-coder-7b-instruct, qwen2.5-coder-3b-claude_opus_4.6-distilled, gemma-3-27b-it-abliterated, meta-llama-3-8b-instruct, yi-coder-1.5b e um modelo de embedding. Se o seu modelo não está nessa lista, ele não está carregado no LM Studio nem baixado no Ollama; escolher aqui um modelo de 1.5B ou de embedding é exatamente como as pessoas concluem que modelos locais não funcionam.

    Cline Settings Model dropdown open over API Configuration listing qwen/qwen3-4b, qwen2.5-coder-7b-instruct, gemma-3-27b-it-abliterated and yi-coder-1.5b served by LM Studio
    Tudo o que o servidor informa aparece aqui — um modelo de embedding na lista é um para deixar em paz.Assistir em 3:03
  3. 9

    Ler a Context Window e ativar Use compact prompt

    O Cline herda o tamanho de contexto com que o runtime carregou: este quadro mostra Context Window 4096, tirado direto da configuração de carga 4K do qwen/qwen3-4b, pequeno demais para um ciclo de agente. O quick start local-models do Cline termina ativando Use compact prompt, e a página de integração dele com o Ollama coloca o piso para programar em 32K tokens. Esse botão troca por um prompt de sistema dimensionado para janelas de cerca de 8K ou menos, e custa o suporte a MCP e Focus Chain — então aumente a janela primeiro e use-o como reserva.

    Cline Settings showing Context Window inherited as 4096 for qwen/qwen3-4b beside the unchecked Use compact prompt toggle and its Does not support MCP warning
    4096 é o sinal. Aumente no runtime e depois mantenha o compact prompt ativado se você ficar preso perto de 8K.Assistir em 3:15

Rodar e depois corrigir o que quebrar

  1. 10

    Rodar uma tarefa pequena com o Auto-approve ligado

    Peça algo pequeno e verificável — listar os arquivos desta pasta, escrever um script, executá-lo. Com o Auto-approve em YOLO, o agente escreve o arquivo, mostra o diff e continua sem parar em cada passo; o editor, o painel Problems e o terminal ficam visíveis para você ver o que ele realmente executou. Deixe o Auto-approve desligado até confiar no modelo que carregou.

    VS Code with Cline editing list_files.py in a red and green diff beside its own reasoning, a 5.0k token count and Auto-approve set to YOLO
    Uma tarefa real com modelo local: o arquivo existe, o Cline quer editá-lo e o modo YOLO está fazendo as aprovações.Assistir em 4:45
  2. 11

    Corrigir “modelo não listado” carregando-o de novo

    A lista suspensa do Cline é a lista de modelos do servidor, e o LM Studio só anuncia os modelos carregados no momento. É por isso que a página Developer → Local Server pode mostrar Loaded Models sem nada embaixo enquanto o Cline não mostra modelo nenhum. Carregue um de novo (Ctrl + L abre o seletor no LM Studio) e reabra a lista Model do Cline. No Ollama, a verificação equivalente é ollama list num terminal — o Cline também aceita uma tag de modelo digitada à mão.

    LM Studio Developer tab Local Server page with Status Running and an empty Loaded Models panel prompting Ctrl plus L to load a model that Cline can then select
    Loaded Models é o menu do Cline: nada carregado, nada para selecionar.Assistir em 4:54
  3. 12

    Corrigir o ciclo de raciocínio com um comprimento de contexto maior

    Quando a janela é pequena demais, o modelo reinicia o raciocínio a cada turno e o agente parece esquecer a tarefa. Ejete o modelo no LM Studio e carregue-o de novo com Manually choose model load parameters ativado, e aumente Context Length antes de clicar em Load Model — este diálogo estava em 2048 enquanto indicava que o modelo suporta até 262144 tokens. O Cline v4.1.21 também adicionou uma rede de segurança: uma resposta longa no llama.cpp, Ollama ou LM Studio que atinge o limite de tokens de saída agora compacta a conversa e tenta uma vez de novo, em vez de encerrar a tarefa.

    LM Studio 0.4.8 load model dialog for Qwen3.5 9B with Context Length at 2048, the note that the model supports up to 262144 tokens and the Load Model button
    Context Length é a alavanca, e a nota “supports up to” diz quanto teto o modelo tem.Assistir em 5:06
  4. 13

    Confirmar com uma tarefa que exige um ciclo longo

    A mesma configuração construiu depois um jogo Snake funcional com contador de recorde: criado de primeira, revisado uma vez após o autor relatar que o jogo não respondia, e jogável no navegador. Tudo rodou localmente, sem chave de API e sem assinatura. Se uma renomeação dá certo mas um build falha, o limite é o contexto ou as chamadas de ferramentas — não a configuração do Cline.

    Snake Game page running in the browser with Score 10 and High Score 210, the grid and a snake built end to end by Cline on a local LM Studio model
    O estado final: um jogo criado pelo agente rodando localmente, sem chave e sem assinatura.Assistir em 5:44

Comprimento de contexto do Cline + LM Studio: por que o agente esquece

O Cline envia um grande prompt de sistema mais a sua tarefa, cada resultado de ferramenta e o próprio raciocínio do modelo. Um runtime local carrega o modelo com o comprimento de contexto que ele escolhe — o padrão do LM Studio para um GGUF recém-baixado é pequeno, a gravação mostra 2048 no diálogo de carga e 4096 herdados no campo Context Window do Cline — e o servidor recusa tudo além disso. A falha raramente é uma mensagem de erro: o modelo simplesmente perde o fio e responde de novo ao seu próprio primeiro pensamento.

A correção fica do lado do runtime. Ejete o modelo, recarregue-o com a opção de parâmetros manuais e defina Context Length o mais alto que a memória permitir; a página de integração do Cline no Ollama coloca o piso para programar em 32K tokens, e a página local-models do Cline aponta para a mesma configuração de janela de contexto. Depois confira o que o Cline mostra em Context Window e mantenha Use compact prompt ativado quando não conseguir aumentar o tamanho de carga.

A versão importa aqui. Antes da v4.1.21, uma resposta longa que esgotava o contexto do servidor local encerrava a tarefa; desde a v4.1.21 o Cline compacta a conversa e tenta uma vez de novo, depois recorre à tentativa concisa e mantém a resposta parcial. As notas de versão são explícitas sobre a causa — esses servidores limitam a geração ao contexto que sobra, independentemente do orçamento de saída que você configurou. Aumentar o comprimento de contexto carregado continua sendo a correção real; a compactação só compra uma segunda tentativa.

Cline + Ollama parou de funcionar depois de uma atualização: as três causas reais

Quase todo relato se resume a uma dessas três causas, e só a primeira é problema do Cline.

  1. 1Desvio no formato de chamadas de ferramentas. O Cline 4.1.x mudou a sintaxe de ferramentas outra vez, e a issue aberta cline#13008 documenta o Ollama local com Qwen3.6 quebrando como consequência direta; o trabalho de tolerância correspondente chegou ao lado do Ollama para os formatos de chamadas do qwen3.6 e do qwen3-coder. Atualize a extensão e o runtime e teste de novo com um modelo cujo template os dois lados aceitem — gpt-oss, qwen3-coder ou devstral.
  2. 2Connection refused. Não há nada escutando. O servidor local do LM Studio fica desligado até você ativá-lo em Developer → Local Server, e o serviço em segundo plano do Ollama precisa estar rodando na 11434. Se você mudou a porta, marque Use custom base URL no Cline e informe o endereço completo; se o runtime está em outra máquina, ligue o Serve on Local Network do LM Studio e abra a porta no firewall.
  3. 3Modelo não listado. O Cline pede ao servidor a lista de modelos, então o LM Studio devolve só os carregados e o Ollama só os baixados. Carregue ou baixe o modelo e reabra a lista suspensa — a página do Cline no Ollama também permite digitar uma tag de modelo à mão, o jeito mais rápido de passar por uma lista desatualizada.
  4. 4Vale a pena acreditar no aviso do próprio runtime. O painel de LM Studio do Cline afirma que o Cline usa prompts complexos, funciona melhor com modelos Claude e que modelos menos capazes podem não funcionar como esperado. Um coder de 1.5B é um modelo de completude, não um modelo de agente — nenhuma configuração o transforma em um.

Requisitos de runtime e hardware para o Cline local

O Cline em si é a mesma extensão de VS Code que você usaria com um provedor hospedado; o modelo roda atrás de um runtime que você instala. A página local-models do Cline nomeia três runtimes suportados — Ollama, LM Studio e Atomic Chat — e resume toda a configuração em cinco linhas: instale um runtime, inicie o servidor local dele, escolha o provedor correspondente no Cline Settings, selecione um modelo local e ative Use Compact Prompt.

Endpoints e portas: o Ollama responde a uma API compatível com a OpenAI em http://localhost:11434 e o LM Studio em http://127.0.0.1:1234, sob /v1. Ambos escutam em localhost por padrão, então nada sai da sua máquina a menos que você exponha o servidor à rede de propósito.

  • 116-32GB de RAM — modelos pequenos ou quantizados na faixa de 7B-14B, janelas de contexto modestas; inferência só na CPU é possível, mas lenta.
  • 232-64GB de RAM — modelos de código intermediários como o qwen3-coder:30b-a3b (19GB) ou o devstral:24b, com espaço para uma janela de 32K ou maior.
  • 364GB+ de RAM ou uma GPU grande — modelos maiores e janelas de contexto maiores juntos; um modelo de 30B numa janela de 64K precisa da memória e de VRAM suficiente para descarregá-lo.

A gravação aponta o mesmo que a documentação: dá para rodar isso numa CPU, mas uma GPU mais forte dá um desempenho bem melhor, e a RAM total do sistema decide tanto o tamanho do modelo quanto o da janela de contexto que você consegue carregar. Orce pela janela, não só pelos pesos.

FAQ de modelos locais no Cline

Continue explorando