Mejor modelo local para Cline: configuración de Ollama y LM Studio
Qué modelos locales son realmente buenos para programar con agentes en Cline, cómo conectar Cline con Ollama o LM Studio y las soluciones para la longitud de contexto, el error «connection refused» y una lista de modelos vacía — 13 pasos verificados con las grabaciones y la documentación oficial.
En corto
- La lista corta de modelos locales para Cline es qwen3-coder:30b (19GB, contexto de 256K, llamadas a herramientas), devstral:24b y gpt-oss:20b. Los tres llevan la insignia tools en la página de modelo de su runtime; un modelo de código sin plantilla de llamadas a herramientas hablará de tu código en vez de editarlo.
- Dos runtimes lo cubren todo: Ollama en http://localhost:11434 y LM Studio en http://127.0.0.1:1234. En Cline Settings → API Configuration elige el API Provider correspondiente y deja Use custom base URL desactivado salvo que hayas cambiado el puerto.
- Casi todos los reportes de «el modelo local no funciona en Cline» son una de tres cosas: el servidor no está corriendo (connection refused), el modelo no está cargado (desplegable vacío) o la ventana de contexto es demasiado pequeña (el agente olvida y reinicia su razonamiento).
- La página de integración de Cline en Ollama pone el mínimo en 32K tokens de contexto para programar, y el quick start de Cline termina con activar Use Compact Prompt. Cline v4.1.21 añadió un reintento de compactación para los modelos locales que se quedan sin espacio, porque llama.cpp, Ollama y LM Studio limitan la generación al contexto que queda.
¿Qué modelos locales son realmente buenos para programar con agentes en Cline?
Cline no es una caja de chat. Envía un gran prompt de sistema con llamadas a herramientas y luego encadena llamadas, diffs de archivos, salida de terminal y seguimientos. Un modelo solo sirve aquí si su plantilla de chat expone las llamadas a herramientas a través de la API del runtime y aguanta una cadena de razonamiento lo bastante larga. Eso filtra el campo rápido: revisa la insignia tools en la página del modelo antes de descargar 19GB.
- 1Hechos para agentes — qwen3-coder:30b tiene 30B totales con 3,3B activos por token, 19GB, una ventana de contexto de 256K y soporte de herramientas; es el programador agéntico más potente que puedes correr en una máquina de 24-32GB. devstral:24b es el modelo de agente de programación de Mistral. gpt-oss:20b es el modelo de pesos abiertos de OpenAI, con llamadas a herramientas, razonamiento y un punto dulce de 16GB.
- 2Usables con el compact prompt activado — qwen3 en sus etiquetas de 4B a 14B y gemma3:12b sí soportan llamadas a herramientas y pueden terminar tareas pequeñas como el script, el renombrado y el juego de esta guía. Queman su ventana rápido, así que sube la longitud de contexto y mantén Use compact prompt activado.
- 3Sáltalos para trabajo de agentes — deepseek-coder-v2 es un modelo de código realmente fuerte, pero no tiene insignia tools en Ollama, así que las llamadas a herramientas de Cline nunca le llegan; lo mismo pasa con los modelos pequeños sin herramientas y con cualquier etiqueta «coder» cuya página no muestre soporte de herramientas. Los benchmarks no predicen si el bucle de herramientas se cierra.
- 4Si lo que buscas es calidad agéntica y no privacidad sin conexión, piénsalo dos veces antes de pagar el impuesto del hardware local: el nivel de modelos gratuitos de Cline ya incluye DeepSeek — DeepSeek V4 Flash aparece ahí con una ventana de contexto de 1M de tokens — así que el mismo bucle de agente corre sin una descarga de 19GB ni una ampliación a 32GB de RAM. Reserva la inferencia local para privacidad, trabajo aislado de la red y aprendizaje, y mira la guía DeepSeek + Cline enlazada abajo para la vía alojada.
- 5Regla práctica de la página local-models de Cline: 16-32GB corre modelos pequeños o cuantizados, 32-64GB modelos de código medianos, 64GB+ compra modelos más grandes y ventanas de contexto mayores. En la práctica, lo que rompe primero un bucle de agente local es la longitud de contexto, no el número de parámetros.
How to Use Cline with LM Studio for 100% Local AI Vibe Coding
Canal:Bootable USBs7:04
Install Qwen 3 Locally in Minutes with Ollama
Canal:Bonverium Studio4:04
Local models — Cline documentation
Documentación oficial:docs.cline.bot
Cline with Ollama — Ollama integration guide
Documentación oficial:docs.ollama.com
Cline v4.1.21 release notes (local model compaction)
Documentación oficial:github.com/cline/cline
Las capturas vienen de dos grabaciones de pantalla: el recorrido de LM Studio + Cline aporta todos los fotogramas de VS Code, Cline Settings y LM Studio, y una grabación aparte de Ollama aporta los del instalador, el selector de modelos y la terminal. Se descartaron los fotogramas con superposiciones del creador, caras o subtítulos incrustados, y un fotograma de longitud de contexto se reextrajo en un instante exacto después de que el avance rápido cayera en la escena equivocada.
Los nombres de producto, las etiquetas de menú y los números de versión se verificaron con docs.cline.bot (Local models), docs.ollama.com/integrations/cline, las páginas de modelos de ollama.com y las notas de la versión cline/cline v4.1.21. Las capturas citan breves fragmentos de las grabaciones a modo de comentario.
Configura Cline con modelos locales en 13 pasos
Instalar Cline y el runtime de Ollama
- 1
Instalar la extensión Cline en VS Code
Abre la vista de Extensiones (Ctrl+Shift+X) y busca Cline, luego instala la extensión publicada por cline.bot. La lista del marketplace está llena de imitaciones — Cline Chinese (Cline 中文版), Cline Max, Cline Pro - CodeAI, Bao Cline — y solo la ficha de cline.bot es la oficial. Cline Desktop y la CLI usan los mismos ajustes de proveedor que se describen abajo.

La ficha oficial es la publicada por cline.bot, no las imitaciones apiladas debajo.Ver en 0:50 - 2
Instalar Ollama con el asistente de configuración
Descarga Ollama para tu sistema y ejecuta el instalador. El asistente de Windows es una sola pantalla de confirmación; macOS y Linux se comportan igual. Al terminar, Ollama queda corriendo como servicio en segundo plano que responde una API compatible con OpenAI en el puerto 11434: con ese servicio, no con la ventana de la app, habla Cline.

Una pantalla, un botón Install: el asistente deja un servicio en segundo plano escuchando en 11434.Ver en 1:00 - 3
Elegir un modelo que pueda llamar herramientas
La app de Ollama tiene un selector Find model…; desde la terminal lo mismo es ollama pull <model>. Para Cline, quédate en las familias con llamadas a herramientas: gpt-oss:20b, qwen3-coder:30b-a3b o devstral:24b. Cada página de modelo de la biblioteca de Ollama muestra insignias de capacidades sobre las etiquetas; si falta la insignia tools, como en deepseek-coder-v2, las llamadas a herramientas de Cline no se atenderán.

El selector de modelos de la app lista gpt-oss, deepseek-r1 y gemma3: la insignia tools de la página de la biblioteca es lo que importa.Ver en 2:40 - 4
Descargarlo y confirmar qué hay en el disco
ollama run qwen3 descarga el manifiesto, verifica el digest y te deja en un prompt. Luego ollama list muestra cada modelo instalado con su tamaño, la forma más rápida de detectar una descarga que nunca terminó. Los tamaños varían muchísimo dentro de una misma familia: la etiqueta más pequeña de qwen3 está muy por debajo de un gigabyte, mientras que la etiqueta coder de 30B pesa 19GB.

Manifiesto, digest y luego un prompt en vivo: Cline solo necesita que los dos primeros hayan funcionado.Ver en 3:20
Cargar un modelo en LM Studio y abrir su servidor
- 5
Descargar el modelo dentro de LM Studio
La pestaña Discover de LM Studio busca en su propio catálogo. Los Staff Picks están etiquetados por aquello en lo que destacan: Qwen3 Coder Next se describe como un MoE de 80B con 3B de parámetros activos diseñado para agentes de programación, excelente en razonamiento de largo alcance y uso complejo de herramientas, y los resultados de la comunidad incluyen builds de DeepSeek-Coder-V2. Lee el tamaño de descarga antes de decidir: el build Q4_K_M que se ve aquí pesa 48,49GB.

Tool Use es aquí una capacidad etiquetada, y el tamaño de descarga también: revisa ambas antes de que empiece la transferencia.Ver en 1:45 - 6
Iniciar el servidor local de LM Studio
Abre la pestaña Developer → Local Server y enciende el servidor; Status: Running significa que otras aplicaciones pueden conectarse. LM Studio anuncia un endpoint compatible con OpenAI en http://127.0.0.1:1234 y lista los endpoints soportados (LM Studio API, OpenAI-compatible, Anthropic-compatible) justo debajo del interruptor. El servidor está apagado hasta que lo enciendas, y esa es la causa más común de un error de conexión en Cline.

Status: Running es la luz verde: el endpoint es compatible con OpenAI en 127.0.0.1:1234.Ver en 2:10
Apuntar Cline al servidor local
- 7
Definir el proveedor de API en Cline Settings
Abre Cline Settings → API Configuration y pon API Provider en LM Studio (u Ollama). Deja Use custom base URL sin marcar mientras estés en los puertos locales por defecto, y rellénalo solo si el servidor se movió a otro puerto u otra máquina. Lee la nota de Cline en este panel: dice que Cline usa prompts complejos, funciona mejor con modelos Claude y que los modelos menos capaces pueden no funcionar como se espera.

Primero el proveedor; la base URL se queda intacta salvo que hayas movido el servidor de verdad.Ver en 3:00 - 8
Seleccionar el modelo que sirve el servidor
El desplegable Model se llena desde el servidor en ejecución, así que lista lo que el runtime tiene realmente: en esta grabación qwen/qwen3-4b, qwen2.5-coder-7b-instruct, qwen2.5-coder-3b-claude_opus_4.6-distilled, gemma-3-27b-it-abliterated, meta-llama-3-8b-instruct, yi-coder-1.5b y un modelo de embeddings. Si tu modelo no aparece en esta lista, no está cargado en LM Studio o no está descargado en Ollama; elegir aquí un modelo de 1.5B o de embeddings es justo como la gente concluye que los modelos locales no funcionan.

Todo lo que reporta el servidor aparece aquí: un modelo de embeddings en la lista es uno que conviene dejar en paz.Ver en 3:03 - 9
Leer la Context Window y activar Use compact prompt
Cline hereda el tamaño de contexto con el que cargó el runtime: este fotograma muestra Context Window 4096, tomado tal cual del ajuste de carga 4K de qwen/qwen3-4b, que es demasiado pequeño para un bucle de agente. El quick start local-models de Cline termina activando Use compact prompt, y su página de integración con Ollama pone el mínimo para programar en 32K tokens. Ese interruptor cambia a un prompt de sistema dimensionado para ventanas de unos 8K o menos, y te cuesta el soporte de MCP y Focus Chain, así que sube primero la ventana y úsalo como respaldo.

4096 es la señal. Súbela en el runtime y luego mantén el compact prompt activado si te quedas cerca de 8K.Ver en 3:15
Ejecutarlo y arreglar lo que falle
- 10
Ejecutar una tarea pequeña con Auto-approve activado
Pide algo pequeño y verificable: lista los archivos de esta carpeta, escribe un script, ejecútalo. Con Auto-approve en YOLO el agente escribe el archivo, te muestra el diff y sigue sin detenerse en cada paso; el editor, el panel Problems y la terminal permanecen visibles para que veas lo que ejecutó de verdad. Deja Auto-approve desactivado hasta que confíes en el modelo que cargaste.

Una tarea real con modelo local: el archivo existe, Cline quiere editarlo y el modo YOLO se encarga de las aprobaciones.Ver en 4:45 - 11
Arreglar «modelo no listado» cargándolo otra vez
El desplegable de Cline es la lista de modelos del servidor, y LM Studio solo anuncia los modelos cargados en ese momento. Por eso la página Developer → Local Server puede mostrar Loaded Models sin nada debajo mientras Cline no muestra ningún modelo. Carga uno de nuevo (Ctrl + L abre el selector en LM Studio) y vuelve a abrir el desplegable Model de Cline. En Ollama la comprobación equivalente es ollama list en una terminal; Cline también acepta una etiqueta de modelo escrita a mano.

Loaded Models es el menú de Cline: nada cargado, nada que seleccionar.Ver en 4:54 - 12
Arreglar el bucle de razonamiento con una longitud de contexto mayor
Cuando la ventana es demasiado pequeña, el modelo reinicia su razonamiento en cada turno y el agente parece olvidar la tarea. Expulsa el modelo en LM Studio y cárgalo otra vez con Manually choose model load parameters activado, y sube Context Length antes de pulsar Load Model: este diálogo estaba en 2048 mientras indicaba que el modelo soporta hasta 262144 tokens. Cline v4.1.21 también añadió una red de seguridad: una respuesta larga en llama.cpp, Ollama o LM Studio que alcanza el límite de tokens de salida ahora compacta la conversación y reintenta una vez en lugar de terminar la tarea.

Context Length es la palanca, y la nota «supports up to» te dice cuánto techo tiene el modelo.Ver en 5:06 - 13
Confirmar con una tarea que exija un bucle largo
La misma configuración construyó después un juego Snake funcional con contador de récord: creado a la primera, revisado una vez tras reportar el autor que el juego no respondía, y jugable en el navegador. Todo corrió en local, sin clave de API ni suscripción. Si un renombrado sale bien pero una compilación falla, el límite está en el contexto o en las llamadas a herramientas, no en la configuración de Cline.

El estado final: un juego creado por el agente y corriendo en local, sin clave ni suscripción.Ver en 5:44
Longitud de contexto de Cline + LM Studio: por qué el agente olvida
Cline envía un gran prompt de sistema más tu tarea, cada resultado de herramienta y el razonamiento del propio modelo. Un runtime local carga el modelo con la longitud de contexto que él elige — el valor por defecto de LM Studio para un GGUF recién descargado es pequeño, la grabación muestra 2048 en el diálogo de carga y 4096 heredados en el campo Context Window de Cline — y el servidor rechaza todo lo que pase de ahí. El fallo rara vez es un mensaje de error: el modelo simplemente pierde el hilo y vuelve a responder su propia primera idea.
La solución está del lado del runtime. Expulsa el modelo, recárgalo con la opción de parámetros manuales y pon Context Length tan alto como te permita la memoria; la página de integración de Cline en Ollama pone el mínimo para programar en 32K tokens, y la página local-models de Cline apunta al mismo ajuste de ventana de contexto. Luego revisa qué muestra Cline en Context Window y mantén Use compact prompt activado cuando no puedas subir el tamaño de carga.
La versión importa aquí. Antes de la v4.1.21, una respuesta larga que agotaba el contexto del servidor local terminaba la tarea; desde la v4.1.21 Cline compacta la conversación y reintenta una vez, luego recurre a su reintento conciso y conserva la respuesta parcial. Las notas de la versión son explícitas sobre la causa: esos servidores limitan la generación al contexto que queda, sea cual sea el presupuesto de salida que hayas configurado. Subir la longitud de contexto cargada sigue siendo la solución real; la compactación solo te compra un segundo intento.
Cline + Ollama deja de funcionar tras una actualización: las tres causas reales
Casi todos los reportes se reducen a una de estas tres causas, y solo la primera es problema de Cline.
- 1Deriva del formato de llamadas a herramientas. Cline 4.1.x volvió a cambiar su sintaxis de herramientas, y el issue abierto cline#13008 documenta Ollama local con Qwen3.6 rompiéndose como consecuencia directa; el trabajo de tolerancia correspondiente llegó al lado de Ollama para los formatos de llamadas de qwen3.6 y qwen3-coder. Actualiza la extensión y el runtime, y vuelve a probar con un modelo cuya plantilla acepten ambos lados: gpt-oss, qwen3-coder o devstral.
- 2Connection refused. No hay nada escuchando. El servidor local de LM Studio está apagado hasta que lo enciendas en Developer → Local Server, y el servicio en segundo plano de Ollama tiene que estar corriendo en 11434. Si cambiaste el puerto, marca Use custom base URL en Cline e introduce la dirección completa; si el runtime está en otra máquina, activa Serve on Local Network en LM Studio y abre el puerto en tu firewall.
- 3Modelo no listado. Cline le pide al servidor su lista de modelos, así que LM Studio devuelve solo los cargados y Ollama solo los descargados. Carga o descarga el modelo y vuelve a abrir el desplegable; la página de Cline en Ollama también permite escribir una etiqueta de modelo a mano, la forma más rápida de saltarse una lista desactualizada.
- 4Vale la pena creerle a la advertencia del propio runtime. El panel de LM Studio de Cline afirma que Cline usa prompts complejos, funciona mejor con modelos Claude y que los modelos menos capaces pueden no funcionar como se espera. Un coder de 1.5B es un modelo de autocompletado, no un modelo de agente: ningún ajuste lo convierte en uno.
Requisitos de runtime y hardware para Cline en local
Cline en sí es la misma extensión de VS Code que usarías con un proveedor alojado; el modelo corre detrás de un runtime que instalas. La página local-models de Cline nombra tres runtimes soportados — Ollama, LM Studio y Atomic Chat — y reduce toda la configuración a cinco líneas: instala un runtime, inicia su servidor local, elige el proveedor correspondiente en Cline Settings, selecciona un modelo local y activa Use Compact Prompt.
Endpoints y puertos: Ollama responde una API compatible con OpenAI en http://localhost:11434 y LM Studio en http://127.0.0.1:1234, bajo /v1. Ambos escuchan en localhost por defecto, así que nada sale de tu máquina salvo que expongas el servidor a la red de forma explícita.
- 116-32GB de RAM — modelos pequeños o cuantizados en el rango de 7B-14B, ventanas de contexto modestas; la inferencia solo con CPU es posible pero lenta.
- 232-64GB de RAM — modelos de código medianos como qwen3-coder:30b-a3b (19GB) o devstral:24b, con margen para una ventana de 32K o mayor.
- 364GB+ de RAM o una GPU grande — modelos más grandes y ventanas de contexto mayores a la vez; un modelo de 30B con ventana de 64K necesita la memoria y suficiente VRAM para descargarlo.
La grabación señala lo mismo que la documentación: puedes correr esto en CPU, pero una GPU más potente da un rendimiento notablemente mejor, y la RAM total del sistema decide tanto el tamaño del modelo como el de la ventana de contexto que puedes cargar. Presupuesta para la ventana, no solo para los pesos.
