Cline v4.1.21 · Ollama + LM Studio

Лучшая локальная модель для Cline: настройка Ollama и LM Studio

Какие локальные модели действительно тянут агентную разработку в Cline, как подключить Cline к Ollama или LM Studio и что делать с длиной контекста, ошибкой connection refused и пустым списком моделей — 13 шагов, проверенных по видеозаписям и официальной документации.

Кратко

  • Короткий список локальных моделей для Cline: qwen3-coder:30b (19 ГБ, контекст 256K, вызов инструментов), devstral:24b и gpt-oss:20b. У всех трёх на странице модели в рантайме есть значок tools; кодовая модель без шаблона вызова инструментов будет обсуждать ваш код, а не править его.
  • Двух рантаймов хватит для всего: Ollama на http://localhost:11434 и LM Studio на http://127.0.0.1:1234. В Cline откройте Settings → API Configuration, выберите соответствующий API Provider и не включайте Use custom base URL, если вы не меняли порт.
  • Почти каждое сообщение «локальная модель не работает в Cline» — это одно из трёх: сервер не запущен (connection refused), модель не загружена (пустой выпадающий список) или контекстное окно слишком мало (агент забывает задачу и начинает рассуждать заново).
  • Страница интеграции Ollama с Cline называет минимумом 32K токенов контекста для кодинга, а собственный быстрый старт Cline заканчивается включением Use Compact Prompt. В Cline v4.1.21 появилась одна повторная попытка сжатия для локальных моделей, которым не хватило места: llama.cpp, Ollama и LM Studio обрезают генерацию по остатку контекста.

Какие локальные модели действительно тянут агентную разработку в Cline?

Cline — не чат-бокс. Он отправляет большой системный промпт с вызовами инструментов, а затем циклично работает с вызовами инструментов, диффами файлов, выводом терминала и уточнениями. Модель подойдёт, только если её шаблон чата отдаёт вызов инструментов через API рантайма и она удерживает достаточно длинную цепочку рассуждений. Это быстро отсеивает лишнее: проверьте значок tools на странице модели, прежде чем качать 19 ГБ.

  • 1Созданы для агентов — qwen3-coder:30b: 30B всего при 3,3B активных на токен, 19 ГБ, контекстное окно 256K и поддержка инструментов; это сильнейший агентный кодер, который можно запустить на машине с 24–32 ГБ. devstral:24b — модель Mistral для кодинг-агентов. gpt-oss:20b — открытая модель OpenAI с вызовом инструментов, рассуждениями и оптимумом в 16 ГБ.
  • 2Работают с включённым compact prompt — qwen3 в тегах от 4B до 14B и gemma3:12b поддерживают вызовы инструментов и справляются с небольшими задачами вроде скрипта, переименования и игры из этого гайда. Но окно они сжигают быстро, поэтому поднимите длину контекста и оставьте Use compact prompt включённым.
  • 3Пропустите для агентной работы — deepseek-coder-v2 действительно сильная кодовая модель, но у неё нет значка tools в Ollama, поэтому вызовы инструментов от Cline до неё не доходят; то же самое с маленькими моделями без поддержки инструментов и с любым тегом «coder», на странице которого нет поддержки инструментов. Бенчмарки не предсказывают, замкнётся ли цикл вызовов.
  • 4Если вам нужнее агентное качество, а не офлайн-приватность, подумайте дважды, прежде чем платить локальный «налог» на железо: бесплатный тариф моделей Cline уже включает DeepSeek — там указан DeepSeek V4 Flash с контекстным окном в 1M токенов — так что тот же агентный цикл работает без загрузки 19 ГБ и апгрейда до 32 ГБ ОЗУ. Локальный инференс оставьте для приватности, работы в изолированной сети и обучения, а для варианта с хостингом смотрите гайд по DeepSeek + Cline по ссылке ниже.
  • 5Практическое правило по железу со страницы Cline о локальных моделях: 16–32 ГБ — маленькие или квантованные модели, 32–64 ГБ — кодовые модели среднего размера, 64 ГБ+ — модели побольше и контекстные окна пошире. На практике первым ломает локальный агентный цикл именно длина контекста, а не число параметров.

How to Use Cline with LM Studio for 100% Local AI Vibe Coding

Канал:Bootable USBs7:04

Открыть

Install Qwen 3 Locally in Minutes with Ollama

Канал:Bonverium Studio4:04

Открыть

Local models — Cline documentation

Документация:docs.cline.bot

Открыть

Cline with Ollama — Ollama integration guide

Документация:docs.ollama.com

Открыть

Cline v4.1.21 release notes (local model compaction)

Документация:github.com/cline/cline

Открыть

Кадры взяты из двух записей экрана: разбор LM Studio + Cline даёт все кадры VS Code, Cline Settings и LM Studio, а отдельная запись по Ollama — кадры установщика, выбора модели и терминала. Кадры с авторскими оверлеями, лицами и вшитыми субтитрами отброшены, а один кадр с длиной контекста пришлось извлечь заново по точному таймкоду: быстрая перемотка попала не в ту сцену.

Названия продуктов, пункты меню и номера версий сверены с docs.cline.bot (Local models), docs.ollama.com/integrations/cline, страницами моделей на ollama.com и примечаниями к релизу cline/cline v4.1.21. Кадры цитируют короткие фрагменты записей для комментария.

Настройка Cline на локальных моделях за 13 шагов

Установите Cline и рантайм Ollama

  1. 1

    Установите расширение Cline в VS Code

    Откройте панель расширений (Ctrl+Shift+X), найдите Cline и установите расширение от cline.bot. В маркетплейсе полно двойников — Cline Chinese, Cline Max, Cline Pro - CodeAI, Bao Cline — и только карточка cline.bot официальная. Cline Desktop и CLI используют те же настройки провайдера, что описаны ниже.

    Cline extension installing in the VS Code marketplace search for cline, with the official cline.bot listing above Cline Chinese, Cline Max and Bao Cline look-alikes
    Официальная карточка — та, что опубликована cline.bot, а не двойники, стоящие под ней.Смотреть с 0:50
  2. 2

    Установите Ollama через мастер установки

    Скачайте Ollama для своей ОС и запустите установщик. В Windows это один экран подтверждения; в macOS и Linux всё так же. После завершения Ollama остаётся работать фоновой службой, которая отвечает на OpenAI-совместимый API по порту 11434 — именно с ней, а не с окном приложения, общается Cline.

    Ollama version 0.11.0 setup wizard on Windows telling you to click Install to get up and running with your own large language models
    Один экран, одна кнопка Install — мастер оставляет фоновую службу слушать порт 11434.Смотреть с 1:00
  3. 3

    Выберите модель, которая умеет вызывать инструменты

    В приложении Ollama есть выбор «Find model…»; из терминала то же самое делает ollama pull <model>. Для Cline держитесь семейств с поддержкой вызова инструментов — gpt-oss:20b, qwen3-coder:30b-a3b или devstral:24b. На каждой странице модели в библиотеке Ollama над тегами показаны значки возможностей; если значка tools нет, как у deepseek-coder-v2, вызовы инструментов от Cline обрабатываться не будут.

    Ollama desktop app Find model picker listing gpt-oss 120b, gpt-oss 20b, deepseek-r1 8b and gemma3 tags while the model chip already reads gpt-oss 20b
    В списке моделей приложения — gpt-oss, deepseek-r1 и gemma3; решает здесь именно значок tools на странице библиотеки.Смотреть с 2:40
  4. 4

    Скачайте её и проверьте, что лежит на диске

    ollama run qwen3 скачивает манифест, проверяет дайджест и открывает приглашение ввода. Затем ollama list показывает все установленные модели с размером — это самый быстрый способ заметить незавершённую загрузку. Размеры внутри одного семейства гуляют сильно: самый маленький тег qwen3 весит заметно меньше гигабайта, а 30B-тег для кодинга — 19 ГБ.

    Windows Command Prompt running ollama run qwen3 with pulling manifest and verifying sha256 digest at 100 percent before dropping into a live qwen3 4b prompt
    Манифест, дайджест, затем живое приглашение — Cline достаточно, чтобы первые два шага прошли успешно.Смотреть с 3:20

Загрузите модель в LM Studio и запустите её сервер

  1. 5

    Скачайте модель внутри LM Studio

    Вкладка Discover в LM Studio ищет по собственному каталогу. Staff Picks подписаны тем, для чего хороши: Qwen3 Coder Next описан как 80B MoE с 3B активных параметров, созданный для кодинг-агентов и особенно сильный в длинных цепочках рассуждений и сложном использовании инструментов, а в подборке сообщества есть сборки DeepSeek-Coder-V2. Посмотрите размер загрузки до начала: сборка Q4_K_M на этом кадре весит 48,49 ГБ.

    LM Studio Discover search for coder showing staff picks Qwen3 Coder Next and Qwen3 Coder 30B beside community DeepSeek-Coder-V2 GGUF builds and a 48.49 GB download button
    Tool Use здесь отмечен как заявленная возможность — как и размер загрузки: проверьте и то, и другое до старта передачи.Смотреть с 1:45
  2. 6

    Запустите локальный сервер LM Studio

    Откройте вкладку Developer → Local Server и включите сервер; Status: Running означает, что другие приложения могут подключаться. LM Studio объявляет OpenAI-совместимую точку входа на http://127.0.0.1:1234 и перечисляет поддерживаемые протоколы (LM Studio API, OpenAI-compatible, Anthropic-compatible) прямо под переключателем. Сервер выключен, пока вы его не включите, — это самая частая причина ошибки соединения в Cline.

    LM Studio 0.4.2 Developer tab Local Server page with the Status Running toggle switched on above an empty Loaded Models panel and the OpenAI-compatible supported endpoints
    Status: Running — зелёный свет; точка входа OpenAI-совместима на 127.0.0.1:1234.Смотреть с 2:10

Направьте Cline на локальный сервер

  1. 7

    Задайте API-провайдера в настройках Cline

    Откройте Settings → API Configuration в Cline и установите API Provider в LM Studio (или Ollama). Пока вы на стандартных локальных портах, галочку Use custom base URL не ставьте — заполняйте её, только если сервер переехал на другой порт или на другую машину. Прочитайте и собственную заметку Cline в этой панели: там сказано, что Cline использует сложные промпты, лучше всего работает с моделями Claude, а менее способные модели могут вести себя не так, как ожидается.

    Cline Settings API Configuration panel with API Provider set to LM Studio, Use custom base URL unchecked, an empty Model field and Context Window at zero
    Сначала провайдер; base URL не трогаем, если вы действительно не перенесли сервер.Смотреть с 3:00
  2. 8

    Выберите модель, которую отдаёт сервер

    Выпадающий список Model заполняется от запущенного сервера, поэтому в нём то, что рантайм реально держит в памяти: в этой записи qwen/qwen3-4b, qwen2.5-coder-7b-instruct, qwen2.5-coder-3b-claude_opus_4.6-distilled, gemma-3-27b-it-abliterated, meta-llama-3-8b-instruct, yi-coder-1.5b и модель эмбеддингов. Если вашей модели в списке нет, значит она не загружена в LM Studio или не скачана в Ollama; выбор модели на 1,5B или эмбеддинг-модели здесь — как раз то, из-за чего люди решают, что локальные модели не работают.

    Cline Settings Model dropdown open over API Configuration listing qwen/qwen3-4b, qwen2.5-coder-7b-instruct, gemma-3-27b-it-abliterated and yi-coder-1.5b served by LM Studio
    Здесь появляется всё, что сообщает сервер, — а эмбеддинг-модель в списке лучше не трогать.Смотреть с 3:03
  3. 9

    Проверьте Context Window и включите Use compact prompt

    Cline наследует размер контекста, с которым модель загружена в рантайме: на этом кадре Context Window равен 4096 — ровно из настройки загрузки 4K для qwen/qwen3-4b, и для агентного цикла этого катастрофически мало. Быстрый старт Cline по локальным моделям заканчивается включением Use compact prompt, а страница интеграции Ollama с Cline называет минимумом для кодинга 32K токенов. Этот переключатель подставляет системный промпт под окна примерно до 8K и стоит вам поддержки MCP и Focus Chain — так что сначала поднимите контекстное окно и держите его как запасной вариант.

    Cline Settings showing Context Window inherited as 4096 for qwen/qwen3-4b beside the unchecked Use compact prompt toggle and its Does not support MCP warning
    4096 — это и есть симптом. Поднимите значение в рантайме, а compact prompt оставьте включённым, если застряли около 8K.Смотреть с 3:15

Запустите и почините то, что сломалось

  1. 10

    Запустите небольшую задачу с включённым автоодобрением

    Попросите что-то маленькое и проверяемое — перечислить файлы в папке, написать скрипт, запустить его. С автоодобрением в режиме YOLO агент пишет файл, показывает дифф и идёт дальше, не останавливаясь на каждом шаге; редактор, панель Problems и терминал остаются на виду, так что видно, что именно он выполнил. Не включайте автоодобрение, пока не доверяете загруженной модели.

    VS Code with Cline editing list_files.py in a red and green diff beside its own reasoning, a 5.0k token count and Auto-approve set to YOLO
    Настоящая задача локальной модели: файл существует, Cline хочет его отредактировать, а одобряет всё режим YOLO.Смотреть с 4:45
  2. 11

    Почините «модель не в списке»: загрузите её заново

    Выпадающий список Cline — это список моделей сервера, а LM Studio объявляет только те модели, что загружены сейчас. Поэтому на странице Developer → Local Server может быть написано Loaded Models, а под надписью пусто, и тогда Cline не покажет ни одной модели. Загрузите модель снова (Ctrl + L открывает выбор в LM Studio) и откройте список Model в Cline заново. В Ollama эквивалентная проверка — ollama list в терминале; Cline также принимает тег модели, введённый вручную.

    LM Studio Developer tab Local Server page with Status Running and an empty Loaded Models panel prompting Ctrl plus L to load a model that Cline can then select
    Loaded Models — это и есть меню Cline: ничего не загружено — нечего выбирать.Смотреть с 4:54
  3. 12

    Почините цикл рассуждений большей длиной контекста

    Когда контекстное окно слишком мало, модель на каждом ходу начинает рассуждать заново, и кажется, что агент забыл задачу. Выгрузите модель в LM Studio, затем загрузите её снова с включённой опцией Manually choose model load parameters и поднимите Context Length до нажатия Load Model — на этом диалоге стояло 2048, хотя рядом указано, что модель поддерживает до 262144 токенов. В Cline v4.1.21 появилась и страховка: длинный ответ на llama.cpp, Ollama или LM Studio, упёршийся в лимит выходных токенов, теперь сжимает беседу и повторяет попытку один раз вместо обрыва задачи.

    LM Studio 0.4.8 load model dialog for Qwen3.5 9B with Context Length at 2048, the note that the model supports up to 262144 tokens and the Load Model button
    Context Length — вот рычаг, а пометка «supports up to» подсказывает потолок модели.Смотреть с 5:06
  4. 13

    Проверьте задачей, которой нужен длинный цикл

    На той же настройке агент собрал рабочую игру «Змейка» со счётчиком рекорда: создал с первого прохода, один раз доработал после того, как автор сообщил, что игра не отвечает, и она играется в браузере. Всё это работало локально, без API-ключа и без подписки. Если переименование проходит, а сборка падает, предел — в контексте или вызове инструментов, а не в настройках Cline.

    Snake Game page running in the browser with Score 10 and High Score 210, the grid and a snake built end to end by Cline on a local LM Studio model
    Финальное состояние: игра, собранная агентом, работает локально — без ключа и без подписки.Смотреть с 5:44

Длина контекста Cline + LM Studio: почему агент забывает задачу

Cline отправляет большой системный промпт плюс вашу задачу, каждый результат инструмента и собственные рассуждения модели. Локальный рантайм загружает модель с той длиной контекста, которую выбрал сам, — значение LM Studio по умолчанию для только что скачанного GGUF невелико (в записи это 2048 в диалоге загрузки и 4096, унаследованные в поле Context Window в Cline), — и сервер отказывает всему, что выходит за этот предел. Сбой редко выглядит как сообщение об ошибке: модель просто теряет нить и снова отвечает на собственную первую мысль.

Лечится это на стороне рантайма. Выгрузите модель, загрузите её заново с ручной настройкой параметров и выставьте Context Length настолько высоко, насколько хватает памяти; страница интеграции Ollama с Cline называет минимумом для кодинга 32K токенов, и страница Cline по локальным моделям указывает на ту же настройку контекстного окна. Затем проверьте, что Cline показывает в Context Window, и держите Use compact prompt включённым, если поднять размер загрузки не получается.

Версия здесь важна. До v4.1.21 длинный ответ, исчерпавший контекст локального сервера, обрывал задачу; начиная с v4.1.21 Cline сжимает беседу и повторяет попытку один раз, а затем переходит к краткой повторной попытке и сохраняет частичный ответ. Примечания к релизу прямо называют причину: такие серверы обрезают генерацию по остатку контекста независимо от настроенного вами бюджета выходных токенов. Поднять загруженную длину контекста всё равно остаётся настоящим решением; сжатие даёт лишь вторую попытку.

Cline + Ollama не работает после обновления: три настоящие причины

Почти любой отчёт сводится к одной из трёх причин, и только первая — проблема Cline.

  1. 1Дрейф формата вызова инструментов. В Cline 4.1.x снова поменялся синтаксис инструментов, и открытый issue cline#13008 документирует поломку локальной Ollama с Qwen3.6 именно из-за этого; соответствующая работа по совместимости прошла на стороне Ollama для форматов вызова инструментов qwen3.6 и qwen3-coder. Обновите и расширение, и рантайм, затем перепроверьте на модели, по шаблону которой обе стороны договорились, — gpt-oss, qwen3-coder или devstral.
  2. 2Connection refused. Никто не слушает порт. Локальный сервер LM Studio выключен, пока вы не включите его в Developer → Local Server, а фоновая служба Ollama должна работать на 11434. Если вы меняли порт, поставьте в Cline галочку Use custom base URL и введите полный адрес; если рантайм на другой машине, включите в LM Studio Serve on Local Network и откройте порт в фаерволе.
  3. 3Модель не в списке. Cline запрашивает у сервера список моделей, поэтому LM Studio возвращает только загруженные, а Ollama — только скачанные. Загрузите или скачайте модель и откройте список заново; страница Ollama про Cline также позволяет ввести тег модели вручную — это самый быстрый путь мимо устаревшего списка.
  4. 4Собственному предупреждению рантайма стоит верить. В панели LM Studio в Cline сказано, что Cline использует сложные промпты, лучше всего работает с моделями Claude, а менее способные модели могут вести себя не так, как ожидается. Кодер на 1,5B — это модель автодополнения, а не агентная: никакая настройка этого не изменит.

Требования к рантайму и железу для локального Cline

Сам Cline — то же расширение VS Code, что и с хостинговым провайдером; модель работает за рантаймом, который вы устанавливаете. На странице Cline о локальных моделях названы три поддерживаемых рантайма — Ollama, LM Studio и Atomic Chat — и вся настройка сводится к пяти строкам: установить рантайм, запустить его локальный сервер, выбрать соответствующего провайдера в Cline Settings, выбрать локальную модель и включить Use Compact Prompt.

Точки входа и порты: Ollama отвечает OpenAI-совместимым API на http://localhost:11434, а LM Studio — на http://127.0.0.1:1234, под /v1. Оба по умолчанию слушают только localhost, так что ничего не покидает вашу машину, пока вы явно не откроете сервер в сеть.

  • 116–32 ГБ ОЗУ — маленькие или квантованные модели в диапазоне 7B–14B, скромные контекстные окна; инференс только на CPU возможен, но медленный.
  • 232–64 ГБ ОЗУ — кодовые модели среднего размера вроде qwen3-coder:30b-a3b (19 ГБ) или devstral:24b, с запасом на контекстное окно в 32K и больше.
  • 364 ГБ+ ОЗУ или большой GPU — модели побольше вместе с контекстными окнами пошире; модель на 30B с окном 64K требует и памяти, и достаточного объёма VRAM, чтобы её туда выгрузить.

Запись подтверждает то же, что и документация: всё это можно запускать на CPU, но более сильный GPU даёт заметно лучшую производительность, а общий объём ОЗУ определяет и размер модели, и размер контекстного окна, которое вы можете загрузить. Закладывайте бюджет под окно, а не только под веса.

Вопросы о локальных моделях в Cline

Читать дальше