Лучшая локальная модель для Cline: настройка Ollama и LM Studio
Какие локальные модели действительно тянут агентную разработку в Cline, как подключить Cline к Ollama или LM Studio и что делать с длиной контекста, ошибкой connection refused и пустым списком моделей — 13 шагов, проверенных по видеозаписям и официальной документации.
Кратко
- Короткий список локальных моделей для Cline: qwen3-coder:30b (19 ГБ, контекст 256K, вызов инструментов), devstral:24b и gpt-oss:20b. У всех трёх на странице модели в рантайме есть значок tools; кодовая модель без шаблона вызова инструментов будет обсуждать ваш код, а не править его.
- Двух рантаймов хватит для всего: Ollama на http://localhost:11434 и LM Studio на http://127.0.0.1:1234. В Cline откройте Settings → API Configuration, выберите соответствующий API Provider и не включайте Use custom base URL, если вы не меняли порт.
- Почти каждое сообщение «локальная модель не работает в Cline» — это одно из трёх: сервер не запущен (connection refused), модель не загружена (пустой выпадающий список) или контекстное окно слишком мало (агент забывает задачу и начинает рассуждать заново).
- Страница интеграции Ollama с Cline называет минимумом 32K токенов контекста для кодинга, а собственный быстрый старт Cline заканчивается включением Use Compact Prompt. В Cline v4.1.21 появилась одна повторная попытка сжатия для локальных моделей, которым не хватило места: llama.cpp, Ollama и LM Studio обрезают генерацию по остатку контекста.
Какие локальные модели действительно тянут агентную разработку в Cline?
Cline — не чат-бокс. Он отправляет большой системный промпт с вызовами инструментов, а затем циклично работает с вызовами инструментов, диффами файлов, выводом терминала и уточнениями. Модель подойдёт, только если её шаблон чата отдаёт вызов инструментов через API рантайма и она удерживает достаточно длинную цепочку рассуждений. Это быстро отсеивает лишнее: проверьте значок tools на странице модели, прежде чем качать 19 ГБ.
- 1Созданы для агентов — qwen3-coder:30b: 30B всего при 3,3B активных на токен, 19 ГБ, контекстное окно 256K и поддержка инструментов; это сильнейший агентный кодер, который можно запустить на машине с 24–32 ГБ. devstral:24b — модель Mistral для кодинг-агентов. gpt-oss:20b — открытая модель OpenAI с вызовом инструментов, рассуждениями и оптимумом в 16 ГБ.
- 2Работают с включённым compact prompt — qwen3 в тегах от 4B до 14B и gemma3:12b поддерживают вызовы инструментов и справляются с небольшими задачами вроде скрипта, переименования и игры из этого гайда. Но окно они сжигают быстро, поэтому поднимите длину контекста и оставьте Use compact prompt включённым.
- 3Пропустите для агентной работы — deepseek-coder-v2 действительно сильная кодовая модель, но у неё нет значка tools в Ollama, поэтому вызовы инструментов от Cline до неё не доходят; то же самое с маленькими моделями без поддержки инструментов и с любым тегом «coder», на странице которого нет поддержки инструментов. Бенчмарки не предсказывают, замкнётся ли цикл вызовов.
- 4Если вам нужнее агентное качество, а не офлайн-приватность, подумайте дважды, прежде чем платить локальный «налог» на железо: бесплатный тариф моделей Cline уже включает DeepSeek — там указан DeepSeek V4 Flash с контекстным окном в 1M токенов — так что тот же агентный цикл работает без загрузки 19 ГБ и апгрейда до 32 ГБ ОЗУ. Локальный инференс оставьте для приватности, работы в изолированной сети и обучения, а для варианта с хостингом смотрите гайд по DeepSeek + Cline по ссылке ниже.
- 5Практическое правило по железу со страницы Cline о локальных моделях: 16–32 ГБ — маленькие или квантованные модели, 32–64 ГБ — кодовые модели среднего размера, 64 ГБ+ — модели побольше и контекстные окна пошире. На практике первым ломает локальный агентный цикл именно длина контекста, а не число параметров.
How to Use Cline with LM Studio for 100% Local AI Vibe Coding
Канал:Bootable USBs7:04
Install Qwen 3 Locally in Minutes with Ollama
Канал:Bonverium Studio4:04
Local models — Cline documentation
Документация:docs.cline.bot
Cline with Ollama — Ollama integration guide
Документация:docs.ollama.com
Cline v4.1.21 release notes (local model compaction)
Документация:github.com/cline/cline
Кадры взяты из двух записей экрана: разбор LM Studio + Cline даёт все кадры VS Code, Cline Settings и LM Studio, а отдельная запись по Ollama — кадры установщика, выбора модели и терминала. Кадры с авторскими оверлеями, лицами и вшитыми субтитрами отброшены, а один кадр с длиной контекста пришлось извлечь заново по точному таймкоду: быстрая перемотка попала не в ту сцену.
Названия продуктов, пункты меню и номера версий сверены с docs.cline.bot (Local models), docs.ollama.com/integrations/cline, страницами моделей на ollama.com и примечаниями к релизу cline/cline v4.1.21. Кадры цитируют короткие фрагменты записей для комментария.
Настройка Cline на локальных моделях за 13 шагов
Установите Cline и рантайм Ollama
- 1
Установите расширение Cline в VS Code
Откройте панель расширений (Ctrl+Shift+X), найдите Cline и установите расширение от cline.bot. В маркетплейсе полно двойников — Cline Chinese, Cline Max, Cline Pro - CodeAI, Bao Cline — и только карточка cline.bot официальная. Cline Desktop и CLI используют те же настройки провайдера, что описаны ниже.

Официальная карточка — та, что опубликована cline.bot, а не двойники, стоящие под ней.Смотреть с 0:50 - 2
Установите Ollama через мастер установки
Скачайте Ollama для своей ОС и запустите установщик. В Windows это один экран подтверждения; в macOS и Linux всё так же. После завершения Ollama остаётся работать фоновой службой, которая отвечает на OpenAI-совместимый API по порту 11434 — именно с ней, а не с окном приложения, общается Cline.

Один экран, одна кнопка Install — мастер оставляет фоновую службу слушать порт 11434.Смотреть с 1:00 - 3
Выберите модель, которая умеет вызывать инструменты
В приложении Ollama есть выбор «Find model…»; из терминала то же самое делает ollama pull <model>. Для Cline держитесь семейств с поддержкой вызова инструментов — gpt-oss:20b, qwen3-coder:30b-a3b или devstral:24b. На каждой странице модели в библиотеке Ollama над тегами показаны значки возможностей; если значка tools нет, как у deepseek-coder-v2, вызовы инструментов от Cline обрабатываться не будут.

В списке моделей приложения — gpt-oss, deepseek-r1 и gemma3; решает здесь именно значок tools на странице библиотеки.Смотреть с 2:40 - 4
Скачайте её и проверьте, что лежит на диске
ollama run qwen3 скачивает манифест, проверяет дайджест и открывает приглашение ввода. Затем ollama list показывает все установленные модели с размером — это самый быстрый способ заметить незавершённую загрузку. Размеры внутри одного семейства гуляют сильно: самый маленький тег qwen3 весит заметно меньше гигабайта, а 30B-тег для кодинга — 19 ГБ.

Манифест, дайджест, затем живое приглашение — Cline достаточно, чтобы первые два шага прошли успешно.Смотреть с 3:20
Загрузите модель в LM Studio и запустите её сервер
- 5
Скачайте модель внутри LM Studio
Вкладка Discover в LM Studio ищет по собственному каталогу. Staff Picks подписаны тем, для чего хороши: Qwen3 Coder Next описан как 80B MoE с 3B активных параметров, созданный для кодинг-агентов и особенно сильный в длинных цепочках рассуждений и сложном использовании инструментов, а в подборке сообщества есть сборки DeepSeek-Coder-V2. Посмотрите размер загрузки до начала: сборка Q4_K_M на этом кадре весит 48,49 ГБ.

Tool Use здесь отмечен как заявленная возможность — как и размер загрузки: проверьте и то, и другое до старта передачи.Смотреть с 1:45 - 6
Запустите локальный сервер LM Studio
Откройте вкладку Developer → Local Server и включите сервер; Status: Running означает, что другие приложения могут подключаться. LM Studio объявляет OpenAI-совместимую точку входа на http://127.0.0.1:1234 и перечисляет поддерживаемые протоколы (LM Studio API, OpenAI-compatible, Anthropic-compatible) прямо под переключателем. Сервер выключен, пока вы его не включите, — это самая частая причина ошибки соединения в Cline.

Status: Running — зелёный свет; точка входа OpenAI-совместима на 127.0.0.1:1234.Смотреть с 2:10
Направьте Cline на локальный сервер
- 7
Задайте API-провайдера в настройках Cline
Откройте Settings → API Configuration в Cline и установите API Provider в LM Studio (или Ollama). Пока вы на стандартных локальных портах, галочку Use custom base URL не ставьте — заполняйте её, только если сервер переехал на другой порт или на другую машину. Прочитайте и собственную заметку Cline в этой панели: там сказано, что Cline использует сложные промпты, лучше всего работает с моделями Claude, а менее способные модели могут вести себя не так, как ожидается.

Сначала провайдер; base URL не трогаем, если вы действительно не перенесли сервер.Смотреть с 3:00 - 8
Выберите модель, которую отдаёт сервер
Выпадающий список Model заполняется от запущенного сервера, поэтому в нём то, что рантайм реально держит в памяти: в этой записи qwen/qwen3-4b, qwen2.5-coder-7b-instruct, qwen2.5-coder-3b-claude_opus_4.6-distilled, gemma-3-27b-it-abliterated, meta-llama-3-8b-instruct, yi-coder-1.5b и модель эмбеддингов. Если вашей модели в списке нет, значит она не загружена в LM Studio или не скачана в Ollama; выбор модели на 1,5B или эмбеддинг-модели здесь — как раз то, из-за чего люди решают, что локальные модели не работают.

Здесь появляется всё, что сообщает сервер, — а эмбеддинг-модель в списке лучше не трогать.Смотреть с 3:03 - 9
Проверьте Context Window и включите Use compact prompt
Cline наследует размер контекста, с которым модель загружена в рантайме: на этом кадре Context Window равен 4096 — ровно из настройки загрузки 4K для qwen/qwen3-4b, и для агентного цикла этого катастрофически мало. Быстрый старт Cline по локальным моделям заканчивается включением Use compact prompt, а страница интеграции Ollama с Cline называет минимумом для кодинга 32K токенов. Этот переключатель подставляет системный промпт под окна примерно до 8K и стоит вам поддержки MCP и Focus Chain — так что сначала поднимите контекстное окно и держите его как запасной вариант.

4096 — это и есть симптом. Поднимите значение в рантайме, а compact prompt оставьте включённым, если застряли около 8K.Смотреть с 3:15
Запустите и почините то, что сломалось
- 10
Запустите небольшую задачу с включённым автоодобрением
Попросите что-то маленькое и проверяемое — перечислить файлы в папке, написать скрипт, запустить его. С автоодобрением в режиме YOLO агент пишет файл, показывает дифф и идёт дальше, не останавливаясь на каждом шаге; редактор, панель Problems и терминал остаются на виду, так что видно, что именно он выполнил. Не включайте автоодобрение, пока не доверяете загруженной модели.

Настоящая задача локальной модели: файл существует, Cline хочет его отредактировать, а одобряет всё режим YOLO.Смотреть с 4:45 - 11
Почините «модель не в списке»: загрузите её заново
Выпадающий список Cline — это список моделей сервера, а LM Studio объявляет только те модели, что загружены сейчас. Поэтому на странице Developer → Local Server может быть написано Loaded Models, а под надписью пусто, и тогда Cline не покажет ни одной модели. Загрузите модель снова (Ctrl + L открывает выбор в LM Studio) и откройте список Model в Cline заново. В Ollama эквивалентная проверка — ollama list в терминале; Cline также принимает тег модели, введённый вручную.

Loaded Models — это и есть меню Cline: ничего не загружено — нечего выбирать.Смотреть с 4:54 - 12
Почините цикл рассуждений большей длиной контекста
Когда контекстное окно слишком мало, модель на каждом ходу начинает рассуждать заново, и кажется, что агент забыл задачу. Выгрузите модель в LM Studio, затем загрузите её снова с включённой опцией Manually choose model load parameters и поднимите Context Length до нажатия Load Model — на этом диалоге стояло 2048, хотя рядом указано, что модель поддерживает до 262144 токенов. В Cline v4.1.21 появилась и страховка: длинный ответ на llama.cpp, Ollama или LM Studio, упёршийся в лимит выходных токенов, теперь сжимает беседу и повторяет попытку один раз вместо обрыва задачи.

Context Length — вот рычаг, а пометка «supports up to» подсказывает потолок модели.Смотреть с 5:06 - 13
Проверьте задачей, которой нужен длинный цикл
На той же настройке агент собрал рабочую игру «Змейка» со счётчиком рекорда: создал с первого прохода, один раз доработал после того, как автор сообщил, что игра не отвечает, и она играется в браузере. Всё это работало локально, без API-ключа и без подписки. Если переименование проходит, а сборка падает, предел — в контексте или вызове инструментов, а не в настройках Cline.

Финальное состояние: игра, собранная агентом, работает локально — без ключа и без подписки.Смотреть с 5:44
Длина контекста Cline + LM Studio: почему агент забывает задачу
Cline отправляет большой системный промпт плюс вашу задачу, каждый результат инструмента и собственные рассуждения модели. Локальный рантайм загружает модель с той длиной контекста, которую выбрал сам, — значение LM Studio по умолчанию для только что скачанного GGUF невелико (в записи это 2048 в диалоге загрузки и 4096, унаследованные в поле Context Window в Cline), — и сервер отказывает всему, что выходит за этот предел. Сбой редко выглядит как сообщение об ошибке: модель просто теряет нить и снова отвечает на собственную первую мысль.
Лечится это на стороне рантайма. Выгрузите модель, загрузите её заново с ручной настройкой параметров и выставьте Context Length настолько высоко, насколько хватает памяти; страница интеграции Ollama с Cline называет минимумом для кодинга 32K токенов, и страница Cline по локальным моделям указывает на ту же настройку контекстного окна. Затем проверьте, что Cline показывает в Context Window, и держите Use compact prompt включённым, если поднять размер загрузки не получается.
Версия здесь важна. До v4.1.21 длинный ответ, исчерпавший контекст локального сервера, обрывал задачу; начиная с v4.1.21 Cline сжимает беседу и повторяет попытку один раз, а затем переходит к краткой повторной попытке и сохраняет частичный ответ. Примечания к релизу прямо называют причину: такие серверы обрезают генерацию по остатку контекста независимо от настроенного вами бюджета выходных токенов. Поднять загруженную длину контекста всё равно остаётся настоящим решением; сжатие даёт лишь вторую попытку.
Cline + Ollama не работает после обновления: три настоящие причины
Почти любой отчёт сводится к одной из трёх причин, и только первая — проблема Cline.
- 1Дрейф формата вызова инструментов. В Cline 4.1.x снова поменялся синтаксис инструментов, и открытый issue cline#13008 документирует поломку локальной Ollama с Qwen3.6 именно из-за этого; соответствующая работа по совместимости прошла на стороне Ollama для форматов вызова инструментов qwen3.6 и qwen3-coder. Обновите и расширение, и рантайм, затем перепроверьте на модели, по шаблону которой обе стороны договорились, — gpt-oss, qwen3-coder или devstral.
- 2Connection refused. Никто не слушает порт. Локальный сервер LM Studio выключен, пока вы не включите его в Developer → Local Server, а фоновая служба Ollama должна работать на 11434. Если вы меняли порт, поставьте в Cline галочку Use custom base URL и введите полный адрес; если рантайм на другой машине, включите в LM Studio Serve on Local Network и откройте порт в фаерволе.
- 3Модель не в списке. Cline запрашивает у сервера список моделей, поэтому LM Studio возвращает только загруженные, а Ollama — только скачанные. Загрузите или скачайте модель и откройте список заново; страница Ollama про Cline также позволяет ввести тег модели вручную — это самый быстрый путь мимо устаревшего списка.
- 4Собственному предупреждению рантайма стоит верить. В панели LM Studio в Cline сказано, что Cline использует сложные промпты, лучше всего работает с моделями Claude, а менее способные модели могут вести себя не так, как ожидается. Кодер на 1,5B — это модель автодополнения, а не агентная: никакая настройка этого не изменит.
Требования к рантайму и железу для локального Cline
Сам Cline — то же расширение VS Code, что и с хостинговым провайдером; модель работает за рантаймом, который вы устанавливаете. На странице Cline о локальных моделях названы три поддерживаемых рантайма — Ollama, LM Studio и Atomic Chat — и вся настройка сводится к пяти строкам: установить рантайм, запустить его локальный сервер, выбрать соответствующего провайдера в Cline Settings, выбрать локальную модель и включить Use Compact Prompt.
Точки входа и порты: Ollama отвечает OpenAI-совместимым API на http://localhost:11434, а LM Studio — на http://127.0.0.1:1234, под /v1. Оба по умолчанию слушают только localhost, так что ничего не покидает вашу машину, пока вы явно не откроете сервер в сеть.
- 116–32 ГБ ОЗУ — маленькие или квантованные модели в диапазоне 7B–14B, скромные контекстные окна; инференс только на CPU возможен, но медленный.
- 232–64 ГБ ОЗУ — кодовые модели среднего размера вроде qwen3-coder:30b-a3b (19 ГБ) или devstral:24b, с запасом на контекстное окно в 32K и больше.
- 364 ГБ+ ОЗУ или большой GPU — модели побольше вместе с контекстными окнами пошире; модель на 30B с окном 64K требует и памяти, и достаточного объёма VRAM, чтобы её туда выгрузить.
Запись подтверждает то же, что и документация: всё это можно запускать на CPU, но более сильный GPU даёт заметно лучшую производительность, а общий объём ОЗУ определяет и размер модели, и размер контекстного окна, которое вы можете загрузить. Закладывайте бюджет под окно, а не только под веса.
