Cline v4.1.21 · Ollama + LM Studio

Cline 로컬 모델 추천: Ollama·LM Studio 설정 방법

Cline에서 에이전트 방식 코딩에 실제로 쓸 만한 로컬 모델은 무엇인지, Cline을 Ollama나 LM Studio에 연결하는 방법, 그리고 컨텍스트 길이 부족·연결 거부·모델 목록이 비어 있는 문제를 고치는 방법을 녹화 영상과 공식 문서로 확인한 13단계로 정리했습니다.

핵심 요약

  • Cline에 쓸 로컬 모델 후보는 qwen3-coder:30b(19GB, 256K 컨텍스트, 도구 호출 지원), devstral:24b, gpt-oss:20b 세 가지입니다. 셋 다 각 런타임의 모델 페이지에 tools 배지가 붙어 있습니다. 도구 호출 템플릿이 없는 코드 모델은 코드를 고치지 않고 코드에 대해 이야기만 합니다.
  • 런타임 두 개면 충분합니다. Ollama는 http://localhost:11434, LM Studio는 http://127.0.0.1:1234입니다. Cline Settings → API Configuration에서 맞는 API Provider를 고르고, 포트를 옮기지 않았다면 Use custom base URL은 꺼둡니다.
  • 「Cline 로컬 모델이 안 된다」는 이야기는 거의 세 가지로 모입니다. 서버가 안 떠 있거나(연결 거부), 모델이 로드되지 않았거나(드롭다운이 비어 있음), 컨텍스트 창이 너무 작은 경우(에이전트가 잊고 추론을 처음부터 다시 함)입니다.
  • Ollama의 Cline 연동 문서는 코딩에 필요한 하한을 32K 토큰으로 잡고, Cline 자체 퀵 스타트도 Use Compact Prompt 활성화로 끝납니다. Cline v4.1.21은 공간이 부족한 로컬 모델을 위해 압축 재시도를 한 번 추가했습니다. llama.cpp, Ollama, LM Studio는 남은 컨텍스트만큼만 생성하기 때문입니다.

Cline 에이전트 코딩에 실제로 쓸 만한 로컬 모델은?

Cline은 채팅창이 아닙니다. 도구 호출용 시스템 프롬프트를 크게 보낸 뒤 도구 호출, 파일 diff, 터미널 출력, 후속 요청을 반복합니다. 여기서 쓸 수 있는 모델은 채팅 템플릿이 런타임 API를 통해 도구 호출을 노출하고, 충분히 긴 사고 사슬을 유지할 수 있는 모델뿐입니다. 이 조건만으로 후보가 확 줄어듭니다. 19GB를 내려받기 전에 모델 페이지의 tools 배지를 확인하세요.

  • 1에이전트용 — qwen3-coder:30b는 총 30B, 토큰당 활성 3.3B, 19GB, 256K 컨텍스트 창에 도구 지원까지 갖춰 24~32GB 머신에서 돌릴 수 있는 가장 강한 에이전트형 코더입니다. devstral:24b는 Mistral의 코딩 에이전트 모델입니다. gpt-oss:20b는 OpenAI의 오픈 웨이트 모델로 도구 호출과 추론을 지원하며 16GB가 적당합니다.
  • 2compact prompt를 켜면 사용 가능 — qwen3의 4B~14B 태그와 gemma3:12b는 도구 호출을 지원하고 이 가이드의 스크립트, 이름 변경, 게임 같은 작은 작업을 끝낼 수 있습니다. 다만 창을 금방 태우므로 컨텍스트 길이를 올리고 Use compact prompt는 켜 두세요.
  • 3에이전트 작업에는 건너뛰기 — deepseek-coder-v2는 정말 강한 코드 모델이지만 Ollama에 tools 배지가 없어 Cline의 도구 호출이 전달되지 않습니다. 도구를 지원하지 않는 소형 모델과, 모델 페이지에 도구 지원 표시가 없는 「coder」 태그도 마찬가지입니다. 벤치마크 점수는 도구 루프가 닫히는지 알려주지 않습니다.
  • 4오프라인 프라이버시보다 에이전트 품질이 목적이라면 로컬 하드웨어 비용을 한 번 따져 보세요. Cline 무료 등급에는 이미 DeepSeek이 포함되어 있고, DeepSeek V4 Flash가 1M 토큰 컨텍스트 창과 함께 목록에 있습니다. 19GB 다운로드도, 32GB 램 증설도 없이 같은 에이전트 루프를 돌릴 수 있습니다. 로컬 추론은 프라이버시, 망 분리 환경, 학습용으로 남기고 호스팅 경로는 아래에 링크한 DeepSeek + Cline 가이드를 보세요.
  • 5Cline 로컬 모델 문서가 제시하는 하드웨어 기준은 16~32GB가 소형 또는 양자화 모델, 32~64GB가 중간급 코딩 모델, 64GB 이상이 더 큰 모델과 더 넓은 컨텍스트 창입니다. 실제로는 파라미터 수가 아니라 컨텍스트 길이가 로컬 에이전트 루프를 먼저 무너뜨립니다.

How to Use Cline with LM Studio for 100% Local AI Vibe Coding

채널:Bootable USBs7:04

열기

Install Qwen 3 Locally in Minutes with Ollama

채널:Bonverium Studio4:04

열기

Local models — Cline documentation

문서:docs.cline.bot

열기

Cline with Ollama — Ollama integration guide

문서:docs.ollama.com

열기

Cline v4.1.21 release notes (local model compaction)

문서:github.com/cline/cline

열기

스틸은 화면 녹화 두 편에서 가져왔습니다. LM Studio + Cline 실습 영상이 모든 VS Code, Cline Settings, LM Studio 프레임을 제공하고, 별도의 Ollama 녹화가 설치 프로그램, 모델 선택기, 터미널 프레임을 제공합니다. 제작자 오버레이, 얼굴, 자막이 박힌 프레임은 제외했고, 컨텍스트 길이 프레임 하나는 빠른 탐색이 엉뚱한 장면에 걸려 정확한 타임스탬프로 다시 추출했습니다.

제품 이름, 메뉴 이름, 버전 번호는 docs.cline.bot(Local models), docs.ollama.com/integrations/cline, ollama.com 모델 페이지, cline/cline v4.1.21 릴리스 노트와 대조했습니다. 스틸은 해설 목적으로 녹화 영상의 짧은 부분을 인용한 것입니다.

13단계로 Cline을 로컬 모델에 연결하기

Cline과 Ollama 런타임 설치하기

  1. 1

    VS Code에 Cline 확장 설치하기

    확장 보기(Ctrl+Shift+X)를 열고 Cline을 검색한 뒤 cline.bot이 게시한 확장을 설치하세요. 마켓플레이스에는 비슷하게 생긴 가짜가 넘칩니다 — Cline 中文版, Cline Max, Cline Pro - CodeAI, Bao Cline — 공식은 cline.bot 목록 하나뿐입니다. Cline Desktop과 CLI도 아래에서 설명하는 같은 프로바이더 설정을 씁니다.

    Cline extension installing in the VS Code marketplace search for cline, with the official cline.bot listing above Cline Chinese, Cline Max and Bao Cline look-alikes
    공식은 cline.bot이 게시한 목록이고, 그 아래 쌓인 비슷한 이름들이 아닙니다.0:50에서 보기
  2. 2

    설치 마법사로 Ollama 설치하기

    사용하는 OS용 Ollama를 내려받아 설치 프로그램을 실행하세요. Windows 마법사는 확인 화면 하나뿐이고 macOS와 Linux도 같습니다. 설치가 끝나면 Ollama는 백그라운드 서비스로 남아 11434 포트에서 OpenAI 호환 API에 응답합니다. Cline이 대화하는 상대는 앱 창이 아니라 이 서비스입니다.

    Ollama version 0.11.0 setup wizard on Windows telling you to click Install to get up and running with your own large language models
    화면 하나, Install 버튼 하나 — 마법사는 11434에서 대기하는 백그라운드 서비스를 남깁니다.1:00에서 보기
  3. 3

    도구를 호출할 수 있는 모델 고르기

    Ollama 앱에는 Find model… 선택기가 있고, 터미널에서는 같은 작업이 ollama pull <model>입니다. Cline에 쓸 모델은 도구 호출을 지원하는 계열 안에서 고르세요 — gpt-oss:20b, qwen3-coder:30b-a3b, devstral:24b. Ollama 라이브러리의 모든 모델 페이지는 태그 위에 기능 배지를 보여줍니다. deepseek-coder-v2처럼 tools 배지가 없으면 Cline의 도구 호출이 처리되지 않습니다.

    Ollama desktop app Find model picker listing gpt-oss 120b, gpt-oss 20b, deepseek-r1 8b and gemma3 tags while the model chip already reads gpt-oss 20b
    앱의 모델 선택기에는 gpt-oss, deepseek-r1, gemma3가 보입니다 — 중요한 건 라이브러리 페이지의 tools 배지입니다.2:40에서 보기
  4. 4

    pull하고 디스크에 있는지 확인하기

    ollama run qwen3은 매니페스트를 가져오고 다이제스트를 검증한 뒤 프롬프트로 들어갑니다. 이어서 ollama list를 실행하면 설치된 모든 모델과 크기가 나오는데, 다운로드가 중간에 끝났는지 가장 빨리 확인하는 방법입니다. 같은 계열 안에서도 크기 차이가 큽니다. 가장 작은 qwen3 태그는 1GB도 안 되지만 30B coder 태그는 19GB입니다.

    Windows Command Prompt running ollama run qwen3 with pulling manifest and verifying sha256 digest at 100 percent before dropping into a live qwen3 4b prompt
    매니페스트, 다이제스트, 그다음 실제 프롬프트 — Cline에는 앞의 두 단계가 성공했는지만 중요합니다.3:20에서 보기

LM Studio에서 모델 로드하고 서버 열기

  1. 5

    LM Studio 안에서 모델 내려받기

    LM Studio의 Discover 탭은 자체 카탈로그를 검색합니다. Staff Picks에는 잘하는 분야가 라벨로 붙습니다 — Qwen3 Coder Next는 80B MoE에 활성 파라미터 3B, 코딩 에이전트용으로 설계되어 장기 추론과 복잡한 도구 사용에 강하다고 설명됩니다. 커뮤니티 결과에는 DeepSeek-Coder-V2 빌드도 있습니다. 시작하기 전에 다운로드 크기를 확인하세요. 여기 보이는 Q4_K_M 빌드는 48.49GB입니다.

    LM Studio Discover search for coder showing staff picks Qwen3 Coder Next and Qwen3 Coder 30B beside community DeepSeek-Coder-V2 GGUF builds and a 48.49 GB download button
    여기서는 Tool Use가 표시된 기능이고 다운로드 크기도 마찬가지입니다 — 전송이 시작되기 전에 둘 다 확인하세요.1:45에서 보기
  2. 6

    LM Studio 로컬 서버 켜기

    Developer 탭 → Local Server를 열고 서버를 켜세요. Status: Running이면 다른 애플리케이션이 접속할 수 있습니다. LM Studio는 http://127.0.0.1:1234에서 OpenAI 호환 엔드포인트를 제공하고, 토글 바로 아래에 지원 엔드포인트(LM Studio API, OpenAI-compatible, Anthropic-compatible)를 나열합니다. 이 서버는 직접 켜기 전까지 꺼져 있으며, 이것이 Cline에서 연결 오류가 나는 가장 흔한 원인입니다.

    LM Studio 0.4.2 Developer tab Local Server page with the Status Running toggle switched on above an empty Loaded Models panel and the OpenAI-compatible supported endpoints
    Status: Running이 초록불입니다 — 엔드포인트는 127.0.0.1:1234의 OpenAI 호환입니다.2:10에서 보기

Cline을 로컬 서버로 연결하기

  1. 7

    Cline Settings에서 API 프로바이더 설정하기

    Cline의 Settings → API Configuration을 열고 API Provider를 LM Studio(또는 Ollama)로 설정하세요. 로컬 기본 포트를 쓰는 동안에는 Use custom base URL을 체크하지 말고, 서버를 다른 포트나 다른 머신으로 옮겼을 때만 입력합니다. 이 패널에 있는 Cline 자체 안내도 읽어 보세요. Cline은 복잡한 프롬프트를 쓰고 Claude 모델과 가장 잘 맞으며, 성능이 낮은 모델은 예상대로 동작하지 않을 수 있다고 적혀 있습니다.

    Cline Settings API Configuration panel with API Provider set to LM Studio, Use custom base URL unchecked, an empty Model field and Context Window at zero
    프로바이더가 먼저입니다. 서버를 실제로 옮기지 않았다면 base URL은 건드리지 마세요.3:00에서 보기
  2. 8

    서버가 제공하는 모델 선택하기

    Model 드롭다운은 실행 중인 서버에서 채워지므로 런타임이 실제로 들고 있는 모델이 나옵니다 — 이 녹화에서는 qwen/qwen3-4b, qwen2.5-coder-7b-instruct, qwen2.5-coder-3b-claude_opus_4.6-distilled, gemma-3-27b-it-abliterated, meta-llama-3-8b-instruct, yi-coder-1.5b, 그리고 embedding 모델입니다. 목록에 내 모델이 없다면 LM Studio에 로드되지 않았거나 Ollama에 pull되지 않은 것입니다. 여기서 1.5B나 embedding 모델을 고르는 것이 「로컬 모델은 안 된다」고 결론 내리는 이유입니다.

    Cline Settings Model dropdown open over API Configuration listing qwen/qwen3-4b, qwen2.5-coder-7b-instruct, gemma-3-27b-it-abliterated and yi-coder-1.5b served by LM Studio
    서버가 보고한 것이 그대로 올라옵니다 — 목록에 있는 embedding 모델은 건드리지 마세요.3:03에서 보기
  3. 9

    Context Window 확인하고 Use compact prompt 켜기

    Cline은 런타임이 로드한 컨텍스트 크기를 그대로 물려받습니다. 이 프레임의 Context Window 4096은 qwen/qwen3-4b의 4K 로드 설정에서 온 값이며 에이전트 루프에는 턱없이 작습니다. Cline의 로컬 모델 퀵 스타트는 Use compact prompt 활성화로 끝나고, Ollama 연동 페이지는 코딩 하한을 32K 토큰으로 잡습니다. 이 토글은 8K 이하 창에 맞춘 시스템 프롬프트로 바꿔 주는 대신 MCP와 Focus Chain 지원을 잃습니다. 그러니 창을 먼저 키우고, 이건 최후의 수단으로 쓰세요.

    Cline Settings showing Context Window inherited as 4096 for qwen/qwen3-4b beside the unchecked Use compact prompt toggle and its Does not support MCP warning
    4096이 그 신호입니다. 런타임에서 먼저 올리고, 8K 근처에서 맴돌 때만 compact prompt를 켜 두세요.3:15에서 보기

실행해 보고, 깨지는 부분 고치기

  1. 10

    자동 승인을 켜고 작은 작업 실행하기

    작고 검증 가능한 일을 시키세요 — 이 폴더의 파일 목록, 스크립트 작성, 실행 정도입니다. auto-approve를 YOLO로 두면 에이전트가 파일을 쓰고 diff를 보여주며 매 단계 멈추지 않고 진행합니다. 편집기, Problems 패널, 터미널이 계속 보이므로 실제로 무엇을 실행했는지 확인할 수 있습니다. 로드한 모델을 신뢰하기 전까지는 auto-approve를 꺼 두세요.

    VS Code with Cline editing list_files.py in a red and green diff beside its own reasoning, a 5.0k token count and Auto-approve set to YOLO
    실제 로컬 모델 작업입니다. 파일이 있고, Cline이 편집하려 하고, YOLO 모드가 승인을 대신합니다.4:45에서 보기
  2. 11

    「모델이 목록에 없음」은 다시 로드해서 해결하기

    Cline의 드롭다운은 서버의 모델 목록이고, LM Studio는 현재 로드된 모델만 알려줍니다. 그래서 Developer → Local Server 페이지의 Loaded Models가 비어 있는데 Cline에는 모델이 하나도 안 보이는 일이 생깁니다. 하나를 다시 로드하고(LM Studio에서 Ctrl + L로 선택기가 열립니다), Cline의 Model 드롭다운을 다시 여세요. Ollama에서는 터미널에서 ollama list가 같은 확인이고, Cline에서 모델 태그를 직접 입력할 수도 있습니다.

    LM Studio Developer tab Local Server page with Status Running and an empty Loaded Models panel prompting Ctrl plus L to load a model that Cline can then select
    Loaded Models가 곧 Cline의 메뉴입니다. 로드된 게 없으면 고를 것도 없습니다.4:54에서 보기
  3. 12

    컨텍스트 길이를 키워 추론 루프 고치기

    창이 너무 작으면 모델이 매 턴 추론을 처음부터 다시 하고, 에이전트는 작업을 잊은 것처럼 보입니다. LM Studio에서 모델을 Eject한 뒤 Manually choose model load parameters를 켜고 다시 로드하면서, Load Model을 누르기 전에 Context Length를 올리세요 — 이 대화상자는 2048에 멈춰 있었고 모델이 최대 262144 토큰까지 지원한다는 안내가 함께 있었습니다. Cline v4.1.21은 안전장치도 추가했습니다. llama.cpp, Ollama, LM Studio에서 긴 응답이 출력 토큰 한도에 닿으면 작업을 끝내는 대신 대화를 압축하고 한 번 재시도합니다.

    LM Studio 0.4.8 load model dialog for Qwen3.5 9B with Context Length at 2048, the note that the model supports up to 262144 tokens and the Load Model button
    Context Length가 레버이고, 「supports up to」 안내가 모델의 천장을 알려줍니다.5:06에서 보기
  4. 13

    긴 루프가 필요한 작업으로 확인하기

    같은 구성으로 최고 점수 기록이 있는 동작하는 스네이크 게임을 만들었습니다. 한 번에 만들어졌고, 작성자가 게임이 반응하지 않는다고 알린 뒤 한 번 수정했으며, 브라우저에서 플레이할 수 있었습니다. 전부 API 키도 구독도 없이 로컬에서 돌았습니다. 이름 변경은 되는데 빌드가 실패한다면 한계는 컨텍스트나 도구 호출이지 Cline 설정이 아닙니다.

    Snake Game page running in the browser with Score 10 and High Score 210, the grid and a snake built end to end by Cline on a local LM Studio model
    최종 상태입니다. 에이전트가 만든 게임이 로컬에서 돌아가고, 키도 구독도 없습니다.5:44에서 보기

Cline + LM Studio 컨텍스트 길이: 에이전트가 잊어버리는 이유

Cline은 큰 시스템 프롬프트에 더해 작업 내용, 모든 도구 실행 결과, 모델 자신의 추론까지 매번 보냅니다. 로컬 런타임은 스스로 정한 컨텍스트 길이로 모델을 로드합니다 — LM Studio는 갓 내려받은 GGUF에 작은 기본값을 쓰고, 녹화에서는 로드 대화상자가 2048, Cline의 Context Window 필드에 4096이 물려졌습니다 — 그리고 서버는 그 이상을 거부합니다. 실패는 대개 오류 메시지로 나타나지 않습니다. 모델이 그냥 흐름을 놓치고 자기 첫 생각을 다시 답합니다.

해법은 런타임 쪽에 있습니다. 모델을 Eject하고 수동 파라미터 옵션으로 다시 로드한 뒤 Context Length를 메모리가 허락하는 만큼 높이세요. Ollama의 Cline 연동 페이지는 코딩 하한을 32K 토큰으로 잡고, Cline의 로컬 모델 페이지도 같은 컨텍스트 창 설정을 가리킵니다. 그다음 Cline의 Context Window에 무엇이 표시되는지 확인하고, 로드 크기를 올릴 수 없을 때는 Use compact prompt를 켜 두세요.

여기서는 버전이 중요합니다. v4.1.21 이전에는 로컬 서버의 컨텍스트를 소진하는 긴 응답이 작업을 끝냈습니다. v4.1.21부터는 Cline이 대화를 압축하고 한 번 재시도한 뒤, 간결 재시도 복구로 넘어가 부분 답변을 유지합니다. 릴리스 노트는 원인을 분명히 밝힙니다 — 그 서버들은 설정한 출력 예산과 무관하게 남은 컨텍스트만큼만 생성합니다. 로드한 컨텍스트 길이를 올리는 것이 여전히 진짜 해법이고, 압축은 재시도 기회를 한 번 벌어 줄 뿐입니다.

업데이트 후 Cline + Ollama가 안 될 때: 진짜 원인 세 가지

거의 모든 제보가 세 가지 원인 중 하나로 모이고, Cline 쪽 문제는 첫 번째뿐입니다.

  1. 1도구 호출 형식 불일치. Cline 4.1.x가 도구 문법을 또 바꿨고, 열려 있는 이슈 cline#13008은 로컬 Ollama와 Qwen3.6 조합이 그 영향으로 깨진다고 기록합니다. qwen3.6과 qwen3-coder 도구 호출 형식에 맞춘 호환 처리는 Ollama 쪽에 들어갔습니다. 확장과 런타임을 모두 업데이트한 뒤, 양쪽 템플릿이 맞는 모델로 다시 테스트하세요 — gpt-oss, qwen3-coder, devstral.
  2. 2연결 거부(Connection refused). 아무것도 리스닝하지 않는 상태입니다. LM Studio 로컬 서버는 Developer → Local Server에서 켜기 전까지 꺼져 있고, Ollama 백그라운드 서비스는 11434에서 돌고 있어야 합니다. 포트를 옮겼다면 Cline에서 Use custom base URL을 체크하고 전체 주소를 입력하세요. 런타임이 다른 머신에 있다면 LM Studio의 Serve on Local Network를 켜고 방화벽에서 포트를 여세요.
  3. 3모델이 목록에 없음. Cline은 서버에 모델 목록을 물어보므로 LM Studio는 로드된 모델만, Ollama는 pull한 모델만 돌려줍니다. 모델을 로드하거나 pull한 뒤 드롭다운을 다시 여세요. Ollama의 Cline 페이지에서는 모델 태그를 직접 입력할 수도 있고, 이게 오래된 목록을 벗어나는 가장 빠른 길입니다.
  4. 4런타임 자체의 경고는 믿을 만합니다. Cline의 LM Studio 패널에는 Cline이 복잡한 프롬프트를 쓰고 Claude 모델과 가장 잘 맞으며 성능이 낮은 모델은 예상대로 동작하지 않을 수 있다고 적혀 있습니다. 1.5B 코더는 완성 모델이지 에이전트 모델이 아닙니다 — 어떤 설정으로도 에이전트 모델이 되지 않습니다.

로컬 Cline의 런타임과 하드웨어 요구 사항

Cline 자체는 호스팅 프로바이더와 함께 쓸 때와 같은 VS Code 확장이고, 모델은 직접 설치한 런타임 뒤에서 돕니다. Cline의 로컬 모델 페이지는 지원 런타임 세 개를 꼽습니다 — Ollama, LM Studio, Atomic Chat — 그리고 전체 설정을 다섯 줄로 줄입니다. 런타임 설치, 로컬 서버 시작, Cline Settings에서 맞는 프로바이더 선택, 로컬 모델 선택, Use Compact Prompt 활성화 순서입니다.

엔드포인트와 포트: Ollama는 http://localhost:11434, LM Studio는 http://127.0.0.1:1234에서 OpenAI 호환 API에 응답하며 경로는 /v1 아래입니다. 둘 다 기본적으로 localhost에만 바인딩하므로 서버를 네트워크에 직접 노출하지 않는 한 데이터는 내 컴퓨터를 벗어나지 않습니다.

  • 116~32GB RAM — 7B~14B 범위의 소형 또는 양자화 모델, 작은 컨텍스트 창. CPU만으로도 추론할 수 있지만 느립니다.
  • 232~64GB RAM — qwen3-coder:30b-a3b(19GB)나 devstral:24b 같은 중간급 코딩 모델, 32K 이상 창을 열 여유.
  • 364GB 이상 RAM 또는 대형 GPU — 더 큰 모델과 더 넓은 컨텍스트 창을 함께. 30B 모델을 64K 창으로 돌리려면 메모리와 오프로드할 충분한 VRAM이 필요합니다.

녹화 영상도 문서와 같은 이야기를 합니다. CPU로도 돌릴 수 있지만 더 강한 GPU가 체감 성능을 확실히 끌어올리고, 시스템 RAM 총량이 모델 크기와 컨텍스트 창 크기를 함께 결정합니다. 가중치만이 아니라 창까지 예산에 넣으세요.

Cline 로컬 모델 FAQ

관련 가이드