2026년 8월 25일, Ollama가 v0.33을 내면서 클로드 데스크톱 공식 지원을 발표했습니다. Ollama 앱에서 토글 하나를 켜면 클로드 데스크톱이 그대로인 채 안에서 도는 모델만 Ollama 모델로 바뀝니다. 로컬 모델이면 사용량 한도 없이 무료고, 끄면 원래 클로드 설정으로 즉시 돌아옵니다.
비공식 프록시나 포크가 아닙니다. 클로드 데스크톱에 원래 있던 서드파티 게이트웨이(third-party inference) 경로를 Ollama가 공식 제공자로 쓰는 방식이라, 클로드 앱을 건드리는 게 하나도 없습니다. 그래서 되돌리기도 토글 하나입니다.
설정 — 세 단계가 전부다
- Ollama 앱을 열고 Claude를 선택한다
- 토글을 켠다 — Ollama가 게이트웨이 설정을 대신 해준다
- 끝. 클로드 데스크톱을 열면 Ollama 모델로 돈다
터미널을 쓰는 쪽이면 명령 한 줄로도 됩니다.
ollama launch claude-desktop
직접 깔아보고 알게 된 것 (2026-08-27 추가): ollama launch claude 는 데스크톱 앱이 아니라 터미널의 Claude Code 입니다. 공식 발표는 데스크톱 쪽만 소개했지만, ollama launch --help 를 열어보면 지원 목록에 19개 통합이 들어 있습니다 — 코딩 에이전트 전반이 대상입니다.
claude(Claude Code) · chatgpt · codex · opencode · cline · copilot · vscode
hermes · hermes-desktop · openclaw · droid · dsh · kimi · muse · omp · pi · pool · qwen
데스크톱 앱은 목록이 아니라 예시(ollama launch claude-desktop --restore)에 나오는 별칭입니다. 그러니까 이 기능은 "클로드 데스크톱에 로컬 모델을 붙이는 것"이 아니라 내가 쓰는 AI 도구 전반의 모델을 로컬로 갈아 끼우는 스위치에 가깝습니다.
설치 마법사는 중간에 계정 가입을 권하는데 필수가 아닙니다 — "No thanks, I'll use Ollama locally" 로 넘어가면 로그인 없이 씁니다.
연결된 동안에는 Ollama에 있는 어떤 모델이든 고를 수 있습니다 — 내 컴퓨터에서 도는 로컬 모델도, Ollama 클라우드의 큰 모델도요. 공식 안내는 가벼운 작업은 로컬로, 큰 코딩·리서치는 클라우드 모델로 나눠 쓰는 그림입니다. 원래대로 돌아가려면 Ollama에서 Claude 토글을 끄면 됩니다.
Ollama가 처음이라면: 설치부터 모델 받는 것까지는 Ollama 로컬 AI 구축 가이드에 정리해뒀습니다. 그 글의 설치를 끝내면 이 글의 토글이 보입니다.
이런 소식, 남들보다 먼저 받으실 분?
직접 돌려보고 되는 것만 골라 매주 보내드립니다. 광고성 하이프는 거릅니다.
이게 왜 큰 뉴스인가
지금까지 "클로드처럼 쓰는 무료 모델"은 전부 어딘가를 포기해야 했습니다. 클로드 데스크톱의 UI·파일 접근·아티팩트를 버리고 다른 앱으로 가거나, 비공식 프록시를 끼워서 업데이트마다 깨지는 걸 감수하거나요. 이번 방식은 앱은 그대로 두고 모델만 갈아 끼우는 공식 경로라 그 트레이드오프가 없습니다.
| 기존 (비공식 우회) | 이번 (공식 게이트웨이) | |
|---|---|---|
| 클로드 앱 | 포크·프록시 필요 | 그대로 |
| 설정 | 설정 파일 수동 편집 | 토글 하나 |
| 되돌리기 | 수동 복원 | 토글 끄면 즉시 |
| 업데이트 | 깨질 위험 | 공식 경로라 유지 |
비용 관점도 큽니다. 클로드 무료 플랜의 한도가 아쉬웠던 사람에게는 "한도 걸리면 로컬 모델로 이어서"라는 선택지가 생긴 거고요 — 무료 플랜으로 어디까지 되는지는 클로드 무료 플랜 가이드에 실측으로 정리해뒀습니다.
데이터는 어디로 가나 — 공식 FAQ 요약
- 프롬프트가 Anthropic이나 Ollama로 전송되나? — 아니요. 텔레메트리는 기본으로 꺼져 있고, Ollama는 클라우드·로컬 전부에 제로 데이터 보존(Zero Data Retention) 정책을 적용한다고 명시했습니다.
- Anthropic 모델을 계속 쓸 수 있나? — 네. Ollama 안의 토글로 언제든 오갑니다.
- 내 로컬 모델도 되나? — 네. Settings에서 로컬 모델을 지정하면 됩니다.
실측 결과가 나왔습니다 (2026-08-27 추가): 여기까지는 공식 발표와 문서 기준이었고, 약속대로 그래픽카드 없는 2017년 사무용 PC(i3-8100 · 내장그래픽)에 직접 깔아 모델 네 개를 같은 질문으로 재봤습니다.
그래서 실제로 얼마나 걸리나 — 실측
토글을 켜도 결국 답을 만드는 건 내 컴퓨터입니다. 그래서 어떤 모델을 고르느냐가 체감을 전부 결정합니다. 같은 질문(“김치찌개를 맛있게 끓이는 핵심 세 가지”)으로 넷을 돌린 결과입니다.
| 모델 | 내려받는 용량 | 답 하나 | 생성 속도 | 한국어 |
|---|---|---|---|---|
| qwen3.5:2b | 2.7GB | 9.5초 | 9.82 tok/s | 중국어 한자가 섞임 |
| qwen3.5:4b | 3.4GB | 26초 | 6.10 tok/s | 문장은 되는데 상식이 틀림 |
| qwen3.5:9b | 6.6GB | 40초 | 3.65 tok/s | 맞지만 느림 |
| gemma4:e2b | 7.2GB | 18.5초 | 12.30 tok/s | 가장 정확 |
예상과 반대였습니다. 제일 큰 모델이 제일 빨랐고 답도 제일 좋았습니다. gemma4:e2b 는 qwen3.5:9b 보다 용량이 큰데 3.4배 빠릅니다 — 메모리에는 전부 올리되 질문마다 일부만 계산하는 구조라, 그래픽카드가 없을수록 이 차이가 벌어집니다. 내려받는 GB 수를 속도의 기준으로 삼으면 더 느리고 덜 정확한 모델을 고르게 됩니다.
또 하나, 추론(thinking) 모델을 끄지 않으면 같은 답에 7분 51초 vs 9.46초가 갈립니다 — 50배입니다. 사고 과정을 통째로 뱉느라 생성 토큰이 4,066개 대 91개가 되기 때문입니다.
기계 사양·과제문 전문·측정 명령까지 그래픽카드 없이 무료 AI 4종 비교에 그대로 공개해뒀습니다. 그대로 재현해볼 수 있습니다.
지금 해볼 사람을 위한 요약
- Ollama를 v0.33 이상으로 업데이트 (또는 ollama.com에서 설치)
- Ollama 앱 → Claude 선택 → 토글 온
- 클로드 데스크톱에서 로컬·클라우드 모델 골라 쓰기 — GPU 가 없으면
gemma4:e2b부터 - 원래대로: Ollama에서 토글 오프