초급읽는 시간 8분·

오픈소스 LLM 로컬 배포: Ollama 실전

대형 모델을 내 컴퓨터에서 돌리면 데이터 프라이버시가 지켜지고, 오프라인 개발과 실험도 쉬워집니다. Ollama를 쓰면 이 모든 것이 앱 하나 설치하는 것만큼 간단해집니다.

작성자AI Resource Hub

왜 로컬 배포인가

로컬 배포에서는 데이터가 내 컴퓨터를 절대 벗어나지 않아 민감한 자료를 다루기에 안성맞춤입니다. API 요금도 없으니 마음껏 실험하고 로컬 워크플로에 통합할 수 있습니다.

첫 모델 설치와 실행

공식 사이트에서 Ollama를 설치한 뒤에는 명령어 하나로 모델을 내려받아 실행합니다. 첫 실행 때 가중치가 자동으로 다운로드됩니다.

# Pull and chat directly
ollama run llama3.2

# Or just download the model
ollama pull qwen2.5

API로 접근하기

실행되면 Ollama가 로컬 11434 포트에 HTTP 인터페이스를 엽니다. 클라우드 API를 호출하듯 그대로 앱에 통합하면 됩니다.

curl http://localhost:11434/api/chat -d '{
  "model": "llama3.2",
  "messages": [{ "role": "user", "content": "Hi, please introduce yourself" }],
  "stream": false
}'

알맞은 모델 고르기

모델이 클수록 성능은 좋아지지만 VRAM과 메모리를 더 요구합니다. 먼저 내 컴퓨터에 맞는 파라미터 크기(예: 7B/8B)를 고르고, 그다음 속도와 품질 사이에서 균형을 잡으세요.

Ollama 모델 라이브러리에는 Llama, Qwen, Mistral, Gemma 같은 오픈소스 모델이 가득합니다. 필요에 따라 자유롭게 바꿔 쓰세요.

성능 튜닝과 GPU 팁

Ollama는 GPU가 있으면 자동으로 가속합니다. Apple Silicon Mac에서는 Metal이 바로 사용됩니다. Linux + NVIDIA에서는 CUDA 드라이버와 Ollama CUDA 빌드가 설치되었는지 확인하세요. VRAM이 부족하면 더 작은 양자화(예: Q8_0 대신 Q4_K_M)나 더 작은 모델 패밀리를 시도하세요. OLLAMA_NUM_PARALLEL을 설정하면 메모리가 충분한 기계에서 동시 요청을 처리할 수 있습니다.

내 앱에 통합하기

Ollama의 API는 OpenAI 채팅 완성 형식과 호환됩니다. 기본 URL을 http://localhost:11434/v1로 바꾸고 API 키에 아무 문자열이나 넣으면 같은 코드를 그대로 재사용할 수 있습니다. LangChain, LlamaIndex 같은 라이브러리도 Ollama를 네이티브로 지원하므로, RAG나 에이전트 파이프라인에서 클라우드 모델을 로컬 모델로 쉽게 교체할 수 있습니다.

Ollama로컬 배포오픈소스프라이버시

관련 튜토리얼