오픈소스 LLM 로컬 배포: Ollama 실전
대형 모델을 내 컴퓨터에서 돌리면 데이터 프라이버시가 지켜지고, 오프라인 개발과 실험도 쉬워집니다. Ollama를 쓰면 이 모든 것이 앱 하나 설치하는 것만큼 간단해집니다.
작성자AI Resource Hub
왜 로컬 배포인가
로컬 배포에서는 데이터가 내 컴퓨터를 절대 벗어나지 않아 민감한 자료를 다루기에 안성맞춤입니다. API 요금도 없으니 마음껏 실험하고 로컬 워크플로에 통합할 수 있습니다.
첫 모델 설치와 실행
공식 사이트에서 Ollama를 설치한 뒤에는 명령어 하나로 모델을 내려받아 실행합니다. 첫 실행 때 가중치가 자동으로 다운로드됩니다.
# Pull and chat directly
ollama run llama3.2
# Or just download the model
ollama pull qwen2.5API로 접근하기
실행되면 Ollama가 로컬 11434 포트에 HTTP 인터페이스를 엽니다. 클라우드 API를 호출하듯 그대로 앱에 통합하면 됩니다.
curl http://localhost:11434/api/chat -d '{
"model": "llama3.2",
"messages": [{ "role": "user", "content": "Hi, please introduce yourself" }],
"stream": false
}'알맞은 모델 고르기
모델이 클수록 성능은 좋아지지만 VRAM과 메모리를 더 요구합니다. 먼저 내 컴퓨터에 맞는 파라미터 크기(예: 7B/8B)를 고르고, 그다음 속도와 품질 사이에서 균형을 잡으세요.
Ollama 모델 라이브러리에는 Llama, Qwen, Mistral, Gemma 같은 오픈소스 모델이 가득합니다. 필요에 따라 자유롭게 바꿔 쓰세요.
성능 튜닝과 GPU 팁
Ollama는 GPU가 있으면 자동으로 가속합니다. Apple Silicon Mac에서는 Metal이 바로 사용됩니다. Linux + NVIDIA에서는 CUDA 드라이버와 Ollama CUDA 빌드가 설치되었는지 확인하세요. VRAM이 부족하면 더 작은 양자화(예: Q8_0 대신 Q4_K_M)나 더 작은 모델 패밀리를 시도하세요. OLLAMA_NUM_PARALLEL을 설정하면 메모리가 충분한 기계에서 동시 요청을 처리할 수 있습니다.
내 앱에 통합하기
Ollama의 API는 OpenAI 채팅 완성 형식과 호환됩니다. 기본 URL을 http://localhost:11434/v1로 바꾸고 API 키에 아무 문자열이나 넣으면 같은 코드를 그대로 재사용할 수 있습니다. LangChain, LlamaIndex 같은 라이브러리도 Ollama를 네이티브로 지원하므로, RAG나 에이전트 파이프라인에서 클라우드 모델을 로컬 모델로 쉽게 교체할 수 있습니다.