왜 LLM을 로컬에서 실행할까?
- 개인정보 보호: 당신의 데이터는 절대 기기 밖으로 나가지 않습니다.
- 비용: 설정 후 토큰당 비용이 0입니다.
- 속도: 추론을 위한 네트워크 지연 없음.
- 오프라인: 인터넷 연결 없이도 작동합니다.
Ollama 설치
- [ollama.com](https://ollama.com)에서 다운로드 — macOS, Linux, Windows에서 이용 가능.
- 'ollama pull llama3'를 실행하여 모델을 다운로드하세요.
- 'ollama run llama3'를 실행해서 대화를 시작하세요.
인기 모델
- Llama 3 8B: 좋은 범용 모델로, 8GB RAM에서 동작합니다.
- Llama 3 70B: 훨씬 똑똑하며 48GB+ RAM이 필요합니다.
- Qwen 2.5: 중국어 및 다국어 작업에 탁월합니다.
- Mistral 7B: 빠르고 효율적인 코딩 작업.
- Phi-3 Mini: 마이크로소프트의 작지만 성능이 뛰어난 모델입니다.
API 사용
Ollama는 'http://localhost:11434'에 로컬 REST API를 제공합니다.
- 'POST /api/generate' — 텍스트 생성.
- 'POST /api/chat' — 채팅 완료
- 기본 URL 오버라이드를 통해 OpenAI SDK와 호환됨.
통합 팁
- 'OllamaLLM' 클래스를 통한 LangChain 사용
- ChatGPT와 유사한 인터페이스를 위해 Open WebUI와 함께 사용.
- GPU 가속: NVIDIA(CUDA)와 Apple Silicon(Metal)에서 작동합니다.
공연 기대치
- M2 맥북용 7B 모델: 초당 ~30 토큰.
- RTX 4090 기반 7B 모델: 초당 ~60 토큰.
- 70B 모델 48GB RAM(CPU): 초당 ~3 토큰.