왜 LLM을 로컬에서 실행할까?

  • 개인정보 보호: 당신의 데이터는 절대 기기 밖으로 나가지 않습니다.
  • 비용: 설정 후 토큰당 비용이 0입니다.
  • 속도: 추론을 위한 네트워크 지연 없음.
  • 오프라인: 인터넷 연결 없이도 작동합니다.

Ollama 설치

  • [ollama.com](https://ollama.com)에서 다운로드 — macOS, Linux, Windows에서 이용 가능.
  • 'ollama pull llama3'를 실행하여 모델을 다운로드하세요.
  • 'ollama run llama3'를 실행해서 대화를 시작하세요.

인기 모델

  • Llama 3 8B: 좋은 범용 모델로, 8GB RAM에서 동작합니다.
  • Llama 3 70B: 훨씬 똑똑하며 48GB+ RAM이 필요합니다.
  • Qwen 2.5: 중국어 및 다국어 작업에 탁월합니다.
  • Mistral 7B: 빠르고 효율적인 코딩 작업.
  • Phi-3 Mini: 마이크로소프트의 작지만 성능이 뛰어난 모델입니다.

API 사용

Ollama는 'http://localhost:11434'에 로컬 REST API를 제공합니다.

  • 'POST /api/generate' — 텍스트 생성.
  • 'POST /api/chat' — 채팅 완료
  • 기본 URL 오버라이드를 통해 OpenAI SDK와 호환됨.

통합 팁

  • 'OllamaLLM' 클래스를 통한 LangChain 사용
  • ChatGPT와 유사한 인터페이스를 위해 Open WebUI와 함께 사용.
  • GPU 가속: NVIDIA(CUDA)와 Apple Silicon(Metal)에서 작동합니다.

공연 기대치

  • M2 맥북용 7B 모델: 초당 ~30 토큰.
  • RTX 4090 기반 7B 모델: 초당 ~60 토큰.
  • 70B 모델 48GB RAM(CPU): 초당 ~3 토큰.