본문으로 건너뛰기
오픈소스고급

llama.cpp

llama.cpp는 CPU와 일반 소비자용 GPU에서 오픈 LLM을 효율적으로 구동하는 경량 C/C++ 추론 엔진으로, Ollama·LM Studio 등 많은 로컬 AI 도구의 기반입니다. GGUF 양자화 포맷 덕분에 전용 가속기 없이도 대형 모델을 평범한 하드웨어에서 돌릴 수 있습니다.

개요

"llama.cpp"은(는) AI Resource Hub가 선별한 "오픈소스" 유형의 리소스로, 도구 카테고리에 속하며 고급 수준의 학습자에게 적합합니다. ggml community이(가) 제공하며 2026-07-24에 마지막으로 업데이트되었고, 편집자 평가는 4.8/5입니다. 원본 페이지를 열려면 오른쪽의 "리소스 방문"을 클릭하세요.

태그

로컬 LLM추론GGUF

주요 기능

  • GGUF 모델의 효율적인 CPU/GPU 추론
  • 소박한 하드웨어에도 들어가는 양자화
  • OpenAI 호환 API의 서버 모드

장점

  • +파이썬 없이 거의 어디서든 구동
  • +수많은 도구가 딛고 선 표준 엔진
  • +많은 로컬 도구가 기반으로 삼는 레퍼런스 엔진

단점

  • 커맨드라인 우선, GUI는 다른 도구의 몫
  • 명령줄 우선이라 UI는 직접 구성해야 함
  • 양자화 모델은 크기 대비 품질을 일부 희생

자주 묻는 질문