오픈소스고급
llama.cpp
llama.cpp는 CPU와 일반 소비자용 GPU에서 오픈 LLM을 효율적으로 구동하는 경량 C/C++ 추론 엔진으로, Ollama·LM Studio 등 많은 로컬 AI 도구의 기반입니다. GGUF 양자화 포맷 덕분에 전용 가속기 없이도 대형 모델을 평범한 하드웨어에서 돌릴 수 있습니다.
개요
"llama.cpp"은(는) AI Resource Hub가 선별한 "오픈소스" 유형의 리소스로, 도구 카테고리에 속하며 고급 수준의 학습자에게 적합합니다. ggml community이(가) 제공하며 2026-07-24에 마지막으로 업데이트되었고, 편집자 평가는 4.8/5입니다. 원본 페이지를 열려면 오른쪽의 "리소스 방문"을 클릭하세요.
태그
로컬 LLM추론GGUF
주요 기능
- ▹GGUF 모델의 효율적인 CPU/GPU 추론
- ▹소박한 하드웨어에도 들어가는 양자화
- ▹OpenAI 호환 API의 서버 모드
장점
- +파이썬 없이 거의 어디서든 구동
- +수많은 도구가 딛고 선 표준 엔진
- +많은 로컬 도구가 기반으로 삼는 레퍼런스 엔진
단점
- −커맨드라인 우선, GUI는 다른 도구의 몫
- −명령줄 우선이라 UI는 직접 구성해야 함
- −양자화 모델은 크기 대비 품질을 일부 희생