오픈소스 LLM 스택
오픈 웨이트 모델로 실행하고 구축하기: 로컬 런타임, 추론 서버, 앱 프레임워크.
Ollama를 이용한 로컬 LLM 배포
Llama·Mistral·Phi 등 오픈소스 LLM을 로컬 머신에서 다운로드하고 실행할 수 있는 크로스 플랫폼 도구입니다. CLI, 로컬 API 서버, OpenAI 호환 엔드포인트를 제공하여 GPU나 클라우드 계정 없이 프라이빗하게 모델을 체험할 수 있습니다. 오프라인 AI 기능이 필요하거나 프로덕션 배포 전 프롬프트를 테스트하려는 개발자에게 적합합니다.
vLLM 고성능 추론 프레임워크
vLLM는 PagedAttention을 활용해 메모리 효율과 처리량을 획기적으로 개선한 대규모 언어 모델용 고처리량 추론·서빙 엔진입니다. 연속 배치, 텐서 병렬 처리, OpenAI 호환 API 서빙을 지원하여 대규모 LLM 배포의首选方案입니다.
오픈 웹 UI
Open WebUI는 Ollama와 OpenAI 호환 API를 즉시 지원하는 기능 풍부한 셀프호스팅 AI 채팅 인터페이스입니다. 완전 오프라인으로 동작하며, 세련된 다중 모델 대화 경험, 역할 관리, Markdown 지원, 플러그인 확장 기능을 제공하여 팀과 개인 모두에게 적합합니다.
LM 스튜디오 로컬 모델 클라이언트
LM Studio는 원클릭으로 오픈소스 LLM을 로컬에서 다운로드·실행하는 데스크톱 앱입니다. 모델과 채팅할 수 있는 세련된 GUI, OpenAI 호환 로컬 API 서버, GGUF/GGML 형식 지원을 제공하며 커맨드라인이나 GPU 전문 지식 없이 사용할 수 있습니다.
Dify LLM 앱 개발 플랫폼
Dify는 시각적 워크플로 오케스트레이션, 내장 RAG 엔진, 에이전트 기능을 결합한 오픈소스 LLM 앱 개발 플랫폼입니다. 개발자와 비기술 사용자 모두 여러 모델 제공자를 지원하고 원활한 API 통합으로 AI 앱을 빠르게 구축·테스트·배포할 수 있습니다.
PyTorch 딥러닝 프레임워크
PyTorch는 Meta에서 개발한 선도적 오픈소스 딥러닝 프레임워크로, 동적 계산 그래프와 Python 친화적 인터페이스로 유명합니다. 최첨단 AI 연구부터 프로덕션 배포까지 지원하며, GPU와 TPU에서 모델을 훈련·디버깅·확장할 수 있는 풍부한 도구 생태계를 갖추고 있습니다.
포옹하기 페이스 트랜스포머 튜토리얼
NLP와 컴퓨터 비전의 업계 표준 라이브러리 Hugging Face Transformers 공식 튜토리얼입니다. 텍스트 분류·토큰화·번역·이미지 세분화 등을 다루며 PyTorch와 TensorFlow 백엔드용 코드 예제를 제공합니다. 사전 학습 모델을 활용하거나 커스텀 데이터셋에서 파인튜닝하여 프로덕션에 활용하려는 실무자를 대상으로 합니다.
메타 라마
Llama는 오픈소스 AI 생태계의 중추인 Meta의 오픈 웨이트 언어 모델 제품군으로, 로컬이나 어느 클라우드에서든 배포할 수 있습니다. 경량부터 프론티어급까지 다양한 크기로 제공되며, 수많은 파인튜닝 파생 모델의 기반이 되어 조직이 AI 스택을 완전히 통제할 수 있게 합니다.
llama.cpp
llama.cpp는 CPU와 일반 소비자용 GPU에서 오픈 LLM을 효율적으로 구동하는 경량 C/C++ 추론 엔진으로, Ollama·LM Studio 등 많은 로컬 AI 도구의 기반입니다. GGUF 양자화 포맷 덕분에 전용 가속기 없이도 대형 모델을 평범한 하드웨어에서 돌릴 수 있습니다.