왜 서버리스 AI인가요?
전통적인 GPU 서버는 비싸고 대부분 유휴 상태입니다. 서버 없는 추론은 실제 사용량에 대해서만 비용을 지불할 수 있게 해줍니다.
플랫폼
### Modal
- 파이썬 네이티브 서버리스 클라우드.
- 코드 변경을 통한 GPU 접근.
- ML 파이프라인과 배치 추론에 매우 적합합니다.
- 가격 책정: 초당 GPU 청구.
### Replicate
- API를 통해 오픈 소스 모델을 실행합니다.
- 인프라 관리 금지.
- 방대한 모델 라이브러리(Llama, Stable Diffusion, Whisper).
- 가격: 초당 GPU 시간.
### 클라우드플레어 워커스 AI
- 전 세계적으로 엣지 배포 모델.
- 최종 사용자에게 낮은 지연 시간.
- 모델 선택은 제한적이지만 점점 증가하고 있습니다.
- 가격: 요청당
### Banana / Together AI
- LLM 추론에 특화됨.
- 0에서 수천 건의 요청까지 자동 확장.
- 대량 작업량에 대한 경쟁력 있는 가격 제공.
건축 패턴
- 냉간 시작 완화: 모델 캐싱과 사전 예열 사용을 사용하세요.
- 요청 큐잉: 스케일업 중 버퍼 요청.
- Edge + Cloud: 가장자리에서는 단순 모델, 클라우드에서는 복잡한 모델.
서버리스를 사용하지 말아야 할 때가 언제
- 일관된 고처리량 워크로드 (>GPU 사용률 80%).
- 서버 없는 GPU 메모리에 너무 큰 모델.
- 지연 시 민감한 애플리케이션에서 <50ms 응답이 필요합니다.