왜 서버리스 AI인가요?

전통적인 GPU 서버는 비싸고 대부분 유휴 상태입니다. 서버 없는 추론은 실제 사용량에 대해서만 비용을 지불할 수 있게 해줍니다.

플랫폼

### Modal

  • 파이썬 네이티브 서버리스 클라우드.
  • 코드 변경을 통한 GPU 접근.
  • ML 파이프라인과 배치 추론에 매우 적합합니다.
  • 가격 책정: 초당 GPU 청구.

### Replicate

  • API를 통해 오픈 소스 모델을 실행합니다.
  • 인프라 관리 금지.
  • 방대한 모델 라이브러리(Llama, Stable Diffusion, Whisper).
  • 가격: 초당 GPU 시간.

### 클라우드플레어 워커스 AI

  • 전 세계적으로 엣지 배포 모델.
  • 최종 사용자에게 낮은 지연 시간.
  • 모델 선택은 제한적이지만 점점 증가하고 있습니다.
  • 가격: 요청당

### Banana / Together AI

  • LLM 추론에 특화됨.
  • 0에서 수천 건의 요청까지 자동 확장.
  • 대량 작업량에 대한 경쟁력 있는 가격 제공.

건축 패턴

  • 냉간 시작 완화: 모델 캐싱과 사전 예열 사용을 사용하세요.
  • 요청 큐잉: 스케일업 중 버퍼 요청.
  • Edge + Cloud: 가장자리에서는 단순 모델, 클라우드에서는 복잡한 모델.

서버리스를 사용하지 말아야 할 때가 언제

  • 일관된 고처리량 워크로드 (>GPU 사용률 80%).
  • 서버 없는 GPU 메모리에 너무 큰 모델.
  • 지연 시 민감한 애플리케이션에서 <50ms 응답이 필요합니다.