본문으로 건너뛰기

추론(Inference)

학습된 모델을 실행해 출력을 생성하는 과정으로, 학습과 구분됩니다.

추론 속도는 초당 토큰 수로 재고, 지연 시간은 채팅 경험을 좌우합니다. vLLM 같은 서빙 엔진과 Groq 같은 하드웨어가 바로 이 추론 처리량과 비용을 최적화하기 위해 존재합니다.

관련 리소스