추론(Inference)
학습된 모델을 실행해 출력을 생성하는 과정으로, 학습과 구분됩니다.
추론 속도는 초당 토큰 수로 재고, 지연 시간은 채팅 경험을 좌우합니다. vLLM 같은 서빙 엔진과 Groq 같은 하드웨어가 바로 이 추론 처리량과 비용을 최적화하기 위해 존재합니다.
학습된 모델을 실행해 출력을 생성하는 과정으로, 학습과 구분됩니다.
추론 속도는 초당 토큰 수로 재고, 지연 시간은 채팅 경험을 좌우합니다. vLLM 같은 서빙 엔진과 Groq 같은 하드웨어가 바로 이 추론 처리량과 비용을 최적화하기 위해 존재합니다.