コンテンツへスキップ

推論(Inference)

学習済みモデルを実行して出力を得るプロセス。学習と対になる。

推論速度は通常トークン/秒で測り、レイテンシはチャット体験に重要。vLLM のようなサービングエンジンや Groq のようなハードが推論スループットとコストを最適化する。

関連リソース