音声AIスタック

音声アシスタントには3つのコンポーネントが必要:STT、LLM、TTSです。

STTオプション

  • Whisper: 99言語対応、オープンソースです。
  • Deepgram: リアルタイムストリーミングです。

TTSオプション

  • ElevenLabs: 最も自然な音声です。
  • OpenAI TTS: シンプルなAPIです。

遅延最適化

  • 各ステージでストリーミングを使用してください。
  • 目標:ユーザー発話終了からAI応答開始まで1秒未満です。

アーキテクチャパターン

本番音声アシスタントの多くはパイプライン:STT→LLM処理→TTSです。各ステージをストリーミングするかバッファリングかが鍵です。ストリーミングなら500ms以内に最初の単語が聞こえます。

レイテンシ予算

優れた音声アシスタントは1–2秒で応答します。STT 200–500ms、LLM初トークン 300–800ms、TTS 200–400msです。2秒以内に収めるにはWhisper large-v3-turbo、GPT-5-mini、ストリーミングTTSを使用してください。

よくある落とし穴

  • エコーと割り込み: エコーキャンセルなしではアシスタントが自分を聞いてループします。
  • 無音検出: ユーザーが発話を終えたタイミングの判断は難しいです。Silero VAD等で調整してください。
  • 訛りのバイアス: 非標準訛りではSTT性能が低下します。多様な話者でテストしてください。