音声AIスタック
音声アシスタントには3つのコンポーネントが必要:STT、LLM、TTSです。
STTオプション
- Whisper: 99言語対応、オープンソースです。
- Deepgram: リアルタイムストリーミングです。
TTSオプション
- ElevenLabs: 最も自然な音声です。
- OpenAI TTS: シンプルなAPIです。
遅延最適化
- 各ステージでストリーミングを使用してください。
- 目標:ユーザー発話終了からAI応答開始まで1秒未満です。
アーキテクチャパターン
本番音声アシスタントの多くはパイプライン:STT→LLM処理→TTSです。各ステージをストリーミングするかバッファリングかが鍵です。ストリーミングなら500ms以内に最初の単語が聞こえます。
レイテンシ予算
優れた音声アシスタントは1–2秒で応答します。STT 200–500ms、LLM初トークン 300–800ms、TTS 200–400msです。2秒以内に収めるにはWhisper large-v3-turbo、GPT-5-mini、ストリーミングTTSを使用してください。
よくある落とし穴
- エコーと割り込み: エコーキャンセルなしではアシスタントが自分を聞いてループします。
- 無音検出: ユーザーが発話を終えたタイミングの判断は難しいです。Silero VAD等で調整してください。
- 訛りのバイアス: 非標準訛りではSTT性能が低下します。多様な話者でテストしてください。