Der Voice AI Stack

Der Bau eines Sprachassistenten erfordert drei Komponenten: Speech-to-Text (STT), ein LLM für das Reasoning und Text-to-Speech (TTS).

Sprach-zu-Text-Optionen

  • Whisper (OpenAI): Hohe Genauigkeit, 99 Sprachen, Open Source.
  • Deepgram: Echtzeit-Streaming, niedrige Latenz, Konversations-KI.
  • AssemblyAI: Gut für Meeting-Transkription mit Sprecherzuordnung.
  • Google Speech-to-Text: Integriert mit GCP, gut für Android.

Text-zu-Sprache-Optionen

  • ElevenLabs: Die natürlichsten Stimmen, Stimmklonen, emotionale Bandbreite.
  • OpenAI TTS: Gute Qualität, einfache API, 6 Stimmen.
  • Google WaveNet: Viele Sprachen, angemessene Qualität.
  • Coqui TTS: Open-Source, selbsthostbar, Sprachklonen.

Architekturmuster

### Einfache Pipeline

1. Audio → STT → Text aufnehmen

2. Text an das LLM senden → Antwort

3. Antwort an TTS senden → Audio abspielen

### Streaming-Pipeline (niedrigere Latenz)

1. Audio-Abschnitte in Echtzeit auf STT streamen.

2. Wenn teilweise Transkripte eintreffen, wird das LLM vorgewärmt.

3. Streame LLM-Antwort-Tokens schrittweise zu TTS.

4. Spiele Audio-Abschnitte ab, sobald sie eintreffen.

Latenzoptimierung

  • Nutze Streaming in jeder Phase.
  • Stelle WebSocket-Verbindungen vorab her.
  • Verwende Edge-Funktionen für das Routing.
  • Ziel: < 1 Sekunde vom Ende der Nutzeräußerung bis zum Antwortbeginn der KI.

Werkzeuge & Frameworks

  • Vocode: Open-Source-Framework für Sprachagenten.
  • LiveKit: Echtzeit-Audio-/Video-Infrastruktur.
  • Pipecat: Das Daily-Framework für Sprach-KI-Pipelines.