Der Voice AI Stack
Der Bau eines Sprachassistenten erfordert drei Komponenten: Speech-to-Text (STT), ein LLM für das Reasoning und Text-to-Speech (TTS).
Sprach-zu-Text-Optionen
- Whisper (OpenAI): Hohe Genauigkeit, 99 Sprachen, Open Source.
- Deepgram: Echtzeit-Streaming, niedrige Latenz, Konversations-KI.
- AssemblyAI: Gut für Meeting-Transkription mit Sprecherzuordnung.
- Google Speech-to-Text: Integriert mit GCP, gut für Android.
Text-zu-Sprache-Optionen
- ElevenLabs: Die natürlichsten Stimmen, Stimmklonen, emotionale Bandbreite.
- OpenAI TTS: Gute Qualität, einfache API, 6 Stimmen.
- Google WaveNet: Viele Sprachen, angemessene Qualität.
- Coqui TTS: Open-Source, selbsthostbar, Sprachklonen.
Architekturmuster
### Einfache Pipeline
1. Audio → STT → Text aufnehmen
2. Text an das LLM senden → Antwort
3. Antwort an TTS senden → Audio abspielen
### Streaming-Pipeline (niedrigere Latenz)
1. Audio-Abschnitte in Echtzeit auf STT streamen.
2. Wenn teilweise Transkripte eintreffen, wird das LLM vorgewärmt.
3. Streame LLM-Antwort-Tokens schrittweise zu TTS.
4. Spiele Audio-Abschnitte ab, sobald sie eintreffen.
Latenzoptimierung
- Nutze Streaming in jeder Phase.
- Stelle WebSocket-Verbindungen vorab her.
- Verwende Edge-Funktionen für das Routing.
- Ziel: < 1 Sekunde vom Ende der Nutzeräußerung bis zum Antwortbeginn der KI.
Werkzeuge & Frameworks
- Vocode: Open-Source-Framework für Sprachagenten.
- LiveKit: Echtzeit-Audio-/Video-Infrastruktur.
- Pipecat: Das Daily-Framework für Sprach-KI-Pipelines.