La pile d’IA vocale
La création d’un assistant vocal nécessite trois composantes : la reconnaissance vocale (STT), un LLM pour le raisonnement, et la synthèse vocale (TTS).
Options de reconnaissance vocale
- Whisper (OpenAI) : Haute précision, 99 langages, open source.
- Deepgram : Streaming en temps réel, faible latence, IA de conversation.
- AssemblyAI : Idéal pour la transcription de réunions avec diarisation de l’orateur.
- Google Speech-to-Text : Intégré à GCP, adapté à Android.
Options de synthèse vocale
- ElevenLabs : Voix les plus naturelles, clonage vocal, étendue émotionnelle.
- OpenAI TTS : API simple de bonne qualité, 6 voix.
- Google WaveNet : De nombreuses langues, qualité raisonnable.
- Coqui TTS : Open source, auto-hébergeable, clonage vocal.
Motifs architecturaux
### Pipeline simple
1. Enregistrer l’audio → STT → texte
2. Envoyer le texte au LLM → réponse
3. Envoyer une réponse à TTS → jouer l’audio
### Pipeline de streaming (latence plus faible)
1. Diffuser des morceaux audio vers STT en temps réel.
2. Au fur et à mesure que les transcriptions partielles arrivent, pré-chauffez le LLM.
3. Diffuser progressivement les tokens de réponse du LLM vers le TTS.
4. Diffusez les morceaux audio au fur et à mesure qu’ils arrivent.
Optimisation de la latence
- Utilisez le streaming à chaque étape.
- Pré-connecter les connexions WebSocket.
- Utiliser des fonctions edge pour le routage.
- Cible : moins de 1 seconde entre la fin de la parole et le début de la réponse de l’IA.
Outils et cadres
- Vocode : Cadre open source pour agents vocaux.
- LiveKit : Infrastructure audio/vidéo en temps réel.
- Pipecat : le cadre de Daily pour les pipelines d’IA vocale.