La pile d’IA vocale

La création d’un assistant vocal nécessite trois composantes : la reconnaissance vocale (STT), un LLM pour le raisonnement, et la synthèse vocale (TTS).

Options de reconnaissance vocale

  • Whisper (OpenAI) : Haute précision, 99 langages, open source.
  • Deepgram : Streaming en temps réel, faible latence, IA de conversation.
  • AssemblyAI : Idéal pour la transcription de réunions avec diarisation de l’orateur.
  • Google Speech-to-Text : Intégré à GCP, adapté à Android.

Options de synthèse vocale

  • ElevenLabs : Voix les plus naturelles, clonage vocal, étendue émotionnelle.
  • OpenAI TTS : API simple de bonne qualité, 6 voix.
  • Google WaveNet : De nombreuses langues, qualité raisonnable.
  • Coqui TTS : Open source, auto-hébergeable, clonage vocal.

Motifs architecturaux

### Pipeline simple

1. Enregistrer l’audio → STT → texte

2. Envoyer le texte au LLM → réponse

3. Envoyer une réponse à TTS → jouer l’audio

### Pipeline de streaming (latence plus faible)

1. Diffuser des morceaux audio vers STT en temps réel.

2. Au fur et à mesure que les transcriptions partielles arrivent, pré-chauffez le LLM.

3. Diffuser progressivement les tokens de réponse du LLM vers le TTS.

4. Diffusez les morceaux audio au fur et à mesure qu’ils arrivent.

Optimisation de la latence

  • Utilisez le streaming à chaque étape.
  • Pré-connecter les connexions WebSocket.
  • Utiliser des fonctions edge pour le routage.
  • Cible : moins de 1 seconde entre la fin de la parole et le début de la réponse de l’IA.

Outils et cadres

  • Vocode : Cadre open source pour agents vocaux.
  • LiveKit : Infrastructure audio/vidéo en temps réel.
  • Pipecat : le cadre de Daily pour les pipelines d’IA vocale.