La pila de IA de voz

Construir un asistente de voz requiere tres componentes: Reconocimiento de voz (STT), un LLM para razonamiento y Texto a Voz (TTS).

Opciones de conversión de voz a texto

  • Whisper (OpenAI): Alta precisión, 99 lenguajes, código abierto.
  • Deepgram: Streaming en tiempo real, baja latencia, IA de conversación.
  • AssemblyAI: Bueno para transcripción de reuniones con diarización de oradores.
  • Google Speech-to-Text: Integrado con GCP, bueno para Android.

Opciones de texto a voz

  • ElevenLabs: Voces más naturales, clonación vocal, rango emocional.
  • OpenAI TTS: API sencilla y de buena calidad, 6 voces.
  • Google WaveNet: Muchos idiomas, calidad razonable.
  • Coqui TTS: Código abierto, autoalojamiento, clonación de voz.

Patrones arquitectónicos

### Pipeline sencillo

1. Grabar audio → STT → texto

2. Enviar un mensaje de texto al LLM → respuesta

3. Enviar respuesta a TTS → reproducir audio

### Pipeline de streaming (Menor latencia)

1. Transmitir fragmentos de audio a STT en tiempo real.

2. Cuando lleguen transcripciones parciales, calienta previamente el LLM.

3. Transmitir tokens de respuesta LLM a TTS de forma incremental.

4. Reproduce fragmentos de audio a medida que lleguen.

Optimización de latencia

  • Utiliza el streaming en cada etapa.
  • Preconectar conexiones WebSocket.
  • Usa funciones edge para el enrutamiento.
  • Objetivo: < 1 segundo desde que el usuario deja de hablar hasta que la IA empieza a responder.

Herramientas y Marcos

  • Vocode: Framework de código abierto para agentes de voz.
  • LiveKit: Infraestructura de audio/vídeo en tiempo real.
  • Pipecat: El marco de Daily para pipelines de IA de voz.