La pila de IA de voz
Construir un asistente de voz requiere tres componentes: Reconocimiento de voz (STT), un LLM para razonamiento y Texto a Voz (TTS).
Opciones de conversión de voz a texto
- Whisper (OpenAI): Alta precisión, 99 lenguajes, código abierto.
- Deepgram: Streaming en tiempo real, baja latencia, IA de conversación.
- AssemblyAI: Bueno para transcripción de reuniones con diarización de oradores.
- Google Speech-to-Text: Integrado con GCP, bueno para Android.
Opciones de texto a voz
- ElevenLabs: Voces más naturales, clonación vocal, rango emocional.
- OpenAI TTS: API sencilla y de buena calidad, 6 voces.
- Google WaveNet: Muchos idiomas, calidad razonable.
- Coqui TTS: Código abierto, autoalojamiento, clonación de voz.
Patrones arquitectónicos
### Pipeline sencillo
1. Grabar audio → STT → texto
2. Enviar un mensaje de texto al LLM → respuesta
3. Enviar respuesta a TTS → reproducir audio
### Pipeline de streaming (Menor latencia)
1. Transmitir fragmentos de audio a STT en tiempo real.
2. Cuando lleguen transcripciones parciales, calienta previamente el LLM.
3. Transmitir tokens de respuesta LLM a TTS de forma incremental.
4. Reproduce fragmentos de audio a medida que lleguen.
Optimización de latencia
- Utiliza el streaming en cada etapa.
- Preconectar conexiones WebSocket.
- Usa funciones edge para el enrutamiento.
- Objetivo: < 1 segundo desde que el usuario deja de hablar hasta que la IA empieza a responder.
Herramientas y Marcos
- Vocode: Framework de código abierto para agentes de voz.
- LiveKit: Infraestructura de audio/vídeo en tiempo real.
- Pipecat: El marco de Daily para pipelines de IA de voz.