음성 AI 스택
음성 비서를 구축하려면 세 가지 요소가 필요합니다: 음성-텍스트(STT), 추론을 위한 LLM, 그리고 텍스트-음성 변환(TTS).
음성 인식 옵션
- Whisper (OpenAI): 높은 정확도, 99개 언어, 오픈소스.
- Deepgram: 실시간 스트리밍, 저지연, 대화 AI.
- AssemblyAI: 회의 전사와 화자 일기 작성에 적합합니다.
- Google 음성 변환 텍스트: GCP와 통합되어 안드로이드에 적합합니다.
텍스트 음성 변환 옵션
- ElevenLabs: 가장 자연스러운 목소리, 음성 복제, 감정 범위.
- OpenAI TTS: 품질이 좋고 간단한 API, 6음성.
- Google WaveNet: 여러 언어, 괜찮은 품질.
- Coqui TTS: 오픈소스, 자체 호스팅, 음성 복제.
건축 패턴
### 단순한 파이프라인
1. STT → 오디오 녹음 → 텍스트
2. LLM에 문자 보내기 → 응답
3. TTS에 응답을 보내→ 오디오 재생
### 스트리밍 파이프라인 (낮은 지연 시간)
1. 오디오 청크를 실시간으로 STT로 스트리밍합니다.
2. 부분 성적표가 도착하면 LLM을 예열하세요.
3. LLM 응답 토큰을 TTS로 점진적으로 스트리밍합니다.
4. 오디오 청크가 도착할 때마다 재생하세요.
지연 시간 최적화
- 모든 단계에서 스트리밍을 사용하세요.
- WebSocket 연결 전 연결
- 라우팅을 위해 엣지 함수를 사용하세요.
- 목표: 사용자가 말을 멈추고 < 1초 후 AI가 응답하기 시작합니다.
도구 및 프레임워크
- Vocode: 음성 에이전트용 오픈 소스 프레임워크.
- LiveKit: 실시간 오디오/비디오 인프라.
- Pipecat: Daily의 음성 AI 파이프라인 프레임워크.