Speech-to-Speech
本地语音 agent 管线,兼容 OpenAI Realtime,每环节可替换
一个模块化语音 agent 管线:按 VAD→STT→LLM→TTS 四阶段串联,通过 WebSocket 和 WebRTC 暴露 OpenAI Realtime 核心事件集。每个环节都有多个可替换后端:VAD 用 Silero VAD v5,STT 可选 Parakeet TDT 或 Whisper 系列,LLM 支持 OpenAI 兼容 API 或本地 Transformers/mlx-lm,TTS 默认 Qwen3-TTS 也可切换 Kokoro、Pocket TTS 等。LLM 可以对接云端提供商、Hugging Face Inference Providers,或本地的 vLLM/llama.cpp 服务器。该管线已作为数千台 Reachy Mini 机器人的对话后端在生产中运行。
pip install speech-to-speech git clone https://github.com/huggingface/speech-to-speech.git && cd speech-to-speech && docker compose up git clone https://github.com/huggingface/speech-to-speech.git && cd speech-to-speech && uv sync