实时语音对话
流式 ASR → LLM → TTS,支持离线唤醒与随时打断,回复延迟控制在一秒以内。
Vibbo 为开发者准备好了完整链路:ESP32 固件、有文档的设备协议,以及一个可以随时切换大模型、语音和工具的控制台——不用自己再搭一遍语音流水线。
MIT 开源 · 支持自托管或直接使用云端控制台 · 无需信用卡
实时会话
把客厅的灯调暗一点。
好了,客厅现在是 30%。今晚要一直保持吗?
端到端约 600ms
快速开始
不用自己写语音流水线,也不用逆向协议:烧录、配网、配置、对话。
使用为 ESP32-S3、C3、P4 预编译的固件,也可以从源码自行编译。
设备联网后会显示六位验证码,在控制台输入即可绑定到你的账号。
选择大模型、语音服务、音色与角色设定,下一轮对话立即生效。
唤醒设备就能实时对话,每一次会话、工具调用与文本记录都可回溯。
vibbo-cli$ vibbo device pair --code 482913
board esp32-s3
transport websocket
agent workshop-guide
status paired
$ vibbo session tail
wake "hey vibbo"
asr "dim the living room lights"
tool home.set_brightness(30)
tts nova · 612ms核心能力
Vibbo 把流式语音识别、大模型和语音合成串成一条低延迟链路,并且每一段都能在控制台里换掉。
流式 ASR → LLM → TTS,支持离线唤醒与随时打断,回复延迟控制在一秒以内。
按智能体切换语音服务、音色、语速与语言,不用重新烧录固件。
接入任意 OpenAI 兼容的模型或服务商,需求变了随时替换。
让智能体真正做事:端侧控制外设,云端接入智能家居与搜索。
注册设备、按智能体分组,并通过 OTA 推送固件更新。
查看每一次回复背后的文本记录、耗时与工具调用。
系统架构
每一层都可替换:可以整套使用,也可以只用服务端,接上你自己的硬件。
MCU + 麦克风 + 喇叭 + 显示屏
语音唤醒 + 音频编解码 + 通信
WebSocket / MQTT / MCP
大模型 + ASR + TTS + 记忆 + 工具
任何能跑通 WebSocket 设备链路的硬件都能接进来。
按智能体自由组合模型、语音、记忆与工具服务。
用 Docker 把整套服务跑在你自己的基础设施上。
读源码、看会话、按需改造。