实时语音对话
流式 ASR → LLM → TTS,支持语音唤醒、自然轮次和随时打断,让对话保持流畅响应。
流式识别
正在思考
正在合成
Built with Agora Conversational AI
让联网设备具备倾听、思考、表达和执行能力——以 Agora Conversational AI 为实时对话核心,在一个平台中自由组合模型、工具和设备运营。
Agora Conversational AI 实时链路
从物理世界输入到智能回复的一条实时链路。
Physical AI 设备
麦克风 + 扬声器 + 传感器
Vibbo
智能体与设备编排
Agora Conversational AI
实时对话智能
工具与动作
端侧与云端执行
一条连续的实时语音链路
从麦克风输入,到语音回复,再到真实世界中的动作执行。
语音唤醒、流式音频与 VAD,面向真实房间环境处理声音输入。
通过 Agora Conversational AI,在变化的网络环境中保持低延迟对话。
按智能体选择 LLM、ASR、TTS、音色、记忆和角色设定。
流式合成语音、响应用户打断,并调用端侧或云端工具。
面向产品交付的完整实时语音技术栈
核心能力
Vibbo 围绕 Agora Conversational AI,把流式语音识别、大模型、语音合成、工具和硬件运营连接成完整产品链路。
流式 ASR → LLM → TTS,支持语音唤醒、自然轮次和随时打断,让对话保持流畅响应。
流式识别
正在思考
正在合成
为每个智能体选择语音识别、大模型和音色,同时保持硬件接入方式不变。
流式语音识别
已为当前智能体配置
OpenAI 兼容模型
已为当前智能体配置
神经网络音色
已为当前智能体配置
注册设备、按智能体分组,并通过 OTA 推送固件更新。
ESP32-S3
厨房 · 固件 1.6.2
桌面陪伴设备
工作室 · 固件 1.6.2
语音音箱
实验室 · 固件 1.5.9
从转写文本到工具结果逐步查看每个轮次,追踪智能体听到了什么、如何决策以及怎样回答。
语音流
Realtime
对话状态
正在聆听
工具调用
1
把客厅灯光调暗一点。
好了,客厅灯光已经调到 30%。
系统架构
一条可替换的软硬件链路把麦克风连接到实时 AI 智能体,Vibbo 则把所有运营控制集中在一个控制台中。
MCU + 麦克风 + 喇叭 + 显示屏
语音唤醒 + 音频编解码 + 通信
WebSocket / MQTT / MCP
Agora Conversational AI + ASR + LLM + TTS + 工具
为硬件而生
同一个语音平台可以服务所有需要在物理世界中倾听、思考、表达和执行的产品。
为桌面伙伴和环境设备创建有个性、音色、记忆和工具能力的长期陪伴体验。
为中控、家电、面板和空间设备加入自然语音控制与工具执行能力。
打造能够倾听、讲解、追问并动态调整语音体验的互动学习硬件。
让联网玩具和机器人拥有安全、可配置的角色,而不必把整套 AI 技术栈写进固件。
快速开始
无需重建实时音频和运营系统,从一块开发板快速走到可管理的语音智能体。
使用为 ESP32-S3、C3、P4 预编译的固件,也可以从源码自行编译。
设备联网后会显示六位验证码,在控制台输入即可绑定到你的账号。
选择大模型、语音服务、音色与角色设定,下一轮对话立即生效。
唤醒设备就能实时对话,每一次会话、工具调用与文本记录都可回溯。
常见问题
语音 AI 产品动态
获取产品更新、硬件接入说明和新的语音 AI 能力。