跳到主要内容
开源 · 可自托管

一个下午,做出你的 AI 语音硬件。

Vibbo 为开发者准备好了完整链路:ESP32 固件、有文档的设备协议,以及一个可以随时切换大模型、语音和工具的控制台——不用自己再搭一遍语音流水线。

MIT 开源 · 支持自托管或直接使用云端控制台 · 无需信用卡

  • ESP32-S3 / C3 / P4
  • WebSocket + MQTT
  • MCP 工具调用
  • OTA 升级
智能体配置设备在线
模型
任意 OpenAI 兼容
音色
Nova · 温暖女声
角色
工坊向导
工具
智能家居 · 天气

实时会话

把客厅的灯调暗一点。

好了,客厅现在是 30%。今晚要一直保持吗?

端到端约 600ms

快速开始

四步,让一块开发板开口说话。

不用自己写语音流水线,也不用逆向协议:烧录、配网、配置、对话。

  1. 1

    烧录固件

    使用为 ESP32-S3、C3、P4 预编译的固件,也可以从源码自行编译。

  2. 2

    配网绑定

    设备联网后会显示六位验证码,在控制台输入即可绑定到你的账号。

  3. 3

    配置智能体

    选择大模型、语音服务、音色与角色设定,下一轮对话立即生效。

  4. 4

    开始对话

    唤醒设备就能实时对话,每一次会话、工具调用与文本记录都可回溯。

vibbo-cli
$ vibbo device pair --code 482913
  board      esp32-s3
  transport  websocket
  agent      workshop-guide
  status     paired

$ vibbo session tail
  wake     "hey vibbo"
  asr      "dim the living room lights"
  tool     home.set_brightness(30)
  tts      nova · 612ms

核心能力

语音链路需要的一切,都已经接好了。

Vibbo 把流式语音识别、大模型和语音合成串成一条低延迟链路,并且每一段都能在控制台里换掉。

实时语音对话

流式 ASR → LLM → TTS,支持离线唤醒与随时打断,回复延迟控制在一秒以内。

一键切换音色

按智能体切换语音服务、音色、语速与语言,不用重新烧录固件。

模型无关

接入任意 OpenAI 兼容的模型或服务商,需求变了随时替换。

MCP 工具调用

让智能体真正做事:端侧控制外设,云端接入智能家居与搜索。

设备与 OTA 管理

注册设备、按智能体分组,并通过 OTA 推送固件更新。

会话可观测

查看每一次回复背后的文本记录、耗时与工具调用。

系统架构

从麦克风到大模型,只有一条链路。

每一层都可替换:可以整套使用,也可以只用服务端,接上你自己的硬件。

01

硬件层

MCU + 麦克风 + 喇叭 + 显示屏

02

固件层

语音唤醒 + 音频编解码 + 通信

03

协议层

WebSocket / MQTT / MCP

04

服务端

大模型 + ASR + TTS + 记忆 + 工具

开源自托管

你交付的这套东西,归你所有。

设备协议、服务端和控制台,都可以自己运行、阅读和改写。

在 GitHub 上查看

有文档的设备协议

任何能跑通 WebSocket 设备链路的硬件都能接进来。

不锁定服务商

按智能体自由组合模型、语音、记忆与工具服务。

可自托管服务端

用 Docker 把整套服务跑在你自己的基础设施上。

全链路可追踪

读源码、看会话、按需改造。

随时可以开始

今天就做出第一台会说话的设备。

创建智能体、挑一个音色、绑定一块开发板——控制台会一步步带你完成。