Xiaozhi AI Backend for ESP32 Devices
xiaozhi-esp32-server-golang 是一款高性能、全流式的 AI 后端服务,专为物联网与智能语音场景设计。项目基于 Go 语言开发,集成了 ASR(自动语音识别)、LLM(大语言模型)、TTS(语音合成)等核心能力,支持大规模并发与多协议接入,助力智能终端与边缘设备的 AI 语音交互。
下载对应平台的压缩包,解压后运行即可:
启动后访问 http://<服务器IP或域名>:8080 进入 Web 控制台进行配置。
适用于开发环境或需要定制编译的场景。
安装依赖(以 Ubuntu 为例)
# Go 1.20+
# Opus 编解码
sudo apt-get install -y pkg-config libopus0 libopusfile-dev
# ONNX Runtime(1.21.0)
wget https://github.com/microsoft/onnxruntime/releases/download/v1.21.0/onnxruntime-linux-x64-1.21.0.tgz
tar -xzf onnxruntime-linux-x64-1.21.0.tgz
sudo cp -r onnxruntime-linux-x64-1.21.0/include/* /usr/local/include/onnxruntime/
sudo cp -r onnxruntime-linux-x64-1.21.0/lib/* /usr/local/lib/
sudo ldconfig
# ten_vad 运行时依赖
sudo apt install -y libc++1 libc++abi1
📖 完整依赖说明与 Windows/macOS 配置请参考 config.md
主程序、控制台前后端、声纹服务的分离编译与 AIO 打包流程请参考 doc/compile_deploy.md
参考 FunASR 官方文档 部署。
编译与启动
# 编译
go build -o xiaozhi_server ./cmd/server/
# 启动(配置文件详见 config/config.yaml)
./xiaozhi_server -c config/config.yaml
| 模块 | 功能简介 | 技术栈 |
|---|---|---|
| VAD | 语音活动检测 | Silero VAD / WebRTC VAD / ten_vad |
| ASR | 语音识别 | FunASR / Doubao ASR |
| LLM | 大模型推理 | Eino 框架兼容、OpenAI、Ollama 等 |
| TTS | 语音合成 | Doubao / EdgeTTS / CosyVoice |
| MCP | 多协议接入、MCP 市场发现导入、设备/智能体维度远程调用调试 | MCP Server / 接入点 / MCP Market / SSE / StreamableHTTP / WebSocket Controller / MCP Tool Call |
| OpenClaw | 智能体维度接入点、进入/退出关键词模式切换、会话消息转发与测试 | OpenClaw WebSocket / Agent Endpoint / Chat Router |
| 视觉 | 视觉处理 | Doubao / 阿里云视觉 |
| 声纹识别 | 说话人识别 | sherpa-onnx + 向量数据库 |
| 声音复刻 | 用户侧复刻音色创建与试听 | Minimax / CosyVoice / 千问 |
| 知识库(RAG) | 文档同步、召回测试与对话检索 | Dify / RAGFlow / WeKnora |
欢迎提交 Issue、PR 或建议!
MIT License
个人微信:hackers365 (加微信拉你进交流群)
开源不易,您的赞助会让项目持续更新
© 2024 xiaozhi-esp32-server-golang
Go
75.0%
Vue
20.7%
JavaScript
1.6%
HTML
1.1%
Xiaozhi AI Backend for ESP32 Devices
xiaozhi-esp32-server-golang 是一款高性能、全流式的 AI 后端服务,专为物联网与智能语音场景设计。项目基于 Go 语言开发,集成了 ASR(自动语音识别)、LLM(大语言模型)、TTS(语音合成)等核心能力,支持大规模并发与多协议接入,助力智能终端与边缘设备的 AI 语音交互。
下载对应平台的压缩包,解压后运行即可:
启动后访问 http://<服务器IP或域名>:8080 进入 Web 控制台进行配置。
适用于开发环境或需要定制编译的场景。
安装依赖(以 Ubuntu 为例)
# Go 1.20+
# Opus 编解码
sudo apt-get install -y pkg-config libopus0 libopusfile-dev
# ONNX Runtime(1.21.0)
wget https://github.com/microsoft/onnxruntime/releases/download/v1.21.0/onnxruntime-linux-x64-1.21.0.tgz
tar -xzf onnxruntime-linux-x64-1.21.0.tgz
sudo cp -r onnxruntime-linux-x64-1.21.0/include/* /usr/local/include/onnxruntime/
sudo cp -r onnxruntime-linux-x64-1.21.0/lib/* /usr/local/lib/
sudo ldconfig
# ten_vad 运行时依赖
sudo apt install -y libc++1 libc++abi1
📖 完整依赖说明与 Windows/macOS 配置请参考 config.md
主程序、控制台前后端、声纹服务的分离编译与 AIO 打包流程请参考 doc/compile_deploy.md
参考 FunASR 官方文档 部署。
编译与启动
# 编译
go build -o xiaozhi_server ./cmd/server/
# 启动(配置文件详见 config/config.yaml)
./xiaozhi_server -c config/config.yaml
| 模块 | 功能简介 | 技术栈 |
|---|---|---|
| VAD | 语音活动检测 | Silero VAD / WebRTC VAD / ten_vad |
| ASR | 语音识别 | FunASR / Doubao ASR |
| LLM | 大模型推理 | Eino 框架兼容、OpenAI、Ollama 等 |
| TTS | 语音合成 | Doubao / EdgeTTS / CosyVoice |
| MCP | 多协议接入、MCP 市场发现导入、设备/智能体维度远程调用调试 | MCP Server / 接入点 / MCP Market / SSE / StreamableHTTP / WebSocket Controller / MCP Tool Call |
| OpenClaw | 智能体维度接入点、进入/退出关键词模式切换、会话消息转发与测试 | OpenClaw WebSocket / Agent Endpoint / Chat Router |
| 视觉 | 视觉处理 | Doubao / 阿里云视觉 |
| 声纹识别 | 说话人识别 | sherpa-onnx + 向量数据库 |
| 声音复刻 | 用户侧复刻音色创建与试听 | Minimax / CosyVoice / 千问 |
| 知识库(RAG) | 文档同步、召回测试与对话检索 | Dify / RAGFlow / WeKnora |
欢迎提交 Issue、PR 或建议!
MIT License
个人微信:hackers365 (加微信拉你进交流群)
开源不易,您的赞助会让项目持续更新
© 2024 xiaozhi-esp32-server-golang
Go
75.0%
Vue
20.7%
JavaScript
1.6%
HTML
1.1%