EBOX × EAR CLOUD EAR CLOUD
首页 / 核心技术 / 端侧 AI 算法

端侧语音算法:听得清,才答得准

工业现场的第一道关卡在终端芯片上完成:唤醒、降噪、检测全部本地运行,只有有效语音上行——抗噪、省带宽、保隐私。

WakeNet10 唤醒端侧 2–3ms/帧MultiNet 离线兜底
PIPELINE · 端侧链路

五步链路,全部跑在终端芯片上

从收音到「该不该上传」,端侧一次做完——云端只收到值得识别的语音。

WakeNet10 唤醒

品牌自定义唤醒词,TTS 合成训练管线,精度达真人录音 95–98%。

AFE 声学前端

AEC 回声消除 + 降噪 + 阵列波束成形,噪音中锁定人声。

VADNet 检测

神经网络 VAD,毫秒级区分说话与停顿。

MultiNet 离线兜底

断网时 30 条本地指令直达,产线永不失聪。

音频流上行

加密 WebSocket,云端大模型级识别。

ASR COMPARISON

ASR 语音识别 · 选型对比

EBOX 采用 LLM 架构新一代开源识别模型。

方案主要语音特点延时
Qwen3-ASR-1.7BEBOX 采用30 语种 + 22 方言
中/英/日/韩/越/泰/德/西/葡/印尼全覆盖
LLM 架构识别;万级 token 行业热词偏置,物料号、批次号越偏门越有效;纯 CPU 服务器实时推理,无 GPU 依赖流式边说边识别
0.1–0.3s / 每秒音频
说完即出全文
传统本地 ASR
Paraformer 类
中/英为主架构成熟,但多语种覆盖少、热词扩展能力弱快,但语种受限
Whisper90+ 语种通用性强;无热词机制、有幻觉风险、算力需求重CPU 上难以实时
云端 API覆盖广依赖外网、语音数据出厂房、按量长期付费受网络波动影响
TTS COMPARISON

TTS 语音合成 · 选型对比

本地合成引擎,许可干净、无云端依赖。

方案主要语音特点延时
Piper / VITS 本地合成EBOX 采用60+ 语种
越南语 3 音色首发
完全本地 CPU 合成,MIT 系许可商用无忧;统一运行时按语种扩展引擎;前置数字 / 库位号读法规范层,播报零歧义首包 100–300ms
流式播报,边生成边开口
MeloTTS6 语种CPU 实时、中英混读,多语种拼盘备选引擎实时
云端 TTS140+ 语种音质好但依赖联网,工业内网不可用受网络 RTT 影响
95–98%
唤醒模型精度(对照真人录音训练)
2–3 ms
端侧每帧算法处理耗时
30 条
断网离线指令即时直达
0 条
误唤醒音频上行(端侧静默过滤)
下一篇:双工对话技术

想验证这些算法在你现场的真实表现?

预约演示,带上你的行业热词来现场试。