EBOX × EAR CLOUD EAR CLOUD
Trang chủ / Công nghệ cốt lõi / Thuật toán AI giọng nói biên

Thuật toán giọng nói biên: nghe rõ mới trả lời đúng

Chốt chặn đầu tiên tại hiện trường công nghiệp nằm ngay trên chip thiết bị: đánh thức, khử ồn, phát hiện đều chạy cục bộ, chỉ giọng nói hợp lệ được đẩy lên — chống ồn, tiết kiệm băng thông, bảo vệ riêng tư.

Đánh thức WakeNet102–3ms mỗi khung tại thiết bịDự phòng offline MultiNet
PIPELINE · CHUỖI TRÊN THIẾT BỊ

Năm bước, đều chạy trên chip của thiết bị

Từ thu âm đến "có nên đẩy lên không" — thiết bị xử lý trọn một lượt; đám mây chỉ nhận giọng nói đáng nhận diện.

Đánh thức WakeNet10

Từ đánh thức tùy biến theo thương hiệu, pipeline huấn luyện bằng tổng hợp TTS, độ chính xác 95–98% so với ghi âm người thật.

AFE front-end âm thanh

AEC triệt tiếng vang + khử ồn + beamforming mảng mic, bắt trúng giọng người giữa tiếng ồn.

Phát hiện VADNet

VAD mạng nơ-ron phân biệt nói và ngắt ở mức mili-giây.

Dự phòng offline MultiNet

Mất mạng vẫn có 30 lệnh cục bộ phản hồi tức thì — dây chuyền không bao giờ điếc.

Đẩy luồng âm thanh lên

WebSocket mã hóa, nhận diện cấp mô hình lớn trên mây.

SO SÁNH ASR

ASR nhận diện giọng nói · So sánh lựa chọn

EBOX dùng mô hình nhận diện mã nguồn mở thế hệ mới kiến trúc LLM.

Phương ánNgôn ngữ chínhĐặc điểmĐộ trễ
Qwen3-ASR-1.7BEBOX lựa chọn30 ngôn ngữ + 22 phương ngữ Trung
Trung/Anh/Nhật/Hàn/Việt/Thái/Đức/Tây/Bồ/Indo đủ cả
Nhận diện kiến trúc LLM; thiên lệch hotword ngành vạn token — mã vật tư, mã lô càng lạ càng hiệu quả; suy luận thời gian thực trên CPU thuần, không cần GPUNhận diện streaming vừa nói vừa nhận
0.1–0.3s / mỗi giây âm thanh
nhắc xong là có văn bản đầy đủ
ASR cục bộ truyền thống
nhóm Paraformer
Chủ yếu Trung/AnhKiến trúc chín, nhưng ít ngôn ngữ và yếu mở rộng hotwordNhanh, nhưng hạn chế ngôn ngữ
Whisper90+ ngôn ngữTổng quát tốt; không có cơ chế hotword, có nguy cơ ảo giác, tốn tính toánKhó real-time trên CPU
API đám mâyPhủ rộngPhụ thuộc mạng ngoài, dữ liệu giọng nói ra khỏi nhà máy, trả phí theo lượng dài hạnChịu ảnh hưởng biến động mạng
SO SÁNH TTS

TTS tổng hợp giọng nói · So sánh lựa chọn

Engine tổng hợp cục bộ, giấy phép sạch, không phụ thuộc đám mây.

Phương ánNgôn ngữ chínhĐặc điểmĐộ trễ
Piper / VITS tổng hợp cục bộEBOX lựa chọn60+ ngôn ngữ
Tiếng Việt 3 giọng ra mắt đầu tiên
Tổng hợp CPU hoàn toàn cục bộ, giấy phép nhóm MIT yên tâm thương mại; một runtime mở rộng engine theo từng ngôn ngữ; lớp chuẩn hóa cách đọc số / mã vị trí trước — phát âm thanh không mơ hồGói đầu 100–300ms
phát streaming, nói khi vừa sinh
MeloTTS6 ngôn ngữCPU real-time, đọc trộn Trung-Anh, engine dự phòng đa ngôn ngữReal-time
TTS đám mây140+ ngôn ngữÂm thanh đẹp nhưng cần mạng — nội bộ công nghiệp không dùng đượcChịu ảnh hưởng RTT mạng
95–98%
độ chính xác mô hình đánh thức (huấn luyện đối chiếu ghi âm người thật)
2–3 ms
thời gian xử lý mỗi khung tại thiết bị
30 lệnh
lệnh offline phản hồi tức thì khi mất mạng
0
âm thanh đánh thức nhầm bị đẩy lên (lọc im lặng tại thiết bị)
Tiếp theo:Hội thoại song công

Muốn kiểm chứng các thuật toán này tại hiện trường của bạn?

Đặt demo — mang hotword ngành hàng của bạn đến thử.