EBOX × EAR CLOUD EAR CLOUD
Trang chủ / Công nghệ cốt lõi

Ba công nghệ cốt lõi

Thiết bị tự nghe được, hội thoại tự nhiên như nói chuyện, giải pháp áp dụng được tại hiện trường — nền tảng công nghệ phía sau EBOX × EAR CLOUD.

Đánh thức WakeNet10Song công ngắt lờiESP32-S31
160 ms
cửa sổ cảm nhận lượt song công
~1 giây
phản hồi đầu-cuối câu hỏi phổ biến
30+ ngôn ngữ
+ 22 phương ngữ Trung
0 rò rỉ
dữ liệu giọng nói không ra khỏi nhà máy
KIẾN TRÚC TỔNG THỂ

Một chuỗi liền mạch: từ câu nói đến việc xong

Nhân viên hỏi bằng miệng, thiết bị EBOX cảm nhận trong mili-giây và trả lời song công; nền tảng EAR CLOUD hoàn thành nhận diện, hiểu ý và gọi hệ thống doanh nghiệp. Không cần ra máy tính, không cần tay, không cần đào tạo.

Thiết bị EBOX (ESP32-S31)

Mảng micthu âm xa · beamforming
Front-end AFEAEC · khử ồn · định hướng sóng
Đánh thức WakeNet10từ đánh thức thương hiệu · chính xác 95–98%
VADNet + MultiNetphát hiện tại thiết bị · dự phòng lệnh offline
WebSocket clientchỉ đẩy giọng nói hợp lệ
⇧ Luồng âm thanh 16kHz
⇩ Phản hồi giọng nói + sự kiện điều khiển

Nền tảng EAR CLOUD (triển khai riêng)

Điều phối song công Duplugcửa sổ 160ms phán lượt · cảm nhận ngắt lời
Nhận diện Qwen3-ASR-1.7B30 ngôn ngữ · thiên lệch hotword · CPU real-time
NLU tuyến nhanhcâu hỏi phổ biến nối thẳng hệ thống · ~1 giây
Mô hình lớn chưng cất Qwen3-4Bhiểu câu dài hiếm · phân tích ý đồ & tham số
Tầng tích hợp MCPgọi công cụ chuẩn hóa · quản lý slot đa lượt
Tổng hợp cục bộ Pipergiọng đa ngôn ngữ · chuẩn hóa đọc · phát streaming
Hệ thống doanh nghiệpWMS quản lý khoMES sản xuấtERP tài nguyên
Tích hợp không sửa code

API hệ thống được tầng MCP bọc sẵn — khách không sửa một dòng code

Bản địa hóa toàn tuyến

đánh thức / nhận diện / hiểu / tổng hợp toàn bộ trong intranet — dữ liệu giọng nói không ra khỏi nhà máy

Ba lớp dự phòng

tầng quy tắc → mô hình lớn → lệnh offline tại thiết bị — dịch vụ không bao giờ điếc

TỔNG QUAN

Ba mảnh ghép, một câu nói xong việc

Nhân viên nói một câu, vài giây sau có câu trả lời — đằng sau là ba công nghệ phối hợp: mô hình trên thiết bị giúp nghe nhanh, đối thoại song công giúp nói chuyện tự nhiên, R&D nhất thể giúp áp dụng được ngay.

CÔNG NGHỆ CỐT LÕI 01

Thuật toán giọng nói biên: nghe rõ mới trả lời đúng

Chốt chặn đầu tiên tại hiện trường công nghiệp nằm ngay trên chip thiết bị: đánh thức, khử ồn, phát hiện đều chạy cục bộ, chỉ giọng nói hợp lệ được đẩy lên — chống ồn, tiết kiệm băng thông, bảo vệ riêng tư.

Đánh thức WakeNet10

Từ đánh thức tùy biến theo thương hiệu, pipeline huấn luyện bằng tổng hợp TTS, độ chính xác 95–98% so với ghi âm người thật.

AFE front-end âm thanh

AEC triệt tiếng vang + khử ồn + beamforming mảng mic, bắt trúng giọng người giữa tiếng ồn.

Phát hiện VADNet

VAD mạng nơ-ron phân biệt nói và ngắt ở mức mili-giây.

Dự phòng offline MultiNet

Mất mạng vẫn có 30 lệnh cục bộ phản hồi tức thì — dây chuyền không bao giờ điếc.

Đang vận hànhLuồng âm thanh truyền lên EAR CLOUD qua WebSocket mã hóa: nhận diện Qwen3-ASR-1.7B (30 ngôn ngữ + 22 phương ngữ Trung, thiên lệch hotword ngành hàng vạn token, thời gian thực trên CPU thuần) và tổng hợp Piper cục bộ (60+ ngôn ngữ, gói đầu 100–300ms). Xử lý mỗi khung tại thiết bị 2–3ms, không đẩy âm thanh đánh thức nhầm lên mạng.

CÔNG NGHỆ CỐT LÕI 02

Song công: như gọi điện, không như bộ đàm

Terminal giọng nói truyền thống là bán song công — bạn không thể chen ngang khi máy đang nói. EBOX dùng ba tầng công nghệ để đạt song công thật, ngắt lời được: nhân viên chen ngang bất cứ lúc nào khi máy phát, máy im trong 100ms để nghe bạn.

VAD · VADNet

VAD mạng nơ-ron phân biệt nói / ngắt / ồn trong tiếng ồn xưởng 75dB, cảm nhận ai đang nói ở mức mili-giây — phản ứng đầu tiên trước ngắt lời đến từ thiết bị, không chờ đám mây.

AEC · lọc kép công nghiệp

AEC lọc kép tuyến tính + phi tuyến triệt tiếng vang do máy tự phát, khử vang tới 40dB — máy biết mình đang nói gì, không nhầm giọng mình thành lệnh người dùng.

Điều phối SoulX-Duplug

Cửa sổ âm học 160ms liên tục phán đoán trạng thái (nghe / nói / ngắt / chờ), quyết định lượt chỉ ~250ms — phân biệt đang nghĩ và đã nói xong, nhịp như người thật.

Ngắt lời ≤100ms

Nhân viên bất ngờ nói khi máy đang phát: im trong 100ms, nghe lại, trả lời lại trong vài giây — chen ngang, sửa lời, tiếp nhận đều tự nhiên.

SoulX-Duplug được mã nguồn mở (Apache-2.0) bởi Soul AI × Đại học Giao thông Thượng Hải × Đại học Bách khoa Tây Bắc, dựa trên công nghệ đã phục vụ hàng trăm triệu người dùng.

CÔNG NGHỆ CỐT LÕI 03

Tích hợp phần cứng - phần mềm: con chip sinh ra cho AI giọng nói, nền tảng sinh ra cho hệ thống doanh nghiệp

EBOX-200 dùng ESP32-S31 — SoC flagship thế hệ mới của Espressif; nền tảng EAR CLOUD chạy mô hình lớn chưng cất nhẹ — phối hợp biên-đám mây, không cần server GPU.

ESP32-S31 · SoC flagship cho AI giọng nói

Chip RISC-V lõi kép thế hệ mới của Espressif, vào sản xuất hàng loạt năm 2026: 320MHz, SIMD 128-bit mỗi lõi, tăng tốc lệnh AI — hiệu năng CoreMark tăng khoảng 65% so với S3 thế hệ trước.

Bộ nhớ lớn · mô hình biên chạy được

PSRAM DDR 250MHz, SiP tối đa 64MB; hai bộ điều khiển I2S đồng bộ âm thanh cấp phần cứng, độ trễ thấp và độ trung thực cao.

Wi-Fi 6 + BT 5.4 + MAC gigabit

802.15.4 và MAC Ethernet gigabit, phù hợp môi trường sóng công nghiệp phức tạp; 60 GPIO, camera DVP, màn hình LCD dành cho phát triển tiếp theo.

Bảo mật cấp công nghiệp

Secure boot + mã hóa Flash/PSRAM + tăng tốc phần cứng AES/RSA/ECDSA.

Phía nền tảng: mô hình hiểu Qwen3-4B chưng cất + mô hình nhận diện Qwen3-ASR-1.7B sau lượng tử hóa chạy thời gian thực trên CPU thuần (một server 16 nhân/32GB đảm nhiệm 5 phiên đồng thời); NLU hai tuyến — câu hỏi phổ biến trả lời khoảng 1 giây qua rule engine nối thẳng hệ thống doanh nghiệp, câu hỏi dài hiếm do mô hình lớn xử lý; tầng tích hợp MCP chuẩn hóa, không cần sửa một dòng code hệ thống của khách.

CHÚNG LÀM VIỆC CÙNG NHAU

Thành một chuỗi liền mạch

Ba công nghệ không phải ba thuật ngữ song song — chúng là một chuỗi tương tác hoàn chỉnh:

Mô hình trên thiết bịNghe nhanh

Tiếng nói được đánh thức và thu tại chỗ — vừa nói là có phản hồi.

Song côngNói tự nhiên

Vừa nghe vừa nói, ngắt lời thoải mái — một câu xong việc.

R&D nhất thểÁp dụng được ngay

Thiết bị tự nghiên cứu + nền tảng mây — đặt xuống là chạy, nối hệ thống là làm.

Đó là nền tảng công nghệ của EBOX × EAR CLOUD — nhân viên nói một câu, hệ thống xong việc.
TRIỂN KHAI

Bốn cấp bậc: từ một server thí điểm đến cụm GPU

Cùng một bộ software stack, bốn hình thái triển khai. Chọn theo quy mô và ngân sách — khởi đầu nhẹ nhàng, nâng cấp mượt mà theo tăng trưởng; nâng cấp chỉ thêm phần cứng, không đổi kiến trúc, không cài lại.

Phương ánBố tríPhần cứngQuy mô
Gọn nhẹChọn thí điểmThuật toán, nền tảng và mô hình lớn trộn chung một server thường — một máy gánh toàn tuyến1 × server thường
16 nhân / 32GB / 500GB · không GPU
≤10 thiết bị EBOX
đỉnh 5 phiên đồng thời
Hiện trường công nghiệpThuật toán hạ xuống edge box (đặt tại xưởng); nền tảng & mô hình lớn trên server thường — thuật toán sát hiện trườngN × edge box (mỗi xưởng 1)
+ 1 × server thường
Mạng xưởng không ổn định
cần dự phòng mất mạng
Tiêu chuẩnKhuyến nghị chínhThuật toán & nền tảng 1 server, mô hình lớn suy luận 1 server — tách tính toán, cách ly miền lỗi2 × server thường
mô hình lớn chiếm trọn máy
10–30 thiết bị EBOX
5–15 phiên đồng thời
Hiệu năng caoNền tảng trên server thường; mô hình lớn & thuật toán trên GPU server (vLLM tăng tốc suy luận batch)1 × server thường
+ 1 × GPU server
Trên 30 thiết bị
chục phiên · nhiều nhà máy

Cả bốn cấp chạy cùng một stack: nâng cấp chỉ thêm server / edge box — chuyển cấu hình là xong, nghiệp vụ gián đoạn bằng 0.

Muốn thấy ba công nghệ này áp dụng vào hiện trường của bạn?

Kịch bản đầu tiên: kho sản xuất — tồn kho, vị trí, xuất nhập, một câu là tới.