Thiết bị tự nghe được, hội thoại tự nhiên như nói chuyện, giải pháp áp dụng được tại hiện trường — nền tảng công nghệ phía sau EBOX × EAR CLOUD.
Nhân viên hỏi bằng miệng, thiết bị EBOX cảm nhận trong mili-giây và trả lời song công; nền tảng EAR CLOUD hoàn thành nhận diện, hiểu ý và gọi hệ thống doanh nghiệp. Không cần ra máy tính, không cần tay, không cần đào tạo.
API hệ thống được tầng MCP bọc sẵn — khách không sửa một dòng code
đánh thức / nhận diện / hiểu / tổng hợp toàn bộ trong intranet — dữ liệu giọng nói không ra khỏi nhà máy
tầng quy tắc → mô hình lớn → lệnh offline tại thiết bị — dịch vụ không bao giờ điếc
Nhân viên nói một câu, vài giây sau có câu trả lời — đằng sau là ba công nghệ phối hợp: mô hình trên thiết bị giúp nghe nhanh, đối thoại song công giúp nói chuyện tự nhiên, R&D nhất thể giúp áp dụng được ngay.
Mô hình đánh thức, khử ồn, nhận diện chạy ngay trên chip của thiết bị — nghe được cả khi mạng không ổn định.
Xem chi tiết →Vừa nghe vừa nói, ngắt lời bất cứ lúc nào — tự nhiên như nói với đồng nghiệp.
Xem chi tiết →Tự nghiên cứu từ bo mạch tới nền tảng mây, giao nguyên bộ tích hợp.
Xem chi tiết →Chốt chặn đầu tiên tại hiện trường công nghiệp nằm ngay trên chip thiết bị: đánh thức, khử ồn, phát hiện đều chạy cục bộ, chỉ giọng nói hợp lệ được đẩy lên — chống ồn, tiết kiệm băng thông, bảo vệ riêng tư.
Từ đánh thức tùy biến theo thương hiệu, pipeline huấn luyện bằng tổng hợp TTS, độ chính xác 95–98% so với ghi âm người thật.
AEC triệt tiếng vang + khử ồn + beamforming mảng mic, bắt trúng giọng người giữa tiếng ồn.
VAD mạng nơ-ron phân biệt nói và ngắt ở mức mili-giây.
Mất mạng vẫn có 30 lệnh cục bộ phản hồi tức thì — dây chuyền không bao giờ điếc.
Đang vận hànhLuồng âm thanh truyền lên EAR CLOUD qua WebSocket mã hóa: nhận diện Qwen3-ASR-1.7B (30 ngôn ngữ + 22 phương ngữ Trung, thiên lệch hotword ngành hàng vạn token, thời gian thực trên CPU thuần) và tổng hợp Piper cục bộ (60+ ngôn ngữ, gói đầu 100–300ms). Xử lý mỗi khung tại thiết bị 2–3ms, không đẩy âm thanh đánh thức nhầm lên mạng.
Terminal giọng nói truyền thống là bán song công — bạn không thể chen ngang khi máy đang nói. EBOX dùng ba tầng công nghệ để đạt song công thật, ngắt lời được: nhân viên chen ngang bất cứ lúc nào khi máy phát, máy im trong 100ms để nghe bạn.
VAD mạng nơ-ron phân biệt nói / ngắt / ồn trong tiếng ồn xưởng 75dB, cảm nhận ai đang nói ở mức mili-giây — phản ứng đầu tiên trước ngắt lời đến từ thiết bị, không chờ đám mây.
AEC lọc kép tuyến tính + phi tuyến triệt tiếng vang do máy tự phát, khử vang tới 40dB — máy biết mình đang nói gì, không nhầm giọng mình thành lệnh người dùng.
Cửa sổ âm học 160ms liên tục phán đoán trạng thái (nghe / nói / ngắt / chờ), quyết định lượt chỉ ~250ms — phân biệt đang nghĩ và đã nói xong, nhịp như người thật.
Nhân viên bất ngờ nói khi máy đang phát: im trong 100ms, nghe lại, trả lời lại trong vài giây — chen ngang, sửa lời, tiếp nhận đều tự nhiên.
SoulX-Duplug được mã nguồn mở (Apache-2.0) bởi Soul AI × Đại học Giao thông Thượng Hải × Đại học Bách khoa Tây Bắc, dựa trên công nghệ đã phục vụ hàng trăm triệu người dùng.
EBOX-200 dùng ESP32-S31 — SoC flagship thế hệ mới của Espressif; nền tảng EAR CLOUD chạy mô hình lớn chưng cất nhẹ — phối hợp biên-đám mây, không cần server GPU.
Chip RISC-V lõi kép thế hệ mới của Espressif, vào sản xuất hàng loạt năm 2026: 320MHz, SIMD 128-bit mỗi lõi, tăng tốc lệnh AI — hiệu năng CoreMark tăng khoảng 65% so với S3 thế hệ trước.
PSRAM DDR 250MHz, SiP tối đa 64MB; hai bộ điều khiển I2S đồng bộ âm thanh cấp phần cứng, độ trễ thấp và độ trung thực cao.
802.15.4 và MAC Ethernet gigabit, phù hợp môi trường sóng công nghiệp phức tạp; 60 GPIO, camera DVP, màn hình LCD dành cho phát triển tiếp theo.
Secure boot + mã hóa Flash/PSRAM + tăng tốc phần cứng AES/RSA/ECDSA.
Phía nền tảng: mô hình hiểu Qwen3-4B chưng cất + mô hình nhận diện Qwen3-ASR-1.7B sau lượng tử hóa chạy thời gian thực trên CPU thuần (một server 16 nhân/32GB đảm nhiệm 5 phiên đồng thời); NLU hai tuyến — câu hỏi phổ biến trả lời khoảng 1 giây qua rule engine nối thẳng hệ thống doanh nghiệp, câu hỏi dài hiếm do mô hình lớn xử lý; tầng tích hợp MCP chuẩn hóa, không cần sửa một dòng code hệ thống của khách.
Ba công nghệ không phải ba thuật ngữ song song — chúng là một chuỗi tương tác hoàn chỉnh:
Tiếng nói được đánh thức và thu tại chỗ — vừa nói là có phản hồi.
Vừa nghe vừa nói, ngắt lời thoải mái — một câu xong việc.
Thiết bị tự nghiên cứu + nền tảng mây — đặt xuống là chạy, nối hệ thống là làm.
Cùng một bộ software stack, bốn hình thái triển khai. Chọn theo quy mô và ngân sách — khởi đầu nhẹ nhàng, nâng cấp mượt mà theo tăng trưởng; nâng cấp chỉ thêm phần cứng, không đổi kiến trúc, không cài lại.
| Phương án | Bố trí | Phần cứng | Quy mô |
|---|---|---|---|
| Gọn nhẹChọn thí điểm | Thuật toán, nền tảng và mô hình lớn trộn chung một server thường — một máy gánh toàn tuyến | 1 × server thường 16 nhân / 32GB / 500GB · không GPU | ≤10 thiết bị EBOX đỉnh 5 phiên đồng thời |
| Hiện trường công nghiệp | Thuật toán hạ xuống edge box (đặt tại xưởng); nền tảng & mô hình lớn trên server thường — thuật toán sát hiện trường | N × edge box (mỗi xưởng 1) + 1 × server thường | Mạng xưởng không ổn định cần dự phòng mất mạng |
| Tiêu chuẩnKhuyến nghị chính | Thuật toán & nền tảng 1 server, mô hình lớn suy luận 1 server — tách tính toán, cách ly miền lỗi | 2 × server thường mô hình lớn chiếm trọn máy | 10–30 thiết bị EBOX 5–15 phiên đồng thời |
| Hiệu năng cao | Nền tảng trên server thường; mô hình lớn & thuật toán trên GPU server (vLLM tăng tốc suy luận batch) | 1 × server thường + 1 × GPU server | Trên 30 thiết bị chục phiên · nhiều nhà máy |
Cả bốn cấp chạy cùng một stack: nâng cấp chỉ thêm server / edge box — chuyển cấu hình là xong, nghiệp vụ gián đoạn bằng 0.
Kịch bản đầu tiên: kho sản xuất — tồn kho, vị trí, xuất nhập, một câu là tới.