従業員が話しかけると、EBOX 端末がミリ秒で感知し全二重で応答;EAR CLOUD プラットフォームが認識・理解・企業システム呼び出しを完結。PC の前へ歩く必要も、手も操作も、研修も不要。
システム API は MCP 層がラップ、お客様のコードは一行も変更不要
ウェイク / 認識 / 理解 / 合成はすべてイントラ内、音声データの外部送信ゼロ
ルール層 → 大モデル → 端側オフライン命令、サービスが「聞こえなくなる」ことはない
従業員が一言話せば、数秒で答えが返る——その裏には 3 つのコア技術の連携があります。エッジモデルは端末の聴き速度を、全二重対話は自然なやり取りを、一体開発は現場への実装を支えます。
工場現場の第一関門は端末チップ上で完結:ウェイク・ノイズ除去・検出はすべてローカル動作、有効な音声のみを上流へ——耐騒音・帯域節約・プライバシー保護。
ブランド独自のウェイクワード、TTS 合成トレーニングパイプライン、精度は実人声録音の 95–98%。
AEC エコーキャンセル+ノイズ除去+アレイビームフォーミングで騒音下でも人声を捕捉。
ニューラル VAD が発話とポーズをミリ秒単位で区別。
断網時も 30 のローカルコマンドで即応、ラインが「聞こえなくなる」ことはありません。
実運用中音声ストリームは暗号化 WebSocket で EAR CLOUD へ:Qwen3-ASR-1.7B 認識(30 言語+中国語 22 方言、1万トークン級の業界ホットワード偏置、CPU のみでリアルタイム)、ローカル Piper 合成(60+ 言語、初回パケット 100–300ms)。端末側の毎フレーム処理は 2–3ms、誤ウェイクの音声上流はゼロ。
従来の音声端末は半二重——端末が話している間は割り込めません。EBOX は三層技術で真の全二重・割り込み可能を実現:再生中でも従業員がいつでも割り込み、端末は 100ms 以内に静まって聞き始めます。
ニューラル VAD が 75dB の工場騒音下で「発話/ポーズ/騒音」を区別、誰が話し始めたかをミリ秒で感知——割り込みへの第一反応はクラウドではなく端末側から。
線形+非線形のデュアルフィルタ AEC が自機の再生エコーを除去、エコー抑制 40dB——端末は「自分が何を言っているか」を知り、自分の声を命令と誤認しません。
160ms の音響ウィンドウで対話状態(聴取/発話/ポーズ/待機)を継続判定、ターン判定は約 250ms——「考え中」と「話し終わり」を区別し、真人のようなテンポ。
再生中に従業員が突然発話:100ms 以内にミュート、再聴取、数秒で再回答——割り込み・訂正・引き継ぎが自然に成立。
SoulX-Duplug は Soul AI × 上海交通大学 × 西北工業大学の共同オープンソース(Apache-2.0)、数億ユーザーの音声シーンで培われた技術基盤。
EBOX-200 端末は Espressif の新世代フラッグシップ ESP32-S31 を採用;EAR CLOUD プラットフォームは蒸留軽量モデルを動作——エッジ・クラウド連携、GPU サーバー不要。
Espressif 2026 年量産の新世代デュアルコア RISC-V:320MHz、単核 128-bit SIMD、AI 命令アクセラレーション——CoreMark 性能は前世代 S3 比約 65% 向上。
250MHz DDR PSRAM、SiP 最大 64MB;デュアル I2S コントローラでハードウェア級の音声同期、低遅延・高忠実度。
802.15.4 とギガビット Ethernet MAC、複雑な工場無線環境に対応;60 GPIO、DVP カメラ、LCD を将来展開用に確保。
セキュアブート+Flash/PSRAM 暗号化+AES/RSA/ECDSA ハードウェアアクセラレーション。
プラットフォーム側:蒸留 Qwen3-4B 理解モデル+Qwen3-ASR-1.7B 認識モデルを量子化して CPU のみでリアルタイム動作(16コア/32GB サーバー1台で 5 並列);NLU 二重ルート——頻出質問はルールエンジンで企業システム直結・約 1 秒で回答、ロングテールは大規模モデルが担当;MCP 対接層で標準化、お客様システムのコードは一行も変更不要。
3 つの技術は並列の用語ではなく、完全なインタラクションチェーンです:
声は端末ローカルでウェイク・収音、話しかけたら即応答。
聞きながら話し、割り込んで、一言で用を足す。
自社端末+クラウド。現場に置けば動き、システムをつなげば仕事をする。
同じソフトウェアスタックで 4 つの展開形態。規模と予算に応じて選択、軽量構成から始めて業務成長とともにスムーズに拡張——拡張はハード追加のみ、アーキテクチャ変更も再インストールも不要。
| プラン | 構成 | ハードウェア | 適用規模 |
|---|---|---|---|
| 軽量構成試験導入に最適 | 音声アルゴリズム・プラットフォーム・大モデルを同一の通常サーバーに混載——1 台で全チェーンを担う | 1 × 通常サーバー 16 コア / 32GB / 500GB · GPU 不要 | EBOX ≤10 台 ピーク 5 並列 |
| 工業シーン構成 | 音声アルゴリズムをエッジボックスへ下沉(車間側設置);プラットフォームと大モデルは通常サーバー——アルゴリズムが現場に寄る | N × エッジボックス(車間ごと 1 台) +1 × 通常サーバー | 車間ネット不安定 断網兜底が必要 |
| 標準構成主力推奨 | 音声アルゴリズムとプラットフォームを 1 台、推論大モデルを 1 台——計算分離、障害ドメイン分離 | 2 × 通常サーバー 大モデルがマシンを独占 | EBOX 10–30 台 5–15 並列 |
| 高性能構成 | プラットフォームは通常サーバー;大モデルとアルゴリズムは GPU サーバー(vLLM バッチ推論加速) | 1 × 通常サーバー +1 × GPU サーバー | 30 台以上 数十並列 · 多工場 |
4 段階とも同一ソフトスタック:拡張はサーバー / エッジハードの追加のみ。設定切替で移行完了、業務ゼロ中断。