EBOX × EAR CLOUD EAR CLOUD
ホーム / コア技術

3 つのコア技術

端末が自ら聞き、会話は話すように自然、ソリューションは現場に届く——EBOX × EAR CLOUD の技術基盤です。

WakeNet10 ウェイク全二重割り込み可ESP32-S31
160 ms
全二重ターン感知ウィンドウ
約1秒
頻出質問のエンドツーエンド応答
30+ 言語
認識対応+中国語22方言
0 外部送信
音声データは工場外へ出ない
ARCHITECTURE · 全体アーキテクチャ

一本のチェーン:発話から実行まで

従業員が話しかけると、EBOX 端末がミリ秒で感知し全二重で応答;EAR CLOUD プラットフォームが認識・理解・企業システム呼び出しを完結。PC の前へ歩く必要も、手も操作も、研修も不要。

EBOX 端末(ESP32-S31)

マイクアレイ遠界収音 · ビームステアリング
音声フロントエンド AFEAEC · ノイズ除去 · ビームフォーミング
WakeNet10 ウェイクブランドウェイクワード · 精度 95–98%
VADNet + MultiNet端側検出 · 断網オフライン命令兜底
WebSocket クライアント有効音声のみ上流
⇧ 16kHz 音声ストリーム
⇩ 音声応答+制御イベント

EAR CLOUD プラットフォーム(プライベート展開)

Duplug 全二重スケジューリング160ms 窓ターン判定 · 割り込み感知
Qwen3-ASR-1.7B 認識30 言語 · ホットワード偏置 · CPU リアルタイム
NLU ルール高速ルート頻出質問はシステム直結 · 約 1 秒
蒸留大モデル Qwen3-4Bロングテール理解 · 意図とパラメータ解析
MCP 対接層標準化ツール呼び出し · マルチターンスロット管理
Piper ローカル合成多言語音色 · 読み規範 · ストリーミング
企業システムWMS 倉庫管理MES 製造実行ERP 経営資源
ゼロ改修対接

システム API は MCP 層がラップ、お客様のコードは一行も変更不要

全体ローカル処理

ウェイク / 認識 / 理解 / 合成はすべてイントラ内、音声データの外部送信ゼロ

三重兜底

ルール層 → 大モデル → 端側オフライン命令、サービスが「聞こえなくなる」ことはない

OVERVIEW · 技術概覧

3 つの要素で、一言インタラクションが完成

従業員が一言話せば、数秒で答えが返る——その裏には 3 つのコア技術の連携があります。エッジモデルは端末の聴き速度を、全二重対話は自然なやり取りを、一体開発は現場への実装を支えます。

CORE TECHNOLOGY 01

エッジ音声アルゴリズム:正しく聞こえてこそ、正しく答えられる

工場現場の第一関門は端末チップ上で完結:ウェイク・ノイズ除去・検出はすべてローカル動作、有効な音声のみを上流へ——耐騒音・帯域節約・プライバシー保護。

WakeNet10 ウェイク

ブランド独自のウェイクワード、TTS 合成トレーニングパイプライン、精度は実人声録音の 95–98%。

AFE 音声フロントエンド

AEC エコーキャンセル+ノイズ除去+アレイビームフォーミングで騒音下でも人声を捕捉。

VADNet 検出

ニューラル VAD が発話とポーズをミリ秒単位で区別。

MultiNet オフライン代替

断網時も 30 のローカルコマンドで即応、ラインが「聞こえなくなる」ことはありません。

実運用中音声ストリームは暗号化 WebSocket で EAR CLOUD へ:Qwen3-ASR-1.7B 認識(30 言語+中国語 22 方言、1万トークン級の業界ホットワード偏置、CPU のみでリアルタイム)、ローカル Piper 合成(60+ 言語、初回パケット 100–300ms)。端末側の毎フレーム処理は 2–3ms、誤ウェイクの音声上流はゼロ。

CORE TECHNOLOGY 02

全二重対話:電話のように、トランシーバーのようにはしない

従来の音声端末は半二重——端末が話している間は割り込めません。EBOX は三層技術で真の全二重・割り込み可能を実現:再生中でも従業員がいつでも割り込み、端末は 100ms 以内に静まって聞き始めます。

VAD · VADNet

ニューラル VAD が 75dB の工場騒音下で「発話/ポーズ/騒音」を区別、誰が話し始めたかをミリ秒で感知——割り込みへの第一反応はクラウドではなく端末側から。

AEC · 工業級デュアルフィルタ

線形+非線形のデュアルフィルタ AEC が自機の再生エコーを除去、エコー抑制 40dB——端末は「自分が何を言っているか」を知り、自分の声を命令と誤認しません。

SoulX-Duplug スケジューリング

160ms の音響ウィンドウで対話状態(聴取/発話/ポーズ/待機)を継続判定、ターン判定は約 250ms——「考え中」と「話し終わり」を区別し、真人のようなテンポ。

≤100ms 割り込みミュート

再生中に従業員が突然発話:100ms 以内にミュート、再聴取、数秒で再回答——割り込み・訂正・引き継ぎが自然に成立。

SoulX-Duplug は Soul AI × 上海交通大学 × 西北工業大学の共同オープンソース(Apache-2.0)、数億ユーザーの音声シーンで培われた技術基盤。

CORE TECHNOLOGY 03

ソフト・ハード一体:音声 AI のために生まれたチップ、企業システムのために生まれたプラットフォーム

EBOX-200 端末は Espressif の新世代フラッグシップ ESP32-S31 を採用;EAR CLOUD プラットフォームは蒸留軽量モデルを動作——エッジ・クラウド連携、GPU サーバー不要。

ESP32-S31 · 音声 AI フラッグシップ SoC

Espressif 2026 年量産の新世代デュアルコア RISC-V:320MHz、単核 128-bit SIMD、AI 命令アクセラレーション——CoreMark 性能は前世代 S3 比約 65% 向上。

大容量メモリ · 端末モデルが動く

250MHz DDR PSRAM、SiP 最大 64MB;デュアル I2S コントローラでハードウェア級の音声同期、低遅延・高忠実度。

Wi-Fi 6+BT 5.4+ギガビット MAC

802.15.4 とギガビット Ethernet MAC、複雑な工場無線環境に対応;60 GPIO、DVP カメラ、LCD を将来展開用に確保。

工業級セキュリティ

セキュアブート+Flash/PSRAM 暗号化+AES/RSA/ECDSA ハードウェアアクセラレーション。

プラットフォーム側:蒸留 Qwen3-4B 理解モデル+Qwen3-ASR-1.7B 認識モデルを量子化して CPU のみでリアルタイム動作(16コア/32GB サーバー1台で 5 並列);NLU 二重ルート——頻出質問はルールエンジンで企業システム直結・約 1 秒で回答、ロングテールは大規模モデルが担当;MCP 対接層で標準化、お客様システムのコードは一行も変更不要。

HOW THEY WORK TOGETHER

一本のチェーンになる

3 つの技術は並列の用語ではなく、完全なインタラクションチェーンです:

エッジモデル速く聞く

声は端末ローカルでウェイク・収音、話しかけたら即応答。

全二重対話自然に話す

聞きながら話し、割り込んで、一言で用を足す。

一体開発現場に届く

自社端末+クラウド。現場に置けば動き、システムをつなげば仕事をする。

これが EBOX × EAR CLOUD の技術基盤——従業員が一言、システムが実行。
DEPLOYMENT · 導入構成

1 台の試験導入から GPU クラスタまでの 4 段階

同じソフトウェアスタックで 4 つの展開形態。規模と予算に応じて選択、軽量構成から始めて業務成長とともにスムーズに拡張——拡張はハード追加のみ、アーキテクチャ変更も再インストールも不要。

プラン構成ハードウェア適用規模
軽量構成試験導入に最適音声アルゴリズム・プラットフォーム・大モデルを同一の通常サーバーに混載——1 台で全チェーンを担う1 × 通常サーバー
16 コア / 32GB / 500GB · GPU 不要
EBOX ≤10 台
ピーク 5 並列
工業シーン構成音声アルゴリズムをエッジボックスへ下沉(車間側設置);プラットフォームと大モデルは通常サーバー——アルゴリズムが現場に寄るN × エッジボックス(車間ごと 1 台)
+1 × 通常サーバー
車間ネット不安定
断網兜底が必要
標準構成主力推奨音声アルゴリズムとプラットフォームを 1 台、推論大モデルを 1 台——計算分離、障害ドメイン分離2 × 通常サーバー
大モデルがマシンを独占
EBOX 10–30 台
5–15 並列
高性能構成プラットフォームは通常サーバー;大モデルとアルゴリズムは GPU サーバー(vLLM バッチ推論加速)1 × 通常サーバー
+1 × GPU サーバー
30 台以上
数十並列 · 多工場

4 段階とも同一ソフトスタック:拡張はサーバー / エッジハードの追加のみ。設定切替で移行完了、業務ゼロ中断。

この技術が現場でどう生きるか、見てみませんか?

最初のシーン:製造業の倉庫——在庫・ロケーション・入出庫を一言で。