Skip to content

音声制御ハードウェアシナリオ ​

純粋な音声会話に基づき、音声制御ハードウェアシナリオではユーザーが音声を通じて物理デバイスを操作できます。ユーザーは口頭でコマンドを発し、AIは理解・応答するだけでなく、実際のデバイス操作を行いタスクを完了します。

技術的実装:音声伝送、ASR、TTSは純粋な音声会話シナリオと同様です。主な違いは、AIエージェントにツール呼び出し機能があることです。制御インテントが検出されると、エージェントはMCPを介してMQTTプロトコルでデバイスにツール呼び出しリクエストを送信します。デバイスはMCPサーバーとして動作し、カメラのオン・オフ、音量調整、表情切り替え、写真撮影などのハードウェア操作を実行し、実行結果をエージェントに返します。エージェントは最終的にユーザーに音声フィードバックを提供します。

アーキテクチャ構成要素:

  • Volcano Engine RTC + ASR + TTS:リアルタイム音声チャネルおよび音声認識・合成(標準製品)
  • AIエージェント(MCPクライアント):インテント理解およびツール呼び出し判断(カスタム開発)
  • EMQX:MCPプロトコルのMQTTトランスポート層(標準製品)
  • デバイス(MCPサーバー):ハードウェア機能をMCPツールとして公開(カスタム開発)

フローダイアグラム ​

音声制御ハードウェアフロー

フロー説明:

  1. 音声伝送およびASR/TTSは純粋な音声会話シナリオと同様です
  2. AIエージェントがユーザーインテントを解析し、ツール呼び出しを決定します
  3. MCPを介したMQTTでツール呼び出しリクエストを送信します
  4. デバイス(MCPサーバー)がリクエストを受信しハードウェア操作を実行します
  5. 実行結果がAIエージェントに返されます
  6. エージェントが結果を音声フィードバックに変換しユーザーに伝えます

代表的なシナリオ ​

スマートホーム — 全館音声制御 ​

午後10時、シャオ・ジャンは就寝準備をしています:

シャオ・ジャン:「寝るよ。」
スピーカー:「わかりました。おやすみモードを有効にしました。」

(リビングの照明が暗くなり消灯、寝室のカーテンがゆっくり閉まり、エアコンが26℃の睡眠モードに切り替わり、テレビがオフになります)

シャオ・ジャン:「ベッドサイドランプを少し暗くして。」
スピーカー:「ベッドサイドランプの明るさを20%に設定しました。」

シャオ・ジャン:「明日朝7時にカーテンを開けて。」
スピーカー:「わかりました。寝室のカーテンは明日朝7時に自動で開きます。」

一つの発話で複数デバイスの連携動作がトリガーされます。AIは「寝る」という文脈を理解し、あらかじめ設定された複数のデバイス操作を自動実行します。

車載システム — 運転中の安全な操作 ​

リーさんは市街地を運転中です:

リーさん:「ちょっと暑いね。エアコンの温度を2度下げて。」
車載システム:「了解しました。エアコンの温度を24℃から22℃に調整しました。」

(温度が自動で調整されます)

リーさん:「換気のためにサンルーフを開けて。」
車載システム:「サンルーフを開けました。」

(サンルーフがゆっくり開きます)

リーさん:「後部窓を閉めて。風が強いから。」
車載システム:「後部窓を閉めました。」

リーさん:「シートマッサージを腰モードでオンにして。」
車載システム:「腰部マッサージを有効にしました。快適なドライブをお楽しみください。」

運転者は視線を落としたり操作パネルに手を伸ばす必要がなく、音声操作により安全な運転を実現します。

医療支援 — 手術室での音声制御 ​

主任外科医のワン医師が手術を行っています:

ワン医師:「手術用ライトを左に10度動かして。」
システム:「手術用ライトを調整しました。」

(ライトが自動で動きます)

ワン医師:「明るさを上げて。」
システム:「明るさを90%に上げました。」

ワン医師:「患者のCT画像、3枚目を表示して。」
システム:「3枚目のCT画像を表示します。」

(表示が指定画像に切り替わります)

ワン医師:「右上部分をズームインして。」
システム:「ズームインしました。」

無菌環境で非滅菌機器に触れられないため、音声制御が不可欠となり、手術の効率と安全性を向上させます。

工業生産 — ハンズフリー操作 ​

工場作業員のラオ・ジャンは機械を操作しています:

ラオ・ジャン(両手に部品を持ちながら):「コンベアベルトを始動して。」
システム:「コンベアベルトを始動しました。」

ラオ・ジャン:「速度をレベル2に設定して。」
システム:「コンベアベルトの速度をレベル2、毎分30ユニットに設定しました。」

ラオ・ジャン:「検査用カメラをオンにして。」
システム:「品質検査カメラをオンにし、リアルタイム検査を開始しました。」

ラオ・ジャン:「現在のパラメータを記録して。」
システム:「記録しました:温度180℃、圧力2.5MPa、速度レベル2。」

作業者の手が塞がっている場合、音声が最も自然な操作手段となり、生産性を大幅に向上させます。

コア機能 ​

MCPツール呼び出し ​

デバイスはMCPサーバーとして機能し、機能をMCPツールとして公開します。AIエージェントはMCPクライアントとしてこれらを呼び出します:

ユーザー音声 → ASR → AIエージェントのインテント理解 → MCPツール呼び出し → デバイス実行 → 音声フィードバック

並列処理 ​

音声フィードバックとデバイス操作は並行して行われ、よりスムーズなユーザー体験を実現します:

  • ユーザーが「カメラをオンにして」と発話
  • AIは即座に「はい、オンにします」と応答
  • 同時にカメラが起動を開始

カメラの起動完了を待つことなく応答するため、体感レイテンシが大幅に低減されます。

技術的ハイライト ​

項目説明
インテント解析AIが自然言語を特定のデバイス操作にマッピング
複数デバイスのオーケストレーション1つのコマンドで複数デバイスの連携動作をトリガー
状態フィードバック実行結果を音声で報告
コンテキスト認識「少し上げて」や「あのライト」などの指示を理解

対応デバイス ​

  • スマートホームゲートウェイ/コントロールパネル
  • サービスロボット/コンパニオンロボット
  • 車載制御システム
  • 手術室医療機器
  • 産業用制御端末
  • スマート会議室機器