音声制御ハードウェアシナリオ
純粋な音声会話に基づき、音声制御ハードウェアシナリオではユーザーが音声を通じて物理デバイスを操作できます。ユーザーは口頭でコマンドを発し、AIは理解・応答するだけでなく、実際のデバイス操作を行いタスクを完了します。
技術的実装:音声伝送、ASR、TTSは純粋な音声会話シナリオと同様です。主な違いは、AIエージェントにツール呼び出し機能があることです。制御インテントが検出されると、エージェントはMCPを介してMQTTプロトコルでデバイスにツール呼び出しリクエストを送信します。デバイスはMCPサーバーとして動作し、カメラのオン・オフ、音量調整、表情切り替え、写真撮影などのハードウェア操作を実行し、実行結果をエージェントに返します。エージェントは最終的にユーザーに音声フィードバックを提供します。
アーキテクチャ構成要素:
- Volcano Engine RTC + ASR + TTS:リアルタイム音声チャネルおよび音声認識・合成(標準製品)
- AIエージェント(MCPクライアント):インテント理解およびツール呼び出し判断(カスタム開発)
- EMQX:MCPプロトコルのMQTTトランスポート層(標準製品)
- デバイス(MCPサーバー):ハードウェア機能をMCPツールとして公開(カスタム開発)
フローダイアグラム

フロー説明:
- 音声伝送およびASR/TTSは純粋な音声会話シナリオと同様です
- AIエージェントがユーザーインテントを解析し、ツール呼び出しを決定します
- MCPを介したMQTTでツール呼び出しリクエストを送信します
- デバイス(MCPサーバー)がリクエストを受信しハードウェア操作を実行します
- 実行結果がAIエージェントに返されます
- エージェントが結果を音声フィードバックに変換しユーザーに伝えます
代表的なシナリオ
スマートホーム — 全館音声制御
午後10時、シャオ・ジャンは就寝準備をしています:
シャオ・ジャン:「寝るよ。」
スピーカー:「わかりました。おやすみモードを有効にしました。」(リビングの照明が暗くなり消灯、寝室のカーテンがゆっくり閉まり、エアコンが26℃の睡眠モードに切り替わり、テレビがオフになります)
シャオ・ジャン:「ベッドサイドランプを少し暗くして。」
スピーカー:「ベッドサイドランプの明るさを20%に設定しました。」シャオ・ジャン:「明日朝7時にカーテンを開けて。」
スピーカー:「わかりました。寝室のカーテンは明日朝7時に自動で開きます。」
一つの発話で複数デバイスの連携動作がトリガーされます。AIは「寝る」という文脈を理解し、あらかじめ設定された複数のデバイス操作を自動実行します。
車載システム — 運転中の安全な操作
リーさんは市街地を運転中です:
リーさん:「ちょっと暑いね。エアコンの温度を2度下げて。」
車載システム:「了解しました。エアコンの温度を24℃から22℃に調整しました。」(温度が自動で調整されます)
リーさん:「換気のためにサンルーフを開けて。」
車載システム:「サンルーフを開けました。」(サンルーフがゆっくり開きます)
リーさん:「後部窓を閉めて。風が強いから。」
車載システム:「後部窓を閉めました。」リーさん:「シートマッサージを腰モードでオンにして。」
車載システム:「腰部マッサージを有効にしました。快適なドライブをお楽しみください。」
運転者は視線を落としたり操作パネルに手を伸ばす必要がなく、音声操作により安全な運転を実現します。
医療支援 — 手術室での音声制御
主任外科医のワン医師が手術を行っています:
ワン医師:「手術用ライトを左に10度動かして。」
システム:「手術用ライトを調整しました。」(ライトが自動で動きます)
ワン医師:「明るさを上げて。」
システム:「明るさを90%に上げました。」ワン医師:「患者のCT画像、3枚目を表示して。」
システム:「3枚目のCT画像を表示します。」(表示が指定画像に切り替わります)
ワン医師:「右上部分をズームインして。」
システム:「ズームインしました。」
無菌環境で非滅菌機器に触れられないため、音声制御が不可欠となり、手術の効率と安全性を向上させます。
工業生産 — ハンズフリー操作
工場作業員のラオ・ジャンは機械を操作しています:
ラオ・ジャン(両手に部品を持ちながら):「コンベアベルトを始動して。」
システム:「コンベアベルトを始動しました。」ラオ・ジャン:「速度をレベル2に設定して。」
システム:「コンベアベルトの速度をレベル2、毎分30ユニットに設定しました。」ラオ・ジャン:「検査用カメラをオンにして。」
システム:「品質検査カメラをオンにし、リアルタイム検査を開始しました。」ラオ・ジャン:「現在のパラメータを記録して。」
システム:「記録しました:温度180℃、圧力2.5MPa、速度レベル2。」
作業者の手が塞がっている場合、音声が最も自然な操作手段となり、生産性を大幅に向上させます。
コア機能
MCPツール呼び出し
デバイスはMCPサーバーとして機能し、機能をMCPツールとして公開します。AIエージェントはMCPクライアントとしてこれらを呼び出します:
ユーザー音声 → ASR → AIエージェントのインテント理解 → MCPツール呼び出し → デバイス実行 → 音声フィードバック並列処理
音声フィードバックとデバイス操作は並行して行われ、よりスムーズなユーザー体験を実現します:
- ユーザーが「カメラをオンにして」と発話
- AIは即座に「はい、オンにします」と応答
- 同時にカメラが起動を開始
カメラの起動完了を待つことなく応答するため、体感レイテンシが大幅に低減されます。
技術的ハイライト
| 項目 | 説明 |
|---|---|
| インテント解析 | AIが自然言語を特定のデバイス操作にマッピング |
| 複数デバイスのオーケストレーション | 1つのコマンドで複数デバイスの連携動作をトリガー |
| 状態フィードバック | 実行結果を音声で報告 |
| コンテキスト認識 | 「少し上げて」や「あのライト」などの指示を理解 |
対応デバイス
- スマートホームゲートウェイ/コントロールパネル
- サービスロボット/コンパニオンロボット
- 車載制御システム
- 手術室医療機器
- 産業用制御端末
- スマート会議室機器