何が起きたか
Hugging Faceはブログで、Reachy Miniを完全ローカルで動作させる音声対話スタックを紹介した。このスタックは、同社のspeech-to-speechライブラリを用いたカスケード方式(VAD→STT→LLM→TTS)で構成され、Realtime API互換の/v1/realtime WebSocketを公開する。バックエンド起動後、UIからロボットをそのエンドポイントに向ける。LLMのローカル配信にはllama.cppを使用し、Gemma 4モデルを推奨。セットアップ手順として、llama-serverの起動コマンドとspeech-to-speechライブラリのインストール・実行コマンドを紹介している。
Key Facts
| Hugging Faceは、Reachy Miniで完全ローカルな音声対話を実現するスタックを公開した。クラウドやAPIキーは不要で、データがマシン外に出ないとしている。 | [0] |
| スタックはspeech-to-speechライブラリによるカスケード方式(VAD→STT→LLM→TTS)で、Realtime API互換の/v1/realtime WebSocketを公開する。 | [0] |
| 推奨コンポーネントは、llama.cpp(Gemma 4)、Silero VAD、Parakeet-TDT 0.6B v3(STT)、Qwen3-TTS。 | [0] |
| LLMのローカル配信にはllama.cppを使用し、モデルはggml-org/gemma-4-E4B-it-GGUFをHubから取得する。 | [0] |
| speech-to-speechライブラリはuv pip install speech-to-speechでインストールし、--mode localで実行するとターミナル上で対話が可能。 | [0] |
なぜ重要か
このスタックは、ロボットの音声対話をクラウドに依存せずローカルで完結させる選択肢を示す。カスケード方式はオープンソース環境で最も柔軟な選択肢の一つであり、コンポーネントを交換可能としている。