何が起きたか

Hugging Faceはブログで、Reachy Miniを完全ローカルで動作させる音声対話スタックを紹介した。このスタックは、同社のspeech-to-speechライブラリを用いたカスケード方式(VAD→STT→LLM→TTS)で構成され、Realtime API互換の/v1/realtime WebSocketを公開する。バックエンド起動後、UIからロボットをそのエンドポイントに向ける。LLMのローカル配信にはllama.cppを使用し、Gemma 4モデルを推奨。セットアップ手順として、llama-serverの起動コマンドとspeech-to-speechライブラリのインストール・実行コマンドを紹介している。

Key Facts

Hugging Faceは、Reachy Miniで完全ローカルな音声対話を実現するスタックを公開した。クラウドやAPIキーは不要で、データがマシン外に出ないとしている。[0]
スタックはspeech-to-speechライブラリによるカスケード方式(VAD→STT→LLM→TTS)で、Realtime API互換の/v1/realtime WebSocketを公開する。[0]
推奨コンポーネントは、llama.cpp(Gemma 4)、Silero VAD、Parakeet-TDT 0.6B v3(STT)、Qwen3-TTS。[0]
LLMのローカル配信にはllama.cppを使用し、モデルはggml-org/gemma-4-E4B-it-GGUFをHubから取得する。[0]
speech-to-speechライブラリはuv pip install speech-to-speechでインストールし、--mode localで実行するとターミナル上で対話が可能。[0]

なぜ重要か

このスタックは、ロボットの音声対話をクラウドに依存せずローカルで完結させる選択肢を示す。カスケード方式はオープンソース環境で最も柔軟な選択肢の一つであり、コンポーネントを交換可能としている。