何が起きたか

Hugging Faceはブログで、音声対話スタックを公開したと発表した。このスタックは、音声認識・言語モデル・音声合成をすべてローカルで実行し、クラウドやAPIキーを必要としない。推奨モデルとして、Silero VAD v5、Parakeet-TDT 0.6B v3、Qwen3-TTS、Gemma 4を挙げている。

なぜ重要か

Reachy Miniを自分で運用する人は、音声認識から言語モデル、音声合成までを同じ端末内で完結させられるため、音声を外部サービスに送らずに会話機能を組めます。Hugging Faceは、VAD・音声認識・音声合成の各段を入れ替え可能だと示し、用途に応じて構成を変えられるとしています。