
市販のスマートスピーカーは便利だが、音声をクラウドに送って処理する前提で、提供元の都合で機能が変わったり、サービス自体が終わったりする。これに対し、手元のマシンだけで完結するオープンソースの音声アシスタント「openlily」が公開された。マイクとスピーカーで話しかけると、LLM(大規模言語モデル)が答えを返す。
基本の流れは、音声入力からLLM、音声出力までをつなぐものだ。ターミナルで動く音声CLIで、ブラウザやスマホは要らない。オプションのウェイクワードを使えば、呼びかけるまで静かに待機する。ウェイクワードの検知や、話し始めと話し終わりの判定は端末の中で動き、クラウドにもAPIキーにも頼らない。スピーカーから出た自分の声をマイクが拾わないよう、エコー除去やノイズ抑制の処理も入れている。
設計の軸は「自分のものにする」点にある。音声認識、言語モデル、音声合成のそれぞれを差し替えられ、信頼できるプロバイダーを選べる。Web検索や実際のブラウザの自動操作、メール送信といったツールは、使いたいものだけをオンにする仕組みだ。ウェイクワードは「Alexa」「Hey Jarvis」などから選べ、自分で用意した音声モデルも指定できる。
動作環境はmacOSやLinux、そしてRaspberry Piに対応する。ラズパイなら、USB接続のマイクとスピーカーをつなぐ構成が手軽だろう。リアルタイム音声処理の枠組みPipecatなど、複数のオープンソースを土台にしており、ライセンスはMITとなっている。クラウド前提のスマートスピーカーに不満がある人や、構成を自分で決めたい人にとって、試す価値のある選択肢になりそうだ。

