ESP32にマイクとスピーカーを接続するだけで、OpenAI・Google Gemini・ElevenLabsなど100以上のAI音声モデルとリアルタイムで会話できるデバイスを作れるオープンソースフレームワーク「ElatoAI」がGitHubで公開されている。
ElatoAIの仕組みはシンプルだ。ESP32がマイクで音声を拾い、Opus形式(高音質・低帯域の音声圧縮規格)に変換してWebSocket経由でエッジサーバーに送信する。エッジサーバー(Deno EdgeまたはCloudflare Workers)がLLM APIに橋渡しし、AIの応答音声をESP32に返してスピーカーで再生する。往復のレイテンシは世界規模で2秒以下、連続会話時間は最大20分以上を実現している。対応モデルはOpenAI Realtime API・Gemini Live API・xAI Grok・ElevenLabs Conversational AI・Hume AI EVI-4のほか、Cloudflare Workers経由では80以上のLLMと10以上のTTS(テキスト読み上げ)エンジンを利用できる。
ESP32-S3で動作し、外部PSRAMは不要。音声サンプリングは24kHz・12kbpsで動く。Webアプリ(Next.js/Vercel)からAIエージェントの個性・声・話し方をカスタマイズでき、ピッチ変換機能でアニメキャラクターのような声にすることも可能だ。デバイスの無線ファームウェア更新(OTA)、タッチセンサーやボタンによる操作、Wi-Fiキャプティブポータルによるネットワーク設定もサポートする。
2026年4月には、Cloudflare Workers AIとDurable Objectsを使ったグローバルデバイスネットワーク機能を追加。複数台のESP32デバイスをクラウド上で管理・一斉制御できるようになった。同年3月には「Local AI Toys」として、ESP32からQwen・Mistral等のローカルLLMとTTSモデルをローカル環境で動かす別プロジェクトも公開している。開発者が想定する用途はぬいぐるみ・フィギュア・おもちゃへのAI組み込みで、カスタムAIエージェントとして動く「しゃべるおもちゃ」の自作プラットフォームとして設計されている。