ロボット制御のAI訓練は、衝突や事故リスクを避けるためシミュレーション環境で行うのが定石になっている。だが仮想空間で身につけた動作を実機にそのまま持ち込むと、材料のばらつきや摩擦、センサーノイズが原因で性能が落ちる「シム・ツー・リアル・ギャップ」が壁になる。英Aston University(アストン大)のAlireza Rastegarpanah氏らは、英University of Birmingham(バーミンガム大学)のExtreme Robotics LabのJamie Hathaway氏らと共同で、画像処理で生まれた「ニューラル・スタイル変換」の発想を強化学習に持ち込み、この壁を埋める手法を開発した。論文は学術誌「Scientific Reports」に掲載された。
ニューラル・スタイル変換は、ある画像のスタイルを別の画像に転写する技術として2015年ごろから知られる。チームはこれをロボットの軌跡データに当てはめた。シミュレーターで生成した軌跡を「コンテンツ」、実機からまばらに集めた未ラベル軌跡を「スタイル」と見なし、変分オートエンコーダ(VAE)で自己教師あり学習させて、両者の特徴表現を共通空間にそろえる。出力されるのは、シミュレーションの動作意図を保ったまま、実世界の物理的なクセを反映した「弱ペアの軌跡」だ。これを訓練データとして再利用することで、強化学習ポリシーの実機転移性能を底上げする。
ケーススタディに選んだのは、未知の素材をロボットが切断するタスク。素材の硬さや変形が事前に分からない条件で、シミュレーションで強化学習させたポリシーをそのまま実機に持ち込み、追加の大規模データ収集なしで動作することを確認した。同じ作業を従来手法でこなそうとすると、材料ごとに長時間の実機データ取得と再調整が必要になる。
Rastegarpanah氏は「純粋なシミュレーション訓練を超え、最小限の追加データで実環境でも安定動作する」とコメントし、長期ビジョンとして「シミュレーション訓練後すぐに新環境へ展開できる、プラグアンドプレイ型のロボット」を掲げる。応用先として持続可能な製造、リサイクル、自律工業システムを挙げており、現場ごとに大規模データを集めるコストを下げる方向の研究だ。