Categories: ニュース

中国の研究チームが人の動画1本でロボットに作業を教える手法を開発、習得は29秒

中国の北京理工大学とX Square Robot、清華大学の研究チームが、人が作業する動画を1本見せるだけでロボットに新しい作業を覚えさせる手法「HOST」を開発した。モデルの中身を書き換えないため、それまでにできていた作業の腕前が落ちない。1つの作業を覚えるまでにかかる時間は平均29秒で、50種類の新しい作業で平均62%の成功率だった。

これまでロボットに新しい作業を教えるには、熟練した操作者が遠隔操作で実演データを何十回分も集め、そのデータでモデルを微調整する必要があった。研究チームの計測では、1つの作業につき50回分の実演を集めて微調整するまでに、およそ4.0〜4.9時間かかる。しかも微調整は複数の作業で共有しているパラメーターを書き換えるため、新しい作業を覚えるたびに前から使えていた作業の成功率が下がる。

HOSTは、この工程を学習の段階から、ロボットが実際に動く段階へ移した。モデルの重みは凍結したまま、人の作業動画を手がかりとして与える。難しいのは、動画とロボットの進み方が一致しない点だ。同じ作業でも速度が違うため、時計の時刻で対応づけると、ロボットがまだ到達していない段階の映像を参照してしまう。体の作りやカメラの位置、見た目の違いも壁になる。

そこで3段階の処理を挟む。まずロボットが今、動画のどの段階にいるかを割り出す。次に動画のこれから進む部分を、ロボット自身から見えるはずの映像へ翻訳する。最後にその予測した映像から動作を導く。段階の対応づけには、時計の時刻ではなく作業の進み具合を尺度にした。人が付けた基準点との誤差は、時刻で合わせた場合の0.079に対して0.006まで縮まった。

学習は2段階に分けた。まず229種類の作業にわたるロボットの動作データ19万3462本を使い、同じ機体同士の組み合わせで実演をなぞる能力を身につけさせる。その後、自前で撮影した人の実演動画5847本とロボットの動作を組み合わせ、人の動画にも対応させた。

実験にはARX R5の6軸ロボットアーム2本を並べた双腕の装置を使い、両手首と俯瞰の計3台のRGBカメラで作業台を撮った。50種類の新しい作業をそれぞれ20試行し、物体の初期位置と向きを毎回変えて人が成否を判定した。動画1本だけを見たHOSTの平均成功率62%は、1作業あたり50回分の実演で微調整した中で最も強い手法の56%を上回った。学習にかかる時間は最も速い微調整手法の507分の1に収まった。既習の7作業では、微調整した手法が元の成功率の20〜43%まで落ちたのに対し、HOSTは水準を保った。

環境を変えた場合の成功率の低下は、照明や色の変更で1ポイント、学習に使っていない物体への交換で4ポイント、作業台ごとの入れ替えで6ポイント、動作の最中に人が物体を動かす妨害で9ポイントだった。

研究チームは制約も挙げている。評価は1種類の双腕装置だけで行っており、体の作りが大きく異なるロボットでは試していない。動画は手順を写すが、物をつかむ力加減までは伝えられず、触覚グローブのような装置で接触力を取り込むことを今後の課題とした。保存した動画が増えると、指示文と作業台の見た目が似ている作業を区別しきれなくなる恐れも残る。論文はプレプリントサーバーのarXivで公開されており、査読は経ていない。

関連情報

FabScene編集部

FabScene編集部