Guangyan Chen
収録論文 7本 ・ フィジカルAI/ロボット学習
操作スキル獲得VLA模倣学習タスクプランニング点群位置合わせ3Dシーン理解
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 単一の人間ビデオから数秒でロボットが操作スキルを獲得操作スキル獲得2026/7/1
ロボットが1本の人間のデモ動画から、数秒で新しい操作スキルを獲得しつつ、既存スキルを保持できるフレームワークHOSTを提案した。
- 一度見れば実行できる:ワンショット動画デモからタスクを学習する視覚-言語-行動モデルVLA2025/12/1
テスト時に1本の専門家デモ動画を見るだけで新しい操作スキルを獲得できるVLAモデルViVLAを提案し、未見タスクで30%以上の性能向上を達成した。
- FMimic: 基盤モデルによる人間動画からの細粒度行動学習模倣学習2025/7/1
少数の人間動画から基盤モデルを用いてロボットの細かい行動スキルを直接学習する手法を提案し、RLBenchや実世界タスクで大幅な性能向上を達成した。
- STEPプランナー: embodied長期的タスクプランナーとしての階層横断サブゴール木構築タスクプランニング2025/6/1
LLMによるサブゴール分解と終了判定を組み合わせ、粗から細への階層的木を構築することで、ロボットの長期的タスク計画の成功率を向上させるフレームワークを提案。
- 点群位置合わせのためのポイントツリートランスフォーマー点群位置合わせ2024/6/1
点群の階層的な特徴木を構築し、木構造に沿って注意領域を重要な点へと段階的に絞り込む新しい注意機構により、線形計算量で局所・大域特徴を効率的に抽出する点群位置合わせ手法を提案した。
- OpenGraph: 大規模屋外環境におけるオープン語彙階層型3Dグラフ表現3Dシーン理解2024/3/1
視覚言語モデルを用いて画像から物体とその説明を抽出し、LiDAR点群に投影して3Dマップを構築、レーングラフで階層化することで、大規模屋外環境でのオープン語彙なシーン理解を実現した。
- Human Demonstrations are Generalizable Knowledge for Robots2023/12/1