Kuan Fang
Cornell University
収録論文 32本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- プロキシポリシー操縦による推論時適応ロボットポリシー適応2026/9/8
凍結された汎用ロボットポリシーを、限られたデモから新しいタスクに適応させるため、2つの軽量プロキシポリシーの速度差でベースのサンプラーを操縦する手法を提案した。
- 異種ロボット学習のための統合運動-行動モデリングVLA2026/6/1
3D物体運動軌跡を共通インターフェースとして用い、視覚運動制御と力学モデリングを統合するモデルを提案。マスク生成目的と対照学習により、多様なデータソースからのマルチタスク事前学習と、複数の推論モードでの適応を実現する。
- KITE: 運動学と相互作用の分離によるゼロショット異種ロボット間操作マニピュレーション2026/6/1
ロボット間の操作ポリシー汎化を実現するため、タスク推論と身体固有の運動制御を分離し、接触パターンに基づく潜在意図表現で橋渡しする手法KITEを提案。新しい身体への適応は運動学モデルからアクションデコーダを学習するだけで済み、デモデータ再収集不要でゼロショット転送を達成。
- 単一の人間デモンストレーションから機能的巧み把持を学習するGenerate, Transfer, Adaptフレームワークマニピュレーション2026/1/1
単一の人間のデモンストレーションから合成データを生成し、カテゴリ内の多様な物体に把持を転移・適応させて、機能的巧み把持を学習するCorDexを提案。
- SAGA: 構造的アフォーダンス接地によるオープンワールド移動マニピュレーション移動マニピュレーション2025/12/1
マルチモーダル基盤モデルを用いてタスク意図を3Dアフォーダンスヒートマップとして接地し、言語・点指定・実演など多様な指示で四足歩行マニピュレータの全身制御を実現するフレームワークを提案。
- 対応志向模倣学習:3D条件付けによる柔軟な視覚運動制御模倣学習2025/12/1
物体上のキーポイントの動きでタスクを指定し、可変な時空間粒度の指示に適応する条件付き模倣学習フレームワークを提案。実世界のマニピュレーションで従来手法を上回る性能を示した。
- 未来をプロンプトする:インタラクティブデジタルツインによるオープンワールドモデル予測制御VLA2025/6/1
VLMの意味推論と物理的に接地したインタラクティブデジタルツインを組み合わせ、未来の観測をVLMに提示して最適な行動を選択するモデル予測制御フレームワークを提案。
- 柔軟な肢間協調による多様な移動操作移動操作2025/6/1
強化学習で各肢を操作と移動に動的に割り当て、目標軌道・接触点・言語指示に応じて多様な移動操作を実現する手法を提案。実機12タスクで平均78.9%の成功率を達成。
- 時間表現アラインメント:後継特徴がロボット指示追従における創発的な構成性を可能にするVLA2025/2/1
現在と将来の状態表現を時間的に整合させる損失で学習することで、明示的なサブタスク計画や強化学習なしに、基本タスクの組み合わせからなる複合タスクをこなせる構成性がロボット操作タスクで向上することを示した論文。
- 接触の多い両腕マニピュレーションのための計画誘導拡散ポリシー学習マニピュレーション2024/12/1
モデルベースの動作計画器で高忠実度シミュレーション内に大規模なデモを生成し、タスク条件付き拡散ポリシーを模倣学習することで、多様な物体を扱う接触の多い両腕操作を実世界で実現した。
- 接触の多いマニピュレーション方策はサンプリングベースプランナから学ぶべきか?マニピュレーション2024/12/1
接触の多い巧みな操作タスクの訓練データをモデルベース計画で生成する手法を検討し、RRTのデモはエントロピーが高すぎるため一貫性を重視したデータ生成と拡散ベースのBCを組み合わせ、実機へのゼロショット転移を実現した。
- KALIE: ロボットデータなしで視覚言語モデルを微調整するオープンワールドマニピュレーションマニピュレーション2024/9/1
人間がラベル付けした2D画像のみで視覚言語モデルを微調整し、自然言語指示と視覚からキーポイントアフォーダンスを予測してロボットを制御する手法を提案。50例のデータで未知物体の新規タスクを頑健に遂行できる。
- Blox-Net: VLM監督・物理シミュレーション・リセット付きロボットによるロボット組立のための生成的設計ロボット組立/生成的設計2024/9/1
自然言語プロンプトと部品画像から、VLMと物理シミュレーションを組み合わせてロボットが組み立て可能なアセンブリを自動生成するシステムを提案し、キリンなどの形状を高精度で再現しつつ実機で安定して組み立てられることを示した。
- 言語最適化による方策適応:少数ショット模倣のためのタスク分解模倣学習2024/8/1
視覚言語モデルによるタスク分解を活用し、少数の実演から未知の長期的ロボット操作タスクに適応する手法PALOを提案した。
- Jacta: 器用な全身マニピュレーションを学習するための汎用プランナマニピュレーション2024/8/1
器用な手先と全身を使う複雑なマニピュレーションタスク向けに、強化学習のデモンストレーションを自動生成する柔軟な動作プランナを提案し、実機への転移も示した。
- 視覚プロンプトによるアフォーダンス誘導強化学習強化学習2024/7/1
視覚言語モデルが推定するキーポイントのアフォーダンスを報酬に変換し、実世界の多様なマニピュレーションタスクで自律強化学習のサンプル効率を向上させる手法KAGIを提案。
- MOKA: マークベース視覚プロンプティングによるオープンワールドロボットマニピュレーションマニピュレーション2024/3/1
視覚言語モデルに画像上のマークを手がかりに質問応答させ、自由文指示からアフォーダンスを予測してロボットの卓上マニピュレーションを実現する手法を提案。
- Open X-Embodiment: Robotic Learning Datasets and RT-X Models2023/10/1
- BridgeData V2: A Dataset for Robot Learning at Scale2023/8/1
- Goal Representations for Instruction Following: A Semi-Supervised Language Interface to Control2023/7/1
- Multi-Stage Cable Routing through Hierarchical Imitation Learning2023/7/1
- Active Task Randomization: Learning Robust Skills via Unsupervised Generation of Diverse and Feasible Tasks2022/11/1
- Generalization with Lossy Affordances: Leveraging Broad Offline Data for Learning Visuomotor Tasks2022/10/1
- Planning to Practice: Efficient Online Fine-Tuning by Composing Goals in Latent Space2022/5/1
- Discovering Generalizable Skills via Automated Generation of Diverse Tasks2021/6/1
- Synergies Between Affordance and Geometry: 6-DoF Grasp Detection via Implicit Representations2021/4/1
- Adaptive Procedural Task Generation for Hard-Exploration Problems2020/7/1
- KETO: Learning Keypoint Representations for Tool Manipulation2019/10/1
- Dynamics Learning with Cascaded Variational Inference for Multi-Step Manipulation2019/10/1
- Scene Memory Transformer for Embodied Agents in Long-Horizon Tasks2019/3/1
- Learning Task-Oriented Grasping for Tool Manipulation from Simulated Self-Supervision2018/6/1
- Multi-Task Domain Adaptation for Deep Learning of Instance Grasping from Simulation2017/10/1