Chuang Gan
University of Massachusetts Amherst
収録論文 71本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- DexTaG: 触覚をガイドにした強化学習による巧みな操作マニピュレーション2026/9/27
グローブ型モーションキャプチャの触覚信号を強化学習のガイドとして用い、人間の接触パターンを保ちながらロボットハンドの巧みな道具操作を実現するフレームワークを提案。
- 自己適応型VLA:ロボット実運用のための堅牢な展開手法VLA2026/9/24
ハードウェアのずれに自己適応するVLAモデルを提案し、展開時のキャリブレーションなしで精度が要求される双腕・巧緻マニピュレーションタスクの性能を80%以上回復させた。
- SyncWorld: 視覚キャリブレーションによるワールドモデルのゼロショットシミュレータ化ワールドモデル/シミュレーション2026/9/8
ロボットの行動と視覚変化の対応を視覚キャリブレーションで文脈的に指定することで、未見環境でも追加学習なしに行動結果を正確にシミュレートできるワールドモデルを提案した。
- SPOT: 空間知覚指向の長時間ヒューマノイド遠隔操作遠隔操作2026/9/7
長時間の移動操作タスクで必要な空間認識を拡張するため、ロボット搭載の魚眼カメラと視点分離型の自由視点表示を組み合わせたVR遠隔操作システムSPOTを提案した。
- IM-ENGINE: 具現化データ生成のための画像編集データ生成2026/9/5
画像編集を中間表現として用い、シミュレータで物理検証されたロボット実行可能なデータを生成するパイプラインを提案。器用な把持合成とゴール状態生成に応用し、意味的に意味があり物理的に実行可能な教師データをスケーラブルに生成する。
- GS-Agent: 生成シミュレーションによる4D物理世界の構築生成モデル2026/7/1
自然言語の記述から、物理的に妥当で動的な4D世界を自動生成するマルチエージェントフレームワークを提案した論文。
- GHOST: ロボット操作の汎化を実現する階層的サブゴールポリシーマニピュレーション2026/6/8
多視点RGB-D観測から3Dエンドエフェクタのポーズを予測する高レベルポリシーと、その目標を達成する低レベルコントローラを組み合わせた階層的枠組みを提案し、操作タスクの汎化性能を向上させた。
- DLO-Lab: 微分可能物理を用いた変形線状物体操作のベンチマーク変形物体操作2026/6/1
ロープやケーブルなどの変形線状物体(DLO)の操作を学習・評価するための、多様な材料特性を扱える微分可能シミュレータとベンチマークタスク群を提案した論文。
- LLawCo: 協調の法則を学習して具現化マルチエージェント行動をモデル化するマルチエージェント協調2026/6/1
LLMベースの具現化エージェントがパートナーや環境とずれた行動を取る問題に対し、過去の失敗から行動法則を抽出し、それを思考連鎖に組み込むフレームワークLLawCoを提案。新ベンチマークPARTNR-Dialogで成功率を向上させた。
- センチネル:具現化された協調的空間推論と計画群制御2026/5/25
都市規模の屋外環境で複数の分散エージェントが自然言語で通信し、安全な待ち合わせ場所を協調して決定し、動的な哨戒を避けながら移動するためのフレームワークを提案した。
- RoboWits: ロボットの創造的問題解決における予期せぬ課題ベンチマーク2026/5/1
ロボットの認知推論と創造的ツール使用を評価するためのバイマニピュレータベンチマークを提案し、自動タスク生成パイプラインを用いて多様なタスクを作成。既存のVLAが変異タスクで性能が低下することを示した。
- アクションイメージ:マルチビュー動画生成によるエンドツーエンド方策学習VLA2026/4/1
ロボットの7自由度動作をピクセルに接地したアクション動画として表現し、動画生成モデル自体を方策として用いる統一的な世界行動モデルを提案した。RLBenchと実機評価で高いゼロショット成功率を達成した。
- ExtremControl: 四肢直接制御による低遅延ヒューマノイド遠隔操作遠隔操作2026/2/1
全身リターゲティングを避け、選択した剛体リンク(主に四肢)のSE(3)姿勢を直接操作し、速度フィードフォワード制御を組み合わせることで、50msの低遅延を実現したヒューマノイド遠隔操作フレームワーク。
- PhyScensis: 物理エンジンで拡張されたLLMエージェントによる複雑な物理シーン配置シーン生成/LLMエージェント2026/2/1
LLMエージェントと物理エンジンを組み合わせ、接触や支持・収納といった物理関係を考慮した複雑な3Dシーンを自動生成するフレームワークを提案。
- バーチャルコミュニティ:人間・ロボット・社会のためのオープンワールド社会シミュレーション2025/8/1
人間とロボットが共存する社会をシミュレートするオープンソースのマルチエージェント物理シミュレータを構築し、コミュニティ計画とロボット協調の2つの課題を提案した。
- MindJourney:世界モデルによるテスト時スケーリングで空間推論を実現VLA2025/7/1
VLMに動画拡散ベースの世界モデルを組み合わせ、テスト時に視点移動を探索させることで3D空間推論を強化するフレームワークを提案。
- RobotSmith: 複雑な操作スキル獲得のための生成的ロボットツール設計マニピュレーション2025/6/1
視覚言語モデルと物理シミュレーションを組み合わせ、ロボットが操作しやすいツールを自動設計し、その使い方まで最適化する手法を提案。
- 3D永続的具現化ワールドモデルの学習ワールドモデル2025/5/1
過去に生成した内容を明示的に記憶する3Dマップを条件付けし、RGB-D動画拡散モデルで長期的に一貫した未来予測を可能にする永続的ワールドモデルを提案。計画や方策学習に有効性を示す。
- TesserAct: 4D身体化世界モデルの学習世界モデル2025/4/1
RGB-DN動画を生成するビデオモデルを微調整し、身体化エージェントの行動に応じた4Dシーン予測を可能にする世界モデルを提案。
- MatchMaker: ロボット組立のための組立アセット自動生成sim2real2025/3/1
干渉するアセットペアをシミュレーション可能なペアに変換し、単一アセットから嵌合する相手を生成し、接触面を侵食して現実的な部品を作るパイプラインを提案。生成データは多様性と組立スキル学習の有効性で従来手法を上回る。
- AdaWorld: 潜在行動で適応可能な世界モデルを学習する世界モデル2025/3/1
動画から自己教師ありで潜在行動を抽出し、それに条件づけた自己回帰的世界モデルを事前学習することで、新しい環境や行動への適応を効率化する手法を提案。
- 任意メッシュの関節構造化:オープンボキャブラリ3D関節物体モデリング3Dモデリング2025/2/1
視覚言語モデルと視覚プロンプトを用いて、任意の剛体3Dメッシュを部品分割と関節構造を持つ関節物体に自動変換するフレームワークを提案し、生成物をロボット操作スキル学習に活用できることを示した。
- 制約付き人間-AI協調:包摂的な身体性社会知能チャレンジ人間-AI協調2024/11/1
身体的制約を持つ人間を支援する身体性エージェントの社会知覚と協調計画を評価するベンチマークCHAICを提案し、LLMと行動モデリングを活用した手法を導入した。
- UBSoft: 非有界軟質環境におけるロボットスキル学習のためのシミュレーションプラットフォームsim2real2024/11/1
軟質材料を含む広大な環境でロボットのスキル学習を可能にするため、ロボット近傍に応じて解像度を動的に変える空間適応型シミュレーションプラットフォームUBSoftを開発し、移動・操作タスクのベンチマークを構築した。
- 3D-Mem: 身体性エージェントのための3Dシーンメモリ身体性AI2024/11/1
探索領域を多視点画像の「メモリスナップショット」として記憶し、未探索領域の「フロンティアスナップショット」も活用することで、身体性エージェントの探索と推論を向上させる3Dシーンメモリを提案した。
- マルチモーダル物理シーン理解のための分離音響場音響・マルチモーダル2024/7/1
音の生成・伝播過程を分離表現でモデル化し、落下物の位置に関する空間不確実性マップを構築して探索候補を提示することで、物体探索の成功率を高める手法を提案。
- CoNav: 人間中心の協調ナビゲーションのためのベンチマークナビゲーション2024/6/1
人間の活動を観察して意図を推論し、人間より先に目的地へナビゲートする協調ナビゲーション(CoNav)ベンチマークを提案。LLMベースの人間動作生成と意図認識エージェントを開発した。
- RoboDreamer: ロボットの想像のための構成的世界モデルの学習世界モデル2024/4/1
言語指示を低レベルプリミティブに分解して動画生成を条件付けすることで、未見の物体と行動の組み合わせに対応できる構成的世界モデルを提案し、ロボットの計画生成を実現した。
- 微分可能物理シミュレーションによる薄殻物体マニピュレーションマニピュレーション2024/4/1
多様な薄殻材料のロボット操作を学習・評価するための微分可能シミュレーションプラットフォームThinShellLabを提案し、薄殻操作特有の課題を明らかにした。
- DIFFTACTILE:接触の多いロボットマニピュレーションのための物理ベース微分可能触覚シミュレータ触覚2024/3/1
FEMベースの柔軟体モデルとペナルティ法接触モデルを組み合わせ、微分可能な触覚シミュレータを構築。実世界データで物理特性を最適化し、触覚を活用した把持・操作スキル学習を可能にした。
- 3D-VLA:3D視覚・言語・行動の生成的ワールドモデルVLA2024/3/1
3D知覚・推論・行動を生成的ワールドモデルで結びつけた基盤モデルを提案し、拡散モデルによる将来の画像・点群生成を通じて行動計画能力を向上させた。
- MultiPLY: A Multisensory Object-Centric Embodied Large Language Model in 3D World2024/1/1
- DiffVL: Scaling Up Soft Body Manipulation using Vision-Language Driven Differentiable Physics2023/12/1
- RoboGen: Towards Unleashing Infinite Data for Automated Robot Learning via Generative Simulation2023/11/1
- DiffuseBot: Breeding Soft Robots With Physics-Augmented Generative Diffusion Models2023/11/1
- Generalizable Long-Horizon Manipulations with Large Language Models2023/10/1
- Adaptive Online Replanning with Diffusion Models2023/10/1
- ConceptGraphs: Open-Vocabulary 3D Scene Graphs for Perception and Planning2023/9/1
- $A^2$Nav: Action-Aware Zero-Shot Robot Navigation by Exploiting Vision-and-Language Ability of Foundation Models2023/8/1
- 3D-LLM: Injecting the 3D World into Large Language Models2023/7/1
- Building Cooperative Embodied Agents Modularly with Large Language Models2023/7/1
- Physion++: Evaluating Physical Scene Understanding that Requires Online Inference of Different Physical Properties2023/6/1
- SafeDiffuser: Safe Planning with Diffusion Probabilistic Models2023/6/1
- Hyper-Decision Transformer for Efficient Online Policy Adaptation2023/4/1
- DexDeform: Dexterous Deformable Object Manipulation with Human Demonstrations and Differentiable Physics2023/4/1
- PAC-NeRF: Physics Augmented Continuum Neural Radiance Fields for Geometry-Agnostic System Identification2023/3/1
- FluidLab: A Differentiable Environment for Benchmarking Complex Fluid Manipulation2023/3/1
- SoftZoo: A Soft Robot Co-design Benchmark For Locomotion In Diverse Environments2023/3/1
- 3D Concept Learning and Reasoning from Multi-View Images2023/3/1
- Deep Masked Graph Matching for Correspondence Identification in Collaborative Perception2023/3/1
- RoboNinja: Learning an Adaptive Cutting Policy for Multi-Material Objects2023/2/1
- Planning with Spatial-Temporal Abstraction from Point Clouds for Deformable Object Manipulation2022/10/1
- On the Forward Invariance of Neural ODEs2022/10/1
- Learning Active Camera for Multi-Object Navigation2022/10/1
- Finding Fallen Objects Via Asynchronous Audio-Visual Integration2022/7/1
- Prompting Decision Transformer for Few-Shot Policy Generalization2022/6/1
- Contact Points Discovery for Soft-Body Manipulations with Differentiable Physics2022/5/1
- ComPhy: Compositional Physical Reasoning of Objects and Events from Videos2022/5/1
- RISP: Rendering-Invariant State Predictor with Differentiable Simulation and Rendering for Cross-Domain Parameter Estimation2022/5/1
- Fixing Malfunctional Objects With Learned Physical Simulation and Functional Prediction2022/5/1
- Learning Neural Acoustic Fields2022/4/1
- DiffSkill: Skill Abstraction from Differentiable Physics for Deformable Object Manipulations with Tools2022/3/1
- OPEn: An Open-ended Physics Environment for Learning Without a Task2021/10/1
- Adversarial Option-Aware Hierarchical Imitation Learning2021/6/1
- Curious Representation Learning for Embodied Intelligence2021/5/1
- PlasticineLab: A Soft-Body Manipulation Benchmark with Differentiable Physics2021/4/1
- The ThreeDWorld Transport Challenge: A Visually Guided Task-and-Motion Planning Benchmark for Physically Realistic Embodied AI2021/3/1
- Noisy Agents: Self-supervised Exploration by Predicting Auditory Events2020/7/1
- ThreeDWorld: A Platform for Interactive Multi-Modal Physical Simulation2020/7/1
- Look, Listen, and Act: Towards Audio-Visual Embodied Navigation2019/12/1
- Imitation Learning from Observations by Minimizing Inverse Dynamics Disagreement2019/10/1