Yunzhu Li
Columbia University
収録論文 66本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- DexAgent: 自己進化するツールライブラリを備えたエージェント型Human2Sim2Robotフレームワークによる巧みな操作マニピュレーション2026/9/28
一人称視点の人間動画とタスク指示から、物理的に妥当なロボット軌道を生成して方策学習を可能にするエージェント型フレームワークを提案。ツールライブラリを自己進化させ、多様な物体や長期的タスクに対応する。
- PointZero: 転移可能な3Dダイナミクス学習のための3D点追跡補完3Dダイナミクス/事前学習2026/9/16
ロボットの行動ラベルなしで、RGB-D観測と部分的な3D軌跡から全点の未来軌跡を予測する事前学習手法を提案し、下流のダイナミクス予測や模倣学習で有効性を示した。
- Hydra-0: 汎用世界モデリングと制御のためのアクションフロー世界モデル2026/8/18
ロボットの動作をピクセル運動として表現するアクションフローを用いた汎用世界モデルを提案し、動作誤差を大幅に低減し、ゼロショット合成やデータ効率的な適応を実現した。
- VTAPグリッパー:指先センシングと視覚触覚アクティブパームの融合による器用な手内操作マニピュレーション2026/7/1
指先の触覚アレイセンサと可動式の視覚触覚パームを備えたグリッパーを開発し、指とパームの協調と多感覚フィードバックにより、把持から微細な操作までを実現した。また、人間の手の動きを3本指構造にマッピングする段階的リターゲティング手法を提案し、複数の難易度の高い操作タスクで性能を実証した。
- 物理誘導残差ダイナミクスによる変形物体シミュレーションの学習シミュレーション2026/7/1
物理ベースと学習ベースを組み合わせたハイブリッドな変形物体シミュレーション手法を提案し、実世界の多様な物体で精度を向上させた。
- FELT: 視覚から触覚信号を生成する視触覚操作のためのフレームワーク触覚/操作2026/7/1
RGB画像から指ごとの圧力触覚画像を生成する学習ベースのフレームワークを提案し、触覚データの不足を補い、視触覚ポリシーの性能を向上させる。
- エージェント型Real2Sim:視覚言語エージェントによる物理ベースの世界モデリングsim2real2026/7/1
ロボットと物体の相互作用の実世界記録を、物理シミュレーション可能な双子モデルに自動変換するフレームワークを提案。視覚言語エージェントが幾何・物理パラメータ・軌道などを自律的に推定し、剛体操作から変形物体、人型動作までを統一的に扱う。
- Deform360: 変形可能な世界モデルのための大規模マルチビュー視触覚データセットデータセット/世界モデル2026/7/1
変形物体の動力学予測(世界モデリング)の研究を促進するため、198個の日用品、1,980のインタラクションシーケンス、215時間以上の観測データを含む大規模な視触覚データセットを構築し、2Dビデオモデルと3Dパーティクルモデルの性能を体系的に評価した。
- BoxTwin: ビデオから弾塑性関節物体の動力学を学習する変形物体操作2026/7/1
ビデオから弾塑性関節物体の動力学を学習するデジタルツインフレームワークを提案し、手動折りたたみや双腕操作実験で長期的な塑性変形挙動を正確に再現した。
- CoStream: 単純な行動の合成による汎用的な複雑操作の実現マニピュレーション2026/6/1
複雑な操作タスクを、基盤モデルと多様なセンシングを組み合わせた複数の単純な行動(意味的・予測的・反応的)に分解し、それらをSE(3)インターフェース上で合成することで、高精度と汎用性を両立するフレームワークを提案した。
- FlexiTac: ロボットシステム向け低コスト・オープンソース・スケーラブルな触覚センシングソリューション触覚2026/4/1
低コストでオープンソースの圧電抵抗式触覚センサモジュールを提案し、薄型センサパッドと多チャンネル読み出し基板を備え、様々なロボットハンドに容易に取り付け可能。触覚学習パイプラインにも対応する。
- 触覚を活用した四脚ロボットの移動操作ポリシー学習移動操作/触覚/強化学習2026/4/1
四脚ロボットの移動操作において、視覚と自己受容感覚に加えて触覚情報を活用する階層的ポリシー学習手法を提案。実世界の人間デモから触覚条件付き高レベルポリシーを学習し、シミュレーションでの大規模強化学習により全身制御ポリシーを獲得し、実世界へゼロショット転送する。接触を伴うタスクで平均28.54%の性能向上を達成。
- ManipulationNet:物理的スキル課題と身体化マルチモーダル推論を備えた実世界ロボット操作のベンチマーク基盤ベンチマーク2026/3/1
実世界のロボット操作タスクを標準化されたハードウェアキットと統一ソフトウェアクライアントで提供し、物理スキルと身体化推論の2トラックで評価する持続可能なベンチマーク基盤を提案した。
- ロボットマニピュレータのための汎用ニューラルモーションプランナーに向けて:課題と機会モーションプランニング2026/3/1
この論文は、ロボットマニピュレータのモーションプランニングにおけるニューラルプランナーの現状をレビューし、その利点と限界を分析して、汎用性の高いプランナーを構築するための道筋を示しています。
- IMPASTO: モデルベース計画と学習された力学モデルを統合したロボット油絵再現ロボットアート/計画2026/3/1
ロボットが油絵の画像列から筆の軌道や力、色を推論して再現するシステムを提案。学習したピクセル力学モデルとモデル予測制御を統合し、自己対戦のみで学習する。
- 実世界からシミュレーション、そして実世界へ:共有自律による効率的で信頼性の高い遠隔操作遠隔操作/共有自律2026/3/1
実世界の遠隔操作データから学習した人間の代理モデルを用いて、シミュレーションで残差コパイロットポリシーを訓練し、実世界の微細な操作タスクで人間の遠隔操作を支援する共有自律フレームワークを提案。
- ロボット政策の訓練と評価のためのインタラクティブ世界シミュレータ世界モデル2026/3/1
一貫性モデルを用いて高速かつ安定なインタラクティブ世界モデルを構築し、ロボット政策の訓練と評価を可能にするフレームワークを提案。世界モデル内で収集したデータで訓練した政策が実世界データと同等の性能を示し、シミュレーションと実世界の性能に強い相関があることを実証。
- 低コスト触覚力制御グリッパによる力調整マニピュレーションの学習マニピュレーション2026/2/1
低コストの触覚フィードバック付き力制御グリッパと、把持力を高頻度で調整するフレームワークを提案し、力加減が重要な実世界タスクで有効性を示した。
- 現在のエージェントは世界モデルを先見のツールとして活用できていないVLA2026/1/7
視覚言語モデルベースのエージェントが生成的世界モデルを外部シミュレータとして使えるかを検証し、シミュレーションの起動判断や予測結果の解釈・統合がボトルネックで性能が向上しないことを示した実証研究。
- 因子分解拡散ポリシーによる柔軟なマルチタスク学習マニピュレーション2025/12/1
複雑な行動分布を専門化した拡散モデルの合成に分解するモジュラー拡散ポリシーを提案し、マルチタスク操作で性能と適応性を向上させた。
- ガウススプラッティングによる軟体相互作用のReal-to-Simロボット方策評価sim2real2025/11/1
実世界の動画から軟体のデジタルツインを構築し、3Dガウススプラッティングでフォトリアルに描画するReal-to-Sim評価フレームワークを提案。ぬいぐるみ詰め込みやロープ通しなどの変形操作タスクで、シミュレーション結果が実機性能と強く相関することを示した。
- VT-Refine: 視触覚フィードバックによる両手組立のシミュレーション微調整学習マニピュレーション2025/10/1
少数の実演と高忠実度の触覚シミュレーションを組み合わせ、強化学習で両手組立ポリシーを微調整することで、接触の多い精密作業の実世界性能を向上させた研究。
- マルチモーダル政策コンセンサスによるマルチモーダルマニピュレーションマニピュレーション2025/9/1
視覚や触覚など複数の感覚モダリティを、それぞれに特化した拡散モデルと適応的な重み付けを行うルータネットワークで統合し、接触の多いタスクや遮蔽された物体の操作を可能にする手法を提案。
- 生成動画を模倣するロボットマニピュレーション:物理的実演なしで複雑タスクを実現マニピュレーション2025/7/1
言語指示と初期画像からAIが生成した動画を模倣し、物理的な実演やロボット固有の訓練なしに、注ぐ・拭く・混ぜるなどの複雑な操作をロボットに実行させるシステムを開発した。
- 実世界での触覚:ポータブル視触覚グリッパによる繊細なマニピュレーション学習触覚2025/7/1
触覚センサ内蔵のポータブルグリッパで視覚と触覚のデータを同時収集し、両モダリティの特性を保つ表現学習により、試験管挿入やピペット操作などの精密作業を高精度・高ロバストに実現した。
- RGB-D動画から変形可能物体モデルを学習する粒子-グリッドニューラルダイナミクス変形可能物体モデリング2025/6/1
粒子と空間グリッドを組み合わせたハイブリッド表現で、ロボットと物体の相互作用を撮影したRGB-D動画から、ロープや布などの変形可能物体のダイナミクスを学習し、モデルベース計画に応用する手法を提案。
- CodeDiffuser: VLM生成コードによる曖昧な指示に対応する注意強化拡散ポリシーVLA2025/6/1
VLMが自然言語指示を解釈してタスク固有のコードを生成し、そのコードから3D注意マップを作って拡散ポリシーを誘導することで、曖昧な指示下のロボットマニピュレーションを実現するフレームワーク。
- 道具をインターフェースとして:人間の道具使用観察からのロボット方策学習模倣学習2025/4/1
人間の道具使用動画から3D再構成と道具中心のタスク空間行動を用いてロボット方策を学習し、視点変化や身体差を克服するフレームワークを提案した。
- PhysTwin: 動画からの物理情報に基づく変形可能物体の再構成とシミュレーションsim2real2025/3/1
動的物体の少数視点動画から、ばね-質量モデルとガウシアンスプラッティングを組み合わせて物理的にリアルなデジタルツインを再構成し、リアルタイム対話型シミュレーションやロボット動作計画を可能にするフレームワーク。
- 状態拡散と逆動力学モデルを用いた協調的双腕マニピュレーション方策の学習マニピュレーション2025/3/1
拡散モデルで将来の状態を予測し、逆動力学モデルで行動を生成することで、双腕ロボットの協調マニピュレーションを模倣学習する手法を提案。
- KUDA: キーポイントで力学学習と視覚プロンプトを統合するオープンボキャブラリロボット操作マニピュレーション2025/3/1
RGB画像上のキーポイントをVLMで目標指定に変換し、学習した力学モデルでコスト関数を最適化することで、多様な物体や変形・粒状物体の操作を可能にするオープンボキャブラリ操作システムを提案した。
- 地形操作のための局所グラフベースニューラルダイナミクスモデル地形操作2025/3/1
地形操作のための学習ベースのダイナミクスモデルを提案し、大規模な地形グラフからロボットの制御入力に基づいて小さな関心領域を特定することで、計算効率と予測精度を向上させた。
- VLM生成の反復キーポイント報酬による実機-シミュレーション-実機のロボットマニピュレーションマニピュレーション2025/2/1
VLMが言語指示とRGB-D観測からキーポイント間の関係に基づく報酬関数を生成・反復改善し、実世界シーンをシミュレーションで再構築してRL方策を訓練、実機へ展開する枠組みを提案。
- CuriousBot: 操作可能な3D関係物体グラフによる対話型移動探索移動探索2025/1/1
物体間の多様な関係を表す3D関係物体グラフを構築し、移動ロボットが能動的な操作を通じて環境を探索するシステムを提案。VLMのみの手法を上回る性能を示した。
- BaB-ND: 分枝限定法とニューラルダイナミクスによる長期的動作計画マニピュレーション2024/12/1
ニューラルダイナミクスモデル上での軌道最適化に分枝限定法をGPUで高速化し、接触の多い長期的なマニピュレーション計画を高精度に解くフレームワークを提案。
- GenDP: カテゴリレベル汎化を実現する3Dセマンティックフィールド拡散ポリシーVLA2024/10/1
マルチビューRGBDから大規模視覚モデルで3D記述子場を生成し、参照記述子と比較して意味場を得ることで、拡散ポリシーの未見物体への汎化性能を20%から93%に向上させた。
- 3D-ViTac:視触覚センシングによる繊細なマニピュレーションの学習マニピュレーション2024/10/1
低コストで柔軟な高密度触覚センサと視覚情報を統合した3D表現を用い、拡散ポリシーによる模倣学習で両手巧みな操作を実現するシステムを提案。
- グラフベース神経力学モデリングのための動的3Dガウシアントラッキングsim2real2024/10/1
多視点RGB動画から3Dガウシアン表現とグラフニューラルネットワークを用いて物体の力学モデルを学習し、ロボット動作に条件付けられた将来予測や操作計画を可能にするフレームワークを提案。
- ReKep: ロボットマニピュレーションのための関係的キーポイント制約の時空間推論マニピュレーション2024/9/1
環境中の3Dキーポイント間の関係をPython関数で表す制約(ReKep)を導入し、大規模視覚モデルと言語モデルを用いて自由形式の指示から自動生成することで、多様なマニピュレーションタスクをリアルタイムに実行する手法を提案。
- AdaptiGraph: 材料適応型グラフベースニューラルダイナミクスによるロボットマニピュレーションマニピュレーション2024/7/1
物理特性が未知の多様な変形可能物体に対し、グラフニューラルネットワークによる動力学モデルを数ショットで適応させ、予測と操作を可能にする手法を提案。
- RoboPack: 触覚情報を活用した動力学モデルによる高密度パッキング触覚2024/7/1
視覚と触覚を組み合わせたリカレントグラフニューラルネットワークで物体状態を推定し、モデル予測制御により非把持操作や高密度パッキングを実現する手法を提案。
- BEHAVIOR-1K:1000の日常活動とリアルなシミュレーションによる人間中心の身体性AIベンチマークsim2real2024/3/1
人間がロボットにやってほしいと望む1000の日常活動を、50のシーンと9000以上の物体を含む物理シミュレーション環境OMNIGIBSONで再現し、実世界への転移も検証したベンチマークを提案した。
- RoboEXP: Action-Conditioned Scene Graph via Interactive Exploration for Robotic Manipulation2024/2/1
- Model-Based Control with Sparse Neural Dynamics2023/12/1
- Open X-Embodiment: Robotic Learning Datasets and RT-X Models2023/10/1
- D$^3$Fields: Dynamic 3D Descriptor Fields for Zero-Shot Generalizable Rearrangement2023/9/1
- Predicting Object Interactions with Behavior Primitives: An Application in Stowing Tasks2023/9/1
- VoxPoser: Composable 3D Value Maps for Robotic Manipulation with Language Models2023/7/1
- Multi-Object Manipulation via Object-Centric Neural Scattering Functions2023/6/1
- RoboCook: Long-Horizon Elasto-Plastic Object Manipulation with Diverse Tools2023/6/1
- Dynamic-Resolution Model Learning for Object Pile Manipulation2023/6/1
- The ObjectFolder Benchmark: Multisensory Learning with Neural and Real Objects2023/6/1
- Planning with Spatial-Temporal Abstraction from Point Clouds for Deformable Object Manipulation2022/10/1
- Does Learning from Decentralized Non-IID Unlabeled Data Benefit from Self Supervision?2022/10/1
- Reinforcement Learning with Neural Radiance Fields2022/6/1
- RoboCraft: Learning to See, Simulate, and Shape Elasto-Plastic Objects with Graph Networks2022/5/1
- ComPhy: Compositional Physical Reasoning of Objects and Events from Videos2022/5/1
- DiffSkill: Skill Abstraction from Differentiable Physics for Deformable Object Manipulations with Tools2022/3/1
- Learning Multi-Object Dynamics with Compositional Neural Radiance Fields2022/2/1
- Dynamic Modeling of Hand-Object Interactions via Tactile Sensing2021/9/1
- 3D Neural Scene Representations for Visuomotor Control2021/7/1
- Keypoints into the Future: Self-Supervised Correspondence in Model-Based Reinforcement Learning2020/9/1
- Learning Compositional Koopman Operators for Model-Based Control2019/10/1
- Connecting Touch and Vision via Cross-Modal Prediction2019/6/1
- Learning Particle Dynamics for Manipulating Rigid Bodies, Deformable Objects, and Fluids2018/10/1
- Propagation Networks for Model-Based Control Under Partial Observation2018/9/1