Jiayuan Gu
ShanghaiTech University
収録論文 19本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- FACT: 忠実度を考慮した関節物体ツインの構築sim2real2026/9/29
画像や受動応答動画から、エージェントが診断と修正を繰り返して関節物体のデジタルツインを構築し、形状・接触・動特性の忠実度を高めるフレームワーク。
- NavProbe: 能動的記憶検索による証拠に基づく推論を用いたゼロショットナビゲーションナビゲーション2026/9/23
訪問場所や遷移の要約をインデックス化し、必要時に視覚・幾何情報を能動的に検索してサブゴールを修正する階層型ゼロショットナビゲーション手法を提案し、R2R-CEやRxR-CEで高い性能を示した。
- PASSAGE: 雑然環境における知覚型ヒューマノイド移動のためのシーン整合運動学習のスケーリング歩行2026/9/16
VRと慣性モーションキャプチャで収集した1500の雑然シーンにおける100時間の人間動作データを用い、条件付きフローマッチングプランナと全身トラッカーを組み合わせて、未知の障害物環境でもヒューマノイドが知覚に基づき踏み越え・すり抜け・くぐり抜けを選択・実行できる枠組みを提案。
- Dexora: 高自由度両腕巧緻操作のためのオープンソースVLAVLA/操作2026/5/1
両腕・両手の高自由度操作を対象とした初のオープンソースVLAシステムDexoraを提案し、ハイブリッド遠隔操作とデータ品質を考慮した学習手法により、巧緻操作の成功率を大幅に向上させた。
- 視覚的に現実的なシミュレーションを目指して:ロボット操作のシミュレーション評価のためのベンチマークシミュレーション評価2026/5/1
シミュレーションと実世界の視覚的ギャップを減らすため、照明とマテリアルが幾何学的推論と空間的接地に与える影響を分析し、高忠実度の3Dアセットと自動パイプラインを用いた視覚的に現実的なベンチマークVISERを提案した。
- R3D: 3Dポリシー学習の再考模倣学習/3Dポリシー2026/4/1
3Dポリシー学習の不安定性と過学習の原因を診断し、3Dデータ拡張の欠如とバッチ正規化の悪影響を特定。スケーラブルなトランスフォーマー型3Dエンコーダと拡散デコーダを組み合わせた新しいアーキテクチャを提案し、操作ベンチマークで最先端を達成した。
- 身体性を持つ思考の木:身体性世界モデルによる意図的なマニピュレーション計画マニピュレーション2025/12/1
物理ベースのデジタルツインを世界モデルとして用い、木探索とVLMによる失敗診断でロボットのマニピュレーション計画を立案するReal2Sim2Realフレームワークを提案。
- DreamPolicy:スケーラブルなヒューマノイド歩行のための統合ワールドモデルポリシー歩行2025/5/1
拡散ベースの地形認識ワールドモデルとオフラインデータを統合し、単一のポリシーで未知の複合地形へのゼロショット転移を実現したヒューマノイド歩行フレームワーク。
- ExFace: 拡散トランスフォーマーとブートストラップ学習によるヒューマノイドロボットの表情豊かな顔制御表情制御2025/4/1
拡散トランスフォーマーを用いて人間の顔のブレンドシェイプからバイオニックロボットのモーター制御へ高精度にマッピングし、ブートストラップ学習で表情生成の品質・精度・滑らかさを向上させた。
- SoFar: 言語に基づく物体の向きが空間推論と物体操作を橋渡しするVLA2025/2/1
自然言語で物体の向きを定義する「意味的向き」を導入し、大規模データセットとゼロショット予測モデルを構築して、6自由度の空間推論とロボット動作生成を可能にした。
- AffordDP: 転移可能なアフォーダンスによる汎化可能な拡散ポリシーマニピュレーション2024/12/1
物体の操作箇所と動作軌道を表すアフォーダンスを基礎モデルと点群位置合わせで未知物体に転移し、拡散サンプリング時の誘導に用いることで、未見カテゴリへの操作汎化を実現した。
- 実世界ロボットマニピュレーションポリシーのシミュレーション評価sim2real2024/5/1
実環境とシミュレーションの制御・視覚ギャップを緩和し、実機セットアップに対応した評価環境SIMPLERを構築。実機とシミュレーションの性能が強く相関することを示した。
- RT-Sketch: 手描きスケッチによる目標条件付き模倣学習模倣学習2024/3/1
手描きスケッチを目標指定に用いる操作ポリシーを提案し、言語や画像条件よりも曖昧さや視覚的妨害に頑健であることを示した。
- RT-Trajectory: Robotic Task Generalization via Hindsight Trajectory Sketches2023/11/1
- Open X-Embodiment: Robotic Learning Datasets and RT-X Models2023/10/1
- ManiSkill2: A Unified Benchmark for Generalizable Manipulation Skills2023/2/1
- Multi-skill Mobile Manipulation for Object Rearrangement2022/9/1
- Close the Optical Sensing Domain Gap by Physics-Grounded Active Stereo Sensor Simulation2022/1/1
- Deep Feedback Inverse Problem Solver2021/1/1