Jiageng Mao
収録論文 18本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 大規模報酬モデル:視覚言語モデルによる汎用的なオンラインロボット報酬生成強化学習2026/3/1
ロボット操作の強化学習において、視覚言語モデルをオンライン報酬生成器として活用し、模倣学習で初期化した方策を少数の反復で改善する枠組みを提案した。
- DreamPlan: ビデオワールドモデルによる視覚言語プランナーの効率的な強化学習ファインチューニング操作2026/3/1
ロボット操作のための視覚言語モデルプランナーを、実世界での試行錯誤を避け、ビデオ生成モデルによる仮想ロールアウトを用いて強化学習でファインチューニングする手法を提案した。
- D-REX: 巧みな把持学習のための微分可能な実世界-シミュレーション-実世界エンジン把持/シミュレーション2026/3/1
ガウススプラット表現を用いた微分可能エンジンを構築し、実世界の視覚観測とロボット制御信号から物体質量を同定しつつ、把持ポリシーを同時学習する手法を提案。
- Ψ₀: 汎用人型ロコマニピュレーションに向けたオープン基盤モデルVLA2026/3/1
高品質な一人称視点の人間動画でVLMを事前学習し、人型ロボットの実機データで追加学習する段階的パラダイムにより、少ないデータで人型ロコマニピュレーションを実現するオープン基盤モデルを提案した。
- 物理世界モデルからのロボット学習マニピュレーション2025/11/1
動画生成モデルと物理世界再構成を組み合わせ、実機データなしでゼロショットのロボットマニピュレーションを実現するフレームワークPhysWorldを提案。
- SeFA-Policy: 選択的フロー整合による高速で正確な視覚運動ポリシー学習VLA2025/11/1
拡散・フローベースのポリシー学習において、蒸留後の生成行動が観測とずれる問題を、専門家デモを用いた選択的フロー整合で補正し、推論遅延を98%以上削減しつつ高精度・高ロバストな視覚運動ポリシーを実現した。
- Humanoid Everyday:オープンワールドヒューマノイド操作のための包括的ロボットデータセットヒューマノイド操作2025/10/1
ヒューマノイドロボットの器用な操作・人間とのインタラクション・移動を伴う動作を含む大規模マルチモーダルデータセットを構築し、クラウド評価基盤も提供した研究。
- あらゆる画像からのロボット学習sim2real2025/9/1
1枚の画像から物理シミュレーション可能なロボット環境を生成し、大規模な視覚運動デモンストレーションデータを自動収集するフレームワークRoLAを提案。
- ManipBench:視覚言語モデルの低レベルロボット操作能力を評価するベンチマークVLA2025/5/1
視覚言語モデルが物体間の相互作用や変形物体の操作をどれだけ理解できるかを評価する新しいベンチマークManipBenchを提案し、33モデルをテストした。
- RoboVerse:スケーラブルで汎化可能なロボット学習のための統合プラットフォーム・データセット・ベンチマークsim2real2025/4/1
複数のシミュレータとロボット形態に対応する統合シミュレーション基盤MetaSimと、高品質な合成データセット、模倣学習・強化学習の統一ベンチマークを提供するフレームワークを提案。
- PhysBench:視覚言語モデルの物理世界理解を評価・強化するベンチマークVLA2025/1/1
視覚言語モデル(VLM)の物理世界理解を評価する10,002件のベンチマークPhysBenchを提案し、75モデルの評価と、視覚モデルを組み合わせて物理理解を強化するPhysAgentを開発した。
- 大規模人間動画から学ぶ汎用人型ポーズ制御VLA2024/12/1
2000万件超の人間動画から人型ロボットのポーズとテキスト指示のデータセットHumanoid-Xを構築し、テキスト入力で人型ロボットを制御する大規模モデルUH-1を学習した。
- RAM: 検索ベースのアフォーダンス転移による汎用ゼロショットロボットマニピュレーションマニピュレーション2024/7/1
ロボット・人間・カスタムデータからアフォーダンス記憶を構築し、言語指示に応じて類似デモを検索して2Dアフォーダンスを3D実行可能な形に転移することで、未知の物体・環境・身体でもゼロショットで操作を実現するフレームワーク。
- DeTra: 物体検出と軌道予測を統合したモデル自動運転2024/6/1
LiDAR点群と高精細地図から物体の存在・姿勢・将来の複数軌道を直接推論し、検出と予測を軌道リファインメント問題として統合したTransformerモデルを提案。
- 大規模言語モデルによる運転ポリシーの適応でどこでも走行自動運転2024/2/1
大規模言語モデルを使って各地域の交通ルールを解釈し、自動運転車の運転行動を新しい環境に適応させる手法LLaDAを提案した。
- A Language Agent for Autonomous Driving2023/11/1
- GPT-Driver: Learning to Drive with GPT2023/10/1
- 3D Object Detection for Autonomous Driving: A Comprehensive Survey2022/6/1