Mingtong Zhang
収録論文 13本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- EmbodiedSWE:長期的器用ロボティクスのためのコーディングエージェントVLA2026/9/23
コーディングエージェントが長期的・器用なロボットタスクを解き、その解を多様な軌道に拡張してVLAを訓練し、実機タスクまで完了できることを示した研究。
- 視覚検証による推論時制御と自律的なポリシー改善ロボット学習2026/6/1
汎用ロボットポリシーに視覚検証器を組み合わせ、推論時に行動を評価・選択することで追加学習なしで性能を向上させ、さらに検証済み軌道で微調整して自律的に改善する手法を提案した。
- MolmoB0T: 大規模シミュレーションによるゼロショット操作の実現操作2026/3/1
大規模で多様なシミュレーションデータのみを用いて、実世界へのゼロショット転移が可能であることを示し、静的・移動操作の両方で有効なポリシーを訓練した。
- D-REX: 巧みな把持学習のための微分可能な実世界-シミュレーション-実世界エンジン把持/シミュレーション2026/3/1
ガウススプラット表現を用いた微分可能エンジンを構築し、実世界の視覚観測とロボット制御信号から物体質量を同定しつつ、把持ポリシーを同時学習する手法を提案。
- LAP: 言語-行動事前学習によるゼロショットの異機体転移VLA2026/2/1
ロボットの低レベル行動を自然言語で表現して事前学習することで、未知のロボット機体にもファインチューニングなしでゼロショット転移できるVLAモデルLAP-3Bを提案した。
- PolaRiS: 汎用ロボットポリシーのためのスケーラブルな実世界→シミュレーション評価sim2real2025/12/1
実世界の短い動画スキャンからニューラル再構成で高忠実度なシミュレーション環境を構築し、汎用ロボットポリシーを実世界と強く相関する形で評価できるようにしたフレームワーク。
- SeFA-Policy: 選択的フロー整合による高速で正確な視覚運動ポリシー学習VLA2025/11/1
拡散・フローベースのポリシー学習において、蒸留後の生成行動が観測とずれる問題を、専門家デモを用いた選択的フロー整合で補正し、推論遅延を98%以上削減しつつ高精度・高ロバストな視覚運動ポリシーを実現した。
- RoboVerse:スケーラブルで汎化可能なロボット学習のための統合プラットフォーム・データセット・ベンチマークsim2real2025/4/1
複数のシミュレータとロボット形態に対応する統合シミュレーション基盤MetaSimと、高品質な合成データセット、模倣学習・強化学習の統一ベンチマークを提供するフレームワークを提案。
- KUDA: キーポイントで力学学習と視覚プロンプトを統合するオープンボキャブラリロボット操作マニピュレーション2025/3/1
RGB画像上のキーポイントをVLMで目標指定に変換し、学習した力学モデルでコスト関数を最適化することで、多様な物体や変形・粒状物体の操作を可能にするオープンボキャブラリ操作システムを提案した。
- 大規模人間動画から学ぶ汎用人型ポーズ制御VLA2024/12/1
2000万件超の人間動画から人型ロボットのポーズとテキスト指示のデータセットHumanoid-Xを構築し、テキスト入力で人型ロボットを制御する大規模モデルUH-1を学習した。
- グラフベース神経力学モデリングのための動的3Dガウシアントラッキングsim2real2024/10/1
多視点RGB動画から3Dガウシアン表現とグラフニューラルネットワークを用いて物体の力学モデルを学習し、ロボット動作に条件付けられた将来予測や操作計画を可能にするフレームワークを提案。
- Open X-Embodiment: Robotic Learning Datasets and RT-X Models2023/10/1
- D$^3$Fields: Dynamic 3D Descriptor Fields for Zero-Shot Generalizable Rearrangement2023/9/1