Jiafei Duan
収録論文 27本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 接地行動モデル:ロボティクスの基盤としての3DグラウンディングVLA2026/9/20
言語・点・ボックス指示を対象物の3D表現に変換し、マルチストリームTransformerで行動を予測するロボット基盤モデルGAMを提案。RoboTwin 2.0やLIBERO-PROで高い成功率を示した。
- 視覚と行動のショートカットを断ち切る:汎化可能なロボット基盤モデルのための潜在インターフェース訓練VLA2026/9/11
視覚入力と行動の相関を過学習する「視覚-行動ショートカット」を防ぐため、画像なしで目標指向の行動を学習させた後、姿勢監督付きの潜在インターフェースで視覚条件付けを制約する2段階訓練法を提案。
- MolmoMotion: 言語指示による3D点軌跡予測動作予測2026/6/17
言語指示に基づいて物体上の3D点の将来軌跡を予測するモデルと、大規模データセット・ベンチマークを構築した論文。
- MolmoAct2: 実世界展開のための行動推論モデルVLA2026/5/1
実世界展開に適した完全オープンな行動推論モデルMolmoAct2を提案し、空間推論に特化したVLMバックボーン、新しいデータセット、オープンな行動トーカナイザ、適応的推論機構などを導入して性能と効率を向上させた。
- MolmoB0T: 大規模シミュレーションによるゼロショット操作の実現操作2026/3/1
大規模で多様なシミュレーションデータのみを用いて、実世界へのゼロショット転移が可能であることを示し、静的・移動操作の両方で有効なポリシーを訓練した。
- MolmoSpaces:ロボットナビゲーションとマニピュレーションのための大規模オープンエコシステムsim2real2026/2/1
23万以上の多様な屋内環境と13万の物体アセットを備え、MuJoCoやIsaacなど複数シミュレータで使えるオープンなロボットベンチマーク基盤を構築し、実機との高い相関を示した。
- TOPReward: トークン確率を隠れたゼロショット報酬として用いるロボティクスVLA2026/2/1
事前学習済み動画言語モデルのトークン確率を利用し、タスク指示に対する進捗を密な報酬として推定する訓練不要の手法を提案。実世界の操作ベンチマークで従来の訓練不要手法を上回る性能を示した。
- 再帰的深さを持つVLA:潜在的反復推論による視覚言語行動モデルのテスト時計算スケーリングVLA2026/2/1
重み共有の再帰的な行動ヘッドを用いて、推論時に潜在空間での反復的な洗練を行うことで、メモリ使用量を一定に保ちながら計算量を適応的に増やせるVLAアーキテクチャを提案した。
- VLS: 視覚言語モデルによる事前学習済みロボット方策の誘導VLA2026/2/1
凍結した拡散・フローマッチング方策のサンプリングを、視覚言語モデルが生成する報酬で推論時に誘導し、再学習なしで空間・タスクの分布シフトに適応させる手法。
- RoboCade:ロボットデータ収集をゲーム化データ収集2025/12/1
一般ユーザーが遠隔操作でゲーム感覚でロボットのデモデータを収集できるプラットフォームを開発し、そのデータで訓練した方策が対象タスクの成功率を16〜56%向上させることを示した。
- FailSafe: VLAモデルの失敗推論と回復VLA2025/10/1
VLAモデルが実行中に遭遇する失敗を検出し、回復動作を生成できるようにする失敗生成・回復システムFailSafeを提案し、LLaVA-OV-7Bを微調整してロボットアームの失敗検出・回復性能を向上させた。
- MolmoAct: 空間で推論できる行動推論モデルVLA2025/8/1
知覚・計画・制御を3段階で統合し、深度を考慮した知覚トークンから編集可能な軌道計画を生成して低レベル行動を予測するロボット基盤モデルを提案。シミュレーションと実世界で高い性能を示し、1万件超の軌道データセットも公開した。
- RoboEval:ロボットマニピュレーションのための構造化・スケーラブルな評価フレームワークマニピュレーション2025/7/1
ロボットマニピュレーションの評価を二値的成功から拡張し、効率・協調・安全性などの行動指標と段階的進捗・失敗局所化を含む構造化ベンチマークを提案。8つの両手タスクと3000以上の実演を提供。
- GraspMolmo:大規模合成データ生成による汎用タスク指向把持把持2025/5/1
自然言語指示とRGB-D画像から、大規模合成データで学習した視覚言語モデルにより、意味的に適切な把持を予測する汎用タスク指向把持モデルを提案。
- SAM2Act:視覚基盤モデルと記憶アーキテクチャを統合したロボットマニピュレーションマニピュレーション2025/1/1
視覚基盤モデルを活用したマルチビューロボット方策SAM2Actを提案し、RLBenchで86.8%の成功率を達成。さらに記憶バンクを備えたSAM2Act+と記憶依存タスク評価用ベンチマークMemoryBenchを導入し、94.3%の成功率を実現した。
- One RING:ロボット屋内ナビゲーションの汎用モデルナビゲーション2024/12/1
シミュレーションで大規模な機体形状のランダム化を行い、様々な実機ロボットに適応できる機体非依存の屋内ナビゲーション方策を学習した。
- SAT: マルチモーダル言語モデルのための動的空間適性トレーニングVLA2024/12/1
3Dシミュレータを用いて静的・動的な空間推論を含む17.5万件のQAペアと2万シーンからなるデータセットSATを構築し、マルチモーダル言語モデルの空間認識能力を訓練する手法を提案した。
- RoboMD: 意味的ポテンシャル場によるロボットの脆弱性発見マニピュレーション2024/12/1
視覚言語埋め込み空間をポテンシャル場として強化学習し、実機試行なしで操作ポリシーの脆弱性を予測・マッピングするフレームワークを提案。
- AHA: ロボットマニピュレーションの失敗を検出・推論する視覚言語モデルVLA2024/10/1
ロボット操作の失敗を自然言語で検出・説明するオープンソースVLM「AHA」を提案し、シミュレーションで生成した大規模失敗データセットで学習させ、実世界や未見タスクへの汎化性能を示した。
- RoboPoint: ロボティクス向け空間アフォーダンス予測の視覚言語モデルVLA2024/6/1
合成データで視覚言語モデルをロボット向けに微調整し、言語指示から画像内のキーポイントアフォーダンスを予測するRoboPointを開発。実世界データ不要でスケーラブルに学習でき、ナビゲーションや操作などのタスクで既存手法を上回る。
- Manipulate-Anything:視覚言語モデルによる実世界ロボット操作の自動化マニピュレーション2024/6/1
視覚言語モデルを活用し、特権的な状態情報や手設計スキルなしで実世界の任意の静的物体を操作する軌道を自動生成する手法を提案し、既存手法を上回る性能とロバストな模倣学習を実現した。
- Octopi: 大規模触覚言語モデルによる物体特性推論触覚2024/5/1
触覚知覚と大規模視覚言語モデルを組み合わせ、物体の物理的特性を予測・推論するシステムOctopiと、触覚動画を含むデータセットPhysiCLeARを提案した。
- EVE: 拡張現実で誰でもロボットを訓練可能に拡張現実/ロボット学習2024/4/1
物理ロボットなしで、iOSアプリのAR可視化を使って日常ユーザーがロボットのタスク実演を収集・訓練できるシステムを開発し、ユーザー研究で有効性を示した。
- コロッセウム:ロボットマニピュレーションの汎化性能を評価するベンチマークマニピュレーション2024/2/1
環境の色・テクスチャ・照明・カメラ位置など14種類の摂動に対するロボットマニピュレーションの汎化性能を評価するシミュレーションベンチマークを提案し、最先端モデルの成功率が30〜50%低下することを示した。
- NEWTON: Are Large Language Models Capable of Physical Reasoning?2023/10/1
- AR2-D2:Training a Robot Without a Robot2023/6/1
- Robustness of Utilizing Feedback in Embodied Visual Navigation2023/3/1