Ivan Laptev
収録論文 35本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 履歴行動軌跡からのスキル学習:世界行動モデルのための行動経験辞書VLA2026/9/30
過去の行動軌跡を共有埋め込みとして辞書化し、操作タスク間でスキルを再利用できるようにした世界行動モデルを提案。
- ロボット実行誤差下でのVLAの制御:自己補償とストレステストVLA2026/9/29
VLAポリシーがロボットの実行誤差をオンラインで自己補償する手法を提案し、シミュレーションベンチマークRoboStressと実機実験で有効性を示した。
- ロボットデータファクトリー:物理AIのための経験生成基盤データ基盤2026/9/15
ロボットの生データではなく物理的経験を継続的に生成・検証・再利用する基盤「Robot Data Factory」を提案し、その階層構造とスケーリング則を定式化した。
- ロボット学習と制御のための世界行動モデル:サーベイVLA2026/9/13
未来の世界予測と実行可能な行動生成を統合したWorld-Action Models(WAMs)について、ロボティクス視点で分類・応用・評価・課題を整理したサーベイ。
- UnfoldArt: テキストまたは画像からの完全な関節3Dオブジェクトのゼロショット復元3D再構成2026/6/29
テキストや画像から、関節構造と隠れた内部形状を含む完全な3Dオブジェクトを復元する、エージェントベースの新しい手法を提案。
- A1: 完全透過型オープンソースの適応的かつ効率的なトランケート型視覚言語行動モデルVLA2026/4/1
低コストで高スループットな推論を実現するため、事前学習済みVLMと適応的早期終了・層間トランケートフローマッチングを導入したVLAモデルA1を提案し、シミュレーションと実機でSOTA性能と推論コスト削減を達成した。
- PhysMoDPO: 選好最適化による物理的に妥当なヒューマノイド動作生成ヒューマノイド動作生成2026/3/1
全身制御器(WBC)を訓練に組み込み、拡散モデルが生成する動作を物理法則とテキスト指示の両方に適合させる選好最適化フレームワークを提案し、シミュレーションと実機G1ヒューマノイドで有効性を示した。
- ManipArena:推論指向の汎用ロボットマニピュレーションの実世界包括評価マニピュレーション2026/3/1
実機ロボットでのマニピュレーション汎化を公平に評価するため、20タスク・1万超の専門家軌道・約188時間分のデータを備えた標準化ベンチマークを構築し、VLAやワールドアクションモデルなど7構成を比較した。
- MessyKitchens: 接触リッチなオブジェクトレベルの3Dシーン再構成3Dシーン再構成2026/3/1
散らかった実世界のキッチンシーンを対象に、物体の形状・姿勢・接触を高精度に再構成する新しいデータセットと、複数物体を同時に再構成する手法を提案した論文。
- 観察対象の選択:視覚運動ポリシーのためのタスク認識型意味幾何表現視覚運動ポリシー2026/3/1
RGB画像とタスク関連エンティティの指定から、対象物とロボットをセグメント化し、意味色と深度情報を統合した標準的な3チャンネル画像表現を構築する観察インターフェースを提案。外観変化に対するロバスト性を向上させる。
- Web動画からの暗黙的幾何表現を用いた視覚言語ナビゲーション視覚言語ナビゲーション2026/3/1
Web上の部屋ツアー動画から大規模な指示データを構築し、RGBフレームから直接空間情報を抽出する暗黙的幾何表現を導入することで、3D再構成に頼らずにVLNエージェントの学習を可能にした。複数のベンチマークで最先端性能を達成し、ゼロショットナビゲーションも実現した。
- GLaD: 視覚言語行動モデルのための幾何潜在蒸留VLA2025/12/1
3D幾何情報を知識蒸留でVLAモデルに組み込み、深度センサーや3D注釈なしで空間推論と操作性能を向上させた手法。
- PixelVLA:視覚言語行動モデルにおけるピクセルレベル理解の推進VLA2025/11/1
ピクセル単位のシーン理解とテキスト・画像のマルチモーダル指示に対応したVLAモデルを提案し、大規模ピクセル注釈データセットで学習することで、低コストながら操作成功率を大幅に向上させた。
- BLAZER: ゼロショットデータ生成によるLLMベース操作エージェントのブートストラップマニピュレーション2025/10/1
LLMプランナーでシミュレーション内の操作デモを自動生成し、成功例でLLMを微調整することで、人手なしに操作スキルを獲得・転移させるフレームワークを提案。
- 基盤モデルは段階的な身体性推論においてどれほど優れているか?VLA2025/9/1
身体性環境での段階的推論能力を評価するFoMERベンチマークを提案し、主要な大規模マルチモーダルモデルの性能と限界を分析した。
- PhyBlock: 3Dブロック組み立てによる物理理解と計画の段階的ベンチマークベンチマーク/VLA2025/6/1
視覚言語モデルの物理理解と計画能力を評価するため、4段階の認知階層を持つ3Dブロック組み立てタスクとVQAを組み合わせたベンチマークを提案し、21モデルを評価した。
- DriveLMM-o1: 自動運転シナリオ理解のための段階的推論データセットと大規模マルチモーダルモデルVLA2025/3/1
自動運転の知覚・予測・計画を段階的に推論するVQAデータセット(学習18k・テスト4k超)とベンチマークを構築し、そのデータで微調整した大規模マルチモーダルモデルを提案した論文。
- RoomTour3D: 幾何情報を活用した動画指示チューニングによる身体性ナビゲーションナビゲーション2024/12/1
Web上のルームツアー動画から3D再構成を行い、歩行軌跡と指示文を付与した大規模データセットRoomTour3Dを構築し、VLNタスクの性能を大幅に改善した。
- MALMM: ゼロショットロボットマニピュレーションのためのマルチエージェント大規模言語モデルマニピュレーション2024/11/1
複数のLLMエージェントに高レベル計画と低レベル制御コード生成を分担させ、環境観察に基づく動的な再計画を行うことで、事前学習済みスキルや例示なしにロボット操作タスクをゼロショットで解くフレームワークを提案。
- 効率的な接触計画のための実行可能遷移の学習歩行2024/7/1
四足歩行ロボットが飛び石のような厳しい環境を移動するため、接触遷移の動的実行可能性を学習し、モンテカルロ木探索による接触計画を高速化・高精度化した。
- ViViDex: 人間の動画から視覚ベースの巧みなマニピュレーションを学習マニピュレーション2024/4/1
人間の動画から強化学習で物理的に妥当な軌道を生成し、それを用いて特権情報なしの統一的な視覚ポリシーを学習するフレームワークViViDexを提案。
- PolarNet: 3D Point Clouds for Language-Guided Robotic Manipulation2023/9/1
- Object Goal Navigation with Recursive Implicit Maps2023/8/1
- Robust Visual Sim-to-Real Transfer for Robotic Manipulation2023/7/1
- Learning Video-Conditioned Policies for Unseen Manipulation Tasks2023/5/1
- Contact Models in Robotics: a Comparative Analysis2023/4/1
- Enforcing the consensus between Trajectory Optimization and Policy Learning for precise robot control2022/9/1
- Instruction-driven history-aware policies for robotic manipulations2022/9/1
- Augmenting differentiable physics with randomized smoothing2022/6/1
- Leveraging Randomized Smoothing for Optimal Control of Nonsmooth Dynamical Systems2022/3/1
- Goal-Conditioned Reinforcement Learning with Imagined Subgoals2021/7/1
- Learning Object Manipulation Skills via Approximate State Estimation from Real Videos2020/11/1
- Learning Obstacle Representations for Neural Motion Planning2020/8/1
- Learning visual policies for building 3D shape categories2020/4/1
- Monte-Carlo Tree Search for Efficient Visually Guided Rearrangement Planning2019/4/1