Ranjay Krishna
収録論文 28本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 接地行動モデル:ロボティクスの基盤としての3DグラウンディングVLA2026/9/20
言語・点・ボックス指示を対象物の3D表現に変換し、マルチストリームTransformerで行動を予測するロボット基盤モデルGAMを提案。RoboTwin 2.0やLIBERO-PROで高い成功率を示した。
- HumanCLAW: 視覚言語モデルは身体を通して行動できるか?VLA評価2026/7/1
視覚言語モデル(VLM)の身体を使った行動能力を評価するフレームワークを提案し、41の屋内シーンで1,218エピソードのベンチマークを構築。最先端のVLMでも成功率は最大16.8%にとどまり、物体認識ではなく身体の自己認識が欠如していることが課題と判明。
- MolmoMotion: 言語指示による3D点軌跡予測動作予測2026/6/17
言語指示に基づいて物体上の3D点の将来軌跡を予測するモデルと、大規模データセット・ベンチマークを構築した論文。
- MolmoAct2: 実世界展開のための行動推論モデルVLA2026/5/1
実世界展開に適した完全オープンな行動推論モデルMolmoAct2を提案し、空間推論に特化したVLMバックボーン、新しいデータセット、オープンな行動トーカナイザ、適応的推論機構などを導入して性能と効率を向上させた。
- MolmoB0T: 大規模シミュレーションによるゼロショット操作の実現操作2026/3/1
大規模で多様なシミュレーションデータのみを用いて、実世界へのゼロショット転移が可能であることを示し、静的・移動操作の両方で有効なポリシーを訓練した。
- 再帰的深さを持つVLA:潜在的反復推論による視覚言語行動モデルのテスト時計算スケーリングVLA2026/2/1
重み共有の再帰的な行動ヘッドを用いて、推論時に潜在空間での反復的な洗練を行うことで、メモリ使用量を一定に保ちながら計算量を適応的に増やせるVLAアーキテクチャを提案した。
- TOPReward: トークン確率を隠れたゼロショット報酬として用いるロボティクスVLA2026/2/1
事前学習済み動画言語モデルのトークン確率を利用し、タスク指示に対する進捗を密な報酬として推定する訓練不要の手法を提案。実世界の操作ベンチマークで従来の訓練不要手法を上回る性能を示した。
- VLS: 視覚言語モデルによる事前学習済みロボット方策の誘導VLA2026/2/1
凍結した拡散・フローマッチング方策のサンプリングを、視覚言語モデルが生成する報酬で推論時に誘導し、再学習なしで空間・タスクの分布シフトに適応させる手法。
- MolmoSpaces:ロボットナビゲーションとマニピュレーションのための大規模オープンエコシステムsim2real2026/2/1
23万以上の多様な屋内環境と13万の物体アセットを備え、MuJoCoやIsaacなど複数シミュレータで使えるオープンなロボットベンチマーク基盤を構築し、実機との高い相関を示した。
- CapNav: 能力条件付き屋内ナビゲーションにおける視覚言語モデルのベンチマークVLA2026/2/1
エージェントの移動能力(階段可否やサイズなど)を条件として、視覚言語モデルが複雑な屋内環境をナビゲートできるかを評価するベンチマークCapNavを提案し、13モデルを評価した。
- FailSafe: VLAモデルの失敗推論と回復VLA2025/10/1
VLAモデルが実行中に遭遇する失敗を検出し、回復動作を生成できるようにする失敗生成・回復システムFailSafeを提案し、LLaVA-OV-7Bを微調整してロボットアームの失敗検出・回復性能を向上させた。
- ManiFlow:一貫性フロー学習による汎用ロボットマニピュレーションポリシーマニピュレーション2025/9/1
視覚・言語・固有感覚入力を条件に、一貫性フロー学習で1〜2ステップの高精度なロボット動作生成を実現する汎用模倣学習ポリシーを提案。
- MolmoAct: 空間で推論できる行動推論モデルVLA2025/8/1
知覚・計画・制御を3段階で統合し、深度を考慮した知覚トークンから編集可能な軌道計画を生成して低レベル行動を予測するロボット基盤モデルを提案。シミュレーションと実世界で高い性能を示し、1万件超の軌道データセットも公開した。
- RoboEval:ロボットマニピュレーションのための構造化・スケーラブルな評価フレームワークマニピュレーション2025/7/1
ロボットマニピュレーションの評価を二値的成功から拡張し、効率・協調・安全性などの行動指標と段階的進捗・失敗局所化を含む構造化ベンチマークを提案。8つの両手タスクと3000以上の実演を提供。
- 収束する機能、発散する形態:形態と制御の効率的な共設計フレームワークLOKI形態と制御の共設計2025/5/1
形態と制御方策を同時に設計する際、類似形態をクラスタ化して方策を共有し、局所探索で多様性を確保することで、計算コストを大幅に削減しつつ多様で汎用性の高いロボット形態を生成する手法を提案。
- GraspMolmo:大規模合成データ生成による汎用タスク指向把持把持2025/5/1
自然言語指示とRGB-D画像から、大規模合成データで学習した視覚言語モデルにより、意味的に適切な把持を予測する汎用タスク指向把持モデルを提案。
- SAM2Act:視覚基盤モデルと記憶アーキテクチャを統合したロボットマニピュレーションマニピュレーション2025/1/1
視覚基盤モデルを活用したマルチビューロボット方策SAM2Actを提案し、RLBenchで86.8%の成功率を達成。さらに記憶バンクを備えたSAM2Act+と記憶依存タスク評価用ベンチマークMemoryBenchを導入し、94.3%の成功率を実現した。
- One RING:ロボット屋内ナビゲーションの汎用モデルナビゲーション2024/12/1
シミュレーションで大規模な機体形状のランダム化を行い、様々な実機ロボットに適応できる機体非依存の屋内ナビゲーション方策を学習した。
- SAT: マルチモーダル言語モデルのための動的空間適性トレーニングVLA2024/12/1
3Dシミュレータを用いて静的・動的な空間推論を含む17.5万件のQAペアと2万シーンからなるデータセットSATを構築し、マルチモーダル言語モデルの空間認識能力を訓練する手法を提案した。
- ロボットの経験を実世界の自然言語で接地するRONARVLA2024/11/1
マルチモーダルなロボット経験をLLMで自然言語ナレーションに変換し、行動説明や失敗分析、人間との対話による復旧を支援するシステムを提案。
- AHA: ロボットマニピュレーションの失敗を検出・推論する視覚言語モデルVLA2024/10/1
ロボット操作の失敗を自然言語で検出・説明するオープンソースVLM「AHA」を提案し、シミュレーションで生成した大規模失敗データセットで学習させ、実世界や未見タスクへの汎化性能を示した。
- RoboPoint: ロボティクス向け空間アフォーダンス予測の視覚言語モデルVLA2024/6/1
合成データで視覚言語モデルをロボット向けに微調整し、言語指示から画像内のキーポイントアフォーダンスを予測するRoboPointを開発。実世界データ不要でスケーラブルに学習でき、ナビゲーションや操作などのタスクで既存手法を上回る。
- Manipulate-Anything:視覚言語モデルによる実世界ロボット操作の自動化マニピュレーション2024/6/1
視覚言語モデルを活用し、特権的な状態情報や手設計スキルなしで実世界の任意の静的物体を操作する軌道を自動生成する手法を提案し、既存手法を上回る性能とロバストな模倣学習を実現した。
- EVE: 拡張現実で誰でもロボットを訓練可能に拡張現実/ロボット学習2024/4/1
物理ロボットなしで、iOSアプリのAR可視化を使って日常ユーザーがロボットのタスク実演を収集・訓練できるシステムを開発し、ユーザー研究で有効性を示した。
- コロッセウム:ロボットマニピュレーションの汎化性能を評価するベンチマークマニピュレーション2024/2/1
環境の色・テクスチャ・照明・カメラ位置など14種類の摂動に対するロボットマニピュレーションの汎化性能を評価するシミュレーションベンチマークを提案し、最先端モデルの成功率が30〜50%低下することを示した。
- SPOC: Imitating Shortest Paths in Simulation Enables Effective Navigation and Manipulation in the Real World2023/12/1
- Holodeck: Language Guided Generation of 3D Embodied AI Environments2023/12/1
- AR2-D2:Training a Robot Without a Robot2023/6/1