Deva Ramanan
Carnegie Mellon University
収録論文 40本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- AevaScenes: 長距離知覚のためのFMCW LiDARデータセットとベンチマークLiDARデータセット2026/9/27
FMCW LiDARのドップラー速度情報を含む大規模データセットを構築し、3D物体検出・シーンフロー推定・セマンティックセグメンテーションのベンチマークを提案。ドップラー情報が遠距離の検出精度を最大2倍改善することを示した。
- MimicAgent: プロンプトから軌道生成による四足歩行スキルの獲得歩行2026/9/21
スキルを表すプロンプトからコーディングエージェントで四足ロボットの参照軌道を生成し、それを用いた模倣強化学習で実機展開可能な動的スキルを学習するフレームワークを提案。
- PointZero: 転移可能な3Dダイナミクス学習のための3D点追跡補完3Dダイナミクス/事前学習2026/9/16
ロボットの行動ラベルなしで、RGB-D観測と部分的な3D軌跡から全点の未来軌跡を予測する事前学習手法を提案し、下流のダイナミクス予測や模倣学習で有効性を示した。
- モダリティ自己回帰型ワールドアクションモデルVLA2026/9/15
将来の観測と行動を複数の視覚モダリティ(点追跡・DINO特徴・深度)で自己回帰的に予測するModARを提案し、RGB予測より効率的で成功率も高いことを示した。
- モデルはすでに知っている:教えずに問い方を学ぶ、視覚言語モデルの少数ショット適応のためのソフトプロンプティングVLA2026/9/10
視覚言語モデルの少数ショット物体検出において、バックボーンを凍結したまま少数の連続プロンプトトークンを最適化するソフトプロンプティングを検討し、プロンプト配置と初期化の設計選択を明らかにした。LoRAと同等精度を2万倍少ないパラメータで達成し、破滅的忘却も回避できることを示した。
- 視覚運動ポリシーの短期記憶を拡張し長期的タスクを実現模倣学習2026/6/1
本論文は、模倣学習による視覚運動ポリシーに短期記憶を効果的に組み込むためのアーキテクチャPRISMを提案し、新しいベンチマークReMemBenchで評価した。
- Any4D: 統合フィードフォワード計量4D再構成4D再構成2025/12/1
多視点トランスフォーマーにより、Nフレームのピクセル単位の動きと形状を直接予測する4D再構成手法を提案。RGB-DやIMU、レーダーなど追加センサーも利用可能で、高精度かつ高速。
- CRISP: 平面プリミティブを用いた単眼動画からの接触誘導型Real2Simsim2real2025/12/1
単眼動画から人間とシーンの接触を手がかりに平面プリミティブでシーン形状を復元し、物理的に妥当な人間動作とシミュレーション可能な環境を生成する手法。
- 少数デモンストレーションによる視覚-言語-行動モデルのメカニズム的解釈に基づくファインチューニングVLA2025/11/1
少数の実演からタスク固有のアテンションヘッドを特定し選択的にファインチューニングするRobotic Steeringを提案し、LoRAを上回る性能とロバスト性、計算コスト削減、解釈性向上を実機で示した。
- MapAnything: 汎用フィードフォワード計量3D再構成3D再構成2025/9/1
複数画像と任意の幾何情報から、カメラ姿勢や深度を含む計量的な3Dシーンを単一のフィードフォワードで推定する統一Transformerモデルを提案。
- HDMI: 人間の動画から対話型ヒューマノイド全身制御を学習全身操作2025/9/1
単眼RGB動画から人間と物体の軌道を抽出・再ターゲットし、強化学習でヒューマノイドの全身物体操作スキルを学習、実機にゼロショット展開するフレームワーク。
- プロンプトから製品へ:双腕マニピュレーションによる生成的組み立てマニピュレーション2025/8/1
自然言語プロンプトからLEGOブロックの組み立て設計を生成し、双腕ロボットで実世界の製品を自動構築するパイプラインを提案した。
- UFM: フローとマッチングを統合するシンプルな密対応モデル密対応2025/6/1
広基線マッチングとオプティカルフローを単一のTransformerで統合学習し、両タスクで専門手法を上回る精度と速度を実現した。
- InstructPart: 指示に基づくタスク指向型パーツセグメンテーションパーツセグメンテーション2025/5/1
物体を構成する部品ごとに分割し、指示されたタスクに応じて適切な部品を切り出すベンチマークInstructPartを提案し、既存の視覚言語モデルでも難しいことを示した上で、データセットでの微調整により性能を倍増させるベースラインを提示した。
- BETTYデータセット:完全自律走行のためのマルチモーダルデータセット自律走行データセット2025/5/1
自律レーシングカーで4年間にわたり収集された32TB超のマルチモーダルデータセットを公開し、知覚・状態推定・動力学モデリング・運動予測など完全自律スタックの学習と評価を可能にした。
- RefAV:計画中心のシナリオマイニングに向けてシナリオマイニング2025/5/1
自動運転の走行ログから自然言語で記述された安全上重要なシナリオを検出・時空間的に特定する大規模データセットRefAVを構築し、視覚言語モデルを用いた手法の課題を分析した。
- 自律レース車両のための高速でモジュール式な自律走行ソフトウェア自律走行2024/8/1
Indy Autonomous Challenge 向けに、エージェント検出・運動計画・制御をモジュール化した高速な自律走行スタックを開発し、単一・複数エージェント環境での性能を評価した。
- 棚監督付きクロスモーダル事前学習による3D物体検出3D物体検出2024/6/1
RGB画像とLiDARのペアデータから、画像基盤モデルを活用してゼロショットで3Dバウンディングボックスを生成し、それを疑似ラベルとして3D検出器を事前学習する手法を提案。
- 適応的世界モデルによる自動運転の計画自動運転計画2024/6/1
都市環境での自動運転計画のため、エージェントの反応行動を予測するBehaviorNetと、それに基づくMPCプランナーAdaptiveDriverを提案し、nuPlanベンチマークで最先端性能を達成した。
- SAL:LiDAR内のあらゆる物体をセグメントする学習への道LiDARセグメンテーション2024/3/1
2D視覚基盤モデルを活用してLiDARの3D疑似ラベルを自動生成し、手動監督なしで任意のクラスをゼロショットでセグメント・分類できるSALモデルを提案した。
- SplaTAM: Splat, Track & Map 3D Gaussians for Dense RGB-D SLAM2023/12/1
- DeformGS: Scene Flow in Highly Deformable Scenes for Deformable Object Manipulation2023/12/1
- Long-Tailed 3D Detection via Multi-Modal Fusion2023/12/1
- Lidar Panoptic Segmentation and Tracking without Bells and Whistles2023/10/1
- An Empirical Analysis of Range for 3D Object Detection2023/8/1
- Joint Metrics Matter: A Better Standard for Trajectory Forecasting2023/5/1
- SLoMo: A General System for Legged Robot Motion Imitation from Casual Videos2023/4/1
- Argoverse 2: Next Generation Datasets for Self-Driving Perception and Forecasting2023/1/1
- Far3Det: Towards Far-Field 3D Detection2022/11/1
- Towards Long-Tailed 3D Detection2022/11/1
- Differentiable Raycasting for Self-supervised Occupancy Forecasting2022/10/1
- Robust Modeling and Controls for Racing on the Edge2022/5/1
- Forecasting from LiDAR via Future Object Detection2022/3/1
- Learning to Move with Affordance Maps2020/1/1
- What You See is What You Get: Exploiting Visibility for 3D Object Detection2019/12/1
- Hierarchical Deep Stereo Matching on High-resolution Images2019/12/1
- Inferring Distributions Over Depth from a Single Image2019/12/1
- Learning to Optimally Segment Point Clouds2019/12/1
- Argoverse: 3D Tracking and Forecasting with Rich Maps2019/11/1
- PixelNet: Representation of the pixels, by the pixels, and for the pixels2017/2/1