Ian Reid
収録論文 43本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- Exo2EgoHOI: 手と物体のインタラクションを考慮した三人称視点から一人称視点への動画生成動画生成2026/9/29
三人称視点の操作動画を一人称視点に変換する際、手と物体のインタラクションを保つための4D事前情報と物体中心のアテンション機構を導入した動画生成フレームワーク。
- ロボットデータファクトリー:物理AIのための経験生成基盤データ基盤2026/9/15
ロボットの生データではなく物理的経験を継続的に生成・検証・再利用する基盤「Robot Data Factory」を提案し、その階層構造とスケーリング則を定式化した。
- UniMo: 人間と動物のモーション生成を統合するフレームワークモーション生成2026/9/11
骨格の違いを点群表現に変換することで種を問わず統一的に扱えるモーション生成手法を提案し、人間と動物を合わせた大規模データセットUniML3Dも構築した。
- ROScopter: ROSflight 2.0に基づくマルチローター自動操縦装置ドローン制御2026/3/1
研究者向けに設計された、ROS 2上で動作する軽量なマルチローター自動操縦装置ROScopterを提案し、シミュレーションと実機での性能を検証した。
- ManipArena:推論指向の汎用ロボットマニピュレーションの実世界包括評価マニピュレーション2026/3/1
実機ロボットでのマニピュレーション汎化を公平に評価するため、20タスク・1万超の専門家軌道・約188時間分のデータを備えた標準化ベンチマークを構築し、VLAやワールドアクションモデルなど7構成を比較した。
- GeoWorld: 幾何学的世界モデル世界モデル2026/2/1
潜在表現を双曲空間に写像するHyperbolic JEPAと幾何学的強化学習を導入し、長期的な視覚計画の精度を向上させた世界モデル。
- ROSplane 2.0: 研究向け固定翼オートパイロット固定翼UAV/オートパイロット2025/10/1
研究向けに設計されたオープンソースの固定翼自律飛行スタックROSplaneをROS 2に対応させ、推定・制御アルゴリズムやモジュール性、空力モデリングを改善した。
- ROSflight 2.0: 無人航空機向けの軽量ROS 2ベース自動操縦システム自動操縦/ROS 22025/10/1
研究向けに設計された軽量なオープンソース自動操縦エコシステムROSflightをROS 2に対応させ、モジュール性と使いやすさを向上させた。シミュレーションから実機への移行を加速する。
- TANGO: 走行可能性を考慮した局所メトリック制御によるトポロジカルゴールへのナビゲーションナビゲーション2025/9/1
RGB画像のみを用い、3Dマップや学習済み制御器なしで物体レベルのサブゴールへ長距離ナビゲーションするトポメトリック手法を提案。単眼深度と走行可能性推定で局所軌道を予測し、基盤モデルによりゼロショットで未知環境に適用できる。
- ObjectReact: 物体相対制御を学習する視覚ナビゲーション視覚ナビゲーション2025/9/1
単眼カメラとトポロジカルマップを用いた視覚ナビゲーションにおいて、画像相対ではなく物体相対の制御を学習する新手法を提案し、センサ高さの変化に対する頑健性を示した。
- 世界モデリングによる潜在行動の事前学習VLA2025/9/1
ラベルなし動画から世界モデリングで潜在行動表現を自己教師あり学習し、模倣学習モデルを事前学習するフレームワークLAWMを提案。
- 効率的な幾何認識ビジョンエンコーダによるロボットマニピュレーションの改善マニピュレーション2025/9/1
幾何認識型の視覚表現を模倣学習に組み込むことで成功率が最大6.5%向上することを示し、さらにVGGTを蒸留した高速・軽量なエンコーダeVGGTを提案した論文。
- インコンテキスト模倣学習におけるアクショントークナイザの重要性模倣学習2025/3/1
インコンテキスト模倣学習において、既存のアクショントークナイザが時間的な滑らかさを保てない問題を指摘し、Lipschitz条件を課すVAE「LipVQ-VAE」を提案して安定した動作生成を実現した。
- Hier-SLAM++: 階層的分類ガウシアンスプラッティングによるニューロシンボリック意味SLAMSLAM2025/2/1
RGB-Dと単眼入力に対応し、LLMと3D生成モデルを活用した階層的分類表現で姿勢推定と3D意味マッピングを高精度に行う意味SLAM手法を提案。
- ロボットナビゲーションにおける言語と計画:最先端モデルの多言語評価VLA2025/1/1
アラビア語を含む多言語の言語モデルを用いて、視覚と言語によるロボットナビゲーションの計画能力を評価した研究。
- 連続環境における制約認識型ゼロショット視覚言語ナビゲーションVLA2024/12/1
ゼロショットVLN-CEを制約認識型のサブ命令完了プロセスとして再構成し、CSMとCVMの2モジュールでナビゲーション計画を逐次生成するCA-Navを提案、ベンチマークで最高性能を達成した。
- 怒りの強化学習:感情のジェットコースターを体験する自動運転2024/10/1
自動運転レースの強化学習コンペで、視覚入力をルールベース制御に組み合わせる手法が優勝した。
- 10回のデモから学ぶ:指向性アフォーダンスフレームによる汎化可能でサンプル効率の良い方策学習模倣学習2024/10/1
指向性アフォーダンスフレームという構造化表現を用いて、わずか10回のデモから汎化性能の高いロボット方策を学習し、長期・複数物体タスクをサブ方策の合成で解決する手法を提案。
- BEVPose: ポーズ誘導マルチモーダルBEVアライメントによるシーン意味理解BEV認識2024/10/1
カメラとLiDARのBEV表現をセンサポーズを教師信号として統合し、アノテーションをほとんど使わずにBEVマップセグメンテーションで既存手法を上回る事前学習手法を提案した。
- Hier-SLAM: 階層的カテゴリカルガウシアンスプラッティングによるSLAMのセマンティクス大規模化セマンティックSLAM2024/9/1
大規模言語モデルを活用した階層的カテゴリ表現を3DガウシアンスプラッティングSLAMに導入し、500クラス以上の実世界シーンで高精度なセマンティックマッピングと高速動作を実現した。
- GraspMamba: 階層的特徴学習を備えたMambaベースの言語駆動型把持検出フレームワークマニピュレーション2024/9/1
Mambaビジョンと階層的特徴融合を用いて、乱雑な画像や長いテキスト記述でも高速・高精度に把持位置を検出する言語駆動型モデルを提案した。
- RoboHop: セグメントベースのトポロジカルマップ表現によるオープンワールド視覚ナビゲーション視覚ナビゲーション2024/5/1
画像セグメントをノードとするトポロジカルグラフを構築し、自然言語クエリによる物体探索とセグメント間のホップとしてナビゲーション計画を生成する手法を提案。
- SayPlan: Grounding Large Language Models using 3D Scene Graphs for Scalable Robot Task Planning2023/7/1
- Predicting Topological Maps for Visual Navigation in Unexplored Environments2022/11/1
- ActiveRMAP: Radiance Field for Active Mapping And Planning2022/11/1
- Autonomy and Perception for Space Mining2021/9/1
- Semantics for Robotic Mapping, Perception and Interaction: A Survey2021/1/1
- HM4: Hidden Markov Model with Memory Management for Visual Place Recognition2020/11/1
- Scalable Place Recognition Under Appearance Change for Autonomous Driving2019/8/1
- Practical Robot Learning from Demonstrations using Deep End-to-End Training2019/5/1
- V2CNet: A Deep Learning Framework to Translate Videos to Commands for Robotic Manipulation2019/3/1
- Real-Time Monocular Object-Model Aware Sparse SLAM2018/9/1
- Structure Aware SLAM using Quadrics and Planes2018/4/1
- Deep-6DPose: Recovering 6D Object Pose from a Single RGB Image2018/2/1
- Vision-and-Language Navigation: Interpreting visually-grounded navigation instructions in real environments2017/11/1
- Addressing Challenging Place Recognition Tasks using Generative Adversarial Networks2017/9/1
- AffordanceNet: An End-to-End Deep Learning Approach for Object Affordance Detection2017/9/1
- SceneCut: Joint Geometric and Object Segmentation for Indoor Scenes2017/9/1
- A Discrete-Time Attitude Observer on SO(3) for Vision and GPS Fusion2017/4/1
- A Branch-and-Bound Algorithm for Checkerboard Extraction in Camera-Laser Calibration2017/4/1
- Deep Learning Features at Scale for Visual Place Recognition2017/1/1
- Meaningful Maps With Object-Oriented Semantic Mapping2016/9/1
- Past, Present, and Future of Simultaneous Localization And Mapping: Towards the Robust-Perception Age2016/6/1