Lu Sheng
Beihang University
収録論文 7本 ・ フィジカルAI/ロボット学習
VLAマニピュレーション
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- ActiveArena:ロボットマニピュレーションにおける能動的知覚のベンチマークと理解VLA2026/9/21
能動的知覚と操作を評価するためのシミュレータと35タスクのベンチマーク、および13種のVLA構成を提案し、記憶管理やOOD汎化の要因を分析した。
- ロボティクスのための視覚言語モデルにおける推論を伴う空間トレースに向けてVLA2025/12/1
3D空間の参照と計測を統合したVLM「RoboTracer」を提案し、強化学習による多段階の空間推論を実現。大規模データセットとベンチマークも構築し、ロボットの長期的タスク実行に応用した。
- TIGeR: ロボティクス向け視覚言語モデルにおけるツール統合幾何推論VLA2025/10/1
視覚言語モデルに外部ツールで正確な幾何計算を生成・実行させる枠組みを提案し、ロボット操作に必要なセンチメートル精度を実現した。
- IS-Bench:家庭内タスクにおけるVLM駆動型身体エージェントの対話型安全性評価VLA2025/6/1
家庭内タスクを行うVLM駆動型エージェントの対話型安全性を評価する初のマルチモーダルベンチマークIS-Benchを提案し、161のシナリオと388のリスクで危険回避行動の手順を検証した。
- RoboRefer: ロボティクス向け視覚言語モデルにおける推論を伴う空間指示VLA2025/6/1
3D空間理解と多段階推論を可能にする視覚言語モデルRoboReferを提案し、大規模データセットRefSpatialとベンチマークRefSpatial-Benchを導入して、空間指示タスクで最先端性能を達成した。
- Code-as-Monitor: 制約認識型ビジュアルプログラミングによるロボットの受動的・能動的障害検出VLA2024/12/1
VLMが生成したコードで時空間制約を評価し、ロボットの予期せぬ失敗の事後検出と予見可能な失敗の事前防止を統一的に実現する手法を提案。
- RH20T-P: 組み合わせ可能な汎化エージェントに向けたプリミティブレベルロボットデータセットマニピュレーション2024/3/1
ロボット操作のための約3.8万本の動画クリップからなるプリミティブレベルデータセットRH20T-Pを構築し、計画実行型の組み合わせ汎化エージェントのベースラインを実装した。