Renrui Zhang
収録論文 14本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- VBVR-Pro: ネイティブ視覚推論のためのスケーラブルで検証可能なスイート視覚推論2026/8/26
視覚生成を推論の媒体として扱うネイティブ視覚推論の研究を進めるため、300の手続き生成タスクからなる閉ループテストベッドVBVR-Proを導入し、検証可能な報酬スコアラと制御されたモダリティ比較を提供する。
- LaST-R1: 適応的物理潜在推論によるロボット操作の強化学習強化操作学習2026/4/1
ロボット操作の基盤モデルに対し、潜在推論と行動生成を共同最適化する強化学習フレームワークを提案し、LIBEROベンチマークで99.9%の成功率を達成した。
- LaST₀:ロボット視覚言語行動モデルのための潜在時空間チェーン・オブ・ソートVLA2026/1/1
言語ではなく潜在空間で未来の視覚・3D・固有感覚を推論する時空間Chain-of-Thoughtを導入し、低頻度推論と高頻度行動生成を分離した二重システムVLAフレームワークを提案。
- ManualVLA:思考連鎖による手順書生成とロボット操作を統合したVLAモデルVLA2025/12/1
目標状態から実行手順を推論する「Manual Chain-of-Thought」を導入し、手順書生成と操作実行をMixture-of-Transformersで統合したVLAモデルを提案。3D Gaussian Splattingによるデジタルツインで訓練データを自動生成する。
- マルチモーダル言語モデルの身体性能力をスキル単位で評価・診断するベンチマークBEARVLA2025/10/1
身体性タスクを14の原子スキルに分解してMLLMを細粒度評価するベンチマークBEARを提案し、知覚と時空間モデリングがボトルネックであることを示すとともに、視覚・空間推論ツールを組み込んだBEAR-Agentで性能を改善した。
- MLA: ロボットマニピュレーションにおけるマルチモーダル理解と予測のためのマルチセンサリー言語行動モデルVLA2025/9/1
2D画像・3D点群・触覚を位置対応で統合し、将来のマルチセンサリー情報を予測する言語行動モデルを提案。接触の多い実世界タスクで従来の2D/3D VLAを大きく上回る。
- AC-DiT: 移動マニピュレーションのための適応協調拡散トランスフォーマ移動マニピュレーション2025/7/1
移動ベースとマニピュレータの協調を改善するため、ベース運動を事前情報として全身動作を予測する機構と、2D画像と3D点群の融合重みを動的に調整する知覚戦略を備えた拡散トランスフォーマを提案した。
- Fast-in-Slow:高速操作と低速推論を統合するデュアルシステム基盤モデルVLA2025/6/1
VLMベースの推論システムに実行モジュールを部分的にパラメータ共有して組み込み、高速かつ精密なロボット操作を実現する統合型VLAモデルを提案。
- HybridVLA:拡散と自己回帰を統合した視覚-言語-行動モデルVLA2025/3/1
拡散モデルによる連続的な行動生成と自己回帰による文脈推論を単一の大規模言語モデル内で統合し、両者を協調的に学習・アンサンブルするロボット操作フレームワークを提案。
- Language-Assisted 3D Scene Understanding2023/12/1
- ManipLLM: Embodied Multimodal Large Language Model for Object-Centric Robotic Manipulation2023/12/1
- Revisiting Event-based Video Frame Interpolation2023/7/1
- EDA: Explicit Text-Decoupling and Dense Alignment for 3D Visual Grounding2022/9/1
- PointCLIP: Point Cloud Understanding by CLIP2021/12/1