Zhirui Fang
収録論文 7本 ・ フィジカルAI/ロボット学習
VLA身体化AI/位置特定マニピュレーション
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- EMERGE-Policy: ロボットの心は単一ポリシーを超えて出現するVLA2026/8/30
複数の専門エージェントが協調して知覚・推論・検証・記憶を行うグラフ構造のエージェントフレームワークを提案し、追加のファインチューニングなしでベンチマークと実ロボット実験で高い性能を達成した。
- ELAN4D: 身体中心の4D監視による視覚言語行動モデルのプラグアンドプレイ適応VLA2026/5/1
ロボットのキーポイントの未来の3D軌跡を予測する補助分岐をVLAモデルに追加し、外乱下での汎化性能を向上させるフレームワークを提案した。
- SpatialPoint: 身体化された位置特定のための空間認識ポイント予測身体化AI/位置特定2026/3/1
視覚と言語指示に基づいて実行可能な3Dポイントを予測する身体化位置特定問題を定式化し、深度情報を視覚言語モデルに統合するSpatialPointを提案。RGB-Dデータセットを構築し、実ロボットでの把握・配置タスクで有効性を検証した。
- CO-RFT: チャンク型オフライン強化学習による視覚-言語-行動モデルの効率的ファインチューニングVLA2025/8/1
VLAモデルをアクションチャンキング対応のオフライン強化学習でファインチューニングする手法を提案し、実環境で成功率57%向上・サイクルタイム22.3%短縮を達成した。
- VLA-OS:視覚言語行動モデルにおける計画表現とパラダイムの構造化と分析VLA2025/6/1
VLAモデルの計画パラダイムと表現を統一的に比較するVLA-OSを提案し、視覚接地表現が言語表現より優れ、階層型VLAが性能・汎化・拡張性で優位だが速度が遅いことを示した。
- 物体注目アクター:データ効率的なロボットの汎化器用把持操作マニピュレーション2025/5/1
巧みな操作タスクにおいて、物体認識と姿勢推定を行い、事前操作姿勢に到達してから物体に注目したアクターで操作を実行する階層的パイプラインを提案し、10回のデモンストレーションだけで背景や位置の変化に汎化できることを示した。
- 実世界強化学習による巧みな把持マニピュレーション2025/3/1
実環境で直接強化学習を行い、模倣学習で事前学習した方策を微調整することで、多様な物体の巧みな把持を約92%の成功率で実現した。