Haoyi Jiang
Huazhong University of Science and Technology
収録論文 7本 ・ フィジカルAI/ロボット学習
VLAVLA/ベンチマークロボット操作
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- Ego4WAM:ロボット学習のための自己中心的人間データのスケーリングで重要な要素は何か?VLA2026/9/30
自己中心的人間データをロボット学習に活用する際、人間とロボットのアライメント、タスク多様性、行動監督、利用戦略が下流性能に与える影響を体系的に分析し、データ設計の指針を示した。
- 世界行動モデルの表現設計を見直すReWAMVLA2026/9/29
事前学習済みDINO特徴を基盤に、特徴校正と時間表現ボトルネックで世界状態を圧縮し、行動損失のみで表現を整形する世界行動モデルを提案。動画生成事前学習なしでRoboTwin 2.0で93.6%の成功率を達成。
- CogWAM: イベント駆動型インターフェースによる意味認知と世界行動モデリングの整合VLA2026/9/29
タスク推論と世界行動学習の間に持続的な意味状態を介した明示的なインターフェースを設け、進捗条件付きクエリで未来予測と行動生成を整合させる認知誘導型世界行動モデルを提案。
- InstructMove: 指示追従操作のためのテキスト必須ベンチマークVLA/ベンチマーク2026/8/24
視覚的に顕著な物体や唯一の動作候補に頼らず、言語指示にのみ従って正解が決まる「テキスト必須」な操作ベンチマークInstructMoveを提案し、VLAモデルの指示追従能力を診断・改善する。
- Faster-WAM: ロバストな世界行動モデルのための効率的な推論時未来条件付けロボット操作2026/8/5
世界行動モデル(WAM)の推論時における未来条件付けの重要性を示し、計算コストを抑えつつ未来表現を活用する効率的なフレームワークFaster-WAMを提案した。
- DreamWAM: RGBを超えた未来予測による世界行動モデルVLA2026/8/1
世界行動モデル(WAM)の未来予測をRGBだけでなく、外観・動き・幾何・意味の構造化表現で行うことで、ロバストな行動学習を実現した。
- Symphonize 3D Semantic Scene Completion with Contextual Instance Queries2023/6/1