Haishan Liu
収録論文 5本 ・ フィジカルAI/ロボット学習
VLA/評価ベンチマークVLAVLA/データ選択VLA/操作VLA/空間知能/3D認識
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- ロボセマンティックベンチ:VLAモデルの行動予測における意味的接地の診断VLA/評価ベンチマーク2026/6/1
VLAモデルが複雑な指示の意味を理解して正しい物体を操作できるかを診断するベンチマークを提案し、多くのモデルが物体把握はできるが意味的に正しい選択がランダム以下であることを示した。
- PhysBrain 1.0 技術報告書VLA2026/5/1
大規模な人間の一人称視点ビデオから物理的常識を抽出し、視覚言語行動モデルとロボット制御ポリシーに転移する手法を提案し、複数のベンチマークで最高性能を達成した。
- FrameSkip: VLAトレーニングにおける少数だが情報量の多いフレームからの学習VLA/データ選択2026/5/1
ロボットのデモ軌道から全フレームを均等に使う代わりに、動作変化や視覚-動作の整合性などに基づいて重要フレームを選び、その割合を増やして学習するフレーム選択手法を提案。データローダのみを変更し、VLAアーキテクチャはそのままに、3つのベンチマークで成功率を向上させた。
- IntentVLA:曖昧なロボット操作のための短期的意図モデリングVLA/操作2026/5/1
視覚と言語の観察が似ていても異なる行動を取るマルチモーダルな模倣データに対し、過去の視覚観察を短期的意図として符号化し、行動生成を条件付けるVLAフレームワークを提案。曖昧さを評価するベンチマークAliasBenchも導入し、複数の環境で安定性と性能を向上させた。
- 3D-Mix for VLA: VGGTベースの3D情報を視覚言語行動モデルに統合するプラグアンドプレイモジュールVLA/空間知能/3D認識2026/3/1
VLAモデルの空間知能を向上させるため、VGGTによる3D情報をタスク文脈に応じて適応的に融合するプラグアンドプレイモジュール「3D-Mix」を提案し、複数のVLAアーキテクチャとベンチマークで一貫した性能向上を実証した。