Xiaomeng Zhu
収録論文 6本 ・ フィジカルAI/ロボット学習
VLA身体化推論/タスク計画シーンフロー推定アフォーダンス推論
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- RxBrain:言語と視覚の推論・想像を統合した身体化認知基盤モデルVLA2026/7/1
身体化認知のための基盤モデルRxBrainを提案。言語による計画構造と視覚による世界状態予測を統合し、単一の計画シーケンスで表現する。
- まず計画を立て、それから精密に調整する:効率的な身体化推論のためのシンボリック強化学習身体化推論/タスク計画2026/6/1
身体化タスク計画において、BDDL仕様を共有インターフェースとして用い、ビデオからBDDLへのパーサー、LLM検証器、軽量シンボリックエンジンを組み合わせることで、ミリ秒単位の密な報酬を提供し、難易度適応型の長さスケジュールGroupAdaptを導入して、8BプランナーのBEHAVIOR-1000での性能を大幅に向上させた。
- TeFlow: 時間的一貫性を活用したマルチフレーム自己教師ありフィードフォワードシーンフロー推定シーンフロー推定2026/2/1
複数フレームの時間的に一貫した動き手がかりを集約することで、自己教師ありフィードフォワード型シーンフロー推定の精度を大幅に向上させた手法を提案。
- ProAct: 構造認識型能動応答のためのベンチマークとマルチモーダルフレームワークVLA2026/2/1
75タスク・91,581アノテーションからなる能動エージェント用ベンチマークProAct-75を構築し、タスクグラフとMLLMを活用したベースラインProAct-Helperを提案した。
- DeltaFlow: 効率的なマルチフレームシーンフロー推定手法シーンフロー推定2025/8/1
複数フレームの時系列情報を低計算コストで活用する軽量な3Dシーンフロー推定フレームワークを提案し、クラス不均衡や動きの一貫性に対処する損失関数を導入して高精度・高速推論を実現した。
- Afford-X: タスク指向操作のための汎化可能で軽量なアフォーダンス推論アフォーダンス推論2025/3/1
大規模データセットLVIS-Affを構築し、動詞注意と双方向融合モジュールを備えた軽量モデルAfford-Xを開発。非LLM手法を上回る性能を達成し、GPT-4Vより約50倍高速にアフォーダンス推論を行う。