Min Zhang
収録論文 8本 ・ フィジカルAI/ロボット学習
運動推論/世界モデルGUIエージェント動画理解sim2real評価基盤VLA
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- LPA-CWM:反事実世界モデルによる運動推論のための学習型物理判定器運動推論/世界モデル2026/9/12
動画予測モデルから反事実的な介入で運動を抽出する際、複数の候補応答を軽量な学習型判定器で重み付け統合し、信頼性の高い運動推定を実現した研究。
- KnowAct-GUIClaw:深く理解し完璧に行動する、自己進化するメモリとスキルを備えたパーソナルGUIアシスタントGUIエージェント2026/7/14
OpenClawのGUI操作と自己進化の欠陥を解決するため、Know-Route-Act-Reflectフレームワークを備えたKnowAct-GUIClawを提案し、クロスプラットフォームでのタスク自動化の効率と精度を向上させた。
- Homer: 階層的メモリとエージェント的推論による長時間動画理解動画理解2026/7/1
長時間動画をオンラインで理解するための階層的メモリとエージェント的推論フレームワークを提案し、既存手法を上回る性能を達成した。
- アフォーダンスグラフによるタスク世界:スケーラブルな身体性学習のための自己進化型タスク生成sim2real2026/2/1
実世界観察からアフォーダンスグラフでタスクを階層分解し、VLM推論と幾何検証を組み合わせた自己進化機構でロボット方策を自動生成・改善するフレームワークを提案。
- Embodied Arena:具現化AIのための包括的・統合・進化型評価プラットフォーム評価基盤2025/9/1
具現化AIの能力を3階層・7能力・25次元で体系化し、22のベンチマークと30以上のモデルを統合評価する進化型プラットフォームを構築した。
- MUVLA: 地図理解による物体ナビゲーションの探索学習VLA2025/9/1
セマンティックマップを活用して履歴情報を構造化し、報酬誘導型のリターンモデリングで探索行動を学習する物体ナビゲーション用VLAモデルを提案。
- VLAS: 音声指示によるカスタマイズ可能なロボット操作のための視覚-言語-行動モデルVLA2025/2/1
音声認識をロボット方策モデルに直接統合したエンドツーエンドの視覚-言語-行動モデルVLASを提案し、音声指示によるロボット操作を実現した。
- QUAR-VLA: Vision-Language-Action Model for Quadruped Robots2023/12/1