Qisen Ma
Institute of Automation, Chinese Academy of Sciences
収録論文 7本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- XEWorld:行動条件付きワールドモデルは未知のロボット形態に汎化できるか?ワールドモデル2026/8/1
ロボット操作のための行動条件付きワールドモデルが、未見のロボット形態に対して物理ダイナミクスを捉えているかを検証するため、クロスエンボディメントテストベッドXEWorldを導入し、既存モデルの限界を分析した。
- BridgeVLA++: 3次元操作のためのデータ効率的で汎化可能なメモリ拡張型視覚言語行動フレームワークVLA2026/8/1
事前学習済み視覚言語モデルを活用した3次元ロボット操作フレームワークBridgeVLAを拡張し、空間的・時間的メモリを統合することで、データ効率と汎化性能を保ちつつ、記憶依存の操作タスクで最先端の性能を達成した。
- FlowWAM: オプティカルフローを世界行動モデルの統一アクション表現として用いるVLA2026/7/1
事前学習済みビデオ生成モデルを活用する世界行動モデル(WAM)において、アクション表現としてオプティカルフローを用いることで、制御精度と世界モデリング性能を向上させる手法を提案した。
- SKIP: 効率的な具現化ワールドモデルのためのスパースキーフレーム補間パラダイムワールドモデル2026/6/1
ロボット操作動画の生成を、タスク関連のキーフレームのみを生成し、残りを補間することで高速化する手法を提案。
- 構造化された段階とキーフレーム監視による視覚言語行動モデルのファインチューニング改善VLA2026/6/1
ロボット操作のVLAモデルにおいて、グリッパーイベント遷移に失敗が集中する問題を解決するため、デモのグリッパー状態から自動的に段階分類器とキーフレーム予測器を補助ヘッドとして学習し、ベースポリシーを変えずに性能を向上させるStaKeフレームワークを提案した。
- DiM-WAM: 多様な履歴イベントメモリを用いた世界行動モデリングVLA2026/6/1
長期依存タスク向けに、多スケールの履歴コンテキストとタスク進捗を統合したメモリ拡張型世界行動モデルを提案し、ロボット操作の成功率を大幅に向上させた。
- 不確実性を考慮した観測再注入による視覚-言語-行動モデルの強化VLA2026/2/1
VLAモデルの言語層の不確実性が高いときに、観測情報を次層のFFNに再注入する訓練不要のプラグインモジュールを提案し、追加データやモジュールなしで行動生成の精度と信頼性を向上させた。