Yihao Wang
Beijing Academy of Artificial Intelligence
収録論文 6本 ・ フィジカルAI/ロボット学習
VLA評価指標世界モデル
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- DIDO: インタラクション中心のダイナミクスを1ステップ拡散に蒸留するワールドアクションモデルVLA2026/9/14
動画生成ベースのロボット操作モデルを1ステップ拡散に蒸留し、把持器と対象物のインタラクションを保ちつつ推論遅延を削減した手法。
- PRM-as-a-Judge 1.5: ロボットプロセス評価のためのツールキット評価指標2026/8/14
ロボットの動作動画から詳細な進捗曲線を生成し、失敗側の進捗や回復能力、成功側の実行品質など複数の細かい指標を導出する評価ツールキットを提案した。
- Orca:世界は心の中にある世界モデル2026/6/29
Orcaは、マルチモーダルな世界信号から統一された世界潜在空間を学習し、テキスト生成・画像予測・身体動作生成などの下流タスクを軽量デコーダで実現する世界基盤モデルである。
- VLA-RFT: 世界シミュレータにおける検証済み報酬を用いた視覚-言語-行動モデルの強化学習ファインチューニングVLA2025/10/1
実データから学習した世界モデルをシミュレータとして使い、VLAモデルを強化学習でファインチューニングする手法を提案。400ステップ未満で教師あり学習を上回り、外乱下でも安定したタスク実行を実現した。
- VLA-Adapter:小型Vision-Language-Actionモデルのための効果的なパラダイムVLA2025/9/1
大規模VLMへの依存を減らし、0.5Bパラメータのバックボーンと軽量なPolicyモジュールでロボットデータの事前学習なしに高性能なVLAモデルを実現した研究。
- LIAM: 言語指示・画像・行動・セマンティックマップのためのマルチモーダルTransformerVLA2025/3/1
家庭内サービスロボット向けに、言語指示・画像・行動履歴・セマンティックマップを入力として行動列を予測するエンドツーエンドモデルを提案し、ALFREDベンチマークで有効性を示した。