日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
VLAarXiv:2609.13679

VLAモデルをより良く訓練する方法:ICRA 2026 REAL-Iチャレンジからの教訓

How to Better Train VLAs: Lessons Learned From the REAL-I Challenge at ICRA 2026

シェア:XThreadsFacebookLINEはてブBluesky

ICRA 2026の実世界 embodied AI 学習チャレンジREAL-Iの結果を報告し、NUS-CLEAR、RCL-Lab、Deeptouch.aiの3チームのVLAと模倣学習を組み合わせたアプローチを比較して、固定データからのロボット学習の教訓をまとめた論文。

詳しい要約

1. どんなもの?

- 固定されたデモンストレーション予算からロボットポリシーを効果的に学習する方法を探る - ICRA 2026のREAL-I Challengeの紹介 - シミュレーション、実機評価、オンサイト最終を共有dual-arm humanoid platformで実施 - 課題タスク、データ、展開インターフェース、競技結果を記述 - NUS-CLEAR、RCL-Lab、Deeptouch.aiのアプローチを比較

2. 先行研究と比べてどこがすごい?

- 先行研究との具体的な比較は要旨からは不明 - 固定データロボット学習の統合的な視点を提案 - データ、適応、評価、展開を統合する重要性を示唆

3. 技術・手法の肝は?

- 事前学習済みvision-language-action modelsとタスク固有のimitation policiesを組み合わせ - データキュレーション、段階的適応、チェックポイント選択、行動空間設計の戦略が異なる - 展開環境への適応と事前能力の保持が重要 - 適切な時間スケールでのデモ品質の扱い - 非アクティブなロボットコンポーネントのエラー抑制

4. どうやって有効だと検証した?

- シミュレーション、実機評価、オンサイト最終で検証 - 共有dual-arm humanoid platform上で実施 - 競技結果とチームレポートで有効性を確認 - オフライン行動予測メトリクスの限界を指摘

5. 議論はある?

- オフライン行動予測メトリクスが閉ループ成功を予測する上での限界 - 固定データロボット学習の統合的な視点の必要性 - データ、適応、評価、展開の統合の重要性

6. 次に読むべき論文は?

- NUS-CLEAR、RCL-Lab、Deeptouch.aiの関連研究 - vision-language-action models - imitation policies - 固定データロボット学習に関する研究

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Jiaming Wang, Jizhuo Chen, Diwen Liu, Wang Song, Qiang Wang, Jie Ren, Chao Fu, Dingkun Zhu, Minchi Ruan, Hongtong Li, Yuhua Jiang, Zhiwei Xue, Yongping Pan, Harold Soh

分類: cs.RO

原文アブストラクト

How can robot policies learn more effectively from a fixed demonstration budget? The first Real-world Embodied AI Learning (REAL-I) Challenge at ICRA 2026 examined this question through simulation, real-robot evaluation, and an on-site final on a shared dual-arm humanoid platform. We describe the challenge tasks, data and deployment interfaces, and competition results, then compare the approaches contributed by NUS-CLEAR, RCL-Lab, and Deeptouch.ai. Their systems combined pretrained vision-language-action models and task-specific imitation policies with different strategies for data curation, staged adaptation, checkpoint selection, and action-space design. The team reports highlight the importance of adapting to the deployment environment while retaining prior capabilities, treating demonstration quality at an appropriate temporal scale, and suppressing errors in inactive robot components. They also expose the limitations of offline action-prediction metrics for forecasting closed-loop success. These observations motivate a view of fixed-data robot learning that integrates data, adaptation, evaluation, and deployment.

関連論文