Bowen Zhou
Shanghai AI Laboratory
収録論文 11本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 統一軌道マッチング方策最適化:多様なT2I生成とVLA汎化VLA2026/9/28
拡散・フローポリシーの事後学習において、報酬最大化ではなく軌道分布マッチングを行う統一RLフレームワークUni-TMPOを提案し、T2I生成の多様性とVLAのタスク・シーン汎化を両立させた。
- InternW0-Δ: 予測ダイナミクスと行動を橋渡しする20K時間超のオープンデータによるワールドアクションモデルVLA2026/9/25
視覚ダイナミクスと行動生成を統合したワールドアクションモデルを、20,000時間超の異種オープンデータで事前学習し、シミュレーションと実機で従来手法を上回る性能を達成した。
- InternW0: 効率的な実世界インタラクションのための基盤的物理世界モデル世界モデル2026/9/23
上海AI Labが、視覚予測とロボット制御を非対称なvideo-actionアーキテクチャで統合した物理世界モデルInternW0を提案。約7,200時間のデータで学習し、化学合成やピペッティングなどの実世界タスクで評価した。
- 人類が最後に作るAI:真の再帰的自己改善に向けて再帰的自己改善2026/9/10
再帰的自己改善(RSI)の概念と発展ロードマップを提示し、科学発見・身体知能・ソフトウェア工学などのシナリオでの要件を検討して、実用的なシステムとの接続や課題を整理した論文。
- ワールドモデルの定義とロードマップワールドモデル2026/7/7
AIの各分野で使われる「ワールドモデル」の定義を明確化し、技術的側面と開発段階のロードマップを提案する視点論文。
- InternVLA-A1.5: 理解・潜在予測・行動の統合による構成的汎化VLA2026/7/1
ロボット操作のための統一モデルで、事前学習済みVLMの意味理解とビデオ生成モデルの動的予測を活用し、将来予測を潜在コードのクエリ問題として再構成することで、実時間制御を維持しつつ構成的汎化を実現した。
- モンテカルロ木探索による先読み荷物を活用した効果的なオンライン3Dビンパッキングマニピュレーション2026/1/1
物流ロボットアームによるオンライン3Dビンパッキングにおいて、先読み情報を活用しMCTSと強化学習を組み合わせることで、分布シフト下でも高い性能を実現した研究。
- InternVLA-A1:ロボットマニピュレーションのための理解・生成・行動の統合VLA2026/1/1
シーン理解・視覚的予測・行動実行の3つの専門家をMixture-of-Transformersで統合したVLAモデルを提案し、実世界12タスクで既存手法を上回る性能を達成した。
- InternVLA-M1: 空間誘導型視覚-言語-行動フレームワークによる汎用ロボットポリシーVLA2025/10/1
空間グラウンディングを手がかりに「どこで行動するか」と「どう行動するか」を二段階で学習し、汎用ロボット制御を実現するVLAフレームワークを提案。
- SimpleVLA-RL:強化学習によるVLAモデル訓練のスケーリングVLA2025/9/1
VLAモデル向けの効率的な強化学習フレームワークを提案し、大規模データへの依存を減らしつつLIBEROやRoboTwinで高性能を達成した。
- HAIR: Head-mounted AR Intention Recognition2021/2/1