Chunhua Shen
Shanghai AI Laboratory
収録論文 20本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- InternW0-Δ: 予測ダイナミクスと行動を橋渡しする20K時間超のオープンデータによるワールドアクションモデルVLA2026/9/25
視覚ダイナミクスと行動生成を統合したワールドアクションモデルを、20,000時間超の異種オープンデータで事前学習し、シミュレーションと実機で従来手法を上回る性能を達成した。
- InternW0: 効率的な実世界インタラクションのための基盤的物理世界モデル世界モデル2026/9/23
上海AI Labが、視覚予測とロボット制御を非対称なvideo-actionアーキテクチャで統合した物理世界モデルInternW0を提案。約7,200時間のデータで学習し、化学合成やピペッティングなどの実世界タスクで評価した。
- Metric-Bench: 屋内シーンにおけるVLMの文脈内空間メトリック推論の探究VLA2026/9/22
画像内の参照物体を手がかりに、カメラ内部パラメータなしでVLMが2Dから3Dへのメトリック推論を行うベンチマークと強化学習微調整手法を提案。
- GAUGE: 物理的忠実性を測定するための実世界基盤ベンチマーク物理シミュレーション/ベンチマーク2026/8/1
シミュレーションエンジンと生成ビデオワールドモデルの物理的忠実性を、実世界の軌跡に基づいて診断するベンチマークを提案した。22のタスクファミリーで剛体・柔軟物・布・変形物体の物理過程を評価し、既存の物理エンジンやビデオモデルの不一致を明らかにした。
- ワールドモデルの定義とロードマップワールドモデル2026/7/7
AIの各分野で使われる「ワールドモデル」の定義を明確化し、技術的側面と開発段階のロードマップを提案する視点論文。
- RoboSnap: ワンショット実世界からシミュレーションへのシーン生成による汎用ロボット学習と評価sim2real2026/7/1
単一のRGB画像から物理的に安定し視覚的にも忠実なシミュレーション環境を自動生成するフレームワークを提案し、ロボットの軌道再現やポリシー学習・評価に活用できることを示した。
- InternVLA-A1.5: 理解・潜在予測・行動の統合による構成的汎化VLA2026/7/1
ロボット操作のための統一モデルで、事前学習済みVLMの意味理解とビデオ生成モデルの動的予測を活用し、将来予測を潜在コードのクエリ問題として再構成することで、実時間制御を維持しつつ構成的汎化を実現した。
- CoRE-VLA:条件付きエキスパートルーティングによるスケーラブルで堅牢な視覚言語行動モデリングVLA2026/7/1
センサ欠落や多様な構成に頑健なVLAモデルを提案し、センサ可用性とタスク意図に基づく条件付きスパース計算でエキスパートをルーティングする。
- Open-AoE: 身体化学習のためのオープンな自己中心視操作データセットとツールチェーンデータセット2026/7/1
スマートフォンで撮影した自己中心視の操作動画約2000時間と、それをロボット学習用に加工するツールチェーンを公開した論文。
- HORIZON: 回復可能性に基づく物理領域スケーリングのカリキュラム歩行2026/6/1
ロボットポリシーの堅牢性を高めるため、物理領域を段階的に拡張するカリキュラム学習手法HORIZONを提案。回復可能性を制約として、四足歩行タスクで有効性を示した。
- 完璧なデモは悪い教師:重要な動作セグメントからのロバストな位置合わせ学習模倣学習2026/6/1
熟練者の滑らかなデモは、精密な位置合わせ動作の重要な瞬間が短時間に圧縮されるため、模倣学習の教師として不十分であることを示し、動作認識を強化する時空間特徴STAIRを提案して性能を向上させた。
- EBench: 汎用モバイル操作ポリシーの要素診断ベンチマーク/モバイル操作2026/6/1
単一の成功率スコアを超えて、汎用モバイル操作ポリシーの能力と汎化を多次元で診断するシミュレーションベンチマークを提案し、最新モデルの特性を明らかにした。
- どこを見るべきか:基礎モデルは能動的探索を通じて目標視点に到達できるか?視点制御2026/5/31
エージェントが3D環境内で能動的に視点を調整し、目標画像と一致する観測を得る「目標視点再現」タスクを導入し、ベンチマークTVRBenchを構築。既存モデルの成功率は低く、訓練フレームワークで改善を試みた。
- AGILE: エージェント生成による動画からの手と物体のインタラクション再構築マニピュレーション2026/2/1
単眼動画から手と物体の動的なインタラクションを再構築するため、VLMが生成モデルを導いて完全な物体メッシュを合成し、SfMに依存しないアンカー・トラック戦略で物体姿勢を追跡するフレームワークを提案。
- NoTVLA: 物語的行動インターフェースによる意味を保つロボット適応VLA2025/10/1
VLAモデルの破滅的忘却を防ぐため、ロボットエンドエフェクタの軌跡を時間圧縮・空間推論で疎にし、その疎軌跡でファインチューニングするNoTVLAを提案。pi0より大幅に少ない計算量で高性能・高汎化を実現。
- StaMo: コンパクトな状態表現による汎化可能なロボット動作の教師なし学習VLA2025/10/1
軽量エンコーダと事前学習済みDiTデコーダで2トークンの圧縮状態表現を教師なし学習し、その差分が潜在行動として機能することを発見。VLAモデルに統合してLIBEROで14.3%、実世界で30%の性能向上を達成。
- GAE:VLMの物理的ポテンシャルを引き出す汎用アクションエキスパートVLA2025/10/1
VLMが予測した疎な3Dウェイポイントを、汎用アクションエキスパートが密なロボット動作に変換する手法を提案。大規模点群-軌道データで事前学習し、下流タスクへの汎化性能を実現した。
- ODYSSEY: 四足歩行ロボットによるオープンワールドでの長期的移動マニピュレーション移動マニピュレーション2025/8/1
視覚言語モデルによる階層的プランナと全身制御ポリシーを統合し、マニピュレータ搭載四足ロボットが言語指示に基づく長期的な移動操作タスクを遂行できるフレームワークを提案した。
- Aether: 幾何学認識を統合した統一的世界モデリング世界モデル2025/3/1
4D動的再構成・行動条件付き動画予測・目標条件付き視覚計画を同時に学習する世界モデルを提案し、実世界データなしでもゼロショットで汎化できることを示した。
- Deep Learning Features at Scale for Visual Place Recognition2017/1/1