Rongyu Zhang
収録論文 6本 ・ フィジカルAI/ロボット学習
VLA/連合学習VLA世界モデル
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- RoboFL: 世界行動モデルのための連合エキスパートアセンブリVLA/連合学習2026/9/28
各クライアントが訓練したLoRAアダプタをサーバー側MoEのエキスパートとして組み込み、ルーティングとエキスパートを協調学習する連合学習フレームワークを提案。実機Frankaで集中学習を12.23%上回り、通信量を最大86.81%削減した。
- Efficient-WAM: 低コストな未来想像を備えた10億パラメータの世界行動モデルVLA2026/6/1
未来の視覚予測を圧縮し、推論コストを大幅に削減した世界行動モデルを提案。実機で約100msの低遅延を実現しつつ、制御性能を維持する。
- マスク世界モデル:ロバストなロボット政策学習のための重要要素予測VLA2026/4/1
動画生成事前学習に基づく世界モデルがロボット政策学習に有望だが、RGB予測は背景や照明などの無関係な要素に過適合しがち。本論文では、ピクセルではなくセマンティックマスクの進化を予測するマスク世界モデル(MWM)を提案し、幾何学的情報ボトルネックにより物理ダイナミクスと接触関係を捉えつつ視覚ノイズを除去。拡散ベースの政策ヘッドと統合し、LIBEROやRLBenchでSOTAを達成し、実世界実験でもロバスト性を示した。
- RoboBench:マルチモーダル大規模言語モデルを身体化脳として評価する包括的ベンチマークVLA2025/10/1
マニピュレーションの意思決定を担う「身体化脳」としてのマルチモーダルLLMを、指示理解・知覚推論・汎化計画・アフォーダンス予測・失敗分析の5次元で評価するベンチマークを提案した。
- MoLe-VLA: レイヤ混合による動的レイヤスキップ型視覚言語行動モデルVLA2025/3/1
LLMの各層をエキスパートとみなし、ロボットの状態に応じて必要な層だけを動的に活性化する視覚言語行動モデルを提案し、計算コストを抑えつつ操作タスクの性能を維持した。
- EVA: 未来映像予測のための身体性世界モデル世界モデル2024/10/1
視覚言語モデルと映像生成モデルを組み合わせ、身体性シナリオでの多段階未来予測を可能にする世界モデルEVAとその評価ベンチマークEVA-Benchを提案した。