Chengyu Bai
収録論文 5本 ・ フィジカルAI/ロボット学習
操作VLA世界モデル
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- MV-WAM: 多様体を考慮した価値拡張付き世界行動モデル操作2026/6/1
視覚と行動のモダリティ間の構造的不整合を解消するため、多様体認識最適化と価値誘導ロールバックを備えた世界行動モデルMV-WAMを提案し、ロボット操作の汎化性能を向上させた。
- WAM4D: 空間レジスタトークンによる高速4DワールドアクションモデルVLA2026/6/1
ロボットの行動予測と未来観測を同時に行うワールドアクションモデルにおいて、軽量な空間レジスタトークンを用いて事前学習済みの幾何学的特徴を因果的なビデオ・アクショントランスフォーマーに転送し、高コストな幾何学的デコードを避けつつ4D空間整合性を向上させる手法を提案した。
- IOI: インタラクティブ世界モデルのための運動学と物理の分離世界モデル2026/6/1
解析的な運動学の事前知識と学習された物理ダイナミクスを組み合わせたハイブリッドなインタラクティブ世界モデルを提案し、正確な制御と物理的に妥当な視覚フィードバックを実現する。
- VEGA: 空間認識型視覚言語行動モデルのための視覚エンコーダ接地整列VLA2026/5/1
VLAモデルの視覚エンコーダ出力を、3D空間認識を持つDINOv2-FiT3Dの特徴に直接整列させることで、空間認識能力を向上させる軽量なフレームワークを提案。推論時には追加コストなしで性能が向上する。
- WoW: 身体性インタラクションを通じた世界全知モデルへの挑戦世界モデル2025/9/1
200万件のロボット操作軌道で学習した140億パラメータの生成的世界モデルを構築し、物理的因果推論を評価する新ベンチマークWoWBenchを提案した論文。