Xiaojie Zhang
収録論文 9本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- Token-World: 視覚言語モデルのトークン空間におけるロボット操作のための世界モデリングVLA2026/9/30
VLAモデルの視覚トークンを圧縮した状態空間で未来のダイナミクスを予測する世界モデルを提案し、操作ベンチマークで予測精度と方策整合性を向上させた。
- FORCE: 価値校正ウォームアップと自己蒸留による効率的なVLA強化学習ファインチューニングVLA/強化学習2026/6/1
VLAモデルの強化学習ファインチューニングを安定化・高速化する3段階フレームワークFORCEを提案。価値校正ウォームアップと自己蒸留でサンプル効率を改善し、シミュレーションと実機で成功率を大幅に向上させた。
- WAM4D: 空間レジスタトークンによる高速4DワールドアクションモデルVLA2026/6/1
ロボットの行動予測と未来観測を同時に行うワールドアクションモデルにおいて、軽量な空間レジスタトークンを用いて事前学習済みの幾何学的特徴を因果的なビデオ・アクショントランスフォーマーに転送し、高コストな幾何学的デコードを避けつつ4D空間整合性を向上させる手法を提案した。
- マスク世界モデル:ロバストなロボット政策学習のための重要要素予測VLA2026/4/1
動画生成事前学習に基づく世界モデルがロボット政策学習に有望だが、RGB予測は背景や照明などの無関係な要素に過適合しがち。本論文では、ピクセルではなくセマンティックマスクの進化を予測するマスク世界モデル(MWM)を提案し、幾何学的情報ボトルネックにより物理ダイナミクスと接触関係を捉えつつ視覚ノイズを除去。拡散ベースの政策ヘッドと統合し、LIBEROやRLBenchでSOTAを達成し、実世界実験でもロバスト性を示した。
- RoboCOIN: 統合マニピュレーションのためのオープンソース両腕ロボットデータ収集マニピュレーション2025/11/1
15種類のロボットプラットフォームから18万件以上の両腕操作デモを集めた大規模データセットを構築し、階層的な注釈とデータ処理パイプラインを提供した。
- RoboBrain 2.0 技術報告VLA2025/7/1
視覚と言語を統合し、実環境での知覚・推論・計画を担う具現化基盤モデルRoboBrain 2.0を提案。7Bと32Bの2種類で、空間理解や時系列意思決定タスクで高い性能を示す。
- 基盤モデルの推論とパーツグラウンディングによる適応的な関節物体操作マニピュレーション2025/7/1
基盤モデルを活用して関節物体をパーツ単位で認識し、そのアフォーダンスからプリミティブスキルを組み合わせて未知カテゴリの物体も操作できるフレームワークAdaRPGを提案した。
- AdaManip: 適応的な関節物体操作環境と方策学習マニピュレーション2025/2/1
鍵やドアなど内部状態が見えない関節物体を試行錯誤で操作するための新しいシミュレーション環境と、3D視覚拡散を用いた模倣学習による適応方策を提案した。
- UniDoorManip:大規模多様ドア操作環境における汎用ドア操作ポリシーの学習マニピュレーション2024/3/1
多様なドアを操作するための大規模データセットとモバイルロボット・部分点群観測を含む新環境を構築し、操作過程を3段階に分解して推論と逆順に学習する汎用ポリシーを提案した。