Xiaozhu Ju
収録論文 26本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- Dream4ACT: 複数身体に対応した動画・行動モデリングのための共有視覚行動インターフェースVLA2026/9/30
関節構成を4つの仮想カメラ映像として描画する「action views」で身体差を吸収し、単一の動画拡散モデルで順動力学・逆動力学・観測行動生成を統合した世界モデルを提案。
- Pelican-Sim 1.0:身体性知能のための汎用ワールドモデルシミュレータワールドモデル2026/9/10
視覚文脈とロボット行動から将来の観測を予測する汎用ワールドモデルシミュレータを提案し、統一行動表現やMoE、効率的なロールアウト生成により行動制御性と映像品質を大幅に向上させた。
- TrustRoboReward: 選好順序付き等調スコア編集によるマルチパラダイムロボット報酬モデル報酬モデル2026/8/9
ロボット操作の強化学習における報酬モデルのボトルネックを解決するため、ペアワイズ選好とビデオQAを統合したマルチパラダイム報酬モデリングフレームワークを提案し、スコアと選好の矛盾を等調回帰で解消する。
- Pelican-VLA 0.5: 行動前に注意を向けることで汎化を向上VLA2026/7/1
視覚言語理解、未来フレーム生成、行動予測を統合したVLAモデルを提案し、注意レベルの汎化を達成。ボトルネックトークンの導入により、未見のシーンやロボットでも操作対象に注意が向くことを示した。
- IOI: インタラクティブ世界モデルのための運動学と物理の分離世界モデル2026/6/1
解析的な運動学の事前知識と学習された物理ダイナミクスを組み合わせたハイブリッドなインタラクティブ世界モデルを提案し、正確な制御と物理的に妥当な視覚フィードバックを実現する。
- MV-WAM: 多様体を考慮した価値拡張付き世界行動モデル操作2026/6/1
視覚と行動のモダリティ間の構造的不整合を解消するため、多様体認識最適化と価値誘導ロールバックを備えた世界行動モデルMV-WAMを提案し、ロボット操作の汎化性能を向上させた。
- SafeDojo: インタラクティブワールドモデルによるVLAのための安全強化学習安全強化学習/VLA2026/6/1
視覚言語行動(VLA)ポリシー向けに、ワールドモデルベースの想像を通じて安全な行動を学習する初のモデルベース安全強化学習フレームワークを提案。
- VLA-Trace: 表現と行動のトレーシングによる視覚-言語-行動モデルの診断VLAモデル解析2026/5/28
VLAモデルがマルチモーダル知識を身体制御に変換する過程を、表現ダイナミクスから因果帰属、行動発現まで段階的に診断するフレームワークを提案し、π0.5とOpenVLAの比較分析からモデル間の適応戦略や制御経路の違いを明らかにした。
- EPIC-Bench: 視覚言語モデルにおける細粒度な身体化視覚グラウンディングのための知覚中心ベンチマークVLA/ベンチマーク2026/5/16
身体化エージェントの視覚基盤として使われる視覚言語モデル(VLM)の、実際の環境での細かい視覚認識能力を評価するベンチマークEPIC-Benchを提案。6.6kの注釈付きデータで、対象位置特定・ナビゲーション・操作の3段階にわたる23タスクを設定し、89以上のVLMを評価した。
- Robo-Cortex: 二重粒度認知記憶と自律知識誘導による自己進化型具現化エージェントナビゲーション2026/5/1
ロボットが過去の経験からナビゲーションのヒューリスティックを自律的に抽出し、戦略を進化させる自己進化型フレームワークを提案した。
- VEGA: 空間認識型視覚言語行動モデルのための視覚エンコーダ接地整列VLA2026/5/1
VLAモデルの視覚エンコーダ出力を、3D空間認識を持つDINOv2-FiT3Dの特徴に直接整列させることで、空間認識能力を向上させる軽量なフレームワークを提案。推論時には追加コストなしで性能が向上する。
- Pelican-Unify 1.0: 理解・推論・想像・行動を統合した身体化基盤モデルVLA2026/5/1
単一のVLMと統一未来生成器を用いて、理解・推論・想像・行動を一つのモデルで統合的に学習・実行する身体化基盤モデルを提案し、各能力のベンチマークで高い性能を達成した。
- Wow, wo, val! 具現化世界モデル評価のためのチューリングテスト世界モデル評価2026/1/1
ロボット操作データ609件を用い、動画基盤モデルを世界モデルとして評価する5能力・22指標のベンチマークを提案し、人間の選好との相関0.93超を達成した。
- TC-IDM: 実行可能なゼロショットロボット動作のための動画生成の接地VLA2026/1/1
生成された動画から道具の3D軌道を抽出し、それを6自由度のエンドエフェクタ動作に変換する逆動力学モデルを提案。ゼロショットで変形物体操作を含むタスクを実現した。
- Pelican-VL 1.0:身体知能のための基盤ブレインモデルVLA2025/11/1
7B〜72Bパラメータのオープンソース身体知能向けマルチモーダル基盤モデルを開発し、大規模データと新学習機構DPPOにより既存モデルを上回る性能を達成した。
- WristWorld: 4D世界モデルによるロボットマニピュレーションのための手首視点映像生成VLA2025/10/1
アンカー視点の映像から手首視点の映像を生成する4D世界モデルを提案し、VLAモデルのマニピュレーション性能を向上させた。
- WoW: 身体性インタラクションを通じた世界全知モデルへの挑戦世界モデル2025/9/1
200万件のロボット操作軌道で学習した140億パラメータの生成的世界モデルを構築し、物理的因果推論を評価する新ベンチマークWoWBenchを提案した論文。
- OmniD: 画像ベースBEV表現による汎化可能なロボットマニピュレーションポリシーマニピュレーション2025/8/1
複数視点の画像を鳥瞰図(BEV)表現に統合し、変形可能注意でタスク関連特徴を抽出することで、未知環境や少データでも汎化しやすいロボット操作ポリシーを実現した。
- ArtVIP:ロボット学習のための視覚的リアリズム、モジュラー相互作用、物理的忠実性を備えた関節デジタルアセットsim2real2025/6/1
ロボット学習向けに、視覚的リアリズムと物理的忠実性を高めた関節物体のデジタルツインを多数収録したオープンソースデータセットArtVIPを構築し、模倣学習と強化学習で有効性を検証した。
- ロボットのための占有世界モデル世界モデル2025/5/1
屋内ロボット向けに、時空間受容野と自己回帰トランスフォーマーを組み合わせて3D占有シーンの進化を予測するRoboOccWorldを提案し、新しいベンチマークで有効性を示した。
- EmbodiedVSR: 動的シーングラフ誘導による視覚空間タスクの連鎖推論VLA2025/3/1
動的シーングラフとChain-of-Thought推論を組み合わせ、微調整なしで身体性エージェントの空間推論を強化するフレームワークを提案し、新ベンチマークで有効性を示した。
- RoboMIND:ロボットマニピュレーションのためのマルチエンボディメント知能規範データセットマニピュレーション2024/12/1
4種類のロボットによる10.7万件の模倣学習用デモンストレーション軌道と失敗例、デジタルツイン環境を提供する大規模データセットを構築し、VLAモデルの性能を評価した。
- Efficient Training of Generalizable Visuomotor Policies via Control-Aware Augmentation2024/1/1
- Mixed Control for Whole-Body Compliance of a Humanoid Robot2021/9/1
- Recursive Hierarchical Projection for Whole-Body Control with Task Priority Transition2021/9/1
- Whole-Body Control with Motion/Force Transmissibility for Parallel-Legged Robot2021/9/1