Zhixuan Liang
Princeton University
収録論文 29本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 未来予測を超えて:ロボット制御のための生成的適応としてのデノイジングVLA2026/9/23
事前学習済み生成DiTを制御に適応させる際、未来の視覚予測は不要であり、現在の観測をデノイズする軌跡そのものが制御への有効なインターフェースとなることを示し、学習効率と性能を両立する手法NowWAMを提案した。
- M²Tok: 視覚言語行動モデルのためのマルチヘッド・マルチコードブック離散行動トークン化VLA2026/9/16
連続的な行動信号を複数のヘッドと独立したコードブックで離散トークン化し、再構成誤差を抑えつつVLAモデルの性能を向上させる手法を提案。
- Ego2Robot: 自己中心視点の人間データからのスケーラブルなロボットデータ合成VLA2026/8/1
自己中心視点の人間の操作動画を、行動リターゲティングとロボットアームの視覚合成、品質キュレーションを経てロボット訓練データに変換するスケーラブルなパイプラインを提案し、大規模データセットでVLAモデルの汎化性能を向上させた。
- Qwen-RobotManip技術報告:アライメントがロボット操作基盤モデルのスケールを解放するVLA/基盤モデル2026/6/16
ロボット操作のための視覚言語行動基盤モデルQwen-RobotManipを提案し、異種データを統一フレームワークで整列させることで大規模学習を可能にし、ゼロショット汎化やクロスエンボディ転移などの創発的能力を示した。
- Qwen-RobotWorld 技術報告:言語条件付きビデオ生成による身体化世界モデルの統合世界モデル/ビデオ生成2026/6/15
自然言語を統一アクションインターフェースとして用い、現在の観測から物理的に妥当な未来の視覚軌跡を予測する言語条件付きビデオ世界モデルを提案。ロボット操作、自動運転、屋内ナビゲーション、人間からロボットへの転移を統一的に扱い、データ生成・評価環境・計画信号の3つの応用を示す。
- AHA-WAM:非同期・地平線適応型ワールドアクションモデルと観測誘導コンテキストルーティング操作学習2026/6/8
世界予測と行動実行を異なる時間解像度で行う非同期ワールドアクションモデルを提案し、ロボット操作タスクで性能を向上させた。
- 計画整合型トークン圧縮による長文脈自動運転自動運転2026/6/1
自動運転のためのモノリシックな視覚行動モデルにおいて、長期の文脈を圧縮する際に計画情報を活用するフレームワークを提案し、成功率を向上させた。
- Qwen-RobotNav 技術報告:エージェント型ナビゲーションシステム向けのスケーラブルなナビゲーションモデルナビゲーション2026/6/1
本論文は、推論時に外部から観測戦略を再構成可能なパラメータ化インターフェースを持つスケーラブルなナビゲーションモデルQwen-RobotNavを提案し、複数のタスクモードと観測パラメータを導入して、指示追従や物体探索などの多様なナビゲーション行動を単一モデルで実現する。
- Qwen-VLA:タスク・環境・ロボット形態を横断する視覚言語行動モデルの統合VLA2026/5/1
多様なロボットタスクを単一の視覚言語行動モデルに統合するQwen-VLAを提案し、操作・ナビゲーション・軌道予測を統一フレームワークで扱う。
- HiVLA: 視覚基盤中心の階層型身体化操作システムVLA/操作2026/4/1
高レベルの意味的計画と低レベルの運動制御を分離した階層型VLAシステムを提案し、VLMの推論能力を保ちつつ、拡散トランスフォーマーによる行動生成で長期的なスキル合成と細かい操作を向上させた。
- R3DP: 実時間3D認識ポリシーによる身体的操作マニピュレーション2026/3/1
大規模3D視覚モデルの強力な事前知識を、非同期の高速・低速協調モジュールと軽量な時間特徴予測ネットワークで統合し、実時間性能を保ちながら操作ポリシーの成功率を向上させる手法を提案した。
- VPWEM: 作業記憶とエピソード記憶を備えた非マルコフ視覚運動ポリシーVLA2026/3/1
ロボットの模倣学習において、短期の作業記憶と長期のエピソード記憶を組み合わせ、長期的な記憶を要する非マルコフタスクを少ない計算コストで解く視覚運動ポリシーを提案した。
- 受動的観察者から能動的批評家へ:強化学習がロボット操作のプロセス推論を引き出すマニピュレーション2026/3/1
ビデオMLLMを受動的な観察者から能動的な批評家へと変えるため、結果ベースの強化学習を用いてプロセス推論を誘発する7BフレームワークPRIMO R1を提案し、長期的ロボット操作の進捗監視性能を大幅に向上させた。
- UltraDexGrasp: 合成データによる双腕ロボットの汎用器用把持の学習把持2026/3/1
双腕ロボットのための多戦略・器用な把持を実現するフレームワークを提案し、大規模合成データセットと単純なポリシーでゼロショットの実機転送に成功した。
- ST-BiBench:双腕身体性タスクにおけるマルチストリーム・マルチモーダル協調のMLLMベンチマークVLA2026/2/1
双腕ロボットの身体性タスクを対象に、マルチモーダル大規模言語モデルの時空間的なマルチストリーム協調能力を評価する多層ベンチマークST-BiBenchを提案し、30以上のモデルを評価して高次推論と細粒度実行の乖離を明らかにした。
- VER: 基盤モデル蒸留と動的ルーティングによるロボット学習のための視覚エキスパートトランスフォーマーVLA2025/10/1
複数の視覚基盤モデルを蒸留してエキスパートライブラリを構築し、軽量なルーティングネットワークでタスクに応じた専門家を動的に選択することで、17種類のロボットタスクで最先端性能を達成した。
- 専門性は独占する必要なし:視覚-言語-行動学習のための行動特化型Mixture of ExpertsVLA2025/10/1
事前学習済みVLAモデルの重みを継承し、フィードフォワード層をスパースなMoE層に置き換えて拡張するAdaMoEを提案。専門家選択と重み付けを分離することで協調的な専門家利用を実現し、計算効率を保ちつつ性能を向上させた。
- HyCodePolicy:身体性エージェントにおけるマルチモーダル監視と意思決定のためのハイブリッド言語コントローラVLA2025/8/1
自然言語指示からコードを生成し、視覚言語モデルによる実行監視とコード修復を組み合わせて、ロボット操作タスクを自己修正しながら遂行するハイブリッド制御フレームワークを提案。
- 離散拡散VLA:視覚言語行動ポリシーの行動デコーディングに離散拡散を導入VLA2025/8/1
行動チャンクを離散化し、統合トランスフォーマー内で離散拡散により並列デコーディングするVLAを提案。適応的なデコーディング順序と再マスキングで誤り訂正を行い、LIBEROやSimplerEnvで高い成功率と事前学習能力の保持を実現した。
- 汎化可能な両腕マニピュレーションのベンチマーク:CVPR 2025 MEISワークショップにおけるRoboTwin両腕協調チャレンジマニピュレーション2025/6/1
RoboTwinシミュレーションと実機ロボットを用いた両腕マニピュレーションの国際コンペを開催し、17タスクで64チームが競い、汎化可能な協調方策の知見をまとめた。
- RoboTwin 2.0:強力なドメインランダム化を備えた両腕ロボット操作のためのスケーラブルなデータ生成器とベンチマークsim2real2025/6/1
両腕ロボット操作のための大規模データ生成フレームワークを提案し、マルチモーダル言語モデルによるタスク生成と5軸のドメインランダム化で実世界への転移性能を大幅に向上させた。
- RoboTwin: 生成デジタルツインによる双腕ロボットベンチマーク双腕マニピュレーション2025/4/1
3D生成基盤モデルと大規模言語モデルを活用し、多様な専門家データセットと実世界に即した評価プラットフォームを提供する双腕ロボットタスク向けの生成デジタルツインフレームワークを提案。
- DexHandDiff: 適応的巧みな操作のための相互作用を考慮した拡散計画マニピュレーション2024/11/1
接触を伴う巧みな操作のための拡散計画フレームワーク。接触前後の二段階拡散とLLMによるガイダンス生成で、訓練分布外の目標にも適応できる。
- G3Flow: 姿勢を考慮した汎化可能な物体操作のための生成的3Dセマンティックフローマニピュレーション2024/11/1
基盤モデルを活用して物体中心の動的な3Dセマンティック表現をリアルタイムに構築し、拡散ポリシーに組み込むことで、遮蔽下でも意味理解を可能にし、操作と物体間汎化を改善した。
- RoboCodeX: Multimodal Code Generation for Robotic Behavior Synthesis2024/2/1
- RoboScript: 実機とシミュレーションをまたぐ自由形式マニピュレーションのためのコード生成マニピュレーション2024/2/1
ROS抽象化に基づく統一インターフェースで、コード生成による実機・シミュレーション両対応のロボットマニピュレーションパイプラインと自由記述タスクのベンチマークを提案。
- SkillDiffuser: Interpretable Hierarchical Planning via Skill Abstractions in Diffusion-Based Task Execution2023/12/1
- AdaptDiffuser: Diffusion Models as Adaptive Self-evolving Planners2023/2/3
- Hierarchical Reinforcement Learning with Opponent Modeling for Distributed Multi-agent Cooperation2022/6/1