Zeyu Zhang
DAMO Academy, Alibaba Group
収録論文 43本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- DexPolicy: 軌道誘導型巧みな操作のためのスケジュール探索マニピュレーション2026/9/30
強化学習による巧みな操作において、探索ノイズを訓練ステップに応じて徐々に減衰させるスケジュールを導入し、PPO・GRPO・FPOの3手法で成功率を大幅に向上させた。
- WorldAttention:対話型動画ワールドモデル向けの効率的注意機構動画生成/効率化2026/9/28
対話型動画生成モデルで長期的な文脈を保ちつつ計算・メモリ効率を高めるため、ハイブリッド疎注意と階層的KVキャッシュを組み合わせた注意アーキテクチャを提案。
- DeltaWAM: 双腕マニピュレーションのためのデルタ世界行動モデルマニピュレーション2026/9/23
映像の変化分(デルタ)と行動を同時に予測する世界行動モデルを提案し、双腕ロボット操作の成功率と推論速度を向上させた。
- ME-Brain-1.0:記憶・認知・行動による自己進化型身体知能VLA2026/9/21
行動実行から経験獲得・進化を経て実行改善へと至る閉ループで自己進化する身体知能システムを提案し、再学習なしにベンチマークで大幅な性能向上を達成した。
- UniMo: 人間と動物のモーション生成を統合するフレームワークモーション生成2026/9/11
骨格の違いを点群表現に変換することで種を問わず統一的に扱えるモーション生成手法を提案し、人間と動物を合わせた大規模データセットUniML3Dも構築した。
- ReMoMask-2: 潜在検索拡張マスク動作生成動作生成2026/9/8
テキストから人間の動作を生成するタスクにおいて、検索拡張と階層的空間時間トポロジーを考慮した新しいフレームワークを提案し、生成品質と速度を向上させた。
- MobileVLA-R1 2.0: モバイルロボット制御のための強化学習強化推論VLA2026/9/5
モバイルロボットのVLAシステムにおいて、言語指示を実行可能な行動に変換する課題に対し、構造化された推論と強化学習を組み合わせたフレームワークを提案し、ナビゲーションや操作タスクで評価した。
- 適応的視覚言語把持:構成可能な基盤事前知識と汎化可能な把持合成による実現マニピュレーション2026/9/3
本論文は、ロボットハンドの種類に依存せず汎用的に把持を合成できるAdaRoboVLGフレームワークを提案し、物理的把持合成とタスク依存の理解を分離することで、基盤モデルの進歩を直接把持能力の向上に結び付ける手法を示した。
- H2R-Bench: ワールドモデルにおける人間からロボットへの操作ビデオ生成のベンチマークビデオ生成/ベンチマーク2026/8/1
人間の操作ビデオをロボットの操作ビデオに変換するクロスエンボディメント生成の性能を評価するベンチマークを提案し、既存モデルの限界を明らかにした。
- ゴールドポイントスナイパー:微細な行動理解のためのVLMにおける自己誘導型視覚推論VLA/行動理解2026/6/21
ロボットが広視野画像中の小さな人物の微細な行動を理解するため、軽量VLMに自己誘導型のマルチモーダル推論を組み込むフレームワークGPSを提案し、行動関連の重要点抽出、自己質問による検証、意味的含意評価で精度と事実整合性を向上させた。
- GeneralVLA-2: 幾何認識再構成と管理されたメモリによるロボット計画VLA2026/6/16
ロボットの軌道計画のための視覚言語行動モデルを改善し、3D再構成の精度向上と長期メモリの品質管理を実現した。
- DragMesh-2: 関節物体との物理的に妥当な器用な手と物体のインタラクションマニピュレーション2026/6/13
関節物体を器用な手で操作するための接触駆動フレームワークを提案し、物理信号を注入する学習機構により接触負荷の変化に対するロバスト性を向上させた。
- WorldOlympiad:あなたの世界モデルはトライアスロンを生き残れるか?世界モデル評価2026/6/9
ビデオベースの世界モデルを物理的忠実性、幾何学的整合性、相互作用の忠実性の3つの観点から評価するベンチマークWorldOlympiadを提案する。
- PlatonicNav: プラトニック位相マップによるナビゲーションの意味的対応の解明ナビゲーション2026/6/1
視覚のみで構築した位相マップを用いて、言語目標をペアデータなしで接地する訓練不要のナビゲーションフレームワークを提案し、シミュレーションと実機で有効性を示した。
- MotionVLA: ヒューマノイド動作のための視覚・言語・行動モデル動作生成2026/6/1
シーン画像とテキストから現実的なヒューマノイド動作を生成するため、動作を基本ストリームと物理ストリームに分離し、DCTとBPEで独立に圧縮する二重ストリーム周波数トークナイザを提案し、軽量な2Bバックボーンで多様性と一貫性を向上させた。
- TriSplat: シミュレーション対応のフィードフォワード3Dシーン再構築3D再構築2026/5/25
スパース視点からの3D再構築を、三角形プリミティブを用いてフィードフォワードで行い、シミュレーションに使えるメッシュを直接出力する手法を提案した。
- MWM: 行動条件付き一貫予測のためのモバイルワールドモデルナビゲーション2026/3/1
ナビゲーションのためのワールドモデルにおいて、行動条件付きの一貫性を向上させる2段階学習と蒸留手法を提案し、画像目標ナビゲーションの性能を改善した。
- GeneralVLA:知識誘導型軌道計画による汎化可能な視覚-言語-行動モデルVLA2026/2/1
基盤モデルの汎化能力を活かし、アフォーダンス認識・3D軌道計画・制御を階層化したVLAモデルを提案。実機データや人間の実演なしでゼロショットのマニピュレーションを実現する。
- GeoWorld: 幾何学的世界モデル世界モデル2026/2/1
潜在表現を双曲空間に写像するHyperbolic JEPAと幾何学的強化学習を導入し、長期的な視覚計画の精度を向上させた世界モデル。
- MobileVLA-R1: 四足歩行ロボットのための視覚-言語-行動モデルを強化学習で強化VLA2025/11/1
自然言語指示を四足歩行ロボットの連続制御に接地させるため、多粒度Chain-of-Thoughtデータセットと教師あり学習+GRPO強化学習の二段階学習を組み合わせた統合VLAフレームワークを提案し、実機で有効性を示した。
- VLA-R1:視覚-言語-行動モデルにおける推論能力の強化VLA2025/10/1
検証可能な報酬による強化学習とGRPOを組み合わせ、アフォーダンスや軌道に沿った思考連鎖を学習させることで、VLAモデルの推論と実行精度を高めた研究。
- StereoAdapter: ステレオ深度推定の水中シーンへの適応ステレオ深度推定/水中ロボティクス2025/9/1
LoRAで適応した単眼基盤エンコーダと再帰的ステレオ精緻化を組み合わせ、水中でも高精度なステレオ深度推定を自己教師ありで実現した。
- Nav-R1: 具現化シーンにおける推論とナビゲーションナビゲーション2025/9/1
段階的CoTデータセットと強化学習、Fast-in-Slow推論で、複雑な3D環境でのロバストな具現化ナビゲーションを実現した基盤モデル。
- ロボットとシーンの運動学を統合した逐次移動マニピュレーション計画移動マニピュレーション2025/8/1
環境構造を運動学モデルとして取り込み、ロボットとシーンの統合配置空間で計画することで、関節物体を含む長期的な移動マニピュレーションを実現する枠組みを提案した。
- SuperMag: 視覚ベース触覚データを用いた磁気触覚センサの高解像度形状再構成触覚2025/7/1
磁気触覚センサの低解像度問題を、視覚ベース触覚センサの高解像度データで教師あり学習し、条件付きVAEで高解像度形状を推定する手法を提案。
- IKDiffuser: 運動学的木構造のための拡散生成モデルによる逆運動学ソルバ逆運動学2025/6/1
エンドエフェクタ姿勢をトークン列として扱う条件付き拡散モデルにより、任意の運動学的木構造に対する逆運動学を学習・推論する汎用ソルバを提案した。
- ManipLVM-R1: 大規模視覚言語モデルによる具現化マニピュレーションの推論のための強化学習マニピュレーション2025/5/1
高価な人手アノテーションに頼らず、検証可能な報酬を用いた強化学習で大規模視覚言語モデルを訓練し、ロボットマニピュレーションの汎化と物理的推論を向上させるフレームワークを提案。
- A2I-Calib: 脚式ロボットのための耐ノイズ能動型マルチIMU時空間キャリブレーションキャリブレーション2025/3/1
脚式ロボットの足先IMU間の時空間ずれを、耐ノイズ軌道生成と強化学習制御で自律的に校正するフレームワークを提案し、シミュレーションと実機で精度向上を実証した。
- 家庭内の危険を先回りして検知・対処するロボット家庭内ロボット2024/11/1
基盤モデルとマルチエージェント議論で家庭内の危険シナリオを自動生成し、ロボットが異常を能動的に発見・対処するスキルを学習する手法を提案した。
- M2Diffuser: 3Dシーンにおけるモバイルマニピュレーションのための拡散ベース軌道最適化モバイルマニピュレーション2024/10/1
ロボット中心の3Dスキャンから移動と操作を統合した全身軌道を拡散モデルで生成し、推論時に物理制約とタスク目的を最適化する手法を提案。20以上のシーンで既存手法を上回り、実機転移も成功。
- M3Bench:3Dシーンにおけるモバイルマニピュレーションの全身動作生成ベンチマークモバイルマニピュレーション2024/10/1
3Dシーンで物体を並べ替える全身動作軌道を生成するモバイルマニピュレーションの新ベンチマークM3Benchを提案し、自動データ生成ツールと物理シミュレーション評価を提供する。
- PR2: 物理・フォトリアルなヒューマノイドテストベッドと競技会でのパイロット研究sim2real2024/9/1
物理シミュレーションとフォトリアルな描画を両立したヒューマノイドロボットのテストベッドPR2を開発し、全国規模の大学ロボット競技会で実証した。
- モジュール型再構成可能UAVの飛行構造最適化群制御2024/7/1
重さや慣性が異なるモジュール型ドローンの群れを、遺伝的アルゴリズムで過駆動な飛行構造に再構成し、軌道追従精度を保ちつつ計算コストを削減した。
- GPT-4Vを用いた閉ループ型オープンボキャブラリ移動マニピュレーションVLA2024/4/1
GPT-4Vを活用し、未知環境での物体探索と操作を閉ループで行うロボットシステムを提案。実世界の8タスクで成功率を約35%向上させた。
- LLM³: 動作失敗の推論を組み込んだ大規模言語モデルベースのタスク・動作計画マニピュレーション2024/3/1
大規模言語モデルを使ってタスク計画と動作計画を橋渡しし、動作計画の失敗フィードバックをプロンプトで与えて提案を反復改善する、ドメイン非依存のTAMPフレームワークを提案した。
- Part-level Scene Reconstruction Affords Robot Interaction2023/7/1
- A Reconfigurable Data Glove for Reconstructing Physical and Virtual Grasps2023/1/1
- Sequential Manipulation Planning on Scene Graph2022/7/1
- Understanding Physical Effects for Effective Tool-use2022/6/1
- Efficient Task Planning for Mobile Manipulation: a Virtual Kinematic Chain Perspective2021/8/1
- Consolidating Kinematic Models to Promote Coordinated Mobile Manipulations2021/8/1
- Reconstructing Interactive 3D Scenes by Panoptic Mapping and CAD Model Alignments2021/3/1
- Human-Robot Interaction in a Shared Augmented Reality Workspace2020/7/1