Jie Zhang
Alibaba Inc.
収録論文 20本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 予測を超えて:回顧的世界モデリングによるVLMエージェントの誘導VLA2026/9/30
VLMエージェントに回顧的世界モデリングを導入し、行動の原因を逆推定する能力と自己整合性報酬を組み合わせることで、物理的に整合した行動を学習させる手法を提案。
- 世界行動モデルの汎化性能を決める要因とは?推論時の未来モデリングに関する実証研究VLA2026/9/28
世界行動モデル(WAM)の汎化性能を環境変化・データ効率・タスク汎化の3軸で評価し、未来表現の条件付けが重要であることを示すとともに、未来生成を1回の順伝播に簡略化したSimple-WAMを提案した。
- 電気自動車充電インフラにおけるサイバー攻撃検知のベンチマーク:正規ユーザー更新を考慮してサイバーセキュリティ2026/8/11
電気自動車の充電インフラにおけるサイバー攻撃検知を、正規のユーザー更新を考慮したベンチマークで評価し、新しいデュアルブランチモデルを提案した論文。
- WorldCycle: 長期的ビデオワールドモデルのための自己検証型強化学習ワールドモデル/強化学習2026/8/5
可逆なアクションサイクルを用いて、長期的な正確性を検証する自己教師あり強化学習フレームワークを提案し、ワールドモデルのドリフトを大幅に低減した。
- Ego2Robot: 自己中心視点の人間データからのスケーラブルなロボットデータ合成VLA2026/8/1
自己中心視点の人間の操作動画を、行動リターゲティングとロボットアームの視覚合成、品質キュレーションを経てロボット訓練データに変換するスケーラブルなパイプラインを提案し、大規模データセットでVLAモデルの汎化性能を向上させた。
- VLA-Corrector: 適応アクションホライズンのための軽量検出・修正推論VLA/行動生成2026/7/1
VLA-Correctorは、アクションチャンク方式のVLAポリシーに軽量な視覚モニタとオンライン勾配ガイダンスを追加し、実行中のずれを検出して修正再計画を行うことで、閉ループ応答性を向上させる。
- ロボストラル・ナビゲート:単眼RGBのみで動作するスケーラブルな視覚言語ナビゲーションモデルナビゲーション2026/7/1
単眼RGB画像のみを入力とし、画像空間上でウェイポイントを予測することで、様々なロボット形態に再較正なしで適用可能な8B視覚言語モデルを提案。大規模シミュレーションデータと効率的な学習手法により、実世界データへの依存を低減しつつ高性能を実現した。
- Qwen-RobotManip技術報告:アライメントがロボット操作基盤モデルのスケールを解放するVLA/基盤モデル2026/6/16
ロボット操作のための視覚言語行動基盤モデルQwen-RobotManipを提案し、異種データを統一フレームワークで整列させることで大規模学習を可能にし、ゼロショット汎化やクロスエンボディ転移などの創発的能力を示した。
- Qwen-RobotWorld 技術報告:言語条件付きビデオ生成による身体化世界モデルの統合世界モデル/ビデオ生成2026/6/15
自然言語を統一アクションインターフェースとして用い、現在の観測から物理的に妥当な未来の視覚軌跡を予測する言語条件付きビデオ世界モデルを提案。ロボット操作、自動運転、屋内ナビゲーション、人間からロボットへの転移を統一的に扱い、データ生成・評価環境・計画信号の3つの応用を示す。
- Qwen-RobotNav 技術報告:エージェント型ナビゲーションシステム向けのスケーラブルなナビゲーションモデルナビゲーション2026/6/1
本論文は、推論時に外部から観測戦略を再構成可能なパラメータ化インターフェースを持つスケーラブルなナビゲーションモデルQwen-RobotNavを提案し、複数のタスクモードと観測パラメータを導入して、指示追従や物体探索などの多様なナビゲーション行動を単一モデルで実現する。
- WorldCraft: カメラナビゲーションからオブジェクト操作へ - インタラクティブビデオワールドモデルにおけるビデオワールドモデル2026/5/24
ビデオベースのワールドモデルをカメラ操作からオブジェクトレベルの軌跡操作へ拡張するフレームワークを提案。ユーザーのクリックと描画パスに基づき、選択オブジェクトが軌跡に沿って動く未来フレームを生成する。
- Qwen-VLA:タスク・環境・ロボット形態を横断する視覚言語行動モデルの統合VLA2026/5/1
多様なロボットタスクを単一の視覚言語行動モデルに統合するQwen-VLAを提案し、操作・ナビゲーション・軌道予測を統一フレームワークで扱う。
- 回復して予測する:可変長軌道予測のための段階的回顧学習軌道予測2026/3/1
不完全な可変長の軌跡データから完全な軌跡を予測する問題に対し、段階的に特徴を整列させる回顧的枠組みを提案した。
- HALO: 身体性マルチモーダル連鎖推論のための統合視覚-言語-行動モデルVLA2026/2/1
テキスト推論・視覚的サブゴール予測・行動予測を統合したEM-CoT推論を可能にするVLAモデルHALOを提案し、シミュレーションと実環境でベースラインを上回る性能を示した。
- ロボット知覚のためのスーパーLiDAR強度LiDAR知覚2025/8/1
低コストLiDARの疎なスキャンデータから、非反復走査LiDARの特性を活かして高密度な強度画像を生成するフレームワークを提案し、ループ閉じ込めや車線検出などへの応用を示した。
- 腹腔鏡手術における主意図予測のための手術活動文法の活用手術支援ロボティクス2024/9/1
手術手順の文法構造と視覚情報を組み合わせ、腹腔鏡映像から重要な手術意図を高精度に予測するフレームワークを提案した。
- The RoboDepth Challenge: Methods and Advancements Towards Robust Depth Estimation2023/7/1
- Multi-modal Transformer Path Prediction for Autonomous Vehicle2022/8/1
- Sampling Efficient Deep Reinforcement Learning through Preference-Guided Stochastic Exploration2022/6/1
- Transferrable Operative Difficulty Assessment in Robot-assisted Teleoperation: A Domain Adaptation Approach2019/6/1