Zixing Lei
Alibaba Inc.
収録論文 13本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 基盤モデルを物理世界エージェントに組み込むことで長期的ナビゲーションの限界を押し広げるナビゲーション2026/8/31
VLMによる推論エージェントとナビゲーション基盤モデルを組み合わせたフレームワークNavMCPを提案し、長期的な探索タスクで高い性能を達成した。
- Ego2Robot: 自己中心視点の人間データからのスケーラブルなロボットデータ合成VLA2026/8/1
自己中心視点の人間の操作動画を、行動リターゲティングとロボットアームの視覚合成、品質キュレーションを経てロボット訓練データに変換するスケーラブルなパイプラインを提案し、大規模データセットでVLAモデルの汎化性能を向上させた。
- Qwen-RobotManip技術報告:アライメントがロボット操作基盤モデルのスケールを解放するVLA/基盤モデル2026/6/16
ロボット操作のための視覚言語行動基盤モデルQwen-RobotManipを提案し、異種データを統一フレームワークで整列させることで大規模学習を可能にし、ゼロショット汎化やクロスエンボディ転移などの創発的能力を示した。
- Qwen-RobotWorld 技術報告:言語条件付きビデオ生成による身体化世界モデルの統合世界モデル/ビデオ生成2026/6/15
自然言語を統一アクションインターフェースとして用い、現在の観測から物理的に妥当な未来の視覚軌跡を予測する言語条件付きビデオ世界モデルを提案。ロボット操作、自動運転、屋内ナビゲーション、人間からロボットへの転移を統一的に扱い、データ生成・評価環境・計画信号の3つの応用を示す。
- Qwen-RobotNav 技術報告:エージェント型ナビゲーションシステム向けのスケーラブルなナビゲーションモデルナビゲーション2026/6/1
本論文は、推論時に外部から観測戦略を再構成可能なパラメータ化インターフェースを持つスケーラブルなナビゲーションモデルQwen-RobotNavを提案し、複数のタスクモードと観測パラメータを導入して、指示追従や物体探索などの多様なナビゲーション行動を単一モデルで実現する。
- Qwen-VLA:タスク・環境・ロボット形態を横断する視覚言語行動モデルの統合VLA2026/5/1
多様なロボットタスクを単一の視覚言語行動モデルに統合するQwen-VLAを提案し、操作・ナビゲーション・軌道予測を統一フレームワークで扱う。
- ツール整合型視覚言語行動モデルによる長期的身体エージェントの実現VLA/長期タスク2026/5/1
高レベルのVLMエージェントが計画を、専門化されたVLAツール群が局所操作を分担し、長期的タスクを効率的に実行する枠組みを提案した。
- デジタルからフィジカルへ:物理知能のための自律型コーチとしてのデジタルエージェントVLA2026/1/1
LLMエージェントが強化学習や模倣学習のタスク設計・デバッグ・最適化を自律的に行うベンチマークEmboCoach-Benchを提案し、人間設計を上回る性能を実証した。
- EmboMatrix: 身体性意思決定のためのスケーラブルな訓練基盤VLA2025/10/1
大規模言語モデルに身体性意思決定能力を獲得させるため、タスク・シーン生成、分散シミュレーション、精密報酬を統合した訓練基盤EmboMatrixを構築し、7Bモデルが671Bモデルを上回る性能を達成した。
- PolySim: マルチシミュレータのダイナミクスランダム化によるヒューマノイド制御のsim-to-realギャップの橋渡しsim2real2025/10/1
複数の異なるシミュレータを同時に用いて全身制御ポリシーを訓練し、シミュレータ固有のバイアスを低減して実機へのゼロショット転移を実現した。
- 外部測位・時刻同期デバイス不要のロバスト協調知覚協調知覚2024/5/1
各エージェントの検出物体から顕著物体グラフを構築し、グラフニューラルネットで共通部分グラフを同定することで、外部の測位・時計デバイスなしに相対姿勢と時刻を推定する協調知覚システムを提案。
- Interruption-Aware Cooperative Perception for V2X Communication-Aided Autonomous Driving2023/4/1
- Latency-Aware Collaborative Perception2022/7/1