Yiyang Huang
Alibaba Inc.
収録論文 10本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 基盤モデルを物理世界エージェントに組み込むことで長期的ナビゲーションの限界を押し広げるナビゲーション2026/8/31
VLMによる推論エージェントとナビゲーション基盤モデルを組み合わせたフレームワークNavMCPを提案し、長期的な探索タスクで高い性能を達成した。
- Ego2Robot: 自己中心視点の人間データからのスケーラブルなロボットデータ合成VLA2026/8/1
自己中心視点の人間の操作動画を、行動リターゲティングとロボットアームの視覚合成、品質キュレーションを経てロボット訓練データに変換するスケーラブルなパイプラインを提案し、大規模データセットでVLAモデルの汎化性能を向上させた。
- Qwen-RobotManip技術報告:アライメントがロボット操作基盤モデルのスケールを解放するVLA/基盤モデル2026/6/16
ロボット操作のための視覚言語行動基盤モデルQwen-RobotManipを提案し、異種データを統一フレームワークで整列させることで大規模学習を可能にし、ゼロショット汎化やクロスエンボディ転移などの創発的能力を示した。
- Qwen-RobotWorld 技術報告:言語条件付きビデオ生成による身体化世界モデルの統合世界モデル/ビデオ生成2026/6/15
自然言語を統一アクションインターフェースとして用い、現在の観測から物理的に妥当な未来の視覚軌跡を予測する言語条件付きビデオ世界モデルを提案。ロボット操作、自動運転、屋内ナビゲーション、人間からロボットへの転移を統一的に扱い、データ生成・評価環境・計画信号の3つの応用を示す。
- Qwen-RobotNav 技術報告:エージェント型ナビゲーションシステム向けのスケーラブルなナビゲーションモデルナビゲーション2026/6/1
本論文は、推論時に外部から観測戦略を再構成可能なパラメータ化インターフェースを持つスケーラブルなナビゲーションモデルQwen-RobotNavを提案し、複数のタスクモードと観測パラメータを導入して、指示追従や物体探索などの多様なナビゲーション行動を単一モデルで実現する。
- Qwen-VLA:タスク・環境・ロボット形態を横断する視覚言語行動モデルの統合VLA2026/5/1
多様なロボットタスクを単一の視覚言語行動モデルに統合するQwen-VLAを提案し、操作・ナビゲーション・軌道予測を統一フレームワークで扱う。
- ANNIE: ロボットの安全性に注意せよVLA2025/9/1
視覚言語行動モデルを搭載した身体性AIロボットへの敵対的攻撃の安全性リスクを初めて体系的に研究し、ISO規格に基づく違反分類、評価ベンチマークANNIEBench、攻撃フレームワークANNIE-Attackを提案した。
- RoboTron-Mani:ロボット操作のためのオールインワン・マルチモーダル大規模モデルマニピュレーション2024/12/1
カメラパラメータと占有監督で3D知覚を強化し、モダリティ分離マスクとマルチモーダルデコーダで融合を改善したロボット操作モデルと、複数データセットを統合したRoboDataを提案。CALVINで平均系列長を1.7から3.5に向上させ、シミュレーションと実世界で最先端を達成。
- DaDu-Corki:身体性AIロボットマニピュレーションのためのアルゴリズム・アーキテクチャ協調設計マニピュレーション2024/7/1
LLM推論・ロボット制御・通信を分離し、近未来の軌道予測と専用ハードウェアでマニピュレーションを高速化・省エネ化する協調設計フレームワークを提案。
- RoboUniView: ロボット操作のための統一視点表現を持つ視覚言語モデルVLA2024/6/1
カメラパラメータに依存しない統一視点表現を事前学習で獲得し、それに基づいてロボット操作の行動を生成することで、異なるロボットプラットフォーム間での性能差を解消した手法を提案。