Yuzheng Zhuang
JD
収録論文 23本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- CometVLA: 身体性データピラミッドの共学習による物理理解の獲得VLA2026/8/31
ロボット操作タスクにおける物理常識の欠如を補うため、身体性に整合した物理VQAデータとベンチマークを構築し、VLAモデルを共学習させる手法を提案。実世界とシミュレーションで性能向上を確認した。
- WorldSimProbe: 身体的操作のための行動条件付きワールドモデルにおけるシミュレータ忠実度の診断シミュレーション評価2026/8/1
行動条件付きワールドモデル(ACWM)が物理シミュレータとして忠実に機能するかを検証するための評価手法「WorldSimProbe」を提案し、複数のベンチマークで既存モデルの欠陥を明らかにした。
- 意図と軌道の分離:世界行動モデルのための表現演繹フレームワークVLA2026/8/1
世界行動モデルにおける高レベルの状態遷移と低レベルの軌道生成の表現が絡み合う問題を解決するため、思考連鎖ガイダンスを用いた表現演繹フレームワークPILOTを提案し、複雑なロボット操作タスクでの成功率と物理的解釈性を向上させた。
- JoyAI-Sim: 具現化データピラミッドのためのシミュレーション対応相互変換ツールチェーンシミュレーション2026/6/1
実ロボットのデータ収集と評価の限界を補うため、シミュレーションを介してロボットと人間のデータを相互変換するツールチェーンを提案し、評価とデータ生成のスケーラビリティを向上させる。
- JoyAI-RA 0.1: ロボット自律性のための基盤モデルVLA2026/4/1
オープンワールドでのロボット操作の汎化を目指し、ウェブデータ、人間の操作動画、シミュレーション、実ロボットデータを統合したVLA基盤モデルJoyAI-RAを提案。実世界とシミュレーションで最先端性能を達成した。
- EchoVLA: 宣言的記憶を統合した移動マニピュレーション向け視覚-言語-行動モデルVLA2025/11/1
人間の脳に着想を得たシーン記憶とエピソード記憶を組み合わせ、移動と操作を協調させるメモリ対応VLAモデルを提案し、大規模学習用ベンチマークMoManiも構築した。
- 一点ではなく面で捉える:ロボットタスクの空間グラウンディングのための適応的アフォーダンスヒートマップによる不確実性の表現VLA2025/10/1
空間的な目標を離散的な点ではなく連続的なアフォーダンスヒートマップとして表現し、不確実性を捉えることで、実世界のマニピュレーション成功率82%と最大50倍の高速化を実現したフレームワークRoboMAPを提案。
- Embodied Arena:具現化AIのための包括的・統合・進化型評価プラットフォーム評価基盤2025/9/1
具現化AIの能力を3階層・7能力・25次元で体系化し、22のベンチマークと30以上のモデルを統合評価する進化型プラットフォームを構築した。
- OmniEVA: タスク適応型3Dグラウンディングと身体性考慮推論による汎用エンボディドプランナーVLA2025/9/1
タスクに応じて3D情報の融合を切り替えるゲート付き機構と、ロボットの身体制約を推論に組み込む枠組みにより、実機で実行可能な計画を立てるエンボディドAIプランナーを提案。
- AutoLayout: 低速・高速協調推論による閉ループレイアウト合成シーン生成/レイアウト合成2025/7/1
低速な推論と高速な生成を組み合わせた二重システムと自己検証ループにより、物理的に整合し意味的にも妥当な物体配置レイアウトを自動生成する手法を提案。
- Mem2Ego: グローバル記憶と自己中心視点を統合した長期的身体性ナビゲーションナビゲーション2025/2/1
グローバルな記憶モジュールからタスク関連情報を適応的に取得し、エージェントの自己中心的な視覚入力と統合することで、長期的な物体ナビゲーションの性能を向上させるVLMベースのフレームワークを提案した。
- 3D-MoE:Rectified Flowによる姿勢拡散を備えた3D視覚・空間推論向けMixture-of-ExpertsマルチモーダルLLMVLA2025/1/1
既存の密活性化LLMをMixture-of-Experts化し、Rectified Flow拡散ヘッド(Pose-DiT)を組み合わせることで、3D質問応答と身体性タスク計画を少ない活性パラメータで高精度に実行するフレームワークを提案した。
- SpatialCoT:座標アライメントと思考連鎖による身体性タスク計画の空間推論強化VLA2025/1/1
視覚言語モデルの空間推論能力を高めるため、座標の双方向アライメントと思考連鎖に基づく空間グラウンディングを組み合わせたSpatialCoTを提案し、ナビゲーションとマニピュレーションのタスクで従来手法を上回る性能を示した。
- ET-Plan-Bench: 基盤モデルによる時空間認知に向けた身体性タスクレベル計画ベンチマークタスク計画2024/10/1
LLMによる身体性タスク計画を評価するベンチマークET-Plan-Benchを提案し、空間・時間・因果理解を要するタスクで最先端モデルの性能が大きく低下することを示した。
- Astra: 身体性指示追従のための効率的Transformerアーキテクチャと対照的ダイナミクス学習VLA2024/8/1
異なるモダリティのセグメントからなる軌跡を効率的に処理する新しいTransformerと、環境ダイナミクス理解を深める対照的学習目的を提案し、ロボット操作ベンチマークで性能を大幅に向上させた。
- ROS-LLM:タスクフィードバックと構造化推論を備えた身体性AIのためのROSフレームワークVLA2024/6/1
ROSと大規模言語モデルを統合し、非専門家が自然言語でロボットをプログラミングできるフレームワークを提案。行動モードや模倣学習、フィードバックによる反省機能を備え、多様なタスクで有効性を検証した。
- 身体性AIのための視覚-言語-行動モデルに関するサーベイVLA2024/5/1
身体性AI向けの視覚-言語-行動(VLA)モデルについて、構成要素・制御ポリシー・タスクプランナーの3系統に分類し、データセットやベンチマークも含めて初めて体系的にまとめたサーベイ。
- SCALE: 新奇性推定による移動ロボットの自己修正型視覚ナビゲーション視覚ナビゲーション2024/4/1
オフライン強化学習と新奇性推定を組み合わせ、未知の観測に直面しても人間の介入なしに自己修正して経路を回復する視覚ナビゲーション手法を提案した。
- 粗から細へのアフォーダンス学習による点群ノイズに頑健な関節物体操作マニピュレーション2024/2/1
実世界の点群ノイズに対処するため、遠距離の粗い点群で操作箇所を推定し、近距離の精細な点群で最終動作を決定する2段階のアフォーダンス学習手法を提案した。
- NeurIPS 2022 Competition: Driving SMARTS2022/11/1
- RITA: Boost Driving Simulators with Realistic Interactive Traffic Flow2022/11/1
- Reinforcement Learning based Negotiation-aware Motion Planning of Autonomous Vehicles2021/7/1
- Triple-GAIL: A Multi-Modal Imitation Learning Framework with Generative Adversarial Nets2020/5/1