Yizhou Zhao
収録論文 11本 ・ フィジカルAI/ロボット学習
3Dシーン生成ナビゲーションビデオ世界モデルベンチマークVLA
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- SimWorlds: 動的3Dシーン生成のためのマルチエージェントシステム3Dシーン生成2026/7/2
テキストから動的で編集可能な4Dシーンを生成するマルチエージェントフレームワークを提案し、物理整合性を検証するベンチマークも導入した。
- ConsistNav: 意味的実行制御によるゼロショット物体ナビゲーションの行動一貫性ギャップ解消ナビゲーション2026/5/1
ゼロショット物体ナビゲーションにおいて、検出後に探索と追跡を繰り返したり、成功間近で放棄する「行動一貫性ギャップ」を特定し、訓練不要のフレームワークConsistNavを提案。有限状態実行制御、永続的候補メモリ、安定性考慮の行動制御の3モジュールで意味的証拠の一貫した活用を実現し、HM3D/MP3DでSOTAを達成。
- RoboAlign-R1: ロボットビデオ世界モデルのための蒸留型マルチモーダル報酬アライメントビデオ世界モデル2026/5/1
ロボットビデオ世界モデルの訓練を、再構成損失などの低レベル目的ではなく、指示追従や操作成功などの意思決定に重要な能力に合わせるため、報酬アライメントと長期推論安定化を組み合わせたフレームワークを提案した。
- エンジニアリングAGIへの道:LLMの設計能力を測るベンチマークベンチマーク2025/9/1
9つの工学分野にわたる実践的な設計課題を解かせるベンチマークEngDesignを提案し、LLMのドメイン知識統合や制約下推論、目的指向設計の能力を評価する。
- GR00T N1: 汎用人型ロボットのためのオープン基盤モデルVLA2025/3/1
視覚言語モジュールと拡散トランスフォーマを組み合わせた二重システム構成のVLA基盤モデルを提案し、実機・人間動画・合成データで学習して人型ロボットの両手マニピュレーションを実現した。
- Triple Regression for Camera Agnostic Sim2Real Robot Grasping and Manipulation Tasks2023/9/1
- Sim2Plan: Robot Motion Planning via Message Passing between Simulation and Reality2023/7/1
- ARNOLD: A Benchmark for Language-Grounded Task Learning With Continuous States in Realistic 3D Scenes2023/4/1
- Learning to Act with Affordance-Aware Multimodal Neural SLAM2022/1/1
- Weighted Entropy Modification for Soft Actor-Critic2020/11/1
- Joint Mind Modeling for Explanation Generation in Complex Human-Robot Collaborative Tasks2020/7/1