Yucheng Zhao
収録論文 13本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- GeoWind2Plan: ミッション時間内の3次元都市風予測によるエネルギー効率の良いUAV計画UAV計画/風予測2026/9/28
建物形状からミッション時間内に3次元都市風を予測し、UAVのエネルギー効率の良い経路と速度を計画するフレームワークを提案。CFDの約8時間に対し約3秒で推論できる。
- Realtime-VLA FLASH: 拡散型VLAのための投機的推論フレームワークVLA/推論高速化2026/5/1
拡散型視覚言語行動モデル(dVLA)の再計画時の推論遅延を削減するため、軽量ドラフトモデルと主モデルのAction Expertによる並列検証、および必要時に完全推論へ切り替える位相認識フォールバック機構を備えた投機的推論フレームワークを提案した。LIBEROで平均推論遅延を19.1ms(3.04倍高速化)に短縮し、実世界のコンベアベルト仕分けでも有効性を示した。
- ロボットシーンクローニング:視覚プロンプト編集による操作タスクのゼロショットシーン適応の推進マニピュレーション2026/3/1
既存のロボット操作軌道を編集してシーン固有の適応を実現する手法を提案し、視覚プロンプトと条件注入モジュールにより正確でシーン整合性のあるサンプル生成を行い、ポリシーの汎化を向上させる。
- DM0: フィジカルAIに向けた身体性ネイティブな視覚-言語-行動モデルVLA2026/2/1
身体性を後付けでなく最初から統合し、大規模事前学習からフローマッチング行動専門家と空間Chain-of-Thoughtで操作とナビゲーションを統一的に学習するVLAフレームワークDM0を提案。
- RoboChallenge:実機ロボットによる具現化ポリシーの大規模評価VLA2025/10/1
多数のモデルとタスクを実機で評価するオンラインシステムRoboChallengeを構築し、初期ベンチマークTable30で最新VLAモデルを調査した。
- Dexbotic: オープンソース視覚-言語-行動ツールボックスVLA2025/10/1
複数のVLAモデルを単一環境で再現・開発できるPyTorchベースのオープンソースツールボックスを提供し、高性能な事前学習済みモデルも公開した。
- ManiAgent:汎用ロボットマニピュレーションのためのエージェント型フレームワークマニピュレーション2025/10/1
複数のエージェントが協調して環境認識・サブタスク分解・行動生成を行い、複雑なマニピュレーションを効率的にこなすエージェント型アーキテクチャを提案した論文。
- IntentionVLA: 人間とロボットのインタラクションのための汎用かつ効率的な意図推論VLA2025/10/1
意図推論・空間グラウンディング・簡潔な身体性推論を組み合わせたカリキュラム学習と効率的推論機構により、間接的な指示から人間の意図を推論して行動生成するVLAフレームワークを提案。
- LLaDA-VLA:視覚言語拡散アクションモデルVLA2025/9/1
拡散ベースの視覚言語モデルをロボットマニピュレーションに適応させた初のVLAモデルを提案し、特殊トークン分類と階層的アクション復号により従来手法を上回る性能を実現した。
- ROSA: ロボット状態を活用した視覚言語と行動のアライメントVLA2025/6/1
ロボットの状態推定データを自動取得してVLAモデルの訓練に組み込み、視覚言語空間と行動空間のずれを埋めることで、少ないデータでも高性能・高汎化を実現する手法を提案。
- Ross3D: 3D認識を備えた再構成的視覚インストラクションチューニング3Dシーン理解2025/4/1
3Dシーン理解のための大規模データ不足に対処するため、クロスビューとグローバルビューの再構成を訓練に組み込んだ3D認識型視覚インストラクションチューニング手法を提案し、複数のベンチマークで最高性能を達成した。
- SubjectDrive: 被写体制御による自動運転向け生成データのスケーリング自動運転/生成データ2024/3/1
被写体を制御できる生成モデルを開発し、多様な生成データを大量に作ることで自動運転の認識モデルの性能を継続的に向上させられることを示した。
- ADriver-I: A General World Model for Autonomous Driving2023/11/1