Weichen Zhang
収録論文 10本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- FutureDuet: 未来予測監督における観測アクセスの分離VLA2026/9/28
ロボットの行動生成において、メインカメラと手首カメラで異なる未来予測目標を与えることで、精密な操作タスクの成功率を向上させた研究。
- ActiveFly-Bench: 空中身体知覚のための身体化質問応答と視覚言語行動の統合UAV/身体化知覚2026/7/1
UAVの能動的知覚を評価する初のベンチマークを提案し、高次タスク理解から低次制御までを階層的に評価するエージェントを開発した。
- Worldscape-MoE: スケーラブルな異種行動制御のための統一Mixture-of-Experts世界モデル世界モデル2026/7/1
異なる行動モダリティ(カメラ軌道、ロボット動作、手の関節信号など)を統一的に扱える拡張可能な世界モデルを提案し、MoEアーキテクチャにより異種の行動制御を共有の世界ダイナミクスに統合する。
- WorldFly: UAVナビゲーションのためのワールドモデル基盤の視覚言語行動モデルナビゲーション2026/6/4
UAVナビゲーションのための新しいVLAフレームワークで、将来の映像予測と行動を同時生成するデュアルブランチ結合フローマッチング機構を導入し、空間想像による意思決定を強化する。
- WorldVLN: 空中視覚言語ナビゲーションのための自己回帰的世界行動モデルVLA2026/5/1
空中VLNを予測駆動の世界行動問題として捉え、自己回帰ビデオバックボーンで世界状態遷移を予測し、実行可能なウェイポイント行動に直接デコードする初のモデルWorldVLNを提案。2段階訓練と強化学習により、ベンチマークで12%以上の成功率向上を達成し、実ドローンへのゼロショット転送も実証。
- 3D空間における長期的視覚生成とナビゲーションのための航空世界モデルナビゲーション2025/12/1
UAVのナビゲーション向けに、過去のフレームと行動から将来の視覚観測を予測する世界モデルANWMを提案し、候補軌道を意味的妥当性で評価することで大規模3D環境での自律飛行性能を向上させた。
- AirScape: 運動制御可能な空中生成ワールドモデル世界モデル2025/7/1
6自由度ドローンの視覚入力と運動意図から将来の観測を予測する世界モデルを構築し、運動意図に沿った3D空間想像力で既存モデルを大幅に上回った。
- IS-Bench:家庭内タスクにおけるVLM駆動型身体エージェントの対話型安全性評価VLA2025/6/1
家庭内タスクを行うVLM駆動型エージェントの対話型安全性を評価する初のマルチモーダルベンチマークIS-Benchを提案し、161のシナリオと388のリスクで危険回避行動の手順を検証した。
- CityNavAgent:階層的意味計画とグローバルメモリによる都市空中ビジョン言語ナビゲーション空中VLN2025/5/1
ドローンが自然言語指示に従って都市環境をナビゲートする空中VLNタスクに対し、LLMを活用した階層的意味計画と履歴をトポロジカルグラフで保持するグローバルメモリを組み合わせたエージェントを提案し、最先端性能を達成した。
- EmbodiedCity:実世界都市環境における身体性エージェントのためのベンチマークプラットフォーム身体性AI/都市シミュレーション2024/10/1
実在都市の建物や道路を再現した高精細3Dシミュレータ上で、歩行者・車両の流れを再現し、身体性AIの評価タスクと入出力インターフェースを提供するベンチマークを構築した。