Xulei Yang
収録論文 6本 ・ フィジカルAI/ロボット学習
計画/ベンチマークベンチマーク自動運転/HMI3D視覚グラウンディングBEV知覚/マルチタスク
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- Ego2World: 一人称調理動画を実行可能な世界へ変換し信念状態計画を行う計画/ベンチマーク2026/5/13
一人称調理動画から実行可能なシンボリック世界を構築し、部分観測下での信念状態計画を評価するベンチマークを提案した論文。
- PRISM: シミュレーション環境における意図を伴う計画と推論ベンチマーク2026/5/1
LLMベースの身体性エージェントの失敗原因を、知覚・推論・長期計画のどの能力に起因するかを診断するベンチマークPRISMを提案した論文。
- 自動運転におけるLLM対応マルチプランナー・スケジューリングによるオープンエンド指示の実現自動運転/HMI2026/4/1
乗客の自然言語によるオープンエンドな指示をLLMで解釈し、複数のMPCベース運動プランナーをスケジューリングして制御信号に変換する枠組みを提案。クローズドループ評価用ベンチマークも導入し、タスク完了率向上とLLMクエリコスト削減を実証した。
- 視覚言語モデルによるゼロショット3D視覚グラウンディング3D視覚グラウンディング2025/5/1
2Dの視覚言語モデルを活用し、3D専用の学習データなしで3Dシーン内の物体を自然言語で特定するゼロショット手法SeeGroundを提案。
- SeeGround: ゼロショットオープンボキャブラリ3D視覚グラウンディングのための見て接地する手法3D視覚グラウンディング2024/12/1
2D視覚言語モデルを活用し、3Dシーンをクエリに合わせたレンダリング画像と空間記述のハイブリッドで表現することで、ゼロショットでオープンボキャブラリな3D視覚グラウンディングを実現した。
- QuadBEV: Bird's-Eye-View表現による効率的な4タスク知覚フレームワークBEV知覚/マルチタスク2024/10/1
Bird's-Eye-View表現を共有バックボーンで活用し、3D物体検出・車線検出・マップセグメンテーション・占有予測の4タスクを効率的に同時実行する組込み向け知覚フレームワークを提案。