Yuchen Zhang
Technical University of Munich
収録論文 16本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- PlannerForge: 自動運転におけるモーションプランナーのシナリオベーステストのためのLLMエージェント自動運転/LLMエージェント/テスト2026/9/8
自動運転システムのシナリオベーステストの全工程を統一的なLLMエージェントフレームワークで統合し、シナリオ生成から評価、さらにはシステム改善とベンチマークまでを自動化するPlannerForgeを提案した。
- スーパーオドメトリ2.0:階層的適応による頑健なオドメトリオドメトリ2026/8/26
環境劣化に応じてセンサ融合を動的に適応させる頑健なオドメトリフレームワークを提案。IMUをカメラやLiDARと同等に扱い、劣化時でも信頼性を確保する。
- REVEAL: 参照に基づく推論によるマルチモーダル操作検出マルチモーダル検出2026/5/27
画像とテキストのペアの偽造を検出し、改ざん領域を特定するために、検索した真正な証拠と比較する参照基盤の検証フレームワークを提案した。
- OmniVL-Guard Pro: ツール拡張エージェントによる包括的視覚言語フォレンジクス視覚言語フォレンジクス2026/5/16
閉世界前提の既存の偽造検出手法を超え、外部ツール(リアルタイム検索、拡大、セグメンテーション等)を活用するエージェントを提案し、オープンワールドでのフォレンジクス推論を実現する。
- RoboSenseチャレンジ:あらゆる環境を認識し、どこへでも移動し、プラットフォームを超えて適応するロボット知覚ベンチマーク2026/1/1
ロボット知覚の堅牢性と適応性を競うRoboSense 2025チャレンジの報告で、5つのタスクのベンチマークと23の受賞解法から得られた知見をまとめた。
- Any4D: 統合フィードフォワード計量4D再構成4D再構成2025/12/1
多視点トランスフォーマーにより、Nフレームのピクセル単位の動きと形状を直接予測する4D再構成手法を提案。RGB-DやIMU、レーダーなど追加センサーも利用可能で、高精度かつ高速。
- MiMo-Embodied: クロス身体性基盤モデル技術報告VLA2025/11/1
自動運転と身体性AIを統合した初のクロス身体性基盤モデルを開発し、両分野で最先端性能を達成した。
- DSBench:車外・車内リスクを評価する包括的ベンチマーク自動運転VLMベンチマーク2025/11/1
自動運転向けVLMの安全性評価のため、車外環境リスクと車内運転行動安全を10カテゴリ28サブカテゴリで統合評価する初のベンチマークDSBenchを構築し、98Kデータでの微調整が安全性を向上させることを示した。
- Target-Bench:動画世界モデルは意味的ターゲットへの地図なし経路計画を達成できるか?VLA2025/11/1
動画世界モデルの意味的推論・空間推定・計画能力を評価する初のベンチマークTarget-Benchを提案し、既存モデルの性能不足と実ロボットデータでの微調整による改善を示した。
- チームXiaomi EV-AD VLA:キャプション誘導検索システムによるクロスモーダルドローン航法VLA2025/10/1
ドローンの自然言語誘導画像検索において、VLMで候補画像のキャプションを生成し再ランキングする2段階手法を提案し、ベースラインを5%改善した。
- MapAnything: 汎用フィードフォワード計量3D再構成3D再構成2025/9/1
複数画像と任意の幾何情報から、カメラ姿勢や深度を含む計量的な3Dシーンを単一のフィードフォワードで推定する統一Transformerモデルを提案。
- SimpleVLA-RL:強化学習によるVLAモデル訓練のスケーリングVLA2025/9/1
VLAモデル向けの効率的な強化学習フレームワークを提案し、大規模データへの依存を減らしつつLIBEROやRoboTwinで高性能を達成した。
- UFM: フローとマッチングを統合するシンプルな密対応モデル密対応2025/6/1
広基線マッチングとオプティカルフローを単一のTransformerで統合学習し、両タスクで専門手法を上回る精度と速度を実現した。
- 自動運転における基盤モデル:シナリオ生成と分析に関するサーベイ自動運転2025/6/1
自動運転のシナリオ生成・分析に基盤モデル(LLM、VLM、拡散モデル、ワールドモデルなど)を適用した研究を体系的に整理し、データセット・評価指標・課題をまとめたサーベイ。
- ローリングシャッターカメラと低精度INSを用いた屋外環境におけるセマンティックSLAMセマンティックSLAM2025/4/1
車線境界や標識などの道路要素を活用し、ローリングシャッター歪みとINSドリフトに対処するグラフ最適化ベースのセマンティックSLAMを提案。低コストなセンサ構成で高精度な自己位置推定を実現する。
- Vision-Guided Quadrupedal Locomotion in the Wild with Multi-Modal Delay Randomization2021/9/1