Yuxuan Zhou
Tsinghua University
収録論文 15本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- OPIS: ビデオ世界モデルにおけるマルチオブジェクト記憶のための入力接地ベンチマークビデオ世界モデル2026/9/28
ビデオ世界モデルが初期観測の物体をどれだけ記憶できるかを評価するベンチマークOPISを提案し、8モデルで物体の存在・同一性・構造を測定した。
- 見ることが信じることではない ― 検索基盤型動画誤情報検出のベンチマーク誤情報検出2026/6/2
動画の誤情報を検出するため、ウェブ検索で関連動画を探し比較するベンチマークEVID-Benchを構築し、最先端モデルの性能が低いことを示した。
- まず計画を立て、それから精密に調整する:効率的な身体化推論のためのシンボリック強化学習身体化推論/タスク計画2026/6/1
身体化タスク計画において、BDDL仕様を共有インターフェースとして用い、ビデオからBDDLへのパーサー、LLM検証器、軽量シンボリックエンジンを組み合わせることで、ミリ秒単位の密な報酬を提供し、難易度適応型の長さスケジュールGroupAdaptを導入して、8BプランナーのBEHAVIOR-1000での性能を大幅に向上させた。
- SeedPolicy: 自己進化型拡散ポリシーによるロボットマニピュレーションの時間軸スケーリングマニピュレーション2026/3/1
ゲート付き注意機構で長期文脈を圧縮する時間モジュールSEGAを拡散ポリシーに統合し、長期的なロボット操作タスクの性能を大幅に向上させた。
- AnyTouch 2: 動的触覚知覚のための汎用光学触覚表現学習触覚2026/2/1
大規模階層型触覚データセットToucHDを構築し、物体理解と力覚を伴う微細な動的知覚を統合する汎用触覚表現学習フレームワークAnyTouch 2を提案した。
- 記憶拡張型の計画と予見による視覚ナビゲーションのための統合世界モデルに向けてナビゲーション2025/10/1
視覚的予見と計画を単一のマルチモーダル自己回帰バックボーンに統合し、階層的記憶機構で長期推論を安定化させた世界モデルUniWMを提案。4つのベンチマークでナビゲーション成功率を最大30%改善し、未見環境へのゼロショット汎化も示した。
- MASt3R-Fusion: フィードフォワード視覚モデルとIMU・GNSSを統合した高機能SLAMSLAM2025/9/1
フィードフォワード型の点群回帰モデルにIMUとGNSSを密結合し、階層的ファクタグラフでリアルタイム・グローバル最適化を両立させた高精度・高ロバストなマルチセンサSLAMを提案。
- HA-VLN 2.0:動的な複数人環境における人間認識ナビゲーションのためのオープンベンチマークとリーダーボードVLA2025/3/1
離散・連続空間での人間認識型視覚言語ナビゲーションを統一評価するベンチマークを提案し、社会的制約を考慮したデータセット・シミュレータ・実機検証・リーダーボードを公開した。
- SF-Loc: スパース視覚構造フレームに基づく視覚マッピングと地理的自己位置推定システム自己位置推定2024/12/1
疎なフレームに密でコンパクトな深度を付与した「視覚構造フレーム」で地図を表現し、軽量なマッピングとGNSS不要の高精度な再自己位置推定を実現したシステム。
- iKalibr-RGBD: 連続時間速度推定によるRGBD向けターゲット不要な視覚慣性時空間キャリブレーションキャリブレーション2024/9/1
RGBDカメラとIMUの時空間キャリブレーションを、人工ターゲットなしで高効率に行う手法を提案。深度情報を活用した自己速度推定により、従来の姿勢推定ベースの手法より計算コストを大幅に削減した。
- RIs-Calib: 連続時間推定に基づく複数3DレーダとIMUのオープンソース時空間キャリブレータキャリブレーション2024/8/1
複数の3DレーダとIMUの時空間キャリブレーションを、追加インフラや事前知識なしで高精度に行う連続時間推定ベースのオープンソース手法を提案し、シミュレーションと実環境で有効性を検証した。
- iKalibr: 堅牢な統合慣性システムのための統一ターゲットレス時空間キャリブレーションキャリブレーション2024/7/1
IMU・レーダー・LiDAR・カメラを組み合わせた統合慣性システム向けに、人工ターゲットを必要とせず時空間キャリブレーションを一括で行うフレームワークを提案した論文。
- 人間を考慮した視覚言語ナビゲーション:動的な人間活動を組み込んだシミュレーションから現実への橋渡しVLA2024/6/1
動的な人間活動を取り入れたHA-VLNタスクを提案し、HA3DシミュレータとHA-R2Rデータセット、および2種類のエージェントを構築して、人間がいる環境でのナビゲーション性能を評価した。
- DBA-Fusion: 深層高密度バンドル調整とマルチセンサを密結合した大規模SLAMVSLAM/マルチセンサ融合2024/3/1
学習ベースの高密度バンドル調整(DBA)を因子グラフでマルチセンサ情報と密結合し、大規模環境でのリアルタイム高密度マッピングと高精度測位を実現した。
- Ground-VIO: Monocular Visual-Inertial Odometry with Online Calibration of Camera-Ground Geometric Parameters2023/6/1