Ao Liang
収録論文 14本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- OmniLiDAR: マルチドメイン3D LiDAR生成のための統一拡散フレームワークLiDAR生成2026/5/1
異なるセンサー条件やプラットフォームにわたる8つのドメインでLiDARスキャンを生成する統一テキスト条件付き拡散モデルを提案し、ドメイン間の特徴シフトを扱う新しいトレーニング戦略と特徴変調を導入した。
- あなたの運転ワールドモデルは万能選手か?自動運転/評価ベンチマーク2026/5/1
運転ワールドモデルの性能を画質から閉ループ運転まで多面的に評価する統一ベンチマークWorldLensを提案し、既存モデルが全軸で優れないことを示した。
- NavThinker: 社会的ナビゲーションにおける結合予測と計画のための行動条件付きワールドモデルナビゲーション2026/3/1
ロボットの行動に応じて将来のシーンと歩行者動態を予測する行動条件付きワールドモデルを強化学習と組み合わせ、社会的ナビゲーションの性能を向上させた。
- RoboSenseチャレンジ:あらゆる環境を認識し、どこへでも移動し、プラットフォームを超えて適応するロボット知覚ベンチマーク2026/1/1
ロボット知覚の堅牢性と適応性を競うRoboSense 2025チャレンジの報告で、5つのタスクのベンチマークと23の受賞解法から得られた知見をまとめた。
- 自動運転のための視覚-言語-行動モデル:過去・現在・未来VLA2025/12/1
自動運転における視覚-言語-行動(VLA)フレームワークの進化を整理し、End-to-End型とDual-System型の2つのパラダイムに分類して、その特徴と課題を概観したサーベイ論文。
- 3EED: あらゆる場所のあらゆるものを3Dでグラウンディング3Dグラウンディング2025/11/1
車・ドローン・四足歩行ロボットのRGBとLiDARデータを統合した大規模3D視覚グラウンディングベンチマークを構築し、クロスプラットフォーム評価手法を提案した。
- 4D LiDARシーケンスの生成を学習するLiDAR生成2025/9/1
自由形式の言語指示から編集可能な4D LiDARシーケンスを生成する統合フレームワークLiDARCrafterを提案し、シーン・物体・シーケンスレベルの評価ベンチマークEvalSuiteも提供する。
- 3D・4D世界モデリングのサーベイ世界モデル2025/9/1
RGB-D画像や占有グリッド、LiDAR点群といったネイティブな3D/4D表現を用いた世界モデリング研究を初めて体系的に整理し、定義・分類・データセット・評価指標をまとめたサーベイ。
- イベントカメラによる視覚的グラウンディングVLA2025/9/1
イベントカメラデータを用いた言語駆動型物体グラウンディングのための大規模ベンチマークTalk2Eventを構築し、動的環境でのマルチモーダル知覚を可能にした。
- La La LiDAR: LiDARデータからの大規模レイアウト生成LiDAR生成2025/8/1
LiDARシーンの前景物体配置と空間関係を制御可能にする、シーングラフ誘導の生成フレームワークを提案し、大規模データセットと評価指標を導入した。
- LiDARCrafter: LiDAR系列からの動的4D世界モデリング4D生成2025/8/1
自然言語指示からLiDARの4Dシーケンスを生成・編集する統合フレームワークを提案し、nuScenesで最先端の忠実性・制御性・時間的一貫性を達成した。
- Veila: 単眼RGB画像からのパノラマLiDAR生成LiDAR生成2025/8/1
単眼RGB画像を条件として、拡散モデルによりパノラマLiDAR点群を生成するフレームワークを提案。信頼度に基づく条件付けと幾何学的整合性により、RGBとLiDARのモダリティギャップを克服する。
- Talk2Event: イベントカメラによる動的シーンの言語接地理解VLA2025/7/1
イベントカメラの非同期ストリームを言語と結びつける大規模ベンチマークTalk2Eventを構築し、属性を考慮した接地フレームワークEventReferを提案した。
- 視点不変な3D物体検出3D物体検出2025/7/1
車両・四足歩行ロボット・ドローンで収集したLiDARデータセットPi3DETを構築し、車両から他プラットフォームへ知識を転移する視点不変な3D検出フレームワークを提案した。