Yu Liu
Amap, Alibaba Group
収録論文 42本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 局所的な動画理解は遭遇をまたいで転移するか?EgoGearsベンチマーク一人称視点/動画理解/ベンチマーク2026/9/29
一人称視点の動画を単一・複数本で比較するベンチマークEgoGearsを提案し、複数動画間での対応付けや証拠統合が必要になるとMLLMの性能が平均22.5ポイント低下することを示した。
- 文脈内ロボット学習の簡素化:マニピュレーションタスクのための民主化レシピマニピュレーション2026/9/29
ロボットの文脈内学習(ICL)の曖昧さを解消する問題定義を提示し、視覚プロンプトエンコーダと低コストデータ収集で構成される再現可能なフレームワークSimpleICLを開発、シミュレーションと実世界で高性能を達成した。
- 統一軌道マッチング方策最適化:多様なT2I生成とVLA汎化VLA2026/9/28
拡散・フローポリシーの事後学習において、報酬最大化ではなく軌道分布マッチングを行う統一RLフレームワークUni-TMPOを提案し、T2I生成の多様性とVLAのタスク・シーン汎化を両立させた。
- MachEmbodied-U0:身体知能のための統合理解・生成モデルVLA2026/9/22
理解と生成の専門家をMixture-of-Transformersで統合し、視覚力学と行動生成をフローマッチングで結びつけた身体知能基盤モデルを提案。LIBEROで99.0%の成功率を達成。
- ME-Brain-1.0:記憶・認知・行動による自己進化型身体知能VLA2026/9/21
行動実行から経験獲得・進化を経て実行改善へと至る閉ループで自己進化する身体知能システムを提案し、再学習なしにベンチマークで大幅な性能向上を達成した。
- ME-Dex 1.0:異種触覚センシングを世界行動モデリングへ統合触覚/マニピュレーション2026/9/18
視覚・触覚・行動を統合的に学習するWorld Action Tactile Modelを提案し、異なる触覚センサや実装を共通空間に写像する仕組みとデータ生成基盤を構築した。
- ABot-World-0: 単一デスクトップGPU上での無限インタラクティブワールドロールアウトワールドモデル2026/7/21
単一のデスクトップGPUでリアルタイムに長時間のインタラクティブなビデオ生成を実現するアクション条件付きワールドモデルを提案し、データ収集から推論最適化までを統合したシステムを構築した。
- ABot-Earth 0.5: 生成型3D地球モデル3D生成2026/6/8
衛星画像から広大な3D環境を生成する生成モデルを提案し、3Dガウススプラッティングを用いてリアルな都市景観を高速に合成する。
- SemGeoNav: 意味的推論と幾何学的計画による安全性誘導型視覚ナビゲーション手法ナビゲーション2026/6/1
エンドツーエンドモデルの意味理解と幾何学的プランナーの安全性を統合した階層型視覚ナビゲーションフレームワークを提案し、実機の四足ロボットで性能を実証した。
- QuadVerse: 四足歩行シミュレーションのための視覚と物理の現実を統合するフレームワークsim2real2026/6/1
RGB動画から再構成した3Dシーンを基盤に、視覚・接触・アクチュエータの各ギャップを統合的に補正し、実機データなしで視覚ナビゲーションをゼロショット展開できる四足歩行シミュレーションフレームワークを提案した。
- LASSAアーキテクチャに基づく無人水中機の自律フォールトトレラント制御水中ロボット/フォールトトレラント制御2026/5/1
大規模言語モデル(LLM)を用いて未知の故障を自律的に検出・再計画し、物理制約検証により幻覚を抑制する無人水中機の知的フォールトトレラント制御手法を提案した。
- SCC-Loc: UAV熱地理定位のための統一セマンティックカスケードコンセンサスフレームワーク地理定位2026/4/1
熱画像と衛星画像のモダリティギャップを克服するため、セマンティックガイド付きビューポート調整、カスケード空間適応テクスチャ構造フィルタリング、コンセンサス駆動の信頼性認識位置選択を統合したUAV熱地理定位フレームワークを提案した。
- ASAP: 平面マイクロホンアレイの3次元音源方向推定のための方位角優先ストリップ探索法音源定位2026/4/1
平面マイクロホンアレイでの3次元音源方向推定を高速化するため、方位角を優先的に絞り込む2段階探索手法を提案した。
- 一緒に歩こう:人間中心の屋外支援のための長期的社会的ナビゲーションナビゲーション2026/4/1
高レベルの自然言語指示から屋外での長期的な社会的ナビゲーションを実現する、地図不要のフレームワークを提案。GPSと公開地図APIのPOIを用いて目的地を推定し、高レベルVLMと低レベルVLAを状況に応じて切り替えることで、安全で社会的に適切な移動を実現する。
- Adaptor: 少数ショット学習とオペレータ横断汎化による支援遠隔操作の高度化遠隔操作2026/4/1
支援遠隔操作におけるオペレータ間の意図認識のばらつきを、ノイズ注入による軌道摂動と幾何学的キーフレーム抽出、および視覚言語モデルとの融合を用いた少数ショット学習フレームワークで解決する。
- LoD-Loc v3: インスタンスシルエット整合による密集都市での汎用航空位置推定位置推定2026/3/1
密集都市環境での航空画像位置推定を、建物のインスタンスセグメンテーションとシルエット整合を用いて高精度化し、大規模データセット生成によりゼロショット汎化を実現した。
- DM0: フィジカルAIに向けた身体性ネイティブな視覚-言語-行動モデルVLA2026/2/1
身体性を後付けでなく最初から統合し、大規模事前学習からフローマッチング行動専門家と空間Chain-of-Thoughtで操作とナビゲーションを統一的に学習するVLAフレームワークDM0を提案。
- 観測からイベントへ:強化学習のためのイベント認識型ワールドモデルモデルベース強化学習2026/1/27
人間が連続的な知覚をイベントに区切って意思決定する仕組みに着想を得て、生の観測から自動でイベント境界を抽出し、イベント予測で表現を学習するワールドモデルEAWMを提案。複数のベンチマークでMBRLの性能を10〜45%向上させた。
- IndoorUAV: 屋内連続環境における視覚言語UAVナビゲーションのベンチマークVLA2025/12/1
屋内ドローン向けの視覚言語ナビゲーション(VLN)ベンチマークとデータセット、およびタスク分解とマルチモーダル推論を用いたナビゲーションモデルを提案した論文。
- Dexbotic: オープンソース視覚-言語-行動ツールボックスVLA2025/10/1
複数のVLAモデルを単一環境で再現・開発できるPyTorchベースのオープンソースツールボックスを提供し、高性能な事前学習済みモデルも公開した。
- VideoArtGS: 単眼動画から関節物体のデジタルツインを構築3D再構成2025/9/1
単眼動画から関節物体の形状・部位分割・関節パラメータを同時に復元し、高精度なデジタルツインを構築する手法を提案。
- M3Depth: ウェーブレット強化による火星の深度推定とデュアルモーダルデータの相互ブースト深度推定2025/5/1
火星探査ローバ向けに、ウェーブレット変換を組み込んだ畳み込みと深度・表面法線の相互ブースト機構により、テクスチャが乏しい火星地形でも高精度なステレオ深度推定を実現した研究。
- 円筒占有表現に基づくLiDARと2Dスキャンレーダのターゲットレス6DoFキャリブレーションキャリブレーション2025/3/1
LiDAR点群と2Dスキャンレーダの走査を共通の円筒占有表現で整合させ、人工マーカーなしで6自由度の外部キャリブレーションを推定する手法LiRaCoを提案した。
- ArtGS: ガウシアンスプラッティングによる複雑な関節物体の操作可能なレプリカ構築3D再構成/関節物体2025/2/1
3Dガウシアンを用いて複数パーツの関節物体を異なる状態間で統合し、パーツメッシュ再構成と関節パラメータ推定を高精度・高効率で行う手法を提案。
- MSC-Bench: 自動運転知覚におけるマルチセンサー劣化のベンチマークと分析自動運転知覚2025/1/1
カメラとLiDARの入力が個別または同時に劣化・欠損した際の自動運転知覚モデルの頑健性を評価する初の総合ベンチマークを提案し、3D物体検出6モデルとHDマップ構築4モデルを評価した。
- ユニバーサルアクションによる具現化基盤モデルの強化VLA2025/1/1
多様なロボットの動作を共通の「ユニバーサルアクション空間」で表現し、異なる機体間でのデータ活用と汎化性能を高める具現化基盤モデルUniActを提案。0.5Bパラメータで14倍規模の既存モデルを上回る。
- Robo-MUTUAL: 単一モーダル学習によるロボットのマルチモーダルタスク指示VLA2024/10/1
単一モーダルの指示データを活用し、クロスモーダルアライメントを事前学習とCollapse/Corrupt操作で強化することで、ロボットがマルチモーダルなタスク指示を理解できるフレームワークを提案。
- SmartPretrain: モデル非依存・データセット非依存の運動予測のための表現学習運動予測2024/10/1
複数の運転データセットを統合し、対照学習と再構成学習を組み合わせた自己教師あり事前学習フレームワークを提案。モデルやデータセットに依存せず運動予測性能を向上させる。
- SlotLifter: スロット誘導特徴リフティングによるオブジェクト中心放射輝度場の学習オブジェクト中心学習/3D再構成2024/8/1
スロット誘導特徴リフティングを用いて、3Dシーンの再構成とオブジェクト分解を同時に行うオブジェクト中心の放射輝度モデルを提案し、合成・実世界データセットで高い性能を示した。
- 指示誘導型ビジュアルマスキングVLA2024/5/1
指示に関係ない画像領域をマスクすることで、マルチモーダルモデルが指示に沿った領域に注目できるようにする手法を提案し、VQAやロボット制御で性能を向上させた。
- RoboKube: ロボティクスにおけるクラウドネイティブ進化の新基盤の確立クラウドロボティクス2024/3/1
Kubernetesエコシステムを基盤に、ROSアプリケーションをクラウド化してデバイス・クラウド間で共通プラットフォームを構築する適応型フレームワークRoboKubeを提案し、遠隔操作テストベッドで実証した。
- SmartRefine: シナリオ適応型の効率的な運動予測リファインメントフレームワーク運動予測2024/3/1
各シナリオの特性に応じてリファインメントの設定と反復回数を適応的に選び、最小限の追加計算で運動予測精度を向上させる汎用的な手法を提案。
- DecisionNCE: 暗黙的選好学習による身体性マルチモーダル表現VLA2024/2/1
視覚軌跡と言語指示の対応を暗黙的選好として扱い、Bradley-Terryモデルを再パラメータ化することで、タスク進捗と時間的一貫性、言語接地を同時に学習する統合表現学習フレームワークを提案した。
- Knowledge-aware Graph Transformer for Pedestrian Trajectory Prediction2024/1/1
- LMDrive: Closed-Loop End-to-End Driving with Large Language Models2023/12/1
- Efficient Reinforcement Learning for Autonomous Driving with Parameterized Skills and Priors2023/5/1
- Accelerating Reinforcement Learning for Autonomous Driving using Task-Agnostic and Ego-Centric Motion Skills2022/9/1
- Safety-Enhanced Autonomous Driving Using Interpretable Sensor Fusion Transformer2022/7/1
- A Novel Generative Convolutional Neural Network for Robot Grasp Detection on Gaussian Guidance2022/5/1
- HDGT: Heterogeneous Driving Graph Transformer for Multi-Agent Trajectory Prediction via Scene Encoding2022/5/1
- Deep Learning-based Inertial Odometry for Pedestrian Tracking using Attention Mechanism and Res2Net Module2022/5/1
- Scalable Place Recognition Under Appearance Change for Autonomous Driving2019/8/1