Yuan Liu
The Hong Kong University of Science and Technology
収録論文 14本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- MVG-WAM: ロボットマニピュレーションのための多視点幾何認識型ワールドアクションモデルマニピュレーション2026/9/29
多視点カメラの幾何学的関係を明示的に組み込んだワールドアクションモデルを提案し、LIBEROやRoboTwin 2.0で高い成功率を達成した。
- SLIP-VLA: 視覚言語行動モデルのための単一ステップ潜在想像による方策学習VLA2026/9/27
VLAモデルに1回のデノイズ更新で未来の潜在表現を生成する「単一ステップ潜在想像」を導入し、幾何・意味特徴との整合と行動条件付き世界モデルで未来を考慮した行動予測を効率化した手法。
- MoSAT: 空間オーディオとテキスト記述からの人間動作生成動作生成2026/9/20
空間オーディオと自然言語を条件として全身動作を生成する新タスクを提案し、データセットSTAMと階層的クロスアテンションを用いた潜在フローマッチング手法MoSATを開発した。
- S4R: 剛体の相互貫入を解消するスケーリング手法物理シミュレーション2026/9/17
物体を一度小さく縮めてから徐々に元のサイズに戻すことで、剛体同士のめり込みを解消する手法を提案し、大規模シーンでも高速かつ高精度に処理できることを示した。
- CitySTAR: オープンボキャブラリ都市3Dグラウンディングのための構造的・トポロジー認識推論3Dグラウンディング2026/9/17
都市規模の3D点群において、自然言語指示から対象を特定するタスクを構造的制約推論として再定式化し、シーングラフとハイパーグラフによるトポロジー検証で高精度にグラウンディングする学習不要のフレームワークを提案。
- ABot-World-0: 単一デスクトップGPU上での無限インタラクティブワールドロールアウトワールドモデル2026/7/21
単一のデスクトップGPUでリアルタイムに長時間のインタラクティブなビデオ生成を実現するアクション条件付きワールドモデルを提案し、データ収集から推論最適化までを統合したシステムを構築した。
- ABot-Earth 0.5: 生成型3D地球モデル3D生成2026/6/8
衛星画像から広大な3D環境を生成する生成モデルを提案し、3Dガウススプラッティングを用いてリアルな都市景観を高速に合成する。
- PO-PDDL: 視覚デモから記号的POMDPを学習し不確実性下でのロボット計画を実現計画/不確実性2026/6/1
実ロボットの視覚デモから、部分観測と確率的行動を扱える記号的POMDPモデルを自動学習し、不確実性下でのタスク計画を可能にする手法を提案した。
- HOIにおけるReal2Sim:単眼ビデオからの物理的に妥当な人-物体インタラクション再構成に向けて人-物体インタラクション/物理シミュレーション2026/5/14
単眼ビデオから人と物体のインタラクションを再構成する際、視覚的にだけでなく物理的にも妥当な4Dアニメーションを生成するフレームワークHA-HOIを提案する。人間の動きを基準に物体を追従させ、物理シミュレーションで安定した動作を実現する。
- 長寿命ロボットに向けて:強化学習ファインチューニングによるVLAモデルの継続学習VLA2026/2/1
VLAモデルの下流タスク適応における破滅的忘却とデータ依存を解決するため、オンライン環境フィードバック不要の強化学習ファインチューニング手法LifeLong-RFTを提案し、継続学習でSFT比22%の成功率向上を達成した。
- MOSPA: 空間オーディオに駆動される人間モーション生成モーション生成2025/7/1
空間オーディオに反応する人間の動きを生成するため、初の空間オーディオ駆動モーション(SAM)データセットを構築し、拡散モデルベースの生成フレームワークMOSPAを提案した。
- MotionWavelet: ウェーブレット多様体学習による人体動作予測動作予測2024/11/1
ウェーブレット変換と拡散モデルを組み合わせ、空間周波数領域で人体動作の時系列パターンを学習することで、将来の動作を高精度に予測するフレームワークを提案した。
- ApolloRL: a Reinforcement Learning Platform for Autonomous Driving2022/1/1
- Glasgow's Stereo Image Database of Garments2013/11/1