Ping Luo
HKU
収録論文 76本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- GroundAnything: 並列デコーディングと高精度視覚グラウンディングをフラッシュ速度で両立視覚グラウンディング2026/9/30
拡散モデルによる並列デコーディングで視覚グラウンディングを高速化し、4Bモデルで同規模の最先端性能を達成した研究。
- GroundingPI:視覚プリミティブで物理知能に挑むグラウンディング基盤モデルVLA2026/9/30
点やボックスを量子化座標として生成する4Bのグラウンディング基盤モデルを提案し、ロボット操作や自動運転の視覚バックボーンとして性能を向上させた。
- 未来予測を超えて:ロボット制御のための生成的適応としてのデノイジングVLA2026/9/23
事前学習済み生成DiTを制御に適応させる際、未来の視覚予測は不要であり、現在の観測をデノイズする軌跡そのものが制御への有効なインターフェースとなることを示し、学習効率と性能を両立する手法NowWAMを提案した。
- EgoWild2Dex: 野生の人間体験から器用なロボットマニピュレーションを学習マニピュレーション2026/9/20
家庭や工場など実環境で頭部カメラにより収集した一人称視点の人間行動データを、視点のずれと身体差を補正して双腕ロボットの器用な操作に転移する手法を提案。
- DexTouch-WM: 人間の触覚から器用なロボット操作のための行動条件付き触覚ワールドモデルを学習触覚/ワールドモデル2026/9/17
人間とロボットの手に同じ触覚センサ配置を装着し、人間の触覚データからロボットの視覚・触覚の未来を予測するワールドモデルを学習。人間のデータを増やすほどロボット領域の予測精度が向上し、政策評価や合成データ生成にも使えることを示した。
- MoPA: サブシステム特化型知覚アラインメントによる協調的移動マニピュレーション移動マニピュレーション2026/9/10
移動とマニピュレーションで異なる知覚表現を二重ストリームで抽出し、行動レベルで協調させるフレームワークを提案。ManiSkill-HABで最高性能、実機でも成功率76.3%を達成。
- 片手で二部品を組み立てるイン・ハンド・アセンブリマニピュレーション2026/9/9
2つの剛体部品を片手だけで把持・位置合わせして組み立てるタスクを強化学習で解き、シミュレーション学習から実機へゼロショット転移を実現した。
- GaussianDream++: ロボット操作のための効率的な3Dガウス世界モデリングVLA/3Dガウス/世界モデル2026/8/26
VLAポリシーに世界状態トークンと世界予測トークンを挿入し、訓練時のみ3Dガウス表現で現在と未来の世界を監督することで、推論時の追加コストなしに操作性能を向上させる手法を提案。
- SoftVTBench: 変形を考慮した視覚触覚データセットと変形物体操作のベンチマーク変形物体操作/データセット/ベンチマーク2026/8/19
変形物体操作の物理的相互作用品質を評価するため、視覚触覚データセットと閉ループベンチマークを構築し、変形許容度を考慮した成功率を提案した。
- XPolicyLab: ロボットポリシー評価と展開のための統一標準・オープンエコシステムロボットポリシー評価2026/8/1
ロボットポリシーの評価と展開を統一する標準規格とオープンエコシステムを提案し、N個のポリシーとM個の環境の接続コストをO(NM)からO(N+M)に削減した。
- UR-VC: 時間由来の進捗指標に対する教師なしロボット価値補正操作学習2026/7/1
デモンストレーションの時間正規化を進捗ラベルとして使う際のノイズを、他エピソードの類似状態から補正する教師なし・学習不要の手法を提案した。
- RoboDojo: 汎用ロボット操作ポリシーの包括的評価のための統合シミュレーション・実世界ベンチマークベンチマーク2026/7/1
シミュレーションと実世界の両方で汎用ロボット操作ポリシーを評価するための統一ベンチマークを提案し、42のシミュレーションタスクと18の実世界タスクで多様な能力を評価する。
- RxBrain:言語と視覚の推論・想像を統合した身体化認知基盤モデルVLA2026/7/1
身体化認知のための基盤モデルRxBrainを提案。言語による計画構造と視覚による世界状態予測を統合し、単一の計画シーケンスで表現する。
- 身体化操作のためのデータピラミッド:サーベイデータ収集/身体化AI2026/7/1
実ロボットデータからシミュレーションデータまで、身体化エージェントの学習に使われる5つのデータ源をピラミッド構造で整理し、各データの特性と組み合わせ方を分析したサーベイ論文。
- SoftVTBench: 物理的制約下での変形物体操作のための安全性を考慮した視覚触覚ベンチマークベンチマーク/変形物体操作/触覚2026/7/1
変形物体の操作において、タスク完了だけでなく物理的安全性(落下や過度な変形の回避)を評価するベンチマークを提案し、触覚センシングが安全性向上に寄与することを示した。
- 信頼できる具現化知能に向けて:システムフレームワークと段階的信頼度レベル信頼性評価2026/7/1
具現化知能の信頼性を「持続的な安全な成功」と定義し、モデル・システム・エビデンス・展開の4層からなるフレームワークと段階的信頼度を提案する論文。
- MemoryVLA++:視覚言語行動モデルにおける記憶と想像による時間的モデリングVLA2026/6/8
ロボット操作のためのVLAモデルに、作業記憶・エピソード記憶・未来想像の仕組みを組み込み、長期的な時間依存タスクを可能にするフレームワークを提案した。
- 計画整合型トークン圧縮による長文脈自動運転自動運転2026/6/1
自動運転のためのモノリシックな視覚行動モデルにおいて、長期の文脈を圧縮する際に計画情報を活用するフレームワークを提案し、成功率を向上させた。
- AttenA+: ロボット基盤モデルにおける行動の不平等性の是正VLA2026/5/1
ロボットの軌道における速度の不均一性に着目し、速度に基づく行動注意機構で重要区間を強調して学習する、既存モデルに追加可能なフレームワークを提案した。
- GaussianDream: ロボット操作のためのフィードフォワード3Dガウス世界モデルVLA/世界モデル2026/5/1
本論文は、ロボット操作のためのフィードフォワード型3Dガウス世界モデルを提案し、現在の3D空間構造と短期的な未来の進化を捉えることで、行動生成の精度を向上させる。
- HyperSim: ロバストなロボット操作のための包括的シミュレーションから実世界へのフレームワークsim2real2026/5/1
シミュレーションから実世界への転移を改善するため、高忠実度環境合成、敵対的軌道生成、シミュレーションと実世界の共学習を組み合わせた包括的フレームワークHyperSimを提案し、実世界タスクで高い成功率を達成した。
- HiVLA: 視覚基盤中心の階層型身体化操作システムVLA/操作2026/4/1
高レベルの意味的計画と低レベルの運動制御を分離した階層型VLAシステムを提案し、VLMの推論能力を保ちつつ、拡散トランスフォーマーによる行動生成で長期的なスキル合成と細かい操作を向上させた。
- SMASH: 自己中心視覚によるヒューマノイド卓球のスケーラブルな全身スキルの習得全身制御2026/4/1
外部センサに頼らず、自己中心視覚のみで連続打撃可能なヒューマノイド卓球システムを構築し、全身協調動作と生成モデルによる多様な打撃動作の学習を実現した。
- MM-Hand: 遠隔駆動を備えた21自由度のマルチモーダルモジュール式器用ロボットハンドロボットハンド/遠隔駆動/腱駆動/器用操作2026/4/1
本論文は、遠隔腱駆動によりモーターを外部に配置し、指と手のひらに自由度とセンサを集約した21自由度の器用ハンドMM-Handを提案し、伝達機構、力出力、センシング、制御性能を実験で検証した。
- VPWEM: 作業記憶とエピソード記憶を備えた非マルコフ視覚運動ポリシーVLA2026/3/1
ロボットの模倣学習において、短期の作業記憶と長期のエピソード記憶を組み合わせ、長期的な記憶を要する非マルコフタスクを少ない計算コストで解く視覚運動ポリシーを提案した。
- ReconDrive: 自動運転シーン再構成のための高速フィードフォワード4Dガウススプラッティング自動運転/4DGS2026/3/1
自動運転シーンの高忠実度再構成と新規視点合成を高速に行うフィードフォワード型4Dガウススプラッティング手法を提案。3D基盤モデルを動的シーン向けに拡張し、静的・動的要素を分離して表現することで、シーン毎の最適化と同等の品質を桁違いの高速処理で実現した。
- ManiTwin: データ生成対応デジタルオブジェクトデータセットを10万点に拡張データセット/シミュレーション2026/3/1
単一画像からシミュレーション対応の3Dアセットを自動生成するパイプラインを構築し、10万点の高品質アセットデータセットを提供する論文。
- RMBench:記憶依存型ロボットマニピュレーションのベンチマークと政策設計への洞察マニピュレーション2026/3/1
記憶を必要とするロボット操作タスクを体系的に評価する9タスクのシミュレーションベンチマークRMBenchと、明示的記憶モジュールを持つ操作政策Mem-0を提案し、既存政策の記憶限界と設計指針を明らかにした。
- RISE: 構成可能な世界モデルによる自己改善ロボット方策VLA2026/2/1
ロボット操作のための構成可能な世界モデルを提案し、想像空間での強化学習により実世界での安全性・コスト問題を回避しつつ、動的タスクで大幅な性能向上を実現した。
- χ₀: 分布の不一致を抑え込むリソース効率の良いロバストマニピュレーションマニピュレーション2026/2/1
人間のデモ分布・方策の帰納バイアス・実行時分布のずれを、重み空間マージやステージ適応型アドバンテージ推定、訓練-展開アライメントで解消し、限られた計算資源で双腕ロボットによる衣類の長期的操作を高信頼に実現した。
- UniVTAC: 視触覚マニピュレーションのデータ生成・学習・評価を統合するシミュレーションプラットフォーム視触覚/マニピュレーション2026/2/1
3種類の視触覚センサに対応したシミュレーション基盤で接触データを大量生成し、視触覚エンコーダと8タスクのベンチマークを提供して、触覚駆動型マニピュレーションの学習と評価を可能にした。
- EgoHumanoid:ロボット不要の一人称デモで実世界ロコマニピュレーションを実現ロコマニピュレーション2026/2/1
人間の一人称視点デモと少量のロボットデータを共訓練し、視点・動作のずれを補正することで、ヒューマノイドの実世界ロコマニピュレーション性能を51%向上させた。
- HUSKY: 物理を考慮した全身制御によるヒューマノイド・スケートボードシステム全身制御2026/2/1
ヒューマノイドがスケートボード上で安定して動的に操縦するため、ボードとトラックの連成をモデル化し、AMPと物理誘導型のリーン・トゥ・ステア戦略を組み合わせた全身制御フレームワークを提案した。
- マルチエージェントロボットシステム(MARS)チャレンジの進歩と革新マルチエージェント2026/1/1
NeurIPS 2025ワークショップで開催されたMARSチャレンジを紹介し、VLMを用いたマルチエージェントの計画とロボットマニピュレーションの制御という2領域での取り組みを概説した論文。
- MM-ACT: マルチモーダル並列生成から行動を学習する統合VLAモデルVLA2025/12/1
テキスト・画像・行動を共有トークン空間で統合し、並列デコードで生成するVLAモデルを提案。LIBEROや実機Franka、RoboTwin2.0で高い成功率を達成した。
- 俊敏性と安定性の融合:異種データによる汎用人型ロボット制御人型ロボット制御2025/11/1
人間のモーションキャプチャと物理的に生成したバランス動作という異種データを組み合わせ、単一のポリシーで俊敏な動きと極限のバランス維持を両立させる人型ロボット制御フレームワークAMSを提案。
- ヒューマノイドゴールキーパー:位置条件付きタスク運動制約からの学習ヒューマノイド2025/10/1
人間の運動事前分布を敵対的学習で取り込み、ヒューマノイドが高速で飛来するボールを自律的に自然な全身動作で阻止する強化学習フレームワークを実現した。
- FieldGen: 遠隔操作の前操作軌道からフィールド誘導データ生成へデータ生成2025/10/1
操作を前操作段階と精密操作段階に分け、人間の実演から引力場を構築して多様な軌道を自動生成することで、少ない人手で高品質な実世界データを収集する枠組みを提案。
- ポリシーを合成せよ!テスト時分布レベル合成による拡散・フローベースロボットポリシーの改善VLA2025/10/1
複数の事前学習済みロボットポリシーの分布スコアを凸結合しテスト時探索で合成する訓練不要手法GPCを提案し、単一ポリシーを超える性能を実現した。
- DriveE2E:実世界からシミュレーションへの閉ループ自動運転ベンチマーク自動運転ベンチマーク2025/9/1
実世界の交通シナリオと交差点のデジタルツインをCARLAに統合し、エンドツーエンド自動運転モデルを評価する閉ループベンチマークを構築した。
- 離散拡散VLA:視覚言語行動ポリシーの行動デコーディングに離散拡散を導入VLA2025/8/1
行動チャンクを離散化し、統合トランスフォーマー内で離散拡散により並列デコーディングするVLAを提案。適応的なデコーディング順序と再マスキングで誤り訂正を行い、LIBEROやSimplerEnvで高い成功率と事前学習能力の保持を実現した。
- V2X協調自動運転のエンドツーエンド競技会:研究課題と進展V2X協調自動運転2025/7/1
V2X通信を活用した協調自動運転のエンドツーエンド競技会を開催し、帯域制約下での知覚・計画の課題と上位解法の傾向を分析した。
- スケーラブルなロボットマニピュレーションに多様性は本当に必要か?マニピュレーション2025/7/1
ロボット学習におけるデータ多様性の役割をタスク・身体・専門家の3次元で検証し、タスク多様性が重要である一方、専門家の速度多様性は学習を妨げることを示し、その偏りを補正する手法を提案した。
- 生涯ロボット学習のための動的混合プログレッシブパラメータ効率エキスパートライブラリ生涯学習2025/6/1
低ランクエキスパートのライブラリを漸進的に構築し、軽量ルーターで動的に組み合わせることで、破滅的忘却を抑えつつ生涯にわたるロボット学習を効率化する手法を提案。
- OWMM-Agent:マルチモーダルなエージェントデータ合成によるオープンワールド移動マニピュレーション移動マニピュレーション2025/6/1
オープンワールド移動マニピュレーションのためのマルチモーダルエージェントアーキテクチャと、VLMをファインチューニングするデータ合成パイプラインを提案し、実世界でSOTA性能と汎化を実現した。
- RoboTwin 2.0:強力なドメインランダム化を備えた両腕ロボット操作のためのスケーラブルなデータ生成器とベンチマークsim2real2025/6/1
両腕ロボット操作のための大規模データ生成フレームワークを提案し、マルチモーダル言語モデルによるタスク生成と5軸のドメインランダム化で実世界への転移性能を大幅に向上させた。
- 汎化可能な両腕マニピュレーションのベンチマーク:CVPR 2025 MEISワークショップにおけるRoboTwin両腕協調チャレンジマニピュレーション2025/6/1
RoboTwinシミュレーションと実機ロボットを用いた両腕マニピュレーションの国際コンペを開催し、17タスクで64チームが競い、汎化可能な協調方策の知見をまとめた。
- UniVLA:タスク中心の潜在行動でどこでも行動を学習するVLA2025/5/1
動画からタスク中心の潜在行動表現を学習し、異なるロボットや環境に展開可能な汎用視覚言語行動ポリシーを実現した研究。
- AutoBio:デジタル生物学実験室におけるロボット自動化のためのシミュレーションとベンチマークsim2real2025/5/1
生物学実験室でのロボット自動化を評価するためのシミュレーションフレームワークとベンチマークAutoBioを提案し、言語誘導型マニピュレーションの課題を明らかにした。
- RoboTwin: 生成デジタルツインによる双腕ロボットベンチマーク双腕マニピュレーション2025/4/1
3D生成基盤モデルと大規模言語モデルを活用し、多様な専門家データセットと実世界に即した評価プラットフォームを提供する双腕ロボットタスク向けの生成デジタルツインフレームワークを提案。
- Centaur: テスト時訓練による堅牢なエンドツーエンド自動運転自動運転2025/3/1
テスト時訓練でプランナーの不確実性を最小化し、手設計のルールやコスト関数に頼らずに自動運転の安全性を向上させる手法を提案。
- AgiBot World Colosseo:スケーラブルで知能的な身体性システムのための大規模マニピュレーションプラットフォームマニピュレーション2025/3/1
100万以上の軌道と217タスクを含む大規模ロボット操作データセットと、潜在行動表現を活用した汎用方策GO-1を提案し、データ規模の拡大に伴う性能向上と実世界での巧みな長期的タスクの成功率向上を示した。
- VB-Com: 知覚欠損下でも歩行可能な視覚・盲複合ヒューマノイド制御歩行2025/2/1
視覚ポリシーと盲ポリシーを状況に応じて切り替える複合フレームワークVB-Comを提案し、知覚が不十分な動的環境でもヒューマノイドが安定して歩行できることを示した。
- DexHandDiff: 適応的巧みな操作のための相互作用を考慮した拡散計画マニピュレーション2024/11/1
接触を伴う巧みな操作のための拡散計画フレームワーク。接触前後の二段階拡散とLLMによるガイダンス生成で、訓練分布外の目標にも適応できる。
- G3Flow: 姿勢を考慮した汎化可能な物体操作のための生成的3Dセマンティックフローマニピュレーション2024/11/1
基盤モデルを活用して物体中心の動的な3Dセマンティック表現をリアルタイムに構築し、拡散ポリシーに組み込むことで、遮蔽下でも意味理解を可能にし、操作と物体間汎化を改善した。
- 知覚的内部モデルによるヒューマノイドの歩行学習歩行2024/11/1
機体周辺の高さマップを内部モデルとして用い、ノイズに強く低計算コストでヒューマノイドの階段昇降を含む不整地歩行を実現した研究。
- RoboTwin: 生成的デジタルツインによる双腕ロボットベンチマーク双腕マニピュレーション2024/9/1
3D生成モデルと大規模言語モデルを活用し、単一の2D画像から多様な物体のデジタルツインを生成して双腕ロボットの専門家データセットと実世界に即した評価ベンチマークを提供するフレームワークを提案。
- SAM2ベースのトラッキングとオンライン軸推定による関節物体マニピュレーションマニピュレーション2024/9/1
SAM2で動的部分を追跡しながら3D点群から関節軸をオンライン推定し、関節物体を閉ループで操作する手法を提案した論文。
- 生成期待を用いた閉ループ視覚運動制御によるロボットマニピュレーションマニピュレーション2024/9/1
テキスト条件付き動画拡散モデルで視覚計画を生成し、誤差を定量化する埋め込み空間とフィードバック制御器を組み合わせて、長期的なロボット操作を閉ループで適応制御するフレームワークCLOVERを提案した。
- HiAgent: 大規模言語モデルによる長期タスク解決のための階層的ワーキングメモリ管理LLMエージェント2024/8/1
サブゴールを記憶のチャンクとして用い、LLMエージェントのワーキングメモリを階層的に管理することで、長期タスクの成功率を2倍に向上させた。
- セグメント・リフト・フィット:2Dプロンプトからの自動3D形状ラベリング自動運転/3Dラベリング2024/7/1
2Dの点やボックスプロンプトからSAMでマスクを生成し、それを3Dに持ち上げてLiDAR点群に合わせて形状と姿勢を最適化することで、学習データなしに3D形状を自動ラベリングする手法を提案。
- DAG-Plan: 双腕協調プランニングのための有向非巡回依存グラフ生成双腕マニピュレーション2024/6/1
自然言語指示をLLMで有向非巡回グラフ(DAG)に変換し、双腕ロボットの並列実行と適応的なタスク割り当てを実現するプランニング手法を提案した。
- 相互作用予測によるマニピュレーション学習マニピュレーション2024/6/1
初期・最終状態と言語指示から遷移フレームと操作対象物体を予測する事前学習手法MPIを提案し、実機・シミュレーションで従来手法を10〜64%上回る性能を達成した。
- V2X協調によるエンドツーエンド自動運転自動運転/V2X2024/4/1
車両とインフラのセンサデータをV2X通信で統合し、知覚から計画までを一つのネットワークでエンドツーエンドに学習する協調自動運転フレームワークUniV2Xを提案。
- DriveCoT: 連鎖的思考推論を統合したエンドツーエンド自動運転自動運転/End-to-End2024/3/1
CARLAシミュレータで連鎖的思考ラベル付きのエンドツーエンド運転データセットDriveCoTを構築し、推論過程と最終判断を生成するベースラインモデルDriveCoT-Agentを提案した。
- RoboCodeX: Multimodal Code Generation for Robotic Behavior Synthesis2024/2/1
- RoboScript: 実機とシミュレーションをまたぐ自由形式マニピュレーションのためのコード生成マニピュレーション2024/2/1
ROS抽象化に基づく統一インターフェースで、コード生成による実機・シミュレーション両対応のロボットマニピュレーションパイプラインと自由記述タスクのベンチマークを提案。
- SkillDiffuser: Interpretable Hierarchical Planning via Skill Abstractions in Diffusion-Based Task Execution2023/12/1
- LanguageMPC: Large Language Models as Decision Makers for Autonomous Driving2023/10/1
- Tree-Planner: Efficient Close-loop Task Planning with Large Language Models2023/10/1
- Scene as Occupancy2023/6/1
- EmbodiedGPT: Vision-Language Pre-Training via Embodied Chain of Thought2023/5/1
- DeepAccident: A Motion and Accident Prediction Benchmark for V2X Autonomous Driving2023/4/1
- AdaptDiffuser: Diffusion Models as Adaptive Self-evolving Planners2023/2/3
- Policy Adaptation from Foundation Model Feedback2022/12/1
- CO^3: Cooperative Unsupervised 3D Representation Learning for Autonomous Driving2022/6/1