Hongsheng Li
CUHK MMLab
収録論文 37本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- MultiTalk: 長時間・多人数・バイリンガル会話への全二重音声モデルの拡張音声対話2026/9/29
長時間・多人数・英中バイリンガルの全二重音声対話モデルを実現するため、57.6k時間の合成データセットと実録音ベースの評価ベンチマークを構築した研究。
- Fysiverse-3D-Vision: 画像から実行可能な3D世界を生成する統合空間推論フレームワーク3D生成2026/9/22
単一画像から物体の意味・形状・配置を統合的に推論し、物理シミュレーション可能な3Dシーンを生成する視覚言語幾何フレームワークを提案。
- DreamHand: ビデオ拡散モデルを転用した、遮蔽に頑健な自己中心視点3D手動作復元手動作復元2026/8/20
ビデオ拡散モデルを決定的な幾何エンコーダとして転用し、遮蔽やフレーム外の手の動きを復元する新しい手法を提案。5つのベンチマークでSOTAを達成し、特に遮蔽の多いデータで誤差を大幅に削減した。
- InterleaveThinker: エージェント型インターリーブ生成の強化マルチモーダル生成2026/6/11
既存の画像生成器にテキストと画像の交互生成能力を付与するマルチエージェントパイプラインを提案し、プランナーと批評エージェントを用いて段階的な指示修正を強化学習で強化する。
- HomeWorld: フロアプランから家具付きまでを統合した、制御可能で高密度にインタラクティブな住宅全体シーン生成フレームワークシーン生成2026/6/4
住宅全体のシーン生成を、フロアプラン生成、家具レイアウト生成、小物体配置の階層的フレームワークに分解し、大規模データとLLM、画像生成、VLMリファイナーを用いて制御可能かつシミュレーション可能なシーンを生成する手法を提案した。
- 階層的アドバンテージ重み付けによるスパースなエピソード結果からのVLAオンラインRL微調整VLA/強化学習2026/6/1
事前学習済みVLAポリシーをオンライン強化学習で微調整する際、エピソードごとの成功/失敗のみのスパースな報酬を、生存性と効率性の2つの目的に分離し、状態適応的に重み付けして遷移レベルの学習信号を生成する手法を提案した。
- OneVLA: 身体性タスクのための統一フレームワークVLA2026/6/1
ナビゲーションと操作を単一のフレームワークに統合したVLAモデルを提案し、タスク固有のアーキテクチャを不要にする統一アクションヘッドと多段階トレーニング戦略を導入。シミュレーションと実環境で最先端の性能を達成した。
- ACE-Ego-0: 自己中心視点の人間とロボットデータを統合したVLA事前学習VLA2026/6/1
ロボットの軌跡データ収集のコストを抑えるため、大規模な自己中心視点の人間ビデオを擬似行動ラベルに変換し、ロボットデータと統合してVLAモデルを事前学習するフレームワークを提案した。
- VLA初期化のためのVLM表現の再考VLA2026/5/25
VLAモデルの初期化に使う事前学習済みVLM表現の設計を、能力別のVQA教師信号・パラメータ更新戦略・ロボットデータ事前学習の3軸で分析し、元のVLM表現の保持が重要で、LoRAベースの段階的学習が最良であることを示した。
- DexJoCo: MuJoCo上でのタスク指向巧みな操作のためのベンチマークとツールキット巧みな操作2026/5/1
巧みなロボットハンドの操作能力を評価するための、11の機能ベースのタスクとデータ収集システムを含むベンチマークとツールキットを提案し、現代のモデルの性能を分析した。
- MindVLA-U1: 統合ストリーミングアーキテクチャによる自動運転向けVLAがVAを凌駕自動運転/VLA2026/5/1
自動運転向けに、言語トークンと連続アクション軌道を単一の共有表現で生成する初の統合ストリーミングVLAアーキテクチャを提案し、従来のVAモデルを上回る性能を実現した。
- 一緒に歩こう:人間中心の屋外支援のための長期的社会的ナビゲーションナビゲーション2026/4/1
高レベルの自然言語指示から屋外での長期的な社会的ナビゲーションを実現する、地図不要のフレームワークを提案。GPSと公開地図APIのPOIを用いて目的地を推定し、高レベルVLMと低レベルVLAを状況に応じて切り替えることで、安全で社会的に適切な移動を実現する。
- LMGenDrive: マルチモーダル理解と生成的ワールドモデルを統合したエンドツーエンド運転自動運転2026/4/1
本論文は、LLMベースのマルチモーダル理解と生成的ワールドモデルを統合した初のエンドツーエンド自動運転フレームワークLMGenDriveを提案し、将来の運転ビデオと制御信号を同時生成することで、長尾・オープンワールドシナリオへの一般化を向上させる。
- DrivingGen: 自動運転のための生成ビデオ世界モデルの包括的ベンチマーク自動運転/世界モデル2026/1/1
自動運転向けの生成ビデオ世界モデルを評価する初の包括的ベンチマークDrivingGenを提案し、多様なデータセットと新指標で14の最先端モデルを比較した。
- UAV-Flow Colosseo:言葉に反応して飛ぶUAV模倣学習の実世界ベンチマークVLA2025/5/1
言語指示に応じて短距離・反応的な飛行を行う「Flying-on-a-Word」タスクを定式化し、実世界データセット・制御フレームワーク・シミュレータを備えた初のベンチマークUAV-Flowを構築した。
- EnerVerse-AC: 行動条件付きで身体性環境を想像する世界モデル世界モデル2025/5/1
エージェントの予測行動から将来の視覚観測を生成する行動条件付き世界モデルを提案し、実機や複雑なシミュレーションなしでロボット模倣学習のデータ拡張と評価を可能にした。
- 敵対的データ収集:効率的でロバストなロボット模倣学習のための人間協調型摂動模倣学習2025/3/1
人間がリアルタイムで環境や指示を攪乱するHiL型データ収集法を提案し、少ないデモ数で模倣学習の汎化・ロバスト性・回復能力を大幅に向上させた。
- EnerVerse: ロボットマニピュレーションのための身体化未来空間の想像VLA2025/1/1
指示から未来の身体化空間を予測する生成ロボティクス基盤モデルを提案し、4Dガウススプラッティングと組み合わせてシミュレーションと実世界のギャップを縮め、高性能な操作を実現した。
- ZOPP: 自動運転のためのゼロショットオフボードパノプティック知覚フレームワーク自動運転/パノプティック知覚2024/11/1
視覚基盤モデルのゼロショット認識能力と点群の3D表現を統合し、自動運転シーンの多様な要素を自動ラベリングするマルチモーダルなパノプティック知覚フレームワークを提案した。
- SmartPretrain: モデル非依存・データセット非依存の運動予測のための表現学習運動予測2024/10/1
複数の運転データセットを統合し、対照学習と再構成学習を組み合わせた自己教師あり事前学習フレームワークを提案。モデルやデータセットに依存せず運動予測性能を向上させる。
- 現実的なUAV視覚言語ナビゲーションに向けて:プラットフォーム・ベンチマーク・手法VLA2024/10/1
UAV向けの視覚言語ナビゲーション(VLN)を現実的にするため、飛行制御を備えたOpenUAVプラットフォーム、約1.2万軌道のデータセット、補助情報付きベンチマークUAV-Need-Help、およびマルチモーダルLLMベースのナビゲーション手法を提案した論文。
- UniAff:視覚言語モデルによる道具使用と関節物体操作のためのアフォーダンス統合表現マニピュレーション2024/9/1
道具と関節物体の操作を統一的に扱うため、アフォーダンス認識と3D運動制約の推論を視覚言語モデルで行う手法UniAffを提案し、シミュレーションと実世界で汎化性能を向上させた。
- SKT: 状態認識キーポイント軌道と視覚言語モデルを統合したロボット衣類操作衣類操作/VLA2024/9/1
視覚言語モデル(VLM)を用いて、多様な衣類の状態を単一モデルで認識しキーポイントを予測することで、ロボットによる衣類操作を汎用的に実現する手法を提案した。大規模合成データで学習し、キーポイント検出精度とタスク成功率を向上させた。
- A3VLM: 動作可能な関節構造を理解する視覚言語モデルVLA2024/6/1
物体の関節構造と操作可能性を理解する視覚言語モデルを提案し、ロボットに依存しない表現から簡単な動作プリミティブでロボット動作に変換できることを示した。
- ManipVQA: マルチモーダル大規模言語モデルへのロボットアフォーダンスと物理的知識の注入VLA2024/3/1
ロボット操作に必要な道具検出・アフォーダンス認識・物理概念理解をVQA形式で学習させ、MLLMに操作中心の知識を注入するフレームワークを提案した。
- SmartRefine: シナリオ適応型の効率的な運動予測リファインメントフレームワーク運動予測2024/3/1
各シナリオの特性に応じてリファインメントの設定と反復回数を適応的に選び、最小限の追加計算で運動予測精度を向上させる汎用的な手法を提案。
- LMDrive: Closed-Loop End-to-End Driving with Large Language Models2023/12/1
- Instruct2Act: Mapping Multi-modality Instructions to Robotic Actions with Large Language Model2023/5/1
- Perception Imitation: Towards Synthesis-free Simulator for Autonomous Vehicles2023/4/1
- ConQueR: Query Contrast Voxel-DETR for 3D Object Detection2022/12/1
- Safety-Enhanced Autonomous Driving Using Interpretable Sensor Fusion Transformer2022/7/1
- 3D Object Detection for Autonomous Driving: A Comprehensive Survey2022/6/1
- RNNPose: Recurrent 6-DoF Object Pose Refinement with Robust Correspondence Field Estimation and Pose Optimization2022/3/1
- Robust Self-Supervised LiDAR Odometry via Representative Structure Discovery and 3D Inherent Error Modeling2022/2/1
- PointCLIP: Point Cloud Understanding by CLIP2021/12/1
- Progressive Correspondence Pruning by Consensus Learning2021/1/1
- SelfVoxeLO: Self-supervised LiDAR Odometry with Voxel-based Deep Neural Networks2020/10/1