Heng Li
収録論文 8本 ・ フィジカルAI/ロボット学習
双腕操作VLAワールドモデルマニピュレーション
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 把持・受け渡し・回転:構成拡散とエネルギーベース最適化による双腕物体再配向双腕操作2026/7/1
双腕ロボットによる物体の再配向(把持、受け渡し、目標姿勢への配置)を、拡散モデルとエネルギーベース最適化を組み合わせて実現する手法を提案した。
- MaskWAM: マスクプロンプトと予測を統合したワールドアクションモデルVLA2026/6/11
ロボット制御のためのワールドアクションモデルに、マスクを入力と予測の両方に統合する手法を提案し、言語の曖昧さを低減して汎化性能を向上させた。
- ViPSim: 視覚空間とパラメータ空間の協調による一貫した長期ホライズン身体化ワールドモデルワールドモデル2026/6/1
身体化ワールドモデルにおける低次元アクションと高次元ビデオ合成の表現ギャップを埋めるため、視覚空間(幾何学的先行知識)とパラメータ空間(数値的駆動)を協調させるフレームワークViPSimを提案し、長期ロールアウトでの軌道ドリフトやロボットと物体の相互作用の不整合を改善した。
- STDArm: 静的データ学習の視覚運動ポリシーを動的ロボットマニピュレーションへ転移マニピュレーション2025/4/1
静的環境で学習した視覚運動ポリシーを、移動ロボット上でもそのまま使えるよう、リアルタイムの行動補正・安定化・遅延推定を組み合わせて動的マニピュレーションを実現したシステム。
- HA-VLN 2.0:動的な複数人環境における人間認識ナビゲーションのためのオープンベンチマークとリーダーボードVLA2025/3/1
離散・連続空間での人間認識型視覚言語ナビゲーションを統一評価するベンチマークを提案し、社会的制約を考慮したデータセット・シミュレータ・実機検証・リーダーボードを公開した。
- 人間を考慮した視覚言語ナビゲーション:動的な人間活動を組み込んだシミュレーションから現実への橋渡しVLA2024/6/1
動的な人間活動を取り入れたHA-VLNタスクを提案し、HA3DシミュレータとHA-R2Rデータセット、および2種類のエージェントを構築して、人間がいる環境でのナビゲーション性能を評価した。
- OCC-VO: Dense Mapping via 3D Occupancy-Based Visual Odometry for Autonomous Driving2023/9/1
- Dense RGB SLAM with Neural Implicit Maps2023/1/1