Hang Li
収録論文 25本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- VidAct: 物体中心の3D認識で野生動画からマニピュレーションを学習マニピュレーション2026/9/29
単眼の実世界動画から物体メッシュと運動を再構成し、残差軌道転移と物体中心の3D点群予測を組み合わせて、ゼロショットで実機展開可能なマニピュレーションポリシーを学習するフレームワーク。
- Lucida: 合成可能な実世界からシミュレーションへのシーン構築のための解析・生成・配置シーン構築2026/8/31
実室内シーンを編集可能なオブジェクト資産として復元するパイプラインを提案し、各ステップが実際の観測で確実に得られる情報のみを消費するよう再設計。VLMポリシーによるGUI操作でオブジェクト配置を閉ループで行う。
- マルチモーダルエージェントのためのタスク焦点型記憶マルチモーダルエージェント2026/5/29
マルチモーダルエージェントが環境から得る膨大な情報の中から、将来のタスクに有用な記憶を選択的に保持するための強化学習ベースのフレームワークTaskMemを提案する。
- Open-H-Embodiment:医療ロボティクスにおける基盤モデルを可能にする大規模データセット医療ロボティクス/データセット/基盤モデル2026/4/1
医療ロボットの自律化を妨げるデータ不足を解決するため、複数のロボットプラットフォームにわたる大規模な医療ロボットビデオと運動学データセットを公開し、基盤モデルの開発を実証した。
- ReMem-VLA: 二重レベル再帰クエリによる記憶を備えた視覚言語行動モデルVLA2026/3/1
視覚言語行動モデルに、フレーム単位とチャンク単位の再帰クエリを導入し、短期・長期記憶を実現。過去の観測予測を補助タスクとして追加し、記憶依存タスクで既存モデルを大幅に上回る性能を達成した。
- SIMART: MLLMによるモノリシックメッシュのシミュレーション対応関節アセットへの分解3Dアセット生成2026/3/1
静的メッシュを、物理シミュレーションに使える関節付き3Dアセットへ変換する統一MLLMフレームワークを提案。スパース3D VQ-VAEでトークン数を削減し、部品分解と関節予測を同時に行う。
- InternVLA-A1:ロボットマニピュレーションのための理解・生成・行動の統合VLA2026/1/1
シーン理解・視覚的予測・行動実行の3つの専門家をMixture-of-Transformersで統合したVLAモデルを提案し、実世界12タスクで既存手法を上回る性能を達成した。
- GR-RL:長期的器用マニピュレーションのための器用で精密なロボット学習マニピュレーション2025/12/1
人間のデモンストレーションをフィルタリング・拡張・強化学習で強化し、VLAポリシーを長期的で精密な器用マニピュレーションに特化させるフレームワークを提案。靴紐を穴に通して結ぶタスクを83.3%の成功率で自律的に達成。
- GR-Dexter 技術報告書VLA2025/12/1
両手デクスタラスハンドロボットで言語条件付き長期操作を実現するVLAフレームワークを提案し、ハードウェア・データ収集・学習手法を統合した。
- Robix: ロボットの対話・推論・計画を統合する統一モデルVLA2025/9/1
視覚言語モデル1つでロボットの高レベル推論・タスク計画・自然言語対話を担い、低レベル制御への指令生成と人間との対話を統合的に実現するモデルを提案。
- GR-3 汎用ロボットポリシー構築に向けた大規模VLAモデルVLA2025/7/1
ウェブ規模の視覚言語データとVR収集の人間軌道データ、ロボット軌道データを組み合わせて訓練した大規模VLAモデルGR-3を開発し、両腕移動ロボットByteMiniと統合して新規物体・環境・長期タスクへの汎化性能を示した。
- 人間の動作リターゲティングによる20自由度ByteDexterハンドの巧みなテレオペレーションテレオペレーション2025/7/1
20自由度のロボットハンドと腕のテレオペレーションシステムを開発し、人間の手の動きをリアルタイムで高忠実に再現することで、巧みな操作のデモデータを生成できることを示した。
- Astra:階層型マルチモーダル学習による汎用移動ロボットの実現移動ロボットナビゲーション2025/6/1
マルチモーダルLLMとマルチタスクネットワークを組み合わせた二重モデルアーキテクチャにより、多様な屋内環境で移動ロボットのナビゲーションを実現した。
- GR-2: ウェブ規模の知識を持つ生成型ビデオ・言語・行動モデルによるロボットマニピュレーションVLA2024/10/1
3800万本のインターネット動画で事前学習した大規模モデルをロボット軌道で微調整し、100以上のタスクで平均97.7%の成功率と未知環境への高い汎化性能を実現した。
- 見てから動く:ロボットマニピュレーションのための非同期能動視覚・行動モデルマニピュレーション2024/9/1
限られた視野や遮蔽に対処するため、カメラの次の最適視点(NBV)とグリッパの次の最適姿勢(NBP)を直列に繋ぎ、少数ショット強化学習で訓練する能動視覚・行動モデルを提案し、RLBenchの視点制約タスクで有効性を示した。
- 言語誘導型オブジェクト中心拡散ポリシーによる汎化可能で衝突回避を考慮したロボットマニピュレーションマニピュレーション2024/7/1
言語指示と物体中心の3D点群を条件とする拡散ポリシーを学習し、推論時にコスト最適化を組み込むことで、未見環境でも衝突回避しながら操作を実現する手法を提案。
- モジュール型再構成可能UAVの飛行構造最適化群制御2024/7/1
重さや慣性が異なるモジュール型ドローンの群れを、遺伝的アルゴリズムで過駆動な飛行構造に再構成し、軌道追従精度を保ちつつ計算コストを削減した。
- DexGANGrasp: タスク指向操作のための巧みな生成的敵対的把握合成マニピュレーション2024/7/1
単一視点からリアルタイムに巧みな把持を生成・評価するGANベースの手法を提案し、MLLM/VLMと組み合わせてタスク指向把持を実現した。
- 閉ループLLMプランナのための不確実性ベース失敗検出の評価VLA2024/6/1
MLLMの不確実性をトークン確率・エントロピー・自己申告信頼度で定量化し、閉ループLLMプランニングの失敗検出精度を比較評価した。
- 音声からアニマトロニクスロボットの表情を駆動する表情生成2024/3/1
線形ブレンドスキニング(LBS)を共通表現として用い、音声入力からアニマトロニクスロボットのリアルな表情をリアルタイム生成する手法を提案した論文。
- Unleashing Large-Scale Video Generative Pre-training for Visual Robot Manipulation2023/12/1
- Vision-Language Foundation Models as Effective Robot Imitators2023/11/1
- Aggregating Single-wheeled Mobile Robots for Omnidirectional Movements2023/8/1
- Sequential Manipulation Planning for Over-actuated Unmanned Aerial Manipulators2023/6/1
- Sensor Network Based Collision-Free Navigation and Map Building for Mobile Robots2017/9/1