Haosheng Li
収録論文 7本 ・ フィジカルAI/ロボット学習
マニピュレーションVLA3Dセマンティックセグメンテーション
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 橋渡し動作としての翻訳:人間からロボットへの操作スキル転移マニピュレーション2026/6/1
人間の動作データから双腕ロボットへの操作スキル転移を改善するため、頭部カメラ座標系での相対手首並進を橋渡し動作表現として用いる手法を提案し、ノイズの多い6DoF人間動作よりも効果的であることを示した。
- BFA++: マルチビュー視覚言語行動モデルのための階層的ベスト特徴認識トークンプルーニングVLA2026/2/1
VLAモデル向けに、視点内・視点間の2段階重要度予測で動的にトークンを削減し、マルチビュー入力の計算効率と操作成功率を両立させるフレームワークを提案した。
- 重なりを考慮した特徴学習による3Dセマンティックセグメンテーションのための堅牢な教師なしドメイン適応3Dセマンティックセグメンテーション2025/4/1
3D点群セマンティックセグメンテーションの教師なしドメイン適応において、特徴の重なりと構造侵食の問題に対処するため、反転可能な注意アライメントと品質認識コントラスティブ学習を組み合わせた手法を提案し、敵対的攻撃下での堅牢性を向上させた。
- BFA: マルチビュー細粒度マニピュレーションのための最良特徴量認識融合マニピュレーション2025/2/1
マルチビュー画像を用いた細粒度マニピュレーションにおいて、各視点の重要度を軽量ネットワークで予測し、再重み付けして融合するプラグアンドプレイ手法を提案。タスク成功率を22-46%向上させた。
- RoboMatrix: スキル中心の階層型フレームワークによるオープンワールドでのスケーラブルなロボットタスク計画と実行VLA2024/12/1
多様なタスクから汎用メタスキルを抽出し、LLMによるタスク分解と移動・操作を統合したVLAモデルで未見タスクを遂行するスキル中心の階層型ロボットフレームワークを提案した。
- Multi-GraspLLM:多様なロボットハンドのための意味誘導型把持生成マルチモーダルLLMマニピュレーション2024/12/1
自然言語指示に基づき、複数のロボットハンドに対応した把持姿勢を生成する統合フレームワークを提案し、接触注釈付き大規模データセットMulti-GraspSetを構築した。
- SegGrasp: セマンティック・幾何学誘導セグメンテーションによるゼロショットタスク指向把持マニピュレーション2024/10/1
視覚言語モデルと凸分解による幾何情報を組み合わせ、学習なしで対象物の機能部位を狙うゼロショット把持を実現したフレームワーク。