Haoxiang Ma
Shanghai AI Laboratory
収録論文 12本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- InternW0: 効率的な実世界インタラクションのための基盤的物理世界モデル世界モデル2026/9/23
上海AI Labが、視覚予測とロボット制御を非対称なvideo-actionアーキテクチャで統合した物理世界モデルInternW0を提案。約7,200時間のデータで学習し、化学合成やピペッティングなどの実世界タスクで評価した。
- Skel-WAM: 人間からロボットへの操作スキル転移を実現する手骨格条件付きワールドアクションモデル模倣学習/人間からロボットへの転移2026/9/18
人間とロボットの手の骨格を共通インターフェースとして用い、人間の動画とロボットの実演を統合学習することで、実機の双腕操作タスクの成功率を大幅に向上させた研究。
- XPolicyLab: ロボットポリシー評価と展開のための統一標準・オープンエコシステムロボットポリシー評価2026/8/1
ロボットポリシーの評価と展開を統一する標準規格とオープンエコシステムを提案し、N個のポリシーとM個の環境の接続コストをO(NM)からO(N+M)に削減した。
- InternVLA-A1.5: 理解・潜在予測・行動の統合による構成的汎化VLA2026/7/1
ロボット操作のための統一モデルで、事前学習済みVLMの意味理解とビデオ生成モデルの動的予測を活用し、将来予測を潜在コードのクエリ問題として再構成することで、実時間制御を維持しつつ構成的汎化を実現した。
- EBench: 汎用モバイル操作ポリシーの要素診断ベンチマーク/モバイル操作2026/6/1
単一の成功率スコアを超えて、汎用モバイル操作ポリシーの能力と汎化を多次元で診断するシミュレーションベンチマークを提案し、最新モデルの特性を明らかにした。
- GraspLDP:潜在拡散による汎化可能な把持ポリシーマニピュレーション2026/2/1
把持姿勢の事前知識を潜在拡散ポリシーに組み込み、模倣学習による把持の精度と物体・空間汎化性能を高める手法を提案。
- InternVLA-A1:ロボットマニピュレーションのための理解・生成・行動の統合VLA2026/1/1
シーン理解・視覚的予測・行動実行の3つの専門家をMixture-of-Transformersで統合したVLAモデルを提案し、実世界12タスクで既存手法を上回る性能を達成した。
- ドメイン事前知識による6自由度把持検出の汎化マニピュレーション2024/4/1
ロボット把持の物理的制約を正則化として学習に組み込み、接触スコアと投影接触マップで把持姿勢を補正することで、未知物体への6自由度把持検出の汎化性能を向上させた。
- グローバルからローカルへのRGB-D適応によるSim-to-Real把持検出sim2real2024/3/1
RGB-D把持検出のsim-to-real問題をドメイン適応として捉え、自己教師あり回転事前学習とグローバル・ローカルな特徴アラインメント、把持プロトタイプ適応によりシミュレーションから実環境への転移性能を向上させた研究。
- RGB-D Grasp Detection via Depth Guided Learning with Cross-modal Attention2023/2/1
- Towards Scale Balanced 6-DoF Grasp Detection in Cluttered Scenes2022/12/1
- Attention-Based Planning with Active Perception2020/12/1