Xiao-Ming Wu
収録論文 14本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- HATS: マルチアームデータ収集のための人間エージェント遠隔操作システム遠隔操作/データ収集2026/6/1
単一の人間オペレータがMLLMベースのエージェントの支援を受けながら、複数アームの操作データを収集できる遠隔操作システムを提案。2本の主アームを人間が直接操作し、2本の補助アームをエージェントが制御することで、専門家2人によるチームと同等の効率と成功率を達成した。
- タスク編集による汎用3D視覚運動ポリシー学習模倣学習2026/6/1
3D視覚運動ポリシーの学習効率を高めるため、タスクをシーン・スキル・オブジェクトに分解し再結合するデモ生成フレームワーク「Task-Edit」を提案した。実世界実験で、長期的操作タスクにおける汎化性能の向上を実証した。
- VLANeXt:強いVLAモデルを構築するためのレシピVLA2026/2/1
VLA設計空間を統一フレームワークで再検討し、12の知見をまとめた実践的レシピと、LIBEROなどでSOTAを上回るモデルVLANeXtを提案した論文。
- VividFace:ヒューマノイドロボットのためのリアルタイムでリアルな表情シャドウイングヒューマンロボットインタラクション2026/2/1
ヒューマノイドロボットが人間の表情をリアルタイムかつリアルに模倣するシステムVividFaceを提案。0.05秒以内の遅延で多様な表情を再現する。
- デュアルアクターポリシーによる分解型物体操作マニピュレーション2025/11/1
物体操作を接近と操作の段階に分け、それぞれに特化した2つのアクターと段階を選択する意思決定器を組み合わせたDual-Actor Policyを提案し、新規データセットで従来手法を上回る性能を示した。
- X2C: ヒューマノイドの繊細な表情模倣のための大規模ベンチマーク表情模倣2025/5/1
人間の表情をヒューマノイドの制御信号に変換するため、10万組の画像と制御値のペアからなる大規模データセットX2Cと、視覚特徴と機械制御を分離する二段階フレームワークX2CNetを提案した。
- iManip: ロボットマニピュレーションのためのスキル漸進学習マニピュレーション2025/3/1
ロボットが既存の知識を保持したまま新しい操作スキルを追加学習できるスキル漸進学習フレームワークiManipを提案し、時間的リプレイと拡張可能なPerceiverIOで破滅的忘却を抑制した。
- AffordDexGrasp: 開集合言語誘導巧みな把持のための汎化可能な指示的アフォーダンスマニピュレーション2025/3/1
言語指示から未知カテゴリの物体を巧みに把持するため、汎化可能なアフォーダンス表現を介して言語と把持動作を結びつけるフレームワークを提案し、開集合での汎化性能を実世界で示した。
- 両腕ロボット操作の再考:分離型インタラクションフレームワークによる学習マニピュレーション2025/3/1
両腕ロボット操作において、各腕に独立したモデルを割り当てつつ選択的インタラクションモジュールで協調動作も学習する分離型フレームワークを提案し、RoboTwinデータセットの7タスクでSOTAを23.5%上回る性能を達成した。
- Real-to-Sim把持:把持検出におけるシミュレーションと実世界のギャップの再考マニピュレーション2024/10/1
6-DoF把持検出において、実世界の深度画像を推論時にシミュレーション空間へ適応させるReal-to-SimフレームワークR2SGraspを提案し、カメラノイズの影響を回避して高精度な把持検出を実現した。
- UGotMe: 感情的人間-ロボットインタラクションのための身体性システム感情認識2024/10/1
多人数会話における感情認識のためのノイズ除去とリアルタイム応答を実現する人間-ロボットインタラクションシステムを提案。
- 6自由度把持検出のための経済的フレームワークマニピュレーション2024/7/1
高密度な教師信号が訓練コストのボトルネックであることを見出し、曖昧さの少ないラベルを選ぶ監督選択戦略と焦点表現モジュールにより、訓練時間・メモリ・ストレージを大幅に削減しつつ把持検出精度を向上させた。
- 言われたとおりに掴む:言語誘導による巧みな把持生成マニピュレーション2024/5/1
自然言語の指示に従ってロボットが巧みに把持を行うためのデータセットDexGYSNetと、意図に沿った高品質で多様な把持を生成するDexGYSGraspフレームワークを提案した。
- 巧みな把持のためのTransformerマニピュレーション2024/4/1
物体の点群から多様で実行可能な巧みな把持姿勢を1回の順伝播で予測するTransformerベースの枠組みを提案し、訓練とテストの段階的な工夫で把持の品質と多様性を向上させた。