Xinqiang Yu
Galbot
収録論文 9本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- UniPart: 実世界インタラクションのためのゼロショット言語接地3Dパーツセグメンテーション3Dセグメンテーション2026/9/11
自由なテキスト指示から点群上の機能パーツを切り出すクロスモーダル3D Transformerを提案し、大規模データセット構築によりゼロショット性能と実機把持への転移を実現した。
- HumanTracker:人間の知覚に整合した包括的なモーション追跡ベンチマークモーション追跡2026/8/1
ヒューマノイドのモーション追跡評価を人間の知覚に整合させ、大規模化するためのベンチマークと評価指標を提案した論文。
- DA-Nav: 方向認識型の都市規模視覚言語ナビゲーションナビゲーション2026/7/1
市街地規模の屋外ナビゲーションを、商用ナビの方向指示を利用して、自己中心視画像上の離散的な空間接地問題として再構成し、軌道回復を可能にするフレームワークを提案した。
- Humanoid-GPT: データと構造のスケーリングによるゼロショット動作追跡全身制御2026/6/1
大規模な動作コーパスで事前学習したGPTスタイルのTransformerを用いて、人型ロボットの全身制御とゼロショット動作追跡を実現した論文。
- LIMMT: モーショントラッキングには少ない方が良いモーショントラッキング2026/6/1
物理ベースのヒューマノイドモーショントラッキングにおいて、データ品質(物理的実現可能性、多様性、複雑さ)に基づいてデータを選別することで、全データセットの3%未満のデータでより良い追跡性能を達成できることを示した初のデータ中心的研究。
- DexVLG: 大規模巧みな視覚-言語-把持モデルマニピュレーション2025/7/1
単視点RGBD入力から言語指示に沿った巧みな手の把持姿勢を予測する大規模モデルを提案し、1.7億の把持データで学習してゼロショット汎化性能を実証した。
- DreamVLA: 包括的な世界知識を夢見る視覚-言語-行動モデルVLA2025/7/1
動的・空間・意味情報を統合した世界知識予測により逆動力学モデリングを行い、知覚-予測-行動ループを実現する新しいVLAフレームワークを提案。
- SoFar: 言語に基づく物体の向きが空間推論と物体操作を橋渡しするVLA2025/2/1
自然言語で物体の向きを定義する「意味的向き」を導入し、大規模データセットとゼロショット予測モデルを構築して、6自由度の空間推論とロボット動作生成を可能にした。
- DexGraspNet 2.0:大規模合成乱雑シーンでの生成的器用把持の学習マニピュレーション2024/10/1
1319物体・8270シーン・4億2700万把持からなる大規模合成ベンチマークを構築し、局所形状を条件とする拡散モデルによる二段階把持手法を提案。乱雑シーンでの実世界把持成功率90.7%を達成。