Yu Qi
収録論文 10本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- Pix2Act: 等変オーグメンテーションを用いた画像空間操作ポリシーマニピュレーション2026/7/1
カメラ平面上の2D軌跡として操作行動を表現し、三角測量でエンドエフェクタの姿勢を復元する模倣学習手法を提案。観測と行動を同じ座標系に揃えることで等変変換を可能にし、汎化性能を向上させた。
- 戦略的スケールアップ:バイアス認識評価とデータ収集によるロボット操作の構成的汎化学習マニピュレーション2026/7/1
事前学習済みポリシーが指示の一部の要素(色など)に過剰に依存する「指示因子バイアス」を定量化する診断フレームワークを提案し、その結果に基づいてデータ収集を再配分することで、少ないデモ数で汎化性能を向上させる手法を示した。
- アクションマップポリシー:ピクセル分類による3D閉ループ操作の学習マニピュレーション2026/7/1
ロボットの操作行動をカメラ画像平面上のピクセル位置として分類問題に変換し、高次元で多峰性の行動を効率的に学習する手法を提案。拡散ポリシーより高速で高精度な推論を実現。
- WAM-RL: 再構成報酬とオンラインビデオSFTを用いたワールド・アクションモデル強化学習強化学習2026/6/1
ワールドモデルとアクションモデルをオンライン環境相互作用で共同最適化する強化学習フレームワークを提案し、長期的タスクでの性能向上を実証した。
- 触覚等変性を利用した残差回転補正触覚2025/11/1
触覚センサのSO(2)対称性を利用し、少ないデータで物体の回転を補正する等変ネットワークを提案。実機で未学習の把持姿勢にも汎化する。
- マルチモーダル言語モデルの身体性能力をスキル単位で評価・診断するベンチマークBEARVLA2025/10/1
身体性タスクを14の原子スキルに分解してMLLMを細粒度評価するベンチマークBEARを提案し、知覚と時空間モデリングがボトルネックであることを示すとともに、視覚・空間推論ツールを組み込んだBEAR-Agentで性能を改善した。
- 物体中心表現による汎化可能な階層的スキル学習マニピュレーション2025/10/1
物体中心のスキルプリミティブを介して視覚言語モデルと低次視覚運動ポリシーを橋渡しし、少ないデモでロボット操作の汎化とサンプル効率を大幅に向上させる階層的学習フレームワークを提案。
- EquAct: 開ループロボット操作のためのSE(3)同変マルチタスクトランスフォーママニピュレーション2025/5/1
言語条件付き3D操作ポリシーにSE(3)同変性を組み込み、シーン変換に対する空間汎化性能を向上させたマルチタスクトランスフォーマを提案。
- 2BY2:汎用ロボット操作のためのマルチタスクペア物体組立学習マニピュレーション2025/4/1
日常的なペア物体の組立タスク18種を含む大規模データセット2BY2を構築し、同変特徴を用いた2段階SE(3)姿勢推定法で高精度な組立を実現した。
- ThinkGrasp: 散乱環境での戦略的パーツ把持のための視覚言語システムマニピュレーション2024/7/1
GPT-4oの文脈推論を活用し、散乱環境で対象物を段階的に露出させて把持するプラグアンドプレイの視覚言語把持システムを開発した。