Qize Yu
収録論文 10本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- UniWAM:統合された世界行動モデルVLA2026/10/1
物理推論・映像生成・行動予測を統合したモデルで、人間の一人称視点データとロボットデータを活用し、複数の評価でSOTAを達成した。
- GroundingPI:視覚プリミティブで物理知能に挑むグラウンディング基盤モデルVLA2026/9/30
点やボックスを量子化座標として生成する4Bのグラウンディング基盤モデルを提案し、ロボット操作や自動運転の視覚バックボーンとして性能を向上させた。
- GroundAnything: 並列デコーディングと高精度視覚グラウンディングをフラッシュ速度で両立視覚グラウンディング2026/9/30
拡散モデルによる並列デコーディングで視覚グラウンディングを高速化し、4Bモデルで同規模の最先端性能を達成した研究。
- AffordanceWAM: アフォーダンス認識型の世界行動統合モデリングによるロボットマニピュレーションVLA2026/9/16
人間とロボットの動画から物体中心のアフォーダンスを予測し、将来の映像とロボット行動を統合的に生成するモデルを提案。人間動画を活用してロボット操作の汎化性能を向上させた。
- OpenWAM: 体系的な世界行動モデル事前学習に向けたオープンでモジュール型の探求VLA2026/9/7
世界行動モデルの設計空間をモジュール化し、制御実験を通じて設計原則を抽出・検証するオープンな研究基盤を構築した。
- LD4WAM: 人間のビデオから潜在ダイナミクスを学習するワールドアクションモデルVLA2026/8/23
人間のビデオからロボットの行動に直接使える潜在ダイナミクスを学習し、将来のビデオ生成と行動条件付けを組み合わせたワールドアクションモデルを提案。5,000時間以上のデータで事前学習し、シミュレーションと実機で高い性能を達成。
- 信頼できる具現化知能に向けて:システムフレームワークと段階的信頼度レベル信頼性評価2026/7/1
具現化知能の信頼性を「持続的な安全な成功」と定義し、モデル・システム・エビデンス・展開の4層からなるフレームワークと段階的信頼度を提案する論文。
- AffordanceVLA:アフォーダンス認識による行動生成を強化する視覚言語行動モデルVLA/操作2026/6/4
視覚言語モデルとロボット制御の構造的ミスマッチを解消するため、アフォーダンス予測を中間表現として導入し、物体の接地・2D位置特定・3D幾何推論を段階的に行う統一フレームワークを提案した。
- SUGAR: 人間ビデオ駆動のスケーラブルな汎用ヒューマノイド移動操作学習フレームワーク移動操作2026/5/1
人間のビデオから不完全な動作プリエントを抽出し、物理ベースのリファイナーで修正してから、階層的な自律ポリシーに蒸留することで、タスク固有の報酬設計やテレオペレーションなしにヒューマノイドの移動操作スキルを学習するフレームワークを提案した。
- A3D: 双腕マニピュレーションによる適応的アフォーダンス組立マニピュレーション2026/1/1
家具組立のための双腕ロボットフレームワークA3Dを提案し、点群ベースの適応的アフォーダンス学習により多様な部品形状に対応した支持・安定化位置を特定する。