Yandong Guo
AI2 Robotics
収録論文 23本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- DexPolicy: 軌道誘導型巧みな操作のためのスケジュール探索マニピュレーション2026/9/30
強化学習による巧みな操作において、探索ノイズを訓練ステップに応じて徐々に減衰させるスケジュールを導入し、PPO・GRPO・FPOの3手法で成功率を大幅に向上させた。
- SEES: 失敗から自己進化するVLAポリシー適応システムVLA2026/9/26
長期的タスクで失敗するVLAポリシーを、専門家の追加デモなしに自己改善するシステム。失敗した原子スキルを自動検出し、シミュレーションでRL学習してポリシーを進化させる。
- DeltaWAM: 双腕マニピュレーションのためのデルタ世界行動モデルマニピュレーション2026/9/23
映像の変化分(デルタ)と行動を同時に予測する世界行動モデルを提案し、双腕ロボット操作の成功率と推論速度を向上させた。
- 抑制は効くが局所性は脆い:VLAポリシーにおけるタスクベクトル否定の閉ループ標的・制御監査VLA2026/8/1
マルチタスクの視覚言語行動(VLA)ポリシーからタスクベクトルを引き算したときの挙動を、全10スキルで監査し、抑制可能・抵抗・全崩壊の3つの様式があることを示した。
- 視覚言語行動モデルは自己受容状態をどう使うべきかVLA2026/8/1
VLAモデルにおけるロボットの自己受容状態の入力方法(テキスト、プレフィックス、直接入力など)と履歴長が性能に与える影響を、制御実験で体系的に比較し、設計原則を導出した論文。
- フローマッチング不確実性の幾何学:コスト不要の不確実性プロキシとフローベースVLA故障検出への応用VLA2026/7/30
フローマッチング生成モデルの不確実性を速度場の幾何学的性質から捉え、追加コストなしで計算できる不確実性プロキシ(denoising acceleration)を提案し、オンライン故障検出に応用した。
- 介入可能なマルチモーダル模倣のためのソースリフトフローマッチング模倣学習2026/7/1
フローマッチングポリシーに介入可能なハンドルを導入し、ユーザーが同じ状態から複数の有効な行動を選択できるようにする手法を提案した。
- TACO: 触覚を考慮した世界モデルによるスケーラブルなVLAポストトレーニングの自己修正VLA/触覚/操作2026/7/1
接触を伴う操作タスクで失敗するVLAモデルに対し、触覚を考慮した世界モデルを用いて失敗状態を認識し、修正動作を想像・ラベル付けすることで、人間の介入なしにポリシーを改善するフレームワークを提案した。
- Lift3D-VLA: 3次元幾何と動力学を考慮した操作のためのVLAモデルのリフティングVLA/操作2026/7/1
VLAモデルに明示的な3次元点群推論と時間的に一貫した行動生成を組み込む統一フレームワークを提案。2Dモデルを3Dに持ち上げる戦略と自己教師あり学習で幾何と物理ダイナミクスを内部化し、LLMの多層で行動チャンクを予測する。
- GeneralVLA-2: 幾何認識再構成と管理されたメモリによるロボット計画VLA2026/6/16
ロボットの軌道計画のための視覚言語行動モデルを改善し、3D再構成の精度向上と長期メモリの品質管理を実現した。
- PHASER: 位相認識と意味的経験再生による視覚言語行動モデルの継続学習継続学習/VLA2026/6/2
視覚言語行動モデルの継続学習における破滅的忘却を防ぐため、操作軌道の位相(サブスキル)に注目した経験再生手法PHASERを提案。位相ごとのメモリ割り当てと忘却リスクに基づく動的優先付けで、LIBEROベンチマークで最大31%の成功率向上を達成した。
- MotionVLA: ヒューマノイド動作のための視覚・言語・行動モデル動作生成2026/6/1
シーン画像とテキストから現実的なヒューマノイド動作を生成するため、動作を基本ストリームと物理ストリームに分離し、DCTとBPEで独立に圧縮する二重ストリーム周波数トークナイザを提案し、軽量な2Bバックボーンで多様性と一貫性を向上させた。
- 視覚言語行動モデルにおける視野外操作のための空間記憶VLA2026/5/1
視覚言語行動モデルに、可動カメラの多視点観測から構築した空間記憶を組み込み、視野外の物体操作を可能にするフレームワークSOMAを提案した。
- 脳に着想を得た身体性知能による流動的で高速な反射的ロボティクス制御VLA2026/1/1
皮質・小脳・脊髄の構造を模したニューロモーフィックVLAを実機ロボットに初めて実装し、腕の振動抑制や20ms未満の安全反射、時間記憶を実現した。
- Video2Act: ロボットの時空間運動モデリングを備えた二重システム動画拡散ポリシーVLA2025/12/1
動画拡散モデルから前景境界とフレーム間運動を抽出して行動生成の条件に使い、低速なSystem 2と高速なSystem 1の非同期二重構成でロボット操作を高精度化した研究。
- PosA-VLA: 姿勢条件付きアンカー注意による行動生成の強化VLA2025/12/1
VLAモデルの視覚注意を姿勢情報で誘導し、タスクに関連する領域に集中させることで、冗長な動きを抑え精密で効率的な行動生成を実現した研究。
- RoboCOIN: 統合マニピュレーションのためのオープンソース両腕ロボットデータ収集マニピュレーション2025/11/1
15種類のロボットプラットフォームから18万件以上の両腕操作デモを集めた大規模データセットを構築し、階層的な注釈とデータ処理パイプラインを提供した。
- SURPRISE3D: 複雑な3Dシーンにおける空間理解と推論のためのデータセット3D空間推論2025/7/1
物体名に頼らず空間関係のみを問う20万件超の視覚言語ペアを構築し、3Dシーンでの空間推論を評価するベンチマークを提案した。
- Fast-in-Slow:高速操作と低速推論を統合するデュアルシステム基盤モデルVLA2025/6/1
VLMベースの推論システムに実行モジュールを部分的にパラメータ共有して組み込み、高速かつ精密なロボット操作を実現する統合型VLAモデルを提案。
- A Real-Time Fusion Framework for Long-term Visual Localization2022/10/1
- BANet: Motion Forecasting with Boundary Aware Network2022/6/1
- Pose Refinement with Joint Optimization of Visual Points and Lines2021/10/1
- Retrieval and Localization with Observation Constraints2021/8/1