Yike Guo
収録論文 9本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- Token-World: 視覚言語モデルのトークン空間におけるロボット操作のための世界モデリングVLA2026/9/30
VLAモデルの視覚トークンを圧縮した状態空間で未来のダイナミクスを予測する世界モデルを提案し、操作ベンチマークで予測精度と方策整合性を向上させた。
- CoBrush:人間とロボットの協調絵画のための階層的計画フレームワークマニピュレーション2026/9/28
人間の意図が対話を通じて変化する中で、ロボットが共有キャンバス上で多ラウンドの協調絵画を実現する階層的フレームワークを提案し、実機実験で単一ターン手法より高い意味的整合性と空間的進行の安定性を示した。
- 潜在世界モデルにおける予測可能性の制御理論世界モデル2026/7/11
潜在世界モデルの予測誤差と制御性能の関係を理論的に分析し、データ平均誤差では制御性能を保証できないことを示し、計画コストの乖離に基づく新たな目的関数を提案した。
- Zero2Skill: 自律データ収集・訓練・展開によるロボットスキルのブートストラップマニピュレーション2026/7/1
人間の介入を減らしつつロボット操作スキルを自律的に学習するシステムを提案。修正を記憶して再利用することで、人間の作業時間を大幅に削減し、成功率を向上させた。
- 注意ハイジャック:視覚言語モデルにおけるクエリ横断的な応答操作敵対的攻撃/VLM2026/5/17
視覚言語モデルに対する敵対的攻撃で、単一の摂動が多様なユーザークエリに対して効果を維持する「クロスクエリ応答操作」を実現する手法を提案。内部の注意分布を画像優位なパターンに固定することで、クエリの文言への依存を減らし、転移性を向上させる。
- Wow, wo, val! 具現化世界モデル評価のためのチューリングテスト世界モデル評価2026/1/1
ロボット操作データ609件を用い、動画基盤モデルを世界モデルとして評価する5能力・22指標のベンチマークを提案し、人間の選好との相関0.93超を達成した。
- WoW: 身体性インタラクションを通じた世界全知モデルへの挑戦世界モデル2025/9/1
200万件のロボット操作軌道で学習した140億パラメータの生成的世界モデルを構築し、物理的因果推論を評価する新ベンチマークWoWBenchを提案した論文。
- MinD: リアルタイム計画と暗黙的リスク分析のためのデュアルシステム世界モデルの学習VLA2025/6/1
低頻度の映像生成と高頻度の拡散ポリシーを非同期に組み合わせ、単一ステップの潜在特徴でリアルタイムに行動計画とリスク予測を行う世界モデルを提案。
- EVA: 未来映像予測のための身体性世界モデル世界モデル2024/10/1
視覚言語モデルと映像生成モデルを組み合わせ、身体性シナリオでの多段階未来予測を可能にする世界モデルEVAとその評価ベンチマークEVA-Benchを提案した。