Kuangzhi Ge
収録論文 7本 ・ フィジカルAI/ロボット学習
VLAVLA/世界モデルデータ収集/身体化AI世界モデル評価世界モデル
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- Token-World: 視覚言語モデルのトークン空間におけるロボット操作のための世界モデリングVLA2026/9/30
VLAモデルの視覚トークンを圧縮した状態空間で未来のダイナミクスを予測する世界モデルを提案し、操作ベンチマークで予測精度と方策整合性を向上させた。
- TrAct: ロボット制御と視覚予測を視覚トラックで橋渡しするVLA/世界モデル2026/8/25
ロボットの行動と画像変化の弱い対応を補うため、視覚トラックを中間表現として用いる世界モデルベースの意思決定フレームワークTrActを提案。シミュレーションと実機で成功率を大幅に向上させた。
- 身体化操作のためのデータピラミッド:サーベイデータ収集/身体化AI2026/7/1
実ロボットデータからシミュレーションデータまで、身体化エージェントの学習に使われる5つのデータ源をピラミッド構造で整理し、各データの特性と組み合わせ方を分析したサーベイ論文。
- TC-IDM: 実行可能なゼロショットロボット動作のための動画生成の接地VLA2026/1/1
生成された動画から道具の3D軌道を抽出し、それを6自由度のエンドエフェクタ動作に変換する逆動力学モデルを提案。ゼロショットで変形物体操作を含むタスクを実現した。
- Wow, wo, val! 具現化世界モデル評価のためのチューリングテスト世界モデル評価2026/1/1
ロボット操作データ609件を用い、動画基盤モデルを世界モデルとして評価する5能力・22指標のベンチマークを提案し、人間の選好との相関0.93超を達成した。
- WoW: 身体性インタラクションを通じた世界全知モデルへの挑戦世界モデル2025/9/1
200万件のロボット操作軌道で学習した140億パラメータの生成的世界モデルを構築し、物理的因果推論を評価する新ベンチマークWoWBenchを提案した論文。
- MinD: リアルタイム計画と暗黙的リスク分析のためのデュアルシステム世界モデルの学習VLA2025/6/1
低頻度の映像生成と高頻度の拡散ポリシーを非同期に組み合わせ、単一ステップの潜在特徴でリアルタイムに行動計画とリスク予測を行う世界モデルを提案。