Kun Zhou
収録論文 6本 ・ フィジカルAI/ロボット学習
世界モデル画像検出VLASLAM
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- CausalWM:身体性世界モデルのための因果連鎖推論世界モデル2026/9/19
未来の映像予測の前に明示的な因果連鎖推論を行う16Bの身体性世界モデルを提案し、大規模動画事前学習・因果CoT中間学習・多目的RL事後学習の3段階で訓練して複数のベンチマークで最高性能を達成した。
- FACT: ツール使用軌跡をコンパイルしたAI生成画像検出のためのフォレンジックエージェント画像検出2026/9/5
AI生成画像を検出するために、画像に応じてフォレンジックツールを選択・実行するエージェントを学習する手法を提案。固定検出器ではなく、証拠が十分になるまでツールを呼び出し、進化・蒸留・洗練のパイプラインで高性能を達成した。
- 因果的にバイアス除去された潜在行動モデルによる身体的行動条件付き世界モデル世界モデル2026/7/1
未ラベル動画から潜在行動を推定する既存モデルは、背景など行動と無関係な要素を混入させる問題を抱える。本論文では、因果的バイアス除去フレームワークCD-LAMを提案し、身体中心の再構成・行動中心の対比学習・潜在空間較正により、制御可能で堅牢な潜在行動表現を実現した。
- シーンへのダイブ:焦点プラン生成による視覚言語意思決定における知覚ボトルネックの打破VLA2026/6/2
ロボット操作やナビゲーションなどの視覚言語意思決定タスクにおいて、VLMとVLAの知覚ボトルネック(視覚的幻覚)を軽減するため、粗から精への焦点プラン生成法SceneDiverを提案した。
- PAN: 汎用的で対話可能な長期的世界シミュレーションのための世界モデル世界モデル2025/11/12
LLMベースの潜在ダイナミクスと動画拡散デコーダを組み合わせ、言語で指定した行動に応じて多様な環境の未来を長期的にシミュレーションする世界モデルPANを提案。
- X-SLAM: 複素ステップ有限差分によるタスク指向最適化のためのスケーラブルな高密度SLAMSLAM2024/5/1
複素ステップ有限差分(CSFD)を用いて微分可能な高密度SLAMをリアルタイム化し、高次最適化によるカメラ再定位とロボット能動スキャンの精度・効率を向上させた研究。