Jiangning Zhang
収録論文 5本 ・ フィジカルAI/ロボット学習
スマートグラス/一人称知能/サーベイ世界モデルビデオ生成VLA意味的占有予測
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 見ることから行動へ:スマートグラスを一人称知能プラットフォームとして捉えるスマートグラス/一人称知能/サーベイ2026/8/25
スマートグラスを、人間の知覚・文脈・行動をつなぐ一人称知能プラットフォームとして体系的に調査し、ハードウェア能力軸や基盤能力、L0-L5フレームワークを提案したサーベイ論文。
- ワールドモデリングはどこへ向かうのか?世界モデル2026/8/1
エージェントの継続的改善のための世界モデルの概念を、物理状態遷移からエージェント中心の情報遷移へと拡張し、6つのプロキシ形式と3つの活用レベルを提案する。
- MetaWorld: 単一視点ビデオデータからのマルチエージェントビデオワールドモデルのスケーリングビデオ生成2026/6/1
単一視点のビデオから、複数エージェントが共有する3D空間で一貫したビデオを生成するマルチエージェントビデオワールドモデルを提案した。カメラ軌跡分解とクロスアテンションによる世界状態整合で、データ不足と視点間の整合性問題を解決する。
- ImitDiff: 基盤モデルの事前知識を転移した妨害に頑健な視覚運動模倣ポリシーVLA2025/2/1
視覚言語基盤モデルで指示をピクセル単位の意味マスクに変換し、二重解像度の知覚と拡散トランスフォーマで妨害に強い模倣学習ポリシーを実現した。
- LiCROcc: LiDARとカメラでレーダーに正確な意味的占有予測を教える意味的占有予測2024/7/1
LiDARとカメラの融合特徴を蒸留することで、レーダー単独およびレーダー・カメラ設定での意味的シーン補完性能を大幅に向上させた研究。