Shen Zhao
収録論文 5本 ・ フィジカルAI/ロボット学習
VLAマニピュレーション4D点群認識
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- EWAM:統合身体モデルにおける創発的な深さ方向の専門化——意味理解から視覚的先読み、行動までVLA2026/9/30
行動中心の統合身体モデルEWAMを提案し、層ごとの監督なしに浅い層で意味、中間層で予測未来、深い層で行動に注意が向く創発的な深さ方向の専門化が生じることを示した。
- A1: 完全透過型オープンソースの適応的かつ効率的なトランケート型視覚言語行動モデルVLA2026/4/1
低コストで高スループットな推論を実現するため、事前学習済みVLMと適応的早期終了・層間トランケートフローマッチングを導入したVLAモデルA1を提案し、シミュレーションと実機でSOTA性能と推論コスト削減を達成した。
- EchoVLA: 宣言的記憶を統合した移動マニピュレーション向け視覚-言語-行動モデルVLA2025/11/1
人間の脳に着想を得たシーン記憶とエピソード記憶を組み合わせ、移動と操作を協調させるメモリ対応VLAモデルを提案し、大規模学習用ベンチマークMoManiも構築した。
- VidMan: ビデオ拡散モデルの暗黙的ダイナミクスを活用したロボットマニピュレーションマニピュレーション2024/11/1
ビデオ拡散モデルを2段階で訓練し、未来の視覚軌道予測で環境ダイナミクスを学習した後、逆ダイナミクスモデルに変換してロボット操作の行動予測精度を向上させた研究。
- VG4D: 視覚言語モデルを4D動画認識へ応用4D点群認識2024/4/1
視覚言語モデルの知識を4D点群エンコーダに転移し、改良したPSTNetで点群動画を効率的にモデル化することで、行動認識の精度を向上させた研究。