Linfeng Zhang
Shanghai Jiao Tong University
収録論文 6本 ・ フィジカルAI/ロボット学習
VLAエージェントメモリ管理VLA/高速化空間推論
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 密なVLAポリシーをMoE化して軽量化する適応手法VLA2026/9/15
VLAポリシーのFFN層をMoEに変換し、ルータ統計に基づく動的なエキスパート無効化でLLMパラメータを40%削減しつつ性能を維持する手法を提案。
- MemForest: EventTree分割と段階的マージによる効率的なエージェントメモリ管理エージェントメモリ管理2026/9/8
エージェントの履歴メモリをイベント単位に分割し、最大全域木と冗長ノードの段階的マージで圧縮するフレームワークを提案。メモリ圧縮率50%で性能をほぼ維持しつつ、検索を高速化した。
- EgoGenesis: オンライン固定投影メモリとAction-3D RoPEによる自己中心的世界行動モデリングVLA2026/7/30
自己中心視点の操作ビデオを合成する世界行動シミュレータを提案し、生成データで実ロボットの汎化性能を向上させた。
- 効率的な視覚言語行動推論のための時間的冗長性の削減VLA/高速化2026/7/1
VLAモデルの推論遅延を減らすため、視覚エンコーディングと拡散サンプリングの時間的冗長性を削減するシステムレベルの高速化手法を提案。動的領域のみのトークン更新と2ステップの拡散サンプリングにより、性能を保ちつつ2倍以上の高速化を達成。
- OmniCoT:グローバルかつ多段階のパノラマ推論のためのベンチマーク空間推論2026/6/29
パノラマ画像におけるマルチモーダル大規模言語モデルの空間推論能力を評価・向上させるため、グローバルな証拠と多段階推論に焦点を当てたベンチマークOmniCoTを提案し、訓練データと評価データを整備した。
- dVLA: マルチモーダル連鎖推論を備えた拡散型視覚-言語-行動モデルVLA2025/9/1
視覚・言語・行動を単一の拡散目的関数で統合し、マルチモーダル連鎖推論を活用したVLAモデルdVLAを提案。LIBEROで96.4%の成功率を達成し、実機Frankaでも多段階計画を要するタスクに成功。