Jianke Zhang
収録論文 8本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- UAM: VLA訓練における忘却問題への二経路視点からのアプローチVLA2026/5/15
VLAモデルがVLMのマルチモーダル能力を失う「身体化税」問題を、生物学的視覚の二経路構造に着想を得て、並列な背側経路(Dorsal Expert)を追加するUAMを提案し、忘却を抑えつつ操作性能を向上させた。
- Veo-Act: 最先端ビデオモデルはどこまで汎用ロボット操作を前進させられるか?操作2026/4/1
ビデオ生成モデルVeo-3を高次プランナーとして使い、低次実行にはVLAポリシーを用いる階層的フレームワークVeo-Actを提案し、操作性能を向上させた。
- BagelVLA: 視覚・言語・行動の交互生成による長期的マニピュレーションの強化VLA2026/2/1
言語計画と視覚予測を行動生成ループに交互に組み込み、長期的なロボット操作タスクの性能を高める統合モデルを提案した。
- UniJEPA:連続・離散表現の統合学習によるロボットポリシーの強化VLA2025/10/1
100万件超の操作動画で視覚表現を事前学習し、ロボット実機データで微調整することで、予測表現から行動トークンへのマッピングを学習する汎用ロボットポリシー手法を提案。
- オンライン強化学習による視覚言語行動モデルの改善VLA2025/1/1
大規模視覚言語行動モデルをオンライン強化学習で改善する際の不安定性と計算負荷に対処するため、強化学習と教師あり学習を交互に繰り返すiRe-VLAフレームワークを提案し、シミュレーションと実機で有効性を検証した。
- 動画予測ポリシー:予測的視覚表現を持つ汎用ロボットポリシーVLA2024/12/1
動画拡散モデルが持つ未来予測的な視覚表現を活用し、ロボット操作のための汎用ポリシーを学習する手法を提案。Calvinベンチマークと実世界の巧緻操作で大幅な性能向上を達成した。
- 行動予測と画像予測の統合拡散過程による視覚ポリシー学習VLA2024/11/1
画像予測とロボット行動生成を同一の拡散過程で統合し、将来画像と行動を同時に予測する視覚ポリシー学習フレームワークPADを提案。Metaworldベンチマークで26.3%の相対改善を達成。
- HiRT: 階層型ロボットトランスフォーマーによるロボット制御の強化VLA2024/10/1
大規模VLAモデルの計算コストと遅延を抑えるため、低頻度のVLMと高頻度の視覚ポリシーを組み合わせた階層型トランスフォーマーを提案し、動的タスクの成功率を向上させた。