Zhenyang Liu
収録論文 8本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- WeaveLA: 反復ロボット操作のためのイベント駆動型サブタスク間潜在記憶の織り込みVLA/操作2026/6/16
VLAポリシーに、サブタスク完了イベントで圧縮した潜在記憶を次のサブタスクの行動生成に渡す軽量なクロスサブタスク記憶チャネルを追加し、反復操作の成功率を向上させた。
- VADF: 視覚適応型拡散ポリシーフレームワークによる効率的なロボット操作マニピュレーション2026/4/1
拡散ポリシーの学習収束の遅さと推論タイムアウト問題を解決するため、訓練時のサンプル難易度に応じた重み付けと、推論時の視覚に基づくタスク分割により、収束ステップ数を削減し早期成功率を向上させるフレームワークを提案した。
- ドリフトを未然に防ぐ:堅牢な視覚言語ナビゲーションのための遡及的修正視覚言語ナビゲーション2026/2/1
視覚言語ナビゲーションにおける模倣学習の誤差蓄積問題に対し、過去の有効な状態から修正軌道を合成するオンラインフレームワークBudVLNを提案し、R2R-CEとRxR-CEで最高性能を達成した。
- ActiveVLA: 能動的知覚を視覚-言語-行動モデルに統合した高精度3DロボットマニピュレーションVLA2026/1/1
静的な手首カメラに頼る従来のVLAモデルに対し、重要領域の特定と能動的な視点選択・3Dズームインを行う2段階の枠組みを導入し、長期的・微細な操作精度を向上させた。
- シュレーディンガーのナビゲーター:ゼロショット物体ナビゲーションのための未来集合の想像ナビゲーション2025/12/1
軌道条件付き3D世界モデルで複数の未来を想像し、不確実性を考慮してゼロショット物体ナビゲーションを行う手法を提案。
- LLM駆動の空間推論によるオープンボキャブラリ3D視覚グラウンディングのためのニューラル表現フレームワーク3D視覚グラウンディング2025/7/1
大規模言語モデルで言語クエリの空間関係を推論し、視覚特性を強化した階層的特徴場を構築することで、自由記述の指示から3D空間内の対象物体を高精度に特定する手法を提案。
- TriVLA: エピソード的世界モデリングを備えた三システム統合型視覚-言語-行動モデルによる汎用ロボット制御VLA2025/7/1
エピソード記憶の概念を取り入れ、VLMによるマルチモーダル理解と動画拡散モデルによる時系列予測、フローマッチングによる行動生成を統合した三システム構成のVLAモデルを提案し、実世界のマニピュレーションタスクで高い性能を示した。
- 時空間認識を組み込んだ視覚運動拡散ポリシー学習VLA2025/7/1
動的ガウス世界モデルを用いて3D空間・4D時空間認識を拡散ポリシーに組み込み、シミュレーションと実機で成功率を向上させた視覚模倣学習手法。