Shiduo Zhang
収録論文 11本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- G0.5: ロボットの推論と行動のための単一自己回帰ストリームVLA2026/8/1
単一のトランスフォーマーデコーダが推論トークンと行動トークンを同一の目的で生成する、事前学習済み自己回帰VLAモデルG0.5を提案。異なるロボットの行動を共有語彙に変換するトークナイザーや、チェーン・オブ・ソート、視覚メモリを導入し、複数のベンチマークでSOTAを達成。
- 二つの橋、一つの道:身体化軌跡結合データによるVLMから汎用VLAへの変換VLA2026/6/1
視覚言語モデル(VLM)をロボット制御ポリシー(VLA)に変換する際のギャップを、ロボットの軌跡に基づく中間データ(ETCデータ)と3段階の訓練手法で段階的に橋渡しし、汎用性を高める手法を提案した論文。
- シンプルにしよう:視覚言語行動モデルのための一段階行動生成VLA2026/6/1
視覚言語行動モデルにおける一段階行動生成の有効性を、条件とターゲットの構造に基づいて理論的・実験的に検証し、高ノイズ学習が一段階復号を向上させることを示した論文。
- 粗から精密へ:視覚言語行動モデルのためのアクショントークン計画VLA2026/6/1
VLAモデルに、将来の軌道を要約する粗いアクショントークンの計画を導入し、その計画に基づいて実行用のアクショントークンを生成する方式を提案。長期的なタスクでの性能が向上した。
- ActionCodec:優れたアクショントークナイザの設計原則VLA2026/2/1
VLA最適化の観点から情報理論に基づく設計原則を導き、それに従う高性能アクショントークナイザActionCodecを提案。LIBEROでロボティクス事前学習なしにSOTAを達成。
- FASTer: ニューラル行動トークン化による効率的な自己回帰型視覚言語行動モデリングVLA2025/12/1
行動チャンクを単一チャネル画像として符号化する学習可能なトークナイザと、ブロック単位の自己回帰復号化を組み合わせ、推論速度とタスク性能を両立させたVLAフレームワークを提案。
- SRPO: VLAモデルのための自己参照方策最適化VLA2025/11/1
VLAモデルの強化学習において、成功軌道を自己参照として失敗軌道に進捗報酬を付与し、報酬の疎さを解消する手法を提案。LIBEROで99.2%の成功率を達成。
- LIBERO-Plus:視覚言語行動モデルの堅牢性に関する詳細分析VLA2025/10/1
VLAモデルのロバスト性を7つの摂動次元で体系的に評価し、見かけの性能の裏に隠れた脆弱性を明らかにした。
- 世界モデリングでより良いプランナーへ:身体性タスク計画のための二重選好最適化VLA2025/3/1
視覚言語モデルによる身体性タスク計画において、状態予測と行動選択を選好学習で同時に最適化するD²POを提案し、人間の注釈なしで選好データを収集する木探索機構を導入した。
- VLABench: 長期的推論を伴う言語条件付きロボット操作のための大規模ベンチマークVLA2024/12/1
視覚言語行動モデル(VLA)向けに、世界知識や意図理解、多段階推論を要する100カテゴリ・2000以上の物体からなる言語条件付き操作タスクのベンチマークを構築した。
- Large Trajectory Models are Scalable Motion Predictors and Planners2023/10/1