Siyin Wang
収録論文 13本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- WCM: 視覚・言語・行動強化学習のためのワールドクリティックモデルVLA/強化学習2026/7/1
ロボット操作のためのVLAモデルの強化学習後訓練において、観測履歴を扱うクリティックの表現が時間的ダイナミクスを捉えられない問題を解決するため、将来の潜在状態を予測しつつ価値を推定する軽量なWorld Critic Modelを提案した。
- 「やる」前に「動く」を学ぶ:タスク非依存事前学習によるVLAモデルの効率化VLA2026/7/1
VLAモデルのデータ不足問題を解決するため、言語ラベル不要の自己教師あり逆動力学で運動プリエントを事前学習し、少量の専門家データで言語接地する2段階フレームワークTAPを提案。SIMPLERベンチマークで100万軌道の教師あり学習と同等性能を達成し、実機でも頑健性が向上した。
- HiMe: 長期的視覚言語行動制御のための階層的具現化メモリVLA2026/7/1
長期的なタスクで苦戦するVLAモデルに対し、実行・作業記憶・計画を分離した階層メモリフレームワークを提案し、成功率を向上させた。
- 孤立したスキルから日常の物理的自律性へ:オムニモーダル具現化エージェントの前進VLA/自律エージェント2026/6/1
サイバー空間と物理空間を統合した行動空間、階層的記憶、非同期の視覚的割り込み検証を備えたフレームワークOmniActを提案し、実世界の長期タスクで性能とトークン効率を向上させた。
- ロボット制御のための文脈内世界モデリングVLA2026/6/1
ロボットポリシーが短い自己生成インタラクション履歴からシステム変数を推論し、新しいカメラ視点やロボット形態にパラメータ更新なしで適応するフレームワークを提案した。
- 粗から精密へ:視覚言語行動モデルのためのアクショントークン計画VLA2026/6/1
VLAモデルに、将来の軌道を要約する粗いアクショントークンの計画を導入し、その計画に基づいて実行用のアクショントークンを生成する方式を提案。長期的なタスクでの性能が向上した。
- ワールドアクションモデル:身体化AIの次のフロンティアVLA/世界モデル/サーベイ2026/5/1
視覚言語行動モデルに世界モデルを統合した「ワールドアクションモデル」の概念を定義し、既存手法を分類・整理したサーベイ論文。
- SRPO: VLAモデルのための自己参照方策最適化VLA2025/11/1
VLAモデルの強化学習において、成功軌道を自己参照として失敗軌道に進捗報酬を付与し、報酬の疎さを解消する手法を提案。LIBEROで99.2%の成功率を達成。
- RoboOmni: 全モーダル文脈における能動的ロボットマニピュレーションVLA2025/10/1
音声対話・環境音・視覚情報からユーザ意図を能動的に推論し、確認と動作実行までを統合した全モーダルLLMフレームワークRoboOmniを提案し、大規模データセットOmniActionで訓練して実機・シミュレーションで有効性を示した。
- LIBERO-Plus:視覚言語行動モデルの堅牢性に関する詳細分析VLA2025/10/1
VLAモデルのロバスト性を7つの摂動次元で体系的に評価し、見かけの性能の裏に隠れた脆弱性を明らかにした。
- 聴き・見・話し・行動する統合モデルELLSAVLA2025/10/1
視覚・テキスト・音声・行動を単一アーキテクチャで同時に知覚・生成する全二重エンドツーエンドモデルを提案し、対話と行動の割り込みや発話しながらの行動などを実現した。
- 世界認識型プランニング物語による大規模視覚言語モデルプランナーの強化VLA2025/6/1
環境理解を4つの認知能力でLVLMに注入し、生の視覚観察のみで訓練するWAPを提案。EB-ALFREDで成功率が大幅に向上し、GPT-4oやClaude-3.5-Sonnetを凌駕した。
- 世界モデリングでより良いプランナーへ:身体性タスク計画のための二重選好最適化VLA2025/3/1
視覚言語モデルによる身体性タスク計画において、状態予測と行動選択を選好学習で同時に最適化するD²POを提案し、人間の注釈なしで選好データを収集する木探索機構を導入した。