Junhao Shi
収録論文 8本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 「やる」前に「動く」を学ぶ:タスク非依存事前学習によるVLAモデルの効率化VLA2026/7/1
VLAモデルのデータ不足問題を解決するため、言語ラベル不要の自己教師あり逆動力学で運動プリエントを事前学習し、少量の専門家データで言語接地する2段階フレームワークTAPを提案。SIMPLERベンチマークで100万軌道の教師あり学習と同等性能を達成し、実機でも頑健性が向上した。
- 孤立したスキルから日常の物理的自律性へ:オムニモーダル具現化エージェントの前進VLA/自律エージェント2026/6/1
サイバー空間と物理空間を統合した行動空間、階層的記憶、非同期の視覚的割り込み検証を備えたフレームワークOmniActを提案し、実世界の長期タスクで性能とトークン効率を向上させた。
- ロボット制御のための文脈内世界モデリングVLA2026/6/1
ロボットポリシーが短い自己生成インタラクション履歴からシステム変数を推論し、新しいカメラ視点やロボット形態にパラメータ更新なしで適応するフレームワークを提案した。
- ワールドアクションモデル:身体化AIの次のフロンティアVLA/世界モデル/サーベイ2026/5/1
視覚言語行動モデルに世界モデルを統合した「ワールドアクションモデル」の概念を定義し、既存手法を分類・整理したサーベイ論文。
- FASTer: ニューラル行動トークン化による効率的な自己回帰型視覚言語行動モデリングVLA2025/12/1
行動チャンクを単一チャネル画像として符号化する学習可能なトークナイザと、ブロック単位の自己回帰復号化を組み合わせ、推論速度とタスク性能を両立させたVLAフレームワークを提案。
- RoboOmni: 全モーダル文脈における能動的ロボットマニピュレーションVLA2025/10/1
音声対話・環境音・視覚情報からユーザ意図を能動的に推論し、確認と動作実行までを統合した全モーダルLLMフレームワークRoboOmniを提案し、大規模データセットOmniActionで訓練して実機・シミュレーションで有効性を示した。
- LIBERO-Plus:視覚言語行動モデルの堅牢性に関する詳細分析VLA2025/10/1
VLAモデルのロバスト性を7つの摂動次元で体系的に評価し、見かけの性能の裏に隠れた脆弱性を明らかにした。
- 世界認識型プランニング物語による大規模視覚言語モデルプランナーの強化VLA2025/6/1
環境理解を4つの認知能力でLVLMに注入し、生の視覚観察のみで訓練するWAPを提案。EB-ALFREDで成功率が大幅に向上し、GPT-4oやClaude-3.5-Sonnetを凌駕した。