Jingjing Gong
Shanghai Innovation Institute
収録論文 18本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- ETA: 身体性タスクのための新しいエージェントパラダイムエージェントアーキテクチャ2026/8/4
ロボットのChatGPT的瞬間を目指し、プランナー・インターフェース・ワールドのループで構成される新しい身体性タスクエージェント(ETA)を提案し、オープンソース実装OpenETAを公開した。
- 「やる」前に「動く」を学ぶ:タスク非依存事前学習によるVLAモデルの効率化VLA2026/7/1
VLAモデルのデータ不足問題を解決するため、言語ラベル不要の自己教師あり逆動力学で運動プリエントを事前学習し、少量の専門家データで言語接地する2段階フレームワークTAPを提案。SIMPLERベンチマークで100万軌道の教師あり学習と同等性能を達成し、実機でも頑健性が向上した。
- HiMe: 長期的視覚言語行動制御のための階層的具現化メモリVLA2026/7/1
長期的なタスクで苦戦するVLAモデルに対し、実行・作業記憶・計画を分離した階層メモリフレームワークを提案し、成功率を向上させた。
- WCM: 視覚・言語・行動強化学習のためのワールドクリティックモデルVLA/強化学習2026/7/1
ロボット操作のためのVLAモデルの強化学習後訓練において、観測履歴を扱うクリティックの表現が時間的ダイナミクスを捉えられない問題を解決するため、将来の潜在状態を予測しつつ価値を推定する軽量なWorld Critic Modelを提案した。
- CoRE-VLA:条件付きエキスパートルーティングによるスケーラブルで堅牢な視覚言語行動モデリングVLA2026/7/1
センサ欠落や多様な構成に頑健なVLAモデルを提案し、センサ可用性とタスク意図に基づく条件付きスパース計算でエキスパートをルーティングする。
- 孤立したスキルから日常の物理的自律性へ:オムニモーダル具現化エージェントの前進VLA/自律エージェント2026/6/1
サイバー空間と物理空間を統合した行動空間、階層的記憶、非同期の視覚的割り込み検証を備えたフレームワークOmniActを提案し、実世界の長期タスクで性能とトークン効率を向上させた。
- ロボット制御のための文脈内世界モデリングVLA2026/6/1
ロボットポリシーが短い自己生成インタラクション履歴からシステム変数を推論し、新しいカメラ視点やロボット形態にパラメータ更新なしで適応するフレームワークを提案した。
- 粗から精密へ:視覚言語行動モデルのためのアクショントークン計画VLA2026/6/1
VLAモデルに、将来の軌道を要約する粗いアクショントークンの計画を導入し、その計画に基づいて実行用のアクショントークンを生成する方式を提案。長期的なタスクでの性能が向上した。
- シンプルにしよう:視覚言語行動モデルのための一段階行動生成VLA2026/6/1
視覚言語行動モデルにおける一段階行動生成の有効性を、条件とターゲットの構造に基づいて理論的・実験的に検証し、高ノイズ学習が一段階復号を向上させることを示した論文。
- 二つの橋、一つの道:身体化軌跡結合データによるVLMから汎用VLAへの変換VLA2026/6/1
視覚言語モデル(VLM)をロボット制御ポリシー(VLA)に変換する際のギャップを、ロボットの軌跡に基づく中間データ(ETCデータ)と3段階の訓練手法で段階的に橋渡しし、汎用性を高める手法を提案した論文。
- ワールドアクションモデル:身体化AIの次のフロンティアVLA/世界モデル/サーベイ2026/5/1
視覚言語行動モデルに世界モデルを統合した「ワールドアクションモデル」の概念を定義し、既存手法を分類・整理したサーベイ論文。
- ActionCodec:優れたアクショントークナイザの設計原則VLA2026/2/1
VLA最適化の観点から情報理論に基づく設計原則を導き、それに従う高性能アクショントークナイザActionCodecを提案。LIBEROでロボティクス事前学習なしにSOTAを達成。
- FRoM-W1: 言語指示による汎用人型全身制御フレームワークVLA2026/1/1
自然言語から人型ロボットの全身動作を生成・実行する2段階フレームワークを提案し、Unitree H1/G1で動作追従精度の向上を実証した。
- FASTer: ニューラル行動トークン化による効率的な自己回帰型視覚言語行動モデリングVLA2025/12/1
行動チャンクを単一チャネル画像として符号化する学習可能なトークナイザと、ブロック単位の自己回帰復号化を組み合わせ、推論速度とタスク性能を両立させたVLAフレームワークを提案。
- SRPO: VLAモデルのための自己参照方策最適化VLA2025/11/1
VLAモデルの強化学習において、成功軌道を自己参照として失敗軌道に進捗報酬を付与し、報酬の疎さを解消する手法を提案。LIBEROで99.2%の成功率を達成。
- LIBERO-Plus:視覚言語行動モデルの堅牢性に関する詳細分析VLA2025/10/1
VLAモデルのロバスト性を7つの摂動次元で体系的に評価し、見かけの性能の裏に隠れた脆弱性を明らかにした。
- RoboOmni: 全モーダル文脈における能動的ロボットマニピュレーションVLA2025/10/1
音声対話・環境音・視覚情報からユーザ意図を能動的に推論し、確認と動作実行までを統合した全モーダルLLMフレームワークRoboOmniを提案し、大規模データセットOmniActionで訓練して実機・シミュレーションで有効性を示した。
- 世界認識型プランニング物語による大規模視覚言語モデルプランナーの強化VLA2025/6/1
環境理解を4つの認知能力でLVLMに注入し、生の視覚観察のみで訓練するWAPを提案。EB-ALFREDで成功率が大幅に向上し、GPT-4oやClaude-3.5-Sonnetを凌駕した。