Jinliang Zheng
収録論文 14本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- Cortex: 長期的操作のための双方向整合型具現化エージェントフレームワークVLA/操作2026/7/1
高レベルVLMと低レベルVLAの間の計画ギャップを埋めるため、32の標準スキルプリミティブと実行可能性原則を導入し、4k時間以上のビデオデータと30時間のシミュレーションデータを自動生成して、長期的操作タスクを改善するフレームワークを提案した。
- X-Tokenizer: 視覚・言語・行動事前学習のためのマルチモーダル行動トークナイザーVLA2026/6/1
ロボットの行動を離散コードに変換する際、単なる再構成ではなく意味的なインターフェースとして学習する新しいトークナイザーを提案。マスク行動モデリングと対照学習により、行動コードが視覚言語の意味と整合するようにした。
- EBench: 汎用モバイル操作ポリシーの要素診断ベンチマーク/モバイル操作2026/6/1
単一の成功率スコアを超えて、汎用モバイル操作ポリシーの能力と汎化を多次元で診断するシミュレーションベンチマークを提案し、最新モデルの特性を明らかにした。
- StarVLA-α: 視覚言語行動システムの複雑さを低減するVLA2026/4/1
VLAモデルの設計選択を制御条件下で研究するため、複雑さを最小限に抑えたシンプルなベースラインStarVLA-αを提案し、複数ベンチマークで高い性能を達成した。
- ロボットマニピュレーション方策のための行動空間設計の謎を解くマニピュレーション2026/2/1
双腕ロボットでの大規模実験により、模倣学習における行動空間の設計(絶対vs差分、関節空間vsタスク空間)が方策の学習性と制御安定性に与える影響を体系的に分析した。
- フローマッチングに基づく対話行動モデリングを用いた自動運転プランニング自動運転プランニング2025/10/1
複雑な運転シーンでの対話行動をモデル化するため、軌道の細分化とフローマッチングを組み合わせたプランナーを提案し、大規模データセットで評価した。
- X-VLA:ソフトプロンプト付きTransformerによるスケーラブルなクロスエンボディメント視覚言語行動モデルVLA2025/10/1
多様なロボットのデータ源ごとに学習可能なソフトプロンプトを割り当てることで、異なる機体を横断して学習できる汎用VLAモデルX-VLAを提案し、6つのシミュレーションと3体の実機でSOTA性能を示した。
- PhysiAgent: 実世界で動作する身体性エージェントフレームワークVLA2025/9/1
VLMとVLAを監視・記憶・自己反省機構とツールボックスで統合し、VLAの能力を最大限に引き出す身体性エージェントフレームワークを提案。複雑な実世界ロボットタスクでの性能向上を実証した。
- 潜在空間後方計画による効率的なロボット政策学習ロボット計画2025/5/1
最終目標から逆算して潜在空間で中間サブゴールを予測する後方計画手法を提案し、長期的なタスクにおけるリアルタイム制御を効率化した。
- ユニバーサルアクションによる具現化基盤モデルの強化VLA2025/1/1
多様なロボットの動作を共通の「ユニバーサルアクション空間」で表現し、異なる機体間でのデータ活用と汎化性能を高める具現化基盤モデルUniActを提案。0.5Bパラメータで14倍規模の既存モデルを上回る。
- 柔軟なガイダンスを備えた拡散ベース自動運転プランニング自動運転計画2025/1/1
Transformerベースの拡散モデルで自動運転の閉ループ計画を行い、予測と計画を統合しつつ分類器ガイダンスで安全かつ適応的な軌道生成を実現した研究。
- Robo-MUTUAL: 単一モーダル学習によるロボットのマルチモーダルタスク指示VLA2024/10/1
単一モーダルの指示データを活用し、クロスモーダルアライメントを事前学習とCollapse/Corrupt操作で強化することで、ロボットがマルチモーダルなタスク指示を理解できるフレームワークを提案。
- 指示誘導型ビジュアルマスキングVLA2024/5/1
指示に関係ない画像領域をマスクすることで、マルチモーダルモデルが指示に沿った領域に注目できるようにする手法を提案し、VQAやロボット制御で性能を向上させた。
- DecisionNCE: 暗黙的選好学習による身体性マルチモーダル表現VLA2024/2/1
視覚軌跡と言語指示の対応を暗黙的選好として扱い、Bradley-Terryモデルを再パラメータ化することで、タスク進捗と時間的一貫性、言語接地を同時に学習する統合表現学習フレームワークを提案した。