Yinan Zheng
収録論文 18本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- X-Tokenizer: 視覚・言語・行動事前学習のためのマルチモーダル行動トークナイザーVLA2026/6/1
ロボットの行動を離散コードに変換する際、単なる再構成ではなく意味的なインターフェースとして学習する新しいトークナイザーを提案。マスク行動モデリングと対照学習により、行動コードが視覚言語の意味と整合するようにした。
- MeanFuser: MeanFlowによる高速ワンショット多様体軌道生成と適応的再構成を用いたエンドツーエンド自動運転自動運転/軌道生成2026/2/1
ガウス混合ノイズとMeanFlowを組み合わせ、離散アンカーに依存せず高速かつロバストに軌道を生成するエンドツーエンド自動運転手法を提案。
- 拡散モデルによるエンドツーエンド自動運転の可能性を解き放つ自動運転/拡散モデル2026/2/1
実車データと公道試験を通じて拡散モデルをエンドツーエンド自動運転のプランナーとして大規模に検証し、学習の鍵となる知見と強化学習による事後学習を提案、実車で10倍の性能向上を達成した。
- 二分的拡散方策最適化拡散方策/強化学習2026/1/1
拡散方策の強化学習において、報酬最大化と最小化の二つの方策に分解し、推論時にスコアを線形結合することで安定かつ制御可能な最適化を実現する手法を提案。
- VLMからのリスク意味蒸留によるエンドツーエンド自動運転の強化自動運転/VLA2025/11/1
VLMが持つリスク推論をBEV特徴量に蒸留するRiskHeadを提案し、エンドツーエンド自動運転モデルの汎化性能とリスク対象への注意を向上させた研究。
- MiMo-Embodied: クロス身体性基盤モデル技術報告VLA2025/11/1
自動運転と身体性AIを統合した初のクロス身体性基盤モデルを開発し、両分野で最先端性能を達成した。
- X-VLA:ソフトプロンプト付きTransformerによるスケーラブルなクロスエンボディメント視覚言語行動モデルVLA2025/10/1
多様なロボットのデータ源ごとに学習可能なソフトプロンプトを割り当てることで、異なる機体を横断して学習できる汎用VLAモデルX-VLAを提案し、6つのシミュレーションと3体の実機でSOTA性能を示した。
- フローマッチングに基づく対話行動モデリングを用いた自動運転プランニング自動運転プランニング2025/10/1
複雑な運転シーンでの対話行動をモデル化するため、軌道の細分化とフローマッチングを組み合わせたプランナーを提案し、大規模データセットで評価した。
- 堅牢なゼロショット強化学習に向けてゼロショットRL2025/10/1
オフライン学習時の分布外行動によるバイアスを行動正則化と拡散モデル・注意機構で抑え、ゼロショットRLの安定性と性能を高めるBREEZEを提案。
- PhysiAgent: 実世界で動作する身体性エージェントフレームワークVLA2025/9/1
VLMとVLAを監視・記憶・自己反省機構とツールボックスで統合し、VLAの能力を最大限に引き出す身体性エージェントフレームワークを提案。複雑な実世界ロボットタスクでの性能向上を実証した。
- 自律走行のための離散拡散による反射型視覚言語行動モデルVLA2025/9/1
離散拡散と言語モデルを活用し、安全な軌道生成のための反射機構を備えた自律走行向けVLAフレームワークを提案。
- 潜在空間後方計画による効率的なロボット政策学習ロボット計画2025/5/1
最終目標から逆算して潜在空間で中間サブゴールを予測する後方計画手法を提案し、長期的なタスクにおけるリアルタイム制御を効率化した。
- パラメータ空間におけるスキル拡張と合成強化学習2025/2/1
スキルをLoRAモジュールとして管理し、パラメータ空間で合成・動的選択することで、新たなタスクに効率的に適応する強化学習フレームワークPSECを提案。
- 柔軟なガイダンスを備えた拡散ベース自動運転プランニング自動運転計画2025/1/1
Transformerベースの拡散モデルで自動運転の閉ループ計画を行い、予測と計画を統合しつつ分類器ガイダンスで安全かつ適応的な軌道生成を実現した研究。
- ユニバーサルアクションによる具現化基盤モデルの強化VLA2025/1/1
多様なロボットの動作を共通の「ユニバーサルアクション空間」で表現し、異なる機体間でのデータ活用と汎化性能を高める具現化基盤モデルUniActを提案。0.5Bパラメータで14倍規模の既存モデルを上回る。
- 指示誘導型ビジュアルマスキングVLA2024/5/1
指示に関係ない画像領域をマスクすることで、マルチモーダルモデルが指示に沿った領域に注目できるようにする手法を提案し、VQAやロボット制御で性能を向上させた。
- DecisionNCE: 暗黙的選好学習による身体性マルチモーダル表現VLA2024/2/1
視覚軌跡と言語指示の対応を暗黙的選好として扱い、Bradley-Terryモデルを再パラメータ化することで、タスク進捗と時間的一貫性、言語接地を同時に学習する統合表現学習フレームワークを提案した。
- Safe Offline Reinforcement Learning with Feasibility-Guided Diffusion Model2024/1/1