Kun Zhan
Li Auto Inc.
収録論文 22本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- MachEmbodied-U0:身体知能のための統合理解・生成モデルVLA2026/9/22
理解と生成の専門家をMixture-of-Transformersで統合し、視覚力学と行動生成をフローマッチングで結びつけた身体知能基盤モデルを提案。LIBEROで99.0%の成功率を達成。
- ME-Brain-1.0:記憶・認知・行動による自己進化型身体知能VLA2026/9/21
行動実行から経験獲得・進化を経て実行改善へと至る閉ループで自己進化する身体知能システムを提案し、再学習なしにベンチマークで大幅な性能向上を達成した。
- ME-Dex 1.0:異種触覚センシングを世界行動モデリングへ統合触覚/マニピュレーション2026/9/18
視覚・触覚・行動を統合的に学習するWorld Action Tactile Modelを提案し、異なる触覚センサや実装を共通空間に写像する仕組みとデータ生成基盤を構築した。
- 効率的なVLAを決めるもの:アクションヘッド設計・スケーリング・レイテンシの探求VLA2026/9/12
VLAモデルにおいて、アクションヘッドの性能はデコーダ構造よりも言語バックボーンの最終層を初期化に使うことが最大の要因であり、アラインメント後はスケーリングが有効になることを実験的に示した研究。
- BrainWAM: 自動運転のための意味的先行知識と予測ダイナミクスの行動空間協調自動運転2026/8/1
自動運転の計画において、意味的推論(VLA)と予測的ダイナミクス(WAM)を単純に結合すると注意配分の不一致が生じる問題を解決するため、行動空間で両者を協調させるBrainWAMを提案し、NAVSIMで最高性能を達成した。
- VLAFlow: 共学習と未来潜在整合による視覚-言語-行動モデルの統合学習フレームワークVLA2026/7/1
ロボット操作のための視覚-言語-行動モデル(VLA)の学習手法を統一フレームワークで比較し、言語教師あり学習と未来潜在整合を組み合わせることで、異種データに対する転移性能が最も安定することを示した論文。
- Metis: 自動運転と都市ナビゲーションのための汎用かつ効率的なワールドアクションモデル自動運転2026/6/14
ビデオ生成と行動予測を分離したエンドツーエンドのワールドアクションモデルを提案し、推論時のビデオ生成を省略することで効率化しつつ、汎用性と性能を向上させた。
- ReflectDrive-2: 強化学習整合型自己編集による離散拡散運転プランナー自動運転2026/5/1
自動運転向けに、離散トークンで軌道を表現し、自己編集で軌道を修正するマスク拡散プランナーを提案。強化学習で編集能力を訓練し、性能を向上させた。
- 実データと合成データの共学習のための閉ループ動的データ混合自動運転2026/5/1
自動運転のエンドツーエンド学習において、実データと合成データを効率的に混合するための自動化された閉ループデータエンジン「AutoScale」を提案し、評価フィードバックに基づいてデータ混合を動的に最適化することで、少ない合成データで性能を向上させる。
- 自動運転のための言語-行動の理解と生成の統合自動運転/VLA2026/3/1
自動運転向けのVLAモデルにおいて、言語と行動のトークンを共有コードブックで統合し、補助的な行動理解目標と粗密生成法を導入することで、指示追従精度と推論効率を向上させた。
- オンデバイスLLMのためのハードウェア協調設計スケーリング則:ルーフライン・モデリングによるアプローチVLA2026/2/10
オンデバイスLLMのアーキテクチャ選択を高速化するため、訓練損失のスケーリング則と推論レイテンシのルーフラインモデルを組み合わせ、精度とレイテンシのパレートフロンティアを導出するハードウェア協調設計手法を提案した。
- WorldRFT: 強化学習ファインチューニングによる潜在世界モデル計画法自動運転/世界モデル/強化学習2025/12/1
自動運転向けに、シーン表現学習を計画タスクに整合させる階層的計画分解と局所的な反復改善を導入し、GRPOによる強化学習ファインチューニングで安全性を高めた潜在世界モデルフレームワークを提案。nuScenesとNavSimでSOTA性能を達成。
- 学ぶほど賢く枝刈り:微分可能なトークン枝刈りによる効率的な視覚-言語-行動モデルVLA2025/9/1
VLAモデルの視覚トークンを微分可能なGumbel Softmaxで動的に枝刈りし、追加パラメータなしで計算量を削減しつつ成功率を向上させるLightVLAを提案。
- 自律走行のための離散拡散による反射型視覚言語行動モデルVLA2025/9/1
離散拡散と言語モデルを活用し、安全な軌道生成のための反射機構を備えた自律走行向けVLAフレームワークを提案。
- RoboPearls: ロボットマニピュレーションのための編集可能なビデオシミュレーションsim2real2025/6/1
3Dガウススプラッティングを用いて実演ビデオからフォトリアルなシミュレーションを構築し、LLMで自動化された編集操作を可能にするロボットマニピュレーション向けフレームワークを提案。
- GeoDrive: 3D幾何情報を活用した精密な行動制御可能な運転世界モデル世界モデル2025/5/1
入力画像から3D表現を抽出し、指定した自車軌道に基づく2Dレンダリングを条件として与えることで、3D幾何的一貫性と行動制御性を高めた自動運転向け世界モデルを提案した。
- TransDiffuser: エンドツーエンド自動運転のための脱相関マルチモーダル表現による多様な軌道生成自動運転/軌道生成2025/5/1
拡散モデルによる軌道生成のモード崩壊を、事前定義軌道語彙やシーンプライアなしで解決するため、脱相関マルチモーダル表現最適化を導入したエンコーダ・デコーダ型生成軌道計画モデルを提案。
- 人間のフィードバック強化学習によるパーソナライズ運転スタイルの学習自動運転2025/3/1
生成的な軌道モデルを人間のフィードバックで微調整し、多様な運転スタイルに合わせた軌道生成を可能にするTrajHFを提案。
- ReconDreamer: オンライン修復による走行シーン再構成のための世界モデル構築sim2real2024/11/1
世界モデルの知識を段階的に統合し、オンライン修復でアーティファクトを抑えることで、車線変更などの大規模な操作を含む走行シーンを高品質に再構成する手法を提案。
- DrivingSphere: 閉ループシミュレーションのための高忠実度4D世界構築自動運転シミュレーション2024/11/1
4D占有表現で動的な運転環境を構築し、高忠実度の多視点映像を生成する閉ループ自動運転シミュレーションフレームワークを提案。
- Mixture of Expertsによる自動運転モーションプランナーの汎化自動運転/プランニング2024/10/1
ViTエンコーダとMixture-of-Experts因果Transformerを組み合わせたスケーラブルなモーションプランナーSTR2を提案し、NuPlanデータセットで従来手法より高い汎化性能とスケーラビリティを示した。
- PlanAgent: マルチモーダル大規模言語モデルによる閉ループ車両運動計画自動運転計画2024/6/1
マルチモーダルLLMを認知エージェントとして用い、BEV地図とテキスト記述から階層的推論でプランナコードを生成し、反省モジュールで評価する閉ループ車両運動計画システムを提案。nuPlanで評価。