Weixin Li
Zhongguancun Academy
収録論文 10本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 空間推論ベンチマークを超えて:ナビゲーションへの応用ナビゲーション2026/9/24
空間推論ベンチマークの性能がナビゲーションに直結しない問題を分析し、空間監督をナビゲーション目標に合わせて2段階で微調整する手法を提案。8BモデルでHM3Dなどで高性能を達成。
- 基盤モデルを物理世界エージェントに組み込むことで長期的ナビゲーションの限界を押し広げるナビゲーション2026/8/31
VLMによる推論エージェントとナビゲーション基盤モデルを組み合わせたフレームワークNavMCPを提案し、長期的な探索タスクで高い性能を達成した。
- TerraZero: ゼロデモンストレーション自己対戦スケールのための手続き型運転シミュレーション自動運転/シミュレーション2026/7/1
強化学習スケールで高速かつ現実的な地図構造に基づく多様な運転シナリオを生成する手続き型シミュレータと自己対戦学習スタックを提案し、ゼロデモンストレーションで汎化する運転ポリシーを訓練した。
- TerraTransfer: 専門家のデモなしで学ぶエンドツーエンド運転ポリシー自動運転2026/6/1
ベクトル化シミュレータでの自己対戦により運転ポリシーを事前学習し、視覚バックボーンとの潜在空間を整列させることで、専門家デモなしでエンドツーエンド運転を実現する手法を提案。
- ツール整合型視覚言語行動モデルによる長期的身体エージェントの実現VLA/長期タスク2026/5/1
高レベルのVLMエージェントが計画を、専門化されたVLAツール群が局所操作を分担し、長期的タスクを効率的に実行する枠組みを提案した。
- FutureVLA: 視覚言語行動モデルのための統合視覚運動予測VLA2026/3/1
ロボットの行動予測において、視覚と運動の相互作用を捉える新しいアーキテクチャFutureVLAを提案。視覚情報と運動情報を分離しつつ、時間的連続性を保った統合予測を実現する。
- デジタルからフィジカルへ:物理知能のための自律型コーチとしてのデジタルエージェントVLA2026/1/1
LLMエージェントが強化学習や模倣学習のタスク設計・デバッグ・最適化を自律的に行うベンチマークEmboCoach-Benchを提案し、人間設計を上回る性能を実証した。
- MSGNav: マルチモーダル3Dシーングラフによるゼロショット身体性ナビゲーションナビゲーション2025/11/1
視覚情報を画像のまま保持するマルチモーダル3Dシーングラフを構築し、ゼロショットで物体探索ナビゲーションを行うシステムを提案。GOAT-BenchとHM3D-ObjNavで最高性能を達成。
- PolySim: マルチシミュレータのダイナミクスランダム化によるヒューマノイド制御のsim-to-realギャップの橋渡しsim2real2025/10/1
複数の異なるシミュレータを同時に用いて全身制御ポリシーを訓練し、シミュレータ固有のバイアスを低減して実機へのゼロショット転移を実現した。
- EmboMatrix: 身体性意思決定のためのスケーラブルな訓練基盤VLA2025/10/1
大規模言語モデルに身体性意思決定能力を獲得させるため、タスク・シーン生成、分散シミュレーション、精密報酬を統合した訓練基盤EmboMatrixを構築し、7Bモデルが671Bモデルを上回る性能を達成した。