Yan Wang
Tsinghua University
収録論文 59本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- CtrlWAM: 意図と予見を整合させた制御可能なワールドアクションモデルVLA2026/10/1
摂動させた行動をシミュレータで実行し、その視覚的結果と対応付けて学習することで、行動予測と映像生成の整合性を高めた制御可能なワールドアクションモデルを提案。
- TacDyn-WAM: 異種視触覚ワールドアクションモデルにおける暗黙的触覚ダイナミクスの学習触覚2026/9/30
触覚の未来画像を再構成する代わりに、触覚ダイナミクスを表現空間で予測する視触覚ワールドアクションモデルを提案し、UniVTACで81.5%の成功率を達成した。
- MotionWeave: 動作中心の未来ダイナミクスを学習する視覚-言語-行動ポリシーVLA2026/9/30
動作に関連する局所的な視覚変化を未来フレームから抽出し、それを行動トークンに注入することで、視覚-言語-行動モデルの行動予測精度を向上させる手法を提案。
- 離散フォーシング:連続デノイジングに離散ガイダンスを注入する少数ステップ行動エキスパートVLA2026/9/30
VLAモデルにおいて、離散行動トークンで粗い行動構造を予測し、それを連続行動の精緻化のガイダンスとして用いるフローマッチング手法を提案。パラメータ数を抑えつつ高精度・高速推論を実現した。
- ChunkTrust: 行動専門家の証拠に基づくロボット政策の実行ホライズン適応マニピュレーション2026/9/30
ロボット基盤政策が予測する行動チャンクの実行長を、固定値ではなく行動専門家の証拠から推論する潜在変数として扱い、訓練不要のセレクタと軽量アダプタで適応的に決定する手法を提案。
- World4Scorer: 自動運転のための結果に基づく世界モデリング自動運転計画2026/9/29
シミュレータで全候補軌道の結果をラベル付けし、軌道条件付きJEPA予測器でスコアリングする計画手法を提案。NAVSIM-v2で最先端性能を達成。
- MobileWAM: 世界行動モデルをチェーン・オブ・フォーサイトで移動操作に橋渡しする移動操作2026/8/5
移動操作のための世界行動モデルを提案し、事前学習済みのビデオ拡散トランスフォーマーと軽量な行動エキスパートを融合させ、移動と操作の異種ダイナミクスを扱う。また、中間表現が未来の潜在チャンクを逐次予測するCoFを導入し、実機でも高い性能を示した。
- Adaptive-WAM: 中間ビデオ拡散特徴からの品質誘導型早期終了計画自動運転2026/8/1
ビデオ拡散モデルの全層を実行せず、中間層から軌道をデコードし、品質スコアに基づいて推論を早期終了する適応型プランナーを提案した。
- 4D-WAM: 軌跡フィールドによる世界行動モデルへの時空間認識の注入VLA2026/8/1
ロボットの行動生成と動画予測を統合する世界行動モデルに対し、3D軌跡フィールドからの時空間知識を表現整合で注入する訓練戦略を提案し、空間理解と実行精度を向上させた。
- JEPA-WAM: 共同埋め込み世界モデリングによる視覚-言語-行動ポリシーの学習VLA/世界モデル2026/8/1
事前学習済みV-JEPA空間に基づく潜在世界モデルを構築し、遷移予測と行動生成を共有予測器で結合することで、効率的かつ高精度なロボット制御を実現した。
- JEPA-WAM: ロボット操作のためのワールドアクションモデルにおける段階レベル結合埋め込み予測操作2026/8/1
ロボット操作タスクにおいて、短期的な物理的未来と段階的な意味的未来を区別し、後者を予測するStage-JEPAを導入したワールドアクションモデルを提案。50タスクで成功率90.25%を達成し、実行ステップ数を削減した。
- DreamQAS: 意思決定に有用な世界モデルによるVQE効率的な量子アーキテクチャ探索量子アーキテクチャ探索2026/7/31
量子回路の構築と動作の合法性が決定的であることを利用し、高コストなVQEフィードバックのみを学習するモデルベース強化学習フレームワークDreamQASを提案した。
- QuantWAMs: ワールドアクションモデルにおける適切な粒度でのキャリブレーション量子化/モデル圧縮2026/7/30
ワールドアクションモデル(WAM)向けに、モデル構造・展開分布・タスク目的に合わせた量子化キャリブレーション手法を提案し、メモリ削減と精度維持を実現した。
- DINS-IO: 微分可能なINS整合性による学習型慣性オドメトリ慣性オドメトリ/自己教師あり学習2026/7/1
位置ラベルなしでIMU生データから慣性オドメトリを学習する手法を提案。ストラップダウンINSの速度再帰を微分可能な整合性制約として自己教師あり損失に用い、少数のラベルで較正する。
- ST-WAM: 視覚分布シフト下でのロバストな操作のための意味的時間的世界行動モデル操作2026/7/1
視覚分布の変化に頑健なロボット操作のため、DINOv3特徴を共有表現として用いる意味的時間的世界行動モデル(ST-WAM)を提案し、将来予測と履歴検索を改善した。
- Cosmos 3: 物理AIのための全モーダル世界モデルVLA2026/6/1
言語、画像、動画、音声、行動を統一的に扱う全モーダル世界モデルを提案し、理解・生成タスクでSOTAを達成した。
- ASSCG: 自動運転における高速・低速LLMプランニングのための適切なゲーティング自動運転プランニング2026/6/1
大規模言語モデルを自動運転プランニングに使う際、低速システムの呼び出しをリソースを考慮した逐次決定問題として捉え、フレームごとにQuery/Cache/Dropを決める適応ゲートASSCGを提案。nuPlanとNAVISIMで性能向上と遅延削減を実証。
- 物理基盤のマルチエージェントダイナミクスベンチマーク:ワールドモデルにおけるワールドモデル2026/6/1
ワールドモデルの生成するマルチエージェント衝突シナリオの物理的妥当性を評価するフレームワークCrashTwinを提案し、既存モデルが視覚品質は高いが物理法則に反する挙動を示すことを明らかにした。
- MV-Actor: 両腕操作のためのマルチビュー意味論と空間認識の整合マニピュレーション2026/6/1
両腕ロボット操作のためのマルチビュー認識フレームワークを提案し、視点間の意味共有と空間認識を強化して、シミュレーションと実機で高い成功率を達成した。
- 計画整合型トークン圧縮による長文脈自動運転自動運転2026/6/1
自動運転のためのモノリシックな視覚行動モデルにおいて、長期の文脈を圧縮する際に計画情報を活用するフレームワークを提案し、成功率を向上させた。
- AR Forcing: 長期的ロボットナビゲーションのためのワールドモデルに向けてナビゲーション2026/5/1
拡散ベースのナビゲーションワールドモデルにおける訓練と推論の分布ずれを解消するため、自己回帰訓練戦略AR Forcingを提案し、長期的な予測の安定性と精度を向上させた。
- RoboMemArena:ロボット記憶のための包括的で挑戦的なベンチマークベンチマーク/VLA/記憶2026/5/1
ロボットの長期タスクにおける記憶能力を評価するため、26タスク・平均1000ステップ超の大規模ベンチマークRoboMemArenaを構築し、VLMによるサブタスク生成と実世界評価を備えた。さらに、記憶管理と予測符号化を統合したVLAモデルPrediMemを提案し、既存手法を上回る性能を示した。
- CapVector: パラメトリック空間における転移可能な能力ベクトルの学習による視覚言語行動モデルの強化VLA2026/5/1
事前学習済みVLAモデルの標準的な教師あり微調整では性能向上が限定的である問題に対し、補助目的の効果をパラメータ差分として抽出し、軽量な正則化で統合する能力ベクトル手法を提案した。
- 障害物密集環境における移動ロボットのためのリアクティブ計画に基づく制御移動ロボット制御2026/5/1
部分的な環境情報しか持たない移動ロボットが、障害物を回避しながら目標位置へ移動するための、リアクティブ計画と適応追従制御を組み合わせた制御戦略を提案した論文。
- CLOVER: エンドツーエンド自動運転計画のための閉ループ価値推定とランキング自動運転計画2026/5/1
エンドツーエンド自動運転プランナーの訓練と評価の不一致を解消するため、生成器とスコアラを用いた閉ループ自己蒸留フレームワークCLOVERを提案した。
- DFM-VLA: 離散フローマッチングによる反復的な行動洗練でロボットマニピュレーションを実現VLA2026/3/1
行動トークンを反復的に洗練する離散フローマッチング型VLAを提案し、初期のトークン誤りを後から修正できるようにしてマニピュレーション精度を向上させた。
- Fast-dVLA: 離散拡散VLAを実時間性能へ高速化VLA/拡散モデル/ファインチューニング2026/3/1
事前学習済みVLAモデルの性能向上と適応コスト削減を両立するため、補助タスクの能力ベクトルをパラメータ空間で分離・統合する手法を提案し、軽量な正則化で標準SFTと同等の性能を低計算コストで実現した。
- 狭い方策に潜む悪魔:運転VLAモデルの探索を解き放つVLA/自動運転/強化学習2026/3/1
自動運転の模倣学習が探索を狭め、強化学習の性能を制限する問題を特定し、軌道拡張と多様性重視の報酬設計で解決するCurious-VLAを提案した。
- FRAPPE: 複数未来表現アラインメントによる汎用ロボット方策への世界モデリングの注入VLA2026/2/1
未来の観測の潜在表現を予測し、複数の視覚基盤モデルと並列にアラインメントすることで、汎用ロボット方策に世界認識を効率的に組み込む手法を提案。
- 自動運転における構造化Chain-of-Thoughtの高速化VLA2026/2/1
自動運転のVLAモデル向けに、Chain-of-Thought推論を依存グラフに分解し並列デコードすることで、精度を保ちつつ3〜4倍高速化する手法を提案。
- 表現の相補性からデュアルシステムへ:VLMと視覚専用バックボーンの協調によるエンドツーエンド運転自動運転VLA2026/2/1
VLMと視覚専用エンコーダの表現を比較し、それぞれが得意な場面が異なることを示した上で、両者を組み合わせた運転モデルHybridDriveVLAを提案した。
- 反事実的VLA:適応的推論を備えた自己反省型視覚-言語-行動モデルVLA2025/12/1
自動運転VLAモデルが計画した行動を反事実的に推論して修正する自己反省フレームワークを提案し、軌道精度と安全性を向上させた。
- 潜在連鎖推論によるエンドツーエンド運転の世界モデリング自動運転VLA2025/12/1
運転行動の推論を自然言語ではなく、行動と整合した潜在空間で行うLCDriveを提案し、推論速度・軌道品質・強化学習の効果を向上させた。
- Alpamayo-R1: 長尾シナリオにおける汎化可能な自動運転のための推論と行動予測の橋渡し自動運転/VLA2025/11/1
視覚言語行動モデルに因果連鎖推論を組み込み、拡散ベースの軌道デコーダと強化学習を組み合わせることで、長尾の安全臨界シナリオでの自動運転計画精度と推論品質を向上させた研究。
- 自転車測位のためのMoEベース学習型慣性オドメトリ慣性オドメトリ2025/10/1
マルチライダー・多路面のIMUデータで学習した速度予測器をEKFと密結合し、疎ゲート型Mixture of Expertsで計算量を抑えつつ高精度な自転車測位を実現した。
- トライプレーンによる効率的なマルチカメラトークン化とエンドツーエンド自動運転自動運転2025/6/1
自動運転向けに、複数カメラの画像をトライプレーン表現で効率的にトークン化し、トークン数を最大72%削減して推論を高速化する手法を提案。
- SELC: 低品質画像のための自己教師あり効率的局所対応学習特徴マッチング2025/4/1
手動アノテーション不要のハイブリッド自己教師あり学習で、低品質画像でも高解像度時に2〜10倍効率的な軽量特徴マッチングネットワークを提案。
- スケーラブルな制約下での非ホロノミック移動ロボットによる低計算量協調搬送群制御2025/2/1
非ホロノミック移動ロボット群がケーブル吊り下げ荷物を協調搬送するため、分散制御に基づきつつ多制約に対応し、軌道生成と追従を定数・線形時間で行う低計算量手法を提案した。
- IROAM: 自動運転車データから路側単眼3D物体検出を改善する学習手法3D物体検出2025/1/1
車載カメラと路側カメラの視点差を埋めるため、意味と幾何を分離した対照学習フレームワークIROAMを提案し、路側単眼3D物体検出の性能を向上させた。
- 外挿的な都市ビュー合成ベンチマークsim2real2024/12/1
自動運転向けの新規視点合成(NVS)において、訓練視点から大きく外れた視点での性能を評価する初のベンチマークEUVSを構築し、既存手法が訓練視点に過適合しやすいことを示した。
- MR-ULINS: マルチエポック外れ値除去を備えたUWB-LiDAR-慣性の密結合推定器測位・SLAM2024/8/1
UWB・LiDAR・IMUを密結合し、UWBの系統誤差とNLOS外れ値をオンラインで推定・除去することで、GNSS拒否環境で約0.1mの高精度測位を実現した。
- 目標到達強化学習におけるスパース報酬の再検討強化学習2024/7/1
目標到達タスクにおいて、最小時間タスクとして定式化したスパース報酬が高品質な方策の学習を促進し、密報酬を上回ることを示し、初期方策の目標到達率が成功の早期指標となることを明らかにした。
- 自動運転のための非同期LLM拡張プランナー自動運転2024/6/1
LLMの推論を非同期化してリアルタイムプランナーを誘導し、計算コストを抑えつつ自動運転の軌道計画性能を向上させたフレームワーク。
- 構造光画像を用いた臨床における顔面位置合わせの新手法位置合わせ2024/5/1
構造光カメラとCT画像から顔の特徴点を抽出し、ICP法で粗位置合わせと精密位置合わせを行うことで、低誤差かつ短時間で顔面深度画像を位置合わせする手法を提案した。
- SceneVerse: Scaling 3D Vision-Language Learning for Grounded Scene Understanding2024/1/1
- Ordering-Flexible Multi-Robot Coordination for MovingTarget Convoying Using Long-TermTask Execution2024/1/1
- An Embodied Generalist Agent in 3D World2023/11/18
- Interpretable Reinforcement Learning for Robotics and Continuous Control2023/11/1
- Predictive Control for Autonomous Driving with Uncertain, Multi-modal Predictions2023/10/1
- Waymax: An Accelerated, Data-Driven Simulator for Large-Scale Autonomous Driving Research2023/10/1
- DynaVIG: Monocular Vision/INS/GNSS Integrated Navigation and Object Tracking for AGV in Dynamic Scenes2022/11/1
- Real-Time Reinforcement Learning for Vision-Based Robotics Utilizing Local and Remote Computers2022/10/1
- Vehicle Trajectory Tracking Through Magnetic Sensors: A Case Study of Two-lane Road2022/9/1
- Robotic Imitation of Human Assembly Skills Using Hybrid Trajectory and Force Learning2021/3/1
- A Reliable Gravity Compensation Control Strategy for dVRK Robotic Arms With Nonlinear Disturbance Forces2020/1/1
- Motion Planning through Demonstration to Deal with Complex Motions in Assembly Process2019/10/1
- LDLS: 3-D Object Segmentation Through Label Diffusion From 2-D Images2019/10/1
- A Convex Optimization-based Dynamic Model Identification Package for the da Vinci Research Kit2019/2/1
- Model-Driven Feed-Forward Prediction for Manipulation of Deformable Objects2016/7/1