Yilun Chen
Renmin University of China
収録論文 40本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 自己中心的全身体人間データの事前学習による汎用人型ロコマニピュレーションモデルVLA2026/9/30
ウェアラブルシステムで収集した500時間の自己中心的人間行動データセットHumanVerse-500を構築し、それを用いた3段階学習で人型ロボットの全身視覚言語行動ポリシーλ0を開発した。
- TacDyn-WAM: 異種視触覚ワールドアクションモデルにおける暗黙的触覚ダイナミクスの学習触覚2026/9/30
触覚の未来画像を再構成する代わりに、触覚ダイナミクスを表現空間で予測する視触覚ワールドアクションモデルを提案し、UniVTACで81.5%の成功率を達成した。
- EgoHumanoid-V2: 全身協調ロコマニピュレーションのための人間からヒューマノイドへのスキル転移VLA2026/9/29
一人称視点の人間のデモデータから、全身協調を保ったままロコマニピュレーションスキルをヒューマノイドへ直接転移する枠組みを提案し、実機4タスクでゼロショット転移を実現した。
- EgoAlign: 人間とヒューマノイドのギャップを埋める長距離移動操作VLA2026/9/29
一人称視点の人間デモを身体スケールと制御応答の違いを補正してヒューマノイドの全身制御用データに変換し、VLAモデルのファインチューニングと実機ゼロショット展開を実現した。
- JEPA-WAM: ロボット操作のためのワールドアクションモデルにおける段階レベル結合埋め込み予測操作2026/8/1
ロボット操作タスクにおいて、短期的な物理的未来と段階的な意味的未来を区別し、後者を予測するStage-JEPAを導入したワールドアクションモデルを提案。50タスクで成功率90.25%を達成し、実行ステップ数を削減した。
- RoboInter1.5: 身体性世界モデリングとロボット操作のための包括的中間表現スイート操作/データセット/世界モデル2026/7/1
ロボット操作と身体性世界モデリングのための、多様な中間表現(サブタスク、プリミティブスキル、物体・グリッパー接地、セグメンテーション、アフォーダンス、把持姿勢、接触点、動作軌跡など)を備えた大規模データセット、ベンチマーク、モデル群を構築した。
- エンドツーエンド自動運転におけるナビゲーション理解の驚くべき有効性の解明自動運転2026/4/1
エンドツーエンド自動運転システムが局所シーン理解に過度に依存し、大域ナビゲーション情報を活用できていない問題を指摘し、実世界のナビゲーションパターンに基づく逐次ナビゲーションガイダンス(SNG)フレームワークと、それを用いたVQAデータセットおよびモデルSNG-VLAを提案して、ナビゲーション追従性能を向上させた。
- VistaBot: 時空間認識ビュー合成による視点ロバストなロボット操作マニピュレーション2026/4/1
カメラ視点の変化にロバストなロボット操作を実現するため、幾何モデルとビデオ拡散モデルを統合したフレームワークVistaBotを提案。テスト時のカメラ校正不要で、シミュレーションと実世界で性能を検証した。
- StarVLA-α: 視覚言語行動システムの複雑さを低減するVLA2026/4/1
VLAモデルの設計選択を制御条件下で研究するため、複雑さを最小限に抑えたシンプルなベースラインStarVLA-αを提案し、複数ベンチマークで高い性能を達成した。
- PokeVLA: 包括的な世界知識の指導によるポケットサイズの視覚言語行動モデルの強化VLA2026/4/1
この論文は、ロボット操作のための軽量な視覚言語行動モデルPokeVLAを提案し、2段階のトレーニングと新しいアクションエキスパートにより、LIBERO-Plusベンチマークと実世界で高い性能を達成した。
- FutureVLA: 視覚言語行動モデルのための統合視覚運動予測VLA2026/3/1
ロボットの行動予測において、視覚と運動の相互作用を捉える新しいアーキテクチャFutureVLAを提案。視覚情報と運動情報を分離しつつ、時間的連続性を保った統合予測を実現する。
- OmniVTA: 接触を伴うロボット操作のための視覚-触覚世界モデル操作2026/3/1
接触を伴う操作タスクのために、大規模な視覚-触覚-行動データセットと、触覚信号を予測・閉ループ制御に活用する世界モデルベースのフレームワークを提案した論文。
- Rhythm: 双ヒューマノイドのインタラクティブ全身制御学習全身制御2026/3/1
人間の動作データから2体のヒューマノイドが抱擁やダンスなどの全身協調動作を実機で行えるようにする統合フレームワークを提案。
- ST4VLA: 視覚言語行動モデルのための空間誘導訓練VLA2026/2/1
VLMに空間的な事前知識を組み込む二段階訓練でロボットの行動生成を改善し、SimplerEnvで新たなSOTAを達成した研究。
- RoboInter:ロボットマニピュレーションのための包括的中間表現スイートマニピュレーション2026/2/1
ロボット操作のためのデータ・ベンチマーク・モデルを統合した中間表現スイートを提案し、大規模データセットとVQAベンチマーク、計画実行フレームワークを提供する。
- InternVLA-A1:ロボットマニピュレーションのための理解・生成・行動の統合VLA2026/1/1
シーン理解・視覚的予測・行動実行の3つの専門家をMixture-of-Transformersで統合したVLAモデルを提案し、実世界12タスクで既存手法を上回る性能を達成した。
- Nimbus: 具現化知能向け統合合成データ生成フレームワーク合成データ生成2026/1/1
ナビゲーションとマニピュレーションの合成データ生成パイプラインを統合し、非同期実行と動的スケジューリングでスループットを2〜3倍向上させるフレームワークを提案。
- その手の中の世界:実環境での人間中心マニピュレーション学習のための大規模オープンソースエコシステムマニピュレーション2025/12/1
実環境で収集した1000時間超の人間のマニピュレーションデータとウェアラブル収集キット、ベンチマークをオープンソースで提供し、ロボットのマニピュレーション成功率を8%から60%に向上させた。
- MM-ACT: マルチモーダル並列生成から行動を学習する統合VLAモデルVLA2025/12/1
テキスト・画像・行動を共有トークン空間で統合し、並列デコードで生成するVLAモデルを提案。LIBEROや実機Franka、RoboTwin2.0で高い成功率を達成した。
- X-VLA:ソフトプロンプト付きTransformerによるスケーラブルなクロスエンボディメント視覚言語行動モデルVLA2025/10/1
多様なロボットのデータ源ごとに学習可能なソフトプロンプトを割り当てることで、異なる機体を横断して学習できる汎用VLAモデルX-VLAを提案し、6つのシミュレーションと3体の実機でSOTA性能を示した。
- InternVLA-M1: 空間誘導型視覚-言語-行動フレームワークによる汎用ロボットポリシーVLA2025/10/1
空間グラウンディングを手がかりに「どこで行動するか」と「どう行動するか」を二段階で学習し、汎用ロボット制御を実現するVLAフレームワークを提案。
- プリミティブ身体性ワールドモデルの学習:スケーラブルなロボット学習に向けてワールドモデル2025/8/1
動画生成ベースの身体性ワールドモデルを固定短時間のプリミティブ動作に限定し、言語と動作の細粒度対応・データ効率・推論速度を改善するPEWMを提案。VLMプランナとヒートマップ誘導で閉ループ制御と長期タスクへの組合せ汎化を実現する。
- StreamVLN:スローファスト文脈モデリングによるストリーミング視覚言語ナビゲーションVLA2025/7/1
視覚と言語の入力からリアルタイムに行動を生成するVLN向けに、高速な対話文脈と低速更新の記憶文脈を組み合わせたストリーミングフレームワークを提案し、低遅延で最先端性能を達成した。
- InstructVLA: 理解から操作へと導く視覚-言語-行動インストラクションチューニングVLA2025/7/1
大規模視覚言語モデルの推論能力を保ちつつ、身体性推論を活用して操作性能を高める新しいVLAモデルと学習法を提案し、汎化ベンチマークで大幅な改善を示した。
- 視覚言語ナビゲーションにおける身体性ギャップの再考:物理的・視覚的格差の包括的研究VLA2025/7/1
人型・四足・車輪ロボットに対応した物理的に現実的なVLN評価プラットフォームVLN-PEを提案し、既存のVLN手法が実機環境で性能劣化する要因を体系的に分析した。
- CronusVLA: マルチフレーム視覚-言語-行動モデリングによる効率的で堅牢なマニピュレーションVLA2025/6/1
単一フレームのVLAモデルをマルチフレームに拡張し、特徴チャンキングで履歴情報を集約することで、計算負荷を抑えつつ操作性能と観測の堅牢性を向上させた。
- GenManip: LLM駆動シミュレーションによる汎化可能な指示追従マニピュレーションマニピュレーション2025/6/1
LLM駆動のシーングラフで多様なタスクを自動生成する卓上シミュレーション環境GenManipと、200シナリオのベンチマークGenManip-Benchを提案し、モジュール型とエンドツーエンド方策の汎化性能を比較評価した。
- NavDP:特権情報ガイダンスを用いたSim-to-Realナビゲーション拡散ポリシーの学習ナビゲーション2025/5/1
シミュレーションのみで学習し、RGB-D観測から軌道生成と評価を統合的に行う拡散ポリシーにより、多様な環境とロボット形態へのゼロショットsim-to-real転移を実現した。
- LiloDriver: ロングテール自動運転シーンにおける閉ループ運動計画のための生涯学習フレームワーク自動運転/運動計画2025/5/1
大規模言語モデルと記憶拡張型プランナ生成を組み合わせ、再学習なしで新たなロングテール走行シーンに適応する生涯学習型の閉ループ運動計画フレームワークを提案し、nuPlanベンチマークで有効性を示した。
- RoboGround: 接地視覚言語事前知識を用いたロボットマニピュレーションマニピュレーション2025/4/1
視覚言語モデルによるグラウンディングマスクを中間表現として用い、対象物の位置・形状情報を政策ネットワークに与えることで汎化性能を高めるロボット操作システムを提案。大規模シミュレーションデータ生成パイプラインも構築した。
- ロボット学習のための事前学習済み視覚モデルのデータ中心再検討VLA2025/3/1
ロボット学習用の視覚モデルにおいて、非物体中心データでも物体中心表現を獲得できるSlotMIMを提案し、認識・シーン理解・ロボットタスクで性能を向上させた。
- Re$^3$Sim: 3DフォトリアルなReal-to-Simによる高忠実度シミュレーションデータ生成sim2real2025/2/1
実世界の3D再構成とニューラルレンダリングでフォトリアルなシミュレーション環境を構築し、模倣学習でロボット操作方策を訓練、ゼロショットで実機転移を実現した研究。
- Dual-AEB: ルールベースとマルチモーダル大規模言語モデルを融合した緊急ブレーキシステム自動運転2024/10/1
マルチモーダル大規模言語モデルによるシーン理解と従来のルールベースAEBを組み合わせ、開放的な状況でも迅速に緊急ブレーキを判断できるシステムを提案した。
- Bench4Merge: 実環境に近い高密度交通におけるマイクロインタラクティブ車両との合流のための包括的ベンチマーク自動運転/合流/ベンチマーク2024/10/1
高密度交通への合流を評価する閉ループベンチマークを提案し、他車両を大規模データで学習させて多様性を高め、LLMで合流性能を評価する。
- VLM-Grounder: ゼロショット3D視覚グラウンディングのためのVLMエージェント3D視覚グラウンディング2024/10/1
2D画像のみを用いた視覚言語モデルにより、3D点群や物体事前情報なしで自然言語指示に基づく3D物体の位置推定をゼロショットで実現したフレームワーク。
- Dense CLIPによるセマンティックマップの汎化で実現するオープンボキャブラリ物体ゴールナビゲーション物体ゴールナビゲーション2024/7/1
テキストのみの学習でセマンティックマップ予測ネットワークを訓練し、Dense CLIP特徴を活用して未知環境・未知物体へのオープンボキャブラリ物体ナビゲーションを効率よく実現するフレームワークOVExpを提案。
- GRUtopia:大規模都市で汎用ロボットを夢見るsim2real2024/7/1
10万の対話可能なシーンからなる都市規模のシミュレーション環境と、LLM駆動のNPCによる社会シミュレーション、脚式ロボット向けベンチマークを提供し、Embodied AIのSim2Real研究を加速するプロジェクト。
- MMScan: 階層的接地言語アノテーション付きマルチモーダル3Dシーンデータセット3Dシーン理解2024/6/1
領域から物体レベルまでの階層的な言語アノテーションを備えた大規模マルチモーダル3Dシーンデータセットを構築し、3D視覚接地と質問応答のベンチマークを提供した。
- RoadMap: A Light-Weight Semantic Map for Visual Localization towards Autonomous Driving2021/6/1
- AVP-SLAM: Semantic Visual Mapping and Localization for Autonomous Vehicles in the Parking Lot2020/7/1