Yupeng Zheng
Institute of Automation, Chinese Academy of Sciences
収録論文 25本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- TacDyn-WAM: 異種視触覚ワールドアクションモデルにおける暗黙的触覚ダイナミクスの学習触覚2026/9/30
触覚の未来画像を再構成する代わりに、触覚ダイナミクスを表現空間で予測する視触覚ワールドアクションモデルを提案し、UniVTACで81.5%の成功率を達成した。
- GIFT: 行動指向の構造的監督による誘導中間特徴学習を用いたロボット操作マニピュレーション2026/9/3
視覚と言語の事前学習で得られる特徴と制御に必要な情報の乖離(行動十分性ギャップ)を埋めるため、中間特徴に幾何・アフォーダンス・目標領域の3つの制御関連構造を学習させるフレームワークGIFTを提案し、複数のポリシーで性能向上を確認した。
- 潜在アクションを意図として用いた効率的な未来想像による世界行動モデルVLA2026/8/25
ロボット制御のための世界行動モデルにおいて、テスト時の未来観測生成の遅延を削減するため、潜在アクションを意図の表現として用いるLAWAを提案。将来の観測を生成せずに効率的な未来想像を実現し、少ないデモデータや分布外シナリオでの性能を向上させた。
- VT-WAM: 接触を伴う操作のための視覚-触覚ワールドアクションモデルマニピュレーション2026/7/1
接触を伴う操作タスク向けに、視覚予測・触覚変形予測・行動予測を統合したフレームワークを提案し、実世界6タスクで高い成功率を達成した。
- TacForeSight: 接触豊富な操作のための力誘導型触覚ワールドモデル触覚/操作2026/6/1
接触を伴う操作タスクにおいて、力覚と触覚の非対称な時空間的役割を考慮し、触覚潜在ダイナミクスを予測する軽量な触覚ワールドモデルと、予測結果を活用するポリシーを提案。実機実験で動的接触外乱下での優位性を示した。
- 潜在空間での高周波連続アクションチャンク学習ロボット制御2026/5/1
高周波(60Hzなど)のロボット制御において、アクション空間ではなくVAEによる潜在空間でアクション学習を行うことで、時間的・空間的一貫性を向上させ、さらにチャンク間の連続性を改善する手法を提案した。
- VistaBot: 時空間認識ビュー合成による視点ロバストなロボット操作マニピュレーション2026/4/1
カメラ視点の変化にロバストなロボット操作を実現するため、幾何モデルとビデオ拡散モデルを統合したフレームワークVistaBotを提案。テスト時のカメラ校正不要で、シミュレーションと実世界で性能を検証した。
- PokeVLA: 包括的な世界知識の指導によるポケットサイズの視覚言語行動モデルの強化VLA2026/4/1
この論文は、ロボット操作のための軽量な視覚言語行動モデルPokeVLAを提案し、2段階のトレーニングと新しいアクションエキスパートにより、LIBERO-Plusベンチマークと実世界で高い性能を達成した。
- 潜在世界行動モデリングによるエンドツーエンド自動運転自動運転2026/3/1
空間認識と動力学を考慮した潜在世界表現を用いた効率的なエンドツーエンド自動運転フレームワークを提案し、軌道計画性能を向上させた。
- OmniVTA: 接触を伴うロボット操作のための視覚-触覚世界モデル操作2026/3/1
接触を伴う操作タスクのために、大規模な視覚-触覚-行動データセットと、触覚信号を予測・閉ループ制御に活用する世界モデルベースのフレームワークを提案した論文。
- 失敗から学ぶ:テイクオーバーデータを用いた運転VLAのポストトレーニング自動運転/VLA2026/3/1
自動運転のVLAモデルに対し、テイクオーバー(人間介入)データを活用した新しいポストトレーニング手法TakeVLAを提案。介入前の言語指示とシナリオ再構築による強化学習で安全マージンを拡大し、ベンチマークで最高性能を達成した。
- DreamerAD: 潜在世界モデルによる自動運転のための効率的な強化学習自動運転/世界モデル2026/3/1
動画拡散モデルのサンプリングを100ステップから1ステップに圧縮し80倍高速化した潜在世界モデルで、自動運転の強化学習を安全かつ高頻度に訓練可能にした。
- Rhythm: 双ヒューマノイドのインタラクティブ全身制御学習全身制御2026/3/1
人間の動作データから2体のヒューマノイドが抱擁やダンスなどの全身協調動作を実機で行えるようにする統合フレームワークを提案。
- 長寿命ロボットに向けて:強化学習ファインチューニングによるVLAモデルの継続学習VLA2026/2/1
VLAモデルの下流タスク適応における破滅的忘却とデータ依存を解決するため、オンライン環境フィードバック不要の強化学習ファインチューニング手法LifeLong-RFTを提案し、継続学習でSFT比22%の成功率向上を達成した。
- WorldRFT: 強化学習ファインチューニングによる潜在世界モデル計画法自動運転/世界モデル/強化学習2025/12/1
自動運転向けに、シーン表現学習を計画タスクに整合させる階層的計画分解と局所的な反復改善を導入し、GRPOによる強化学習ファインチューニングで安全性を高めた潜在世界モデルフレームワークを提案。nuScenesとNavSimでSOTA性能を達成。
- Mimir: 不確実性伝播を伴う階層的目標駆動拡散によるエンドツーエンド自動運転自動運転2025/12/1
目標点の不確実性をラプラス分布で推定し、マルチレート誘導機構で先読みすることで、堅牢かつ高速な軌道生成を実現した階層型自動運転フレームワーク。
- TakeAD: 専門家の介入データを用いた選好ベースの事後最適化によるエンドツーエンド自動運転自動運転2025/12/1
自動運転の模倣学習における開ループ訓練と閉ループ運用のギャップを埋めるため、ドライバー介入データを活用しDAggerとDPOを組み合わせて方策を微調整する手法を提案した。
- その手の中の世界:実環境での人間中心マニピュレーション学習のための大規模オープンソースエコシステムマニピュレーション2025/12/1
実環境で収集した1000時間超の人間のマニピュレーションデータとウェアラブル収集キット、ベンチマークをオープンソースで提供し、ロボットのマニピュレーション成功率を8%から60%に向上させた。
- World4RL: 拡散世界モデルによるロボットマニピュレーションの強化学習ポリシー改善マニピュレーション2025/9/1
拡散モデルベースの世界モデルを高忠実度シミュレータとして用い、実機やシミュレータを使わずに想像環境内でマニピュレーション方策を強化学習で直接改善するフレームワークを提案。
- ReasonPlan:閉ループ自動運転のための統合シーン予測と意思決定推論自動運転2025/5/1
マルチモーダル大規模言語モデルを微調整し、次シーン予測と意思決定連鎖推論を組み合わせて閉ループ自動運転の性能と解釈性を向上させた研究。
- LiloDriver: ロングテール自動運転シーンにおける閉ループ運動計画のための生涯学習フレームワーク自動運転/運動計画2025/5/1
大規模言語モデルと記憶拡張型プランナ生成を組み合わせ、再学習なしで新たなロングテール走行シーンに適応する生涯学習型の閉ループ運動計画フレームワークを提案し、nuPlanベンチマークで有効性を示した。
- オンラインマップの不確かさを活用した安全なエンドツーエンド自動運転自動運転2025/4/1
知覚モジュールでオンラインマップの不確かさを見積もり、その不確かさを予測・計画・軌道選択に活用することで、衝突率を最大26%削減する手法UncADを提案した。
- 模倣学習ベースのエンドツーエンド自動運転におけるデータスケーリング則自動運転2024/12/1
400万件の運転デモデータを用いて、模倣学習ベースのエンドツーエンド自動運転モデルの性能がデータ量に対してべき乗則に従うことを示し、長尾データの重要性や組み合わせ汎化を明らかにした。
- PlanAgent: マルチモーダル大規模言語モデルによる閉ループ車両運動計画自動運転計画2024/6/1
マルチモーダルLLMを認知エージェントとして用い、BEV地図とテキスト記述から階層的推論でプランナコードを生成し、反省モジュールで評価する閉ループ車両運動計画システムを提案。nuPlanで評価。
- GaussianGrasper: オープンボキャブラリなロボット把持のための3D言語ガウシアンスプラッティングマニピュレーション2024/3/1
3Dガウシアンスプラッティングでシーンを明示的に表現し、言語埋め込みを蒸留することで、言語指示に基づくオープンボキャブラリな物体把持を実現した。