Zhenyu Wu
Tsinghua University
収録論文 34本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- SkillMemo: 専門家ガイドによるスキル記憶フレームワークを用いた構成的手操作操作2026/8/1
長期的なデモンストレーションを潜在的な原子スキルに分解し、動的エピソード記憶バンクに統合することで、構成的一般化を向上させるフレームワークを提案。
- GigaWorld-1: ロボットポリシー評価のためのワールドモデル構築ロードマップワールドモデル2026/7/1
ロボットポリシーの評価を効率化するため、ワールドモデルの信頼性を体系的に研究し、ベンチマークWMBenchを構築して、7つのビデオワールドモデルと4つの行動表現を比較した。
- GigaWorld-Policy-0.5: AutoResearchによる高速・高精度なWAMの実現VLA2026/7/1
将来の視覚予測を訓練時のみに用い、推論時は行動生成のみで高速化した行動中心のWorld Action Modelを提案し、AutoResearchで最適設定を探索して性能を向上させた。
- WorldSample: ワールドモデリングを用いた実機ロボットの閉ループ強化学習強化学習2026/7/1
実機ロボットの強化学習において、実ロールアウトとワールドモデル生成を閉ループで結び、高品質な合成遷移を生成して学習を効率化する手法を提案。ポリシー成功率を28%向上させ、訓練ステップを59%削減した。
- R2RDreamer: 空間的に汎化する2次元操作ポリシーのための3次元認識データ拡張操作学習2026/6/15
実デモから3D編集と2Dビデオ補完を組み合わせて、物体位置や視点が変わっても動作する操作ポリシーを学習するためのデータ拡張手法を提案した。
- UniIntervene: 実世界強化学習の効率化のためのエージェント介入強化学習2026/6/10
人間参加型強化学習における介入コストを削減するため、非生産的な探索を検知し自律的に回復行動を生成するエージェント介入モデルUniInterveneを提案した。
- iMaC: 動作と接触画像への変換による具現化ワールドモデルVLA2026/6/8
ロボット操作のための新しい制御パラダイムを提案し、画像をアクション表現として用いることで、従来のベクトルベースのアクションよりも表現力と汎化性を向上させる。
- MIL-LC: 頑健な磁気・慣性・LiDAR融合マルチモーダル位置推定フレームワーク位置推定2026/6/1
GNSS拒否環境や幾何学的反復・テクスチャレス環境でも頑健な位置推定を実現するため、磁気センサ・慣性センサ・LiDARを融合したマルチモーダル位置推定フレームワークMIL-LCを提案した。
- DVG-WM: 分離型ビデオ生成によるロボット操作のための効率的身体化世界モデル世界モデル2026/6/1
ビデオ生成を動力学学習と視覚合成に分離することで、高品質な予測を高速に実現する身体化世界モデルを提案した。
- RoSLAC: 複数磁力計のロバストな同時位置推定と校正位置推定2026/4/1
GPSが使えない環境での移動ロボット位置推定のため、磁力計の歪みを補正しながら位置推定を同時に行うロバストな手法を提案した論文。
- DockAnywhere: 新規デモ生成による移動操作のためのデータ効率的視覚運動ポリシー学習移動操作2026/4/1
移動操作ロボットのドッキング位置のずれによる視点一般化問題を解決するため、単一のデモを多様なドッキング構成に拡張する低コストなデモ生成フレームワークを提案した。
- AAAI 2026 RoCoチャレンジ:産業オートメーションに向けたロボット協調組立操作のベンチマーク協調操作/組立/ベンチマーク2026/3/1
産業用ロボットの協調組立操作を評価するため、惑星歯車組立タスクを用いたシミュレーションと実世界のチャレンジを開催し、データセットと評価システムを提供した。
- SteadyTray: 残差強化学習による人型ロボットのトレイ運搬における物体バランス学習歩行/強化学習2026/3/1
人型ロボットが歩行中にトレイ上の物体を安定して運ぶための階層型強化学習フレームワークを提案し、歩行制御と物体安定化を分離することで高い成功率と実機でのゼロショット転移を実現した。
- E2HiL: エントロピー誘導サンプル選択による効率的な実世界ヒューマン・イン・ザ・ループ強化学習ヒューマン・イン・ザ・ループ強化学習2026/1/1
方策エントロピーへの影響度を推定し、有益なサンプルを能動的に選ぶことで、人手介入を減らしつつ実世界マニピュレーションタスクの学習を効率化するヒューマン・イン・ザ・ループ強化学習フレームワークを提案した。
- L2M-Calib: LiDARと複数磁気センサのワンキーキャリブレーション手法キャリブレーション2025/12/1
磁気センサとLiDARの融合システム向けに、外部パラメータと磁気センサの内部歪みパラメータを同時推定するワンキーキャリブレーション手法を提案し、シミュレーションと実機実験で高精度・高ロバスト性を示した。
- MAP-VLA:視覚言語行動モデルのための記憶拡張プロンプティングによるロボット操作VLA2025/11/1
長期タスクに弱いVLAモデルに対し、過去のデモから記憶ライブラリを構築し、類似軌道を検索してソフトプロンプトとして注入することで、凍結したVLAの行動生成を軽量に拡張する手法。
- RESample: 探索的サンプリングによるロボットマニピュレーションのための堅牢なデータ拡張フレームワークデータ拡張2025/10/1
VLAモデルの失敗復帰データ不足を補うため、保守的カバレッジ関数で不足領域を特定し、探索行動と復帰行動を能動的にサンプリングしてデータ拡張するフレームワークを提案。LIBEROと実機で最大12%の成功率向上を達成。
- MoTo: 汎用モバイルマニピュレーションのためのゼロショット・プラグイン型インタラクション認識ナビゲーションモバイルマニピュレーション2025/9/1
固定ベースのマニピュレーション基盤モデルにプラグインするだけで、VLMと軌道最適化によりゼロショットで移動マニピュレーションを実現する手法を提案。
- VLA-Reasoner: オンラインMCTSによる推論で視覚言語行動モデルを強化VLA2025/9/1
VLAモデルにテスト時スケーリングを適用し、ワールドモデルとMCTSで将来状態を予測・探索することで長期的な操作タスクの性能を向上させるプラグイン手法を提案。
- SafeBimanual: 拡散モデルによる安全な両手マニピュレーションのための軌道最適化マニピュレーション2025/8/1
事前学習済みの拡散モデルベース両手マニピュレーションポリシーに対し、VLMで安全制約を動的に設計しテスト時に軌道を最適化することで、危険動作を抑えつつ成功率を向上させるフレームワーク。
- UniLGL: FOV制限/パノラマLiDARのための均一な場所認識に基づくグローバル位置推定グローバル位置推定2025/7/1
LiDAR点群を空間・強度のBEV画像に変換し、異種センサにも対応する均一な特徴抽出と視点不変性で、登録不要の高精度なグローバル位置推定を実現した。
- MCN-SLAM: ハイブリッド暗黙的ニューラルシーン表現を用いたマルチエージェント協調ニューラルSLAMSLAM2025/6/1
複数エージェントが協調して動作する分散型ニューラルSLAMフレームワークを提案し、通信帯域制約下での大規模環境の再構成と、単一・複数エージェント両対応の実世界データセットを構築した。
- MoManipVLA:視覚言語行動モデルを汎用モバイルマニピュレーションへ転移VLA2025/3/1
固定ベース操作用に事前学習されたVLAモデルを活用し、二段階最適化で台車移動とアーム軌道を計画することで、モバイルマニピュレーションをゼロショットで汎化させるフレームワークを提案。
- IDF-MFL: 移動ロボットのためのインフラ不要・ドリフトフリー磁場自己位置推定自己位置推定2024/11/1
建物や地下パイプなどが生む環境磁場を利用し、事前インフラなしで外れ値に頑健な状態推定によりドリフトのない自己位置推定を実現した。
- SG-Nav: 3Dシーングラフを用いたLLMベースのゼロショット物体ナビゲーションナビゲーション2024/10/1
観測した環境を3Dシーングラフで表現し、LLMに階層的な思考プロンプトを与えることで、ゼロショット物体ナビゲーションを高精度かつ説明可能に実現した研究。
- CTE-MLO: 連続時間かつ高効率なマルチLiDARオドメトリと局所化可能性を考慮した点群サンプリングマルチLiDARオドメトリ2024/8/1
複数のLiDARからの点群を連続時間ガウス過程とカルマンフィルタで統合し、局所化可能性を考慮したサンプリングで計算量を抑えつつ高精度・リアルタイムな自己位置推定を実現する手法を提案。
- 未知環境における身体性指示追従VLA2024/6/1
マルチモーダル大規模言語モデルを用いた階層的フレームワークにより、未知環境を探索しながら複雑な人間の指示を実行する身体性エージェントを実現した。
- Anyview: Generalizable Indoor 3D Object Detection with Variable Frames2023/10/1
- NTU4DRadLM: 4D Radar-centric Multi-Modal Dataset for Localization and Mapping2023/9/1
- Embodied Task Planning with Large Language Models2023/7/1
- Category-level Shape Estimation for Densely Cluttered Objects2023/2/1
- Smart Explorer: Recognizing Objects in Dense Clutter via Interactive Exploration2022/8/1
- Semantic Reinforced Attention Learning for Visual Place Recognition2021/8/1
- Magnetic-Assisted Initialization for Infrastructure-free Mobile Robot Localization2019/11/1