Ziwei Wang
Nanyang Technological University
収録論文 61本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- DynaHarness:自己進化するロボットエージェントのための動的物理ハーネスVLA2026/9/30
意味推論と物理実行を実行契約で結びつけ、失敗の帰属分析と回帰チェックにより再利用可能な能力を自己修正する枠組みを提案し、LIBERO-Proで凍結方策を大きく上回る成功率を達成した。
- RotateIt!:オンライン適応型動的回転による高速で信頼性の高い片腕での衣類展開マニピュレーション2026/9/17
片腕で衣類を持ち上げて軸回転させ、慣性で層を分離する動的な展開フレームワークを提案。オンライン適応方策で回転量と速度を調整し、準静的な手法より成功率を大幅に改善した。
- Facet-0: 接触を伴う精密操作のためのロボット基盤モデルマニピュレーション2026/9/1
接触の結果を予測・評価するロボット基盤モデルを提案し、サブミリ精度の組立タスクで高い成功率を達成した。
- EMERGE-Policy: ロボットの心は単一ポリシーを超えて出現するVLA2026/8/30
複数の専門エージェントが協調して知覚・推論・検証・記憶を行うグラフ構造のエージェントフレームワークを提案し、追加のファインチューニングなしでベンチマークと実ロボット実験で高い性能を達成した。
- SkillMemo: 専門家ガイドによるスキル記憶フレームワークを用いた構成的手操作操作2026/8/1
長期的なデモンストレーションを潜在的な原子スキルに分解し、動的エピソード記憶バンクに統合することで、構成的一般化を向上させるフレームワークを提案。
- AffordTrajDP: 動的アフォーダンス誘導によるロボット操作の視覚運動ポリシー学習マニピュレーション2026/8/1
静的アフォーダンスの限界を克服するため、物体のSE(3)姿勢を媒体にアフォーダンス軌道を生成し、時間的に一貫した状態認識ガイダンスを提供する動的フレームワークを提案。ManiSkill3で70%の成功率を達成し、実機でも堅牢性を実証した。
- WorldSample: ワールドモデリングを用いた実機ロボットの閉ループ強化学習強化学習2026/7/1
実機ロボットの強化学習において、実ロールアウトとワールドモデル生成を閉ループで結び、高品質な合成遷移を生成して学習を効率化する手法を提案。ポリシー成功率を28%向上させ、訓練ステップを59%削減した。
- RoboDojo: 汎用ロボット操作ポリシーの包括的評価のための統合シミュレーション・実世界ベンチマークベンチマーク2026/7/1
シミュレーションと実世界の両方で汎用ロボット操作ポリシーを評価するための統一ベンチマークを提案し、42のシミュレーションタスクと18の実世界タスクで多様な能力を評価する。
- SkillPlug: 教師なしスキル抽出によるロボット操作の少数ショット適応マニピュレーション2026/7/1
既存の視覚運動模倣ポリシーにスキル条件付けモジュールを追加し、マルチタスクのデモから共有可能なスキルライブラリを自己教師ありで抽出することで、新しいタスクへの少数ショット適応を効率化するフレームワークを提案した。
- UniIntervene: 実世界強化学習の効率化のためのエージェント介入強化学習2026/6/10
人間参加型強化学習における介入コストを削減するため、非生産的な探索を検知し自律的に回復行動を生成するエージェント介入モデルUniInterveneを提案した。
- iMaC: 動作と接触画像への変換による具現化ワールドモデルVLA2026/6/8
ロボット操作のための新しい制御パラダイムを提案し、画像をアクション表現として用いることで、従来のベクトルベースのアクションよりも表現力と汎化性を向上させる。
- DVG-WM: 分離型ビデオ生成によるロボット操作のための効率的身体化世界モデル世界モデル2026/6/1
ビデオ生成を動力学学習と視覚合成に分離することで、高品質な予測を高速に実現する身体化世界モデルを提案した。
- 嗜好較正型ヒューマン・イン・ザ・ループ強化学習によるロボット操作マニピュレーション2026/6/1
人間介入を利用した強化学習で、介入が誘発する嗜好信号から劣った軌道区間を特定し、Q値の過大評価を防ぎつつ方策を人間の修正行動に合わせて較正するPACTフレームワークを提案した。
- DexTeleop-0: 力覚対応の両手巧緻遠隔操作と自己中心視覚による共有自律遠隔操作2026/6/1
触覚駆動の適応戦略を導入し、遠隔操作パイプライン上で細かい操作を可能にする両手巧緻遠隔操作フレームワークを提案。実時間最適化ループで身体差を埋め、接触点推定と触覚指先力センシングにより局所補正を動的計算する。
- DockAnywhere: 新規デモ生成による移動操作のためのデータ効率的視覚運動ポリシー学習移動操作2026/4/1
移動操作ロボットのドッキング位置のずれによる視点一般化問題を解決するため、単一のデモを多様なドッキング構成に拡張する低コストなデモ生成フレームワークを提案した。
- SIMART: MLLMによるモノリシックメッシュのシミュレーション対応関節アセットへの分解3Dアセット生成2026/3/1
静的メッシュを、物理シミュレーションに使える関節付き3Dアセットへ変換する統一MLLMフレームワークを提案。スパース3D VQ-VAEでトークン数を削減し、部品分解と関節予測を同時に行う。
- AAAI 2026 RoCoチャレンジ:産業オートメーションに向けたロボット協調組立操作のベンチマーク協調操作/組立/ベンチマーク2026/3/1
産業用ロボットの協調組立操作を評価するため、惑星歯車組立タスクを用いたシミュレーションと実世界のチャレンジを開催し、データセットと評価システムを提供した。
- SA-VLA: 空間認識型フローマッチングによる視覚-言語-行動強化学習VLA2026/2/1
フローマッチング型VLAポリシーの強化学習適応時に空間的帰納バイアスが失われる問題に対し、空間表現の融合・幾何学的進捗に基づく密報酬・空間条件付き探索戦略を組み合わせ、空間分布シフト下での汎化性能を高める手法を提案。
- UniManip: エージェント型操作グラフによる汎用ゼロショットロボットマニピュレーションマニピュレーション2026/2/1
意味推論と物理制御を二層のエージェント型操作グラフで統合し、未知の物体やタスクにもゼロショットで対応できる汎用マニピュレーション手法を提案。
- E2HiL: エントロピー誘導サンプル選択による効率的な実世界ヒューマン・イン・ザ・ループ強化学習ヒューマン・イン・ザ・ループ強化学習2026/1/1
方策エントロピーへの影響度を推定し、有益なサンプルを能動的に選ぶことで、人手介入を減らしつつ実世界マニピュレーションタスクの学習を効率化するヒューマン・イン・ザ・ループ強化学習フレームワークを提案した。
- NORA-1.5:世界モデルと行動に基づく選好報酬で訓練された視覚-言語-行動モデルVLA2025/11/1
事前学習済みNORAにフローマッチング行動エキスパートを追加し、世界モデルと正解からの逸脱を報酬とするDPOで事後学習することで、シミュレーションと実機の両方で信頼性と汎化性能を向上させたVLAモデル。
- 視覚-言語-行動モデルの未来を導く10の未解決課題VLA2025/11/1
VLAモデルの発展における10の主要マイルストーンと新たな研究動向を議論し、今後の研究方向に注目を促す論文。
- MAP-VLA:視覚言語行動モデルのための記憶拡張プロンプティングによるロボット操作VLA2025/11/1
長期タスクに弱いVLAモデルに対し、過去のデモから記憶ライブラリを構築し、類似軌道を検索してソフトプロンプトとして注入することで、凍結したVLAの行動生成を軽量に拡張する手法。
- RESample: 探索的サンプリングによるロボットマニピュレーションのための堅牢なデータ拡張フレームワークデータ拡張2025/10/1
VLAモデルの失敗復帰データ不足を補うため、保守的カバレッジ関数で不足領域を特定し、探索行動と復帰行動を能動的にサンプリングしてデータ拡張するフレームワークを提案。LIBEROと実機で最大12%の成功率向上を達成。
- RoDyn: ロボット操作のための対話型ロボット・ダイナミック2.5D世界モデルの構築世界モデル2025/10/1
ロボット操作のための幾何学的・運動学的推論を組み込んだ2.5D世界モデルを提案し、実世界模倣学習の成功率を42%向上させた。
- トルク対応VLAモデルの設計空間の解明VLA2025/9/1
トルク信号をVLAモデルに統合する設計空間を体系的に検討し、デコーダへのトルクアダプタ導入と補助出力としてのトルク予測が有効であることを示した。
- MoTo: 汎用モバイルマニピュレーションのためのゼロショット・プラグイン型インタラクション認識ナビゲーションモバイルマニピュレーション2025/9/1
固定ベースのマニピュレーション基盤モデルにプラグインするだけで、VLMと軌道最適化によりゼロショットで移動マニピュレーションを実現する手法を提案。
- RoboChemist: 長期的・安全基準準拠のロボット化学実験システムVLA2025/9/1
VLMとVLAを組み合わせた二重ループ構成で、危険物や変形物を扱う多段階の化学実験を、安全規範を守りながら実行するロボットシステムを提案した。
- VLA-Reasoner: オンラインMCTSによる推論で視覚言語行動モデルを強化VLA2025/9/1
VLAモデルにテスト時スケーリングを適用し、ワールドモデルとMCTSで将来状態を予測・探索することで長期的な操作タスクの性能を向上させるプラグイン手法を提案。
- 問い合わせ可能な3Dシーン表現:意味推論とロボットタスク計画のためのマルチモーダルフレームワークシーン理解2025/9/1
パノラマ再構成・点群・シーングラフを統合し、視覚言語モデルで物体検索できる3Dシーン表現を構築、ロボットのタスク計画に応用した研究。
- GWM: ロボットマニピュレーションのためのスケーラブルなガウス世界モデルマニピュレーション2025/8/1
ロボット操作のためのガウス世界モデル(GWM)を提案し、ガウスプリミティブの伝播を予測して将来状態を再構成することで、模倣学習とモデルベース強化学習を支援する。
- SafeBimanual: 拡散モデルによる安全な両手マニピュレーションのための軌道最適化マニピュレーション2025/8/1
事前学習済みの拡散モデルベース両手マニピュレーションポリシーに対し、VLMで安全制約を動的に設計しテスト時に軌道を最適化することで、危険動作を抑えつつ成功率を向上させるフレームワーク。
- IGL-Nav: 画像ゴールナビゲーションのためのインクリメンタル3Dガウシアンローカリゼーションナビゲーション2025/8/1
3Dガウシアンスプラッティングを用いて、探索中に逐次更新されるシーン表現からゴール画像の位置を粗く特定し、近づくと微分可能レンダリングで精密化する画像ゴールナビゲーション手法を提案。
- ManiGaussian++:階層的ガウス世界モデルによる汎用ロボット両腕マニピュレーションマニピュレーション2025/6/1
両腕ロボットのマルチタスク操作のため、役割の異なる腕を区別するガウス表現とリーダー・フォロワー型の階層的世界モデルを導入し、時空間ダイナミクスを予測して性能を向上させた。
- VLA-RL:スケーラブルな強化学習による汎用ロボットマニピュレーションの習得VLA2025/5/1
事前学習済みVLAモデルをオンライン強化学習で改善し、スパース報酬をVLMベースの報酬モデルで補うことで、LIBEROの40タスクで最高性能を達成した。
- UniGoal: 汎用的なゼロショット目標指向ナビゲーションに向けてナビゲーション2025/3/1
異なる種類の目標を統一的なグラフ表現で扱い、LLMによるグラフ推論でゼロショット目標指向ナビゲーションを実現するフレームワークを提案。
- MoManipVLA:視覚言語行動モデルを汎用モバイルマニピュレーションへ転移VLA2025/3/1
固定ベース操作用に事前学習されたVLAモデルを活用し、二段階最適化で台車移動とアーム軌道を計画することで、モバイルマニピュレーションをゼロショットで汎化させるフレームワークを提案。
- 狭い配管内検査のための四足歩行ロボットの移動学習歩行2024/12/1
強化学習を用いて、四足歩行ロボットが狭い配管内を障害物があっても適応的に移動できる方策を訓練した研究。
- AnyBimanual:単腕ポリシーを汎用両腕マニピュレーションへ転移マニピュレーション2024/12/1
事前学習済みの単腕ポリシーをスキルマネージャと視覚アライナで両腕タスクに転移し、少ない実演で汎用両腕マニピュレーションを実現する手法を提案。
- 宇宙分散型宇宙機の自己再構成戦略宇宙ロボティクス2024/11/1
模倣学習と強化学習を組み合わせてモジュールの運搬順序を学習し、ロボットアームの動作計画により軌道上で宇宙機を自己再構成する手法を提案した。
- EmbodiedSAM: 実時間で任意の3D物体をオンラインセグメンテーション3D知覚2024/8/1
SAMを活用し、RGB-Dストリームからオンラインでリアルタイムに3Dインスタンスセグメンテーションを行う手法を提案。
- 学習ベースのキーポイント検出と姿勢推定手法のロバスト性認証姿勢推定2024/8/1
2段階の6D物体姿勢推定において、キーポイント検出モデルを検証しやすい形に変更し、画像の凸包表現を入力仕様として用いることで、意味的摂動に対する局所ロバスト性をニューラルネットワーク検証問題として認証する手法を提案した。
- ManiCM: ロボットマニピュレーションのための一貫性モデルによるリアルタイム3D拡散ポリシーマニピュレーション2024/6/1
拡散モデルに一貫性制約を課すことで、点群入力からロボットの行動を1ステップで生成するリアルタイムマニピュレーションモデルを提案し、従来手法を平均10倍高速化した。
- 未知環境における身体性指示追従VLA2024/6/1
マルチモーダル大規模言語モデルを用いた階層的フレームワークにより、未知環境を探索しながら複雑な人間の指示を実行する身体性エージェントを実現した。
- ManiGaussian: マルチタスクロボット操作のための動的ガウシアンスプラッティングマニピュレーション2024/3/1
将来のシーン再構成を通じてシーンの動きを捉える動的ガウシアンスプラッティング手法を提案し、言語条件付きロボット操作タスクの成功率を向上させた。
- StableLego:ブロック積み上げ構造の安定性解析組立・安定性解析2024/2/1
ブロック積み上げ構造の安定性を力の釣り合い方程式に基づく最適化で推定する手法を提案し、50k以上の3Dオブジェクトを含むデータセットStableLegoを公開した。
- Robust Adversarial Attacks Detection for Deep Learning based Relative Pose Estimation for Space Rendezvous2023/11/1
- Anyview: Generalizable Indoor 3D Object Detection with Variable Frames2023/10/1
- Spiral Complete Coverage Path Planning Based on Conformal Slit Mapping in Multi-connected Domains2023/9/1
- Dynamic Hand Gesture-Featured Human Motor Adaptation in Tool Delivery using Voice Recognition2023/9/1
- Embodied Task Planning with Large Language Models2023/7/1
- Category-level Shape Estimation for Densely Cluttered Objects2023/2/1
- Planning Irregular Object Packing via Hierarchical Reinforcement Learning2022/11/1
- Smart Explorer: Recognizing Objects in Dense Clutter via Interactive Exploration2022/8/1
- Smart Visual Beacons with Asynchronous Optical Communications using Event Cameras2022/8/1
- GE-Grasp: Efficient Target-Oriented Grasping in Dense Clutter2022/7/1
- Multiple-Pilot Collaboration for Advanced Remote Intervention using Reinforcement Learning2021/9/1
- Dual-arm Coordinated Manipulation for Object Twisting with Human Intelligence2021/8/1
- Shared Control for Bimanual Telesurgery with Optimized Robotic Partner2021/7/1
- An Asynchronous Kalman Filter for Hybrid Event Cameras2020/12/1
- Event Camera Calibration of Per-pixel Biased Contrast Threshold2020/12/1