Zhigang Wang
収録論文 24本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- OpenFlyScan:民生ドローン向け品質誘導型空中再構成システムsim2real2026/9/21
3Dガウシアンスプラッティングの再構成品質を予測し、不足領域を補う追加撮影を計画・実行する民生ドローン向けシステムを提案。
- WOLF: 予測フロンティアを用いた世界モデル誘導LiDAR探索探索2026/9/20
LiDAR搭載UAVの自律探索において、再帰的世界モデルで将来の観測を予測し、予測フロンティアを生成することで遮蔽物の先の有望領域を推定し探索効率を高める手法を提案。
- 動的補正を備えた閉ループアクションチャンクによる学習不要の拡散ポリシー拡散ポリシー/操作2026/3/1
拡散ベースのポリシーに動的環境情報を注入し、リアルタイムでアクションを補正する閉ループ拡散ポリシーフレームワークDCDPを提案。再学習なしで動的シナリオへの適応性を向上させる。
- FastUMI-100K:大規模UMI形式データセットによるデータ駆動型ロボットマニピュレーションの進展マニピュレーション2025/10/1
モジュール型ハードウェアと軽量トラッキングを備えたFastUMIシステムで収集した10万件超の家庭内タスク実演データセットを構築し、多様な模倣学習アルゴリズムで高い成功率を示した。
- ニューロシンボリックTAMPによる解体作業の身体性知能:マルチモーダル知覚の相互検証と継続学習ニューロシンボリックTAMP2025/9/1
ニューロシンボリックなタスク・動作計画にマルチモーダル知覚の相互検証と継続学習を組み込み、動的な電池解体作業でのロボットの成功率と知覚精度を大幅に向上させた研究。
- RobKiNetの解読:ロボット運動学情報ニューラルネットワークの効率的な学習への洞察マニピュレーション2025/9/1
ロボットの運動学知識を組み込んだニューラルネットワークRobKiNetを提案し、多制約下の関節配置サンプリングを効率化。9自由度移動マニピュレータの電池分解タスクで高い成功率を達成。
- 左脳から右脳へ:視覚と言語によるナビゲーションのための適応的テキストドリーマーVLA2025/5/1
視覚と言語によるナビゲーション(VLN)において、LLMをベースに左脳(論理統合)と右脳(想像的予測)の二重分岐構造で将来の環境意味を言語形式で適応的に想像し、ナビゲーション専門モジュールと統合する手法を提案。R2Rベンチマークで少ないパラメータで最先端性能を達成。
- 小さく考え、大きく行動する:生涯ロボットマニピュレーションのためのプリミティブプロンプト学習マニピュレーション2025/4/1
スキル間で共有されるプリミティブをプロンプトとして学習し、生涯にわたるロボットマニピュレーションを実現する手法を提案。
- MoMa-Kitchen: モバイルマニピュレーションにおけるアフォーダンスに基づく最終接近ナビゲーションのための10万件超ベンチマークモバイルマニピュレーション2025/3/1
キッチン環境でロボットが物体を掴むために最適な最終ナビゲーション位置を学習するための10万件超のデータセットとベンチマークを構築し、軽量なベースラインモデルNavAffを提案した。
- OpenFly: 空中視覚言語ナビゲーションのための包括的プラットフォームVLA2025/2/1
空中視覚言語ナビゲーションのための多様なレンダリングエンジンと自動データ収集ツールチェーンを統合したプラットフォームを提案し、10万軌道の大規模ベンチマークとキーフレーム重視のナビゲーションモデルを構築した。
- SpatialVLA:視覚-言語-行動モデルのための空間表現の探求VLA2025/1/1
ロボット操作における空間理解の重要性に着目し、3D位置エンコーディングと適応的行動グリッドを導入した視覚-言語-行動基盤モデルSpatialVLAを提案。110万件の実世界ロボットデータで事前学習し、ゼロショットでの操作や新環境への適応を実現した。
- 空間表現の探索による空中視覚言語ナビゲーションにおけるLLM推論の強化空中VLN2024/10/1
空中VLNタスクにおいて、LLMをエージェントとして活用し、意味論的トポロジカル距離表現(STMR)を導入することで空間推論能力を高め、訓練不要のゼロショットフレームワークを実現した。
- FastUMI: スケーラブルでハードウェア非依存の汎用マニピュレーションインターフェースとデータセットマニピュレーション2024/9/1
ロボットアームの実世界データ収集を低コスト・ハードウェア非依存で実現するため、UMIを再設計したFastUMIを提案し、22タスク・1万軌跡超のデータセットを公開した。
- COHERENT: 大規模言語モデルによる異種マルチロボット協調システムマルチロボット協調2024/9/1
ドローン・ロボット犬・ロボットアームなど異種ロボットの協調を、LLMによる提案・実行・フィードバック・調整のループで計画するフレームワークを提案し、100タスクのベンチマークで従来手法を大きく上回った。
- 奥行きが効く:RGBベースの事前学習済み方策への奥行き情報注入による改善マニピュレーション2024/8/1
RGB入力のみで動作するロボット操作方策に、学習時のみRGB-Dを使う奥行き情報注入フレームワークを提案し、3D知覚能力を高めて細かい操作タスクの性能を向上させた。
- KOI: ハイブリッドキー状態ガイダンスによるオンライン模倣学習の加速模倣学習2024/8/1
視覚言語モデルとオプティカルフローで専門家軌道から意味的・動作的キー状態を抽出し、報酬推定を改善することでオンライン模倣学習の探索効率を高める手法を提案。
- 電池解体を革新する:電池解体自律移動マニピュレータロボット(BEAM-1)の設計と実装マニピュレーション2024/7/1
ニューロシンボリックAIを活用し、多様なボルトの連続解体を自律的に行う移動マニピュレータロボットBEAM-1を開発。実環境で98.78%の成功率を達成した。
- SAM-E: 視覚基盤モデルと系列模倣による身体性マニピュレーションマニピュレーション2024/5/1
大規模画像で事前学習されたSegment Anything (SAM) を基盤モデルとして活用し、ロボットデータで効率的に微調整することで、長期的な行動推論と汎化性能を高めたマニピュレーション手法を提案。
- RobKiNet: ロボット運動学を考慮したニューラルネットワークによる最適ロボット配置予測タスク・運動計画2024/2/1
ロボットの運動学制約をニューラルネットワークに組み込み、タスク達成に適した配置パラメータを高精度・高データ効率で予測するフレームワークを提案。運動計画を最大153倍高速化。
- Kinematic-aware Prompting for Generalizable Articulated Object Manipulation with LLMs2023/11/1
- Affordance-Driven Next-Best-View Planning for Robotic Grasping2023/9/1
- Learning Symbolic Operators: A Neurosymbolic Solution for Autonomous Disassembly of Electric Vehicle Battery2022/6/1
- Autonomous Electric Vehicle Battery Disassembly Based on NeuroSymbolic Computing2022/5/1
- Are We Ready for Service Robots? The OpenLORIS-Scene Datasets for Lifelong SLAM2019/11/1