Hanbo Zhang
収録論文 26本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 物体中心ポリシーを組み合わせたリcedingホライズン押し動作マニピュレーション2026/9/20
任意形状の3D物体を長期的に押して目標姿勢へ移動させるため、物体中心の学習ポリシーとBIT*探索を組み合わせた階層的フレームワークを提案し、実機実験で有効性を示した。
- 不確実性下での仮説駆動型モデル拡張によるオープンワールドロボット計画プランニング2026/7/1
未知環境で動作するサービスロボットが、基盤モデルを用いて世界モデルの仮説を生成・検証・更新しながら自律的に知識を拡張し、タスク計画を実行する枠組みを提案した。
- 動的環境における可視性を考慮した移動把持移動把持2026/5/1
限られた視野を持つ移動ロボットが、動的で未知の環境で安全に物体を把持するための統合システムを提案。低レベルの全身プランナーと高レベルの行動木プランナーを組み合わせ、シミュレーションと実機で有効性を実証した。
- 階層的マニピュレーション政策のための世界モデルのスケーリングVLA2026/2/1
大規模事前学習済み世界モデルを高レベルプランナーとして用い、VLAを低レベル実行者とする階層的フレームワークを提案。未知物体や新規状況での汎化性能を大幅に向上させた。
- MimicFunc: 単一の人間動画から機能対応を介して道具操作を模倣する模倣学習2025/8/1
機能中心の局所座標系「ファンクションフレーム」を構築し、1本のRGB-D人間動画から新しい道具への操作スキルを汎化するフレームワークを提案。
- Chain-of-Action: ロボットマニピュレーションのための軌道自己回帰モデリングマニピュレーション2025/6/1
目標から逆算して行動系列を自己回帰的に生成する視覚運動ポリシーを提案し、RLBenchと実機タスクで最先端性能を達成した。
- 取扱説明書を読んで家電を操作するロボットVLA2025/5/1
家電の取扱説明書を大規模視覚言語モデルで解釈し、記号的なモデルを構築して実際の操作に結びつけるロボットシステムApBotを提案した。
- FUNCTO: 機能中心のワンショット模倣学習による道具操作模倣学習2025/2/1
人間の1回のデモ動画から、同じ機能を持つ形状の異なる道具へ操作スキルを汎化できる、3D機能キーポイント表現を用いたワンショット模倣学習手法を提案。
- 汎用ロボットのための視覚言語行動モデル構築で重要な要素VLA2024/12/1
視覚言語行動モデル(VLA)の性能を左右する設計要因を大規模実験で分析し、汎用ロボット向けの新しいVLAファミリーRoboVLMsを提案した論文。
- GR-2: ウェブ規模の知識を持つ生成型ビデオ・言語・行動モデルによるロボットマニピュレーションVLA2024/10/1
3800万本のインターネット動画で事前学習した大規模モデルをロボット軌道で微調整し、100以上のタスクで平均97.7%の成功率と未知環境への高い汎化性能を実現した。
- REGNet V2: 異なるサイズのグリッパ向けエンドツーエンド領域ベース把持検出ネットワークマニピュレーション2024/10/1
点群にグリッパパラメータを埋め込み、スコア・領域・精緻化の3段階ネットワークで多様な物体への把持を予測するシステムを提案し、実環境で高い成功率を達成した。
- DexDiff: 制約のない環境で掴めない物体を外的手先で操作するマニピュレーション2024/9/1
VLMによる高レベル計画と目標条件付き拡散モデルを組み合わせ、壁や机の端を利用して本や鍋のような掴みにくい物体を掴む外的手先操作を実現した。
- SInViG: A Self-Evolving Interactive Visual Agent for Human-Robot Interaction2024/2/1
- Towards Unified Interactive Visual Grounding in The Wild2024/1/1
- Vision-Language Foundation Models as Effective Robot Imitators2023/11/1
- InViG: Benchmarking Interactive Visual Grounding with 500K Human-Robot Interactions2023/10/1
- Robotic Grasping from Classical to Modern: A Survey2022/2/1
- Density-based Curriculum for Multi-goal Reinforcement Learning with Sparse Rewards2021/9/1
- INVIGORATE: Interactive Visual Grounding and Grasping in Clutter2021/8/1
- REGRAD: A Large-Scale Relational Grasp Dataset for Safe and Object-Specific Robotic Grasping in Clutter2021/4/1
- REGNet: REgion-based Grasp Network for End-to-end Grasp Detection in Point Clouds2020/2/1
- A Real-time Robotic Grasp Approach with Oriented Anchor Box2018/9/1
- A Multi-task Convolutional Neural Network for Autonomous Robotic Grasping in Object Stacking Scenes2018/9/1
- ROI-based Robotic Grasp Detection for Object Overlapping Scenes2018/8/1
- Fully Convolutional Grasp Detection Network with Oriented Anchor Box2018/3/1
- Visual Manipulation Relationship Network2018/2/1