Hongtao Wu
収録論文 20本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- BridgeVLA++: 3次元操作のためのデータ効率的で汎化可能なメモリ拡張型視覚言語行動フレームワークVLA2026/8/1
事前学習済み視覚言語モデルを活用した3次元ロボット操作フレームワークBridgeVLAを拡張し、空間的・時間的メモリを統合することで、データ効率と汎化性能を保ちつつ、記憶依存の操作タスクで最先端の性能を達成した。
- GR-3 汎用ロボットポリシー構築に向けた大規模VLAモデルVLA2025/7/1
ウェブ規模の視覚言語データとVR収集の人間軌道データ、ロボット軌道データを組み合わせて訓練した大規模VLAモデルGR-3を開発し、両腕移動ロボットByteMiniと統合して新規物体・環境・長期タスクへの汎化性能を示した。
- BridgeVLA: 視覚言語モデルによる効率的な3Dマニピュレーション学習のための入出力アラインメントVLA2025/6/1
3D入力を複数の2D画像に投影し、2Dヒートマップで行動予測を行うことで、VLMを活用した3Dマニピュレーション学習を効率化する手法を提案。
- 人間支援によるロボット政策の行動選好最適化VLA2025/6/1
人間とのインタラクションから得た選好信号を用いてVLAモデルを事後的に改善するAPOを提案し、失敗からの学習を可能にした。
- GR-2: ウェブ規模の知識を持つ生成型ビデオ・言語・行動モデルによるロボットマニピュレーションVLA2024/10/1
3800万本のインターネット動画で事前学習した大規模モデルをロボット軌道で微調整し、100以上のタスクで平均97.7%の成功率と未知環境への高い汎化性能を実現した。
- 世界モデルに基づく知覚による視覚的脚式移動歩行2024/9/1
環境の世界モデルを構築し、それを用いて視覚入力から直接脚式ロボットの制御方策を学習する手法を提案。シミュレーションで訓練しながら実世界でも正確な予測が可能で、従来手法より高い走破性と頑健性を示した。
- GR-MG: 部分注釈データを活用するマルチモーダル目標条件付きポリシーマニピュレーション2024/8/1
テキスト指示と目標画像の両方で条件付けできるポリシーを提案し、部分的に注釈されたデータを活用してロボット操作の汎化性能を向上させた。
- IRASim: ロボットマニピュレーションのための細粒度ワールドモデルワールドモデル2024/6/1
拡散トランスフォーマーとフレーム単位の行動条件付けモジュールを導入し、ロボットと物体の細かな相互作用を捉えた動画を生成するワールドモデルを提案。方策評価の加速やモデルベース計画による性能向上を実証した。
- Unleashing Large-Scale Video Generative Pre-training for Visual Robot Manipulation2023/12/1
- Vision-Language Foundation Models as Effective Robot Imitators2023/11/1
- MOMA-Force: Visual-Force Imitation for Real-World Mobile Manipulation2023/8/1
- Prepare the Chair for the Bear! Robot Imagination of Sitting Affordance to Reorient Previously Unseen Chairs2023/6/1
- Cell Biomechanical Modeling Based on Membrane Theory with Considering Speed Effect of Microinjection2022/11/1
- Transporters with Visual Foresight for Solving Unseen Rearrangement Tasks2022/2/1
- Put the Bear on the Chair! Intelligent Robot Interaction with Previously Unseen Chairs via Robot Imagination2021/8/1
- Efficient Path Planning in Narrow Passages for Robots with Ellipsoidal Components2021/4/1
- Can I Pour into It? Robot Imagining Open Containability Affordance of Previously Unseen Objects via Physical Simulations2020/8/1
- A Fractional-Order Normalized Bouc-Wen Model for Piezoelectric Hysteresis Nonlinearity2020/3/1
- Is That a Chair? Imagining Affordances Using Simulations of an Articulated Human Body2019/9/1
- "Good Robot!": Efficient Reinforcement Learning for Multi-Step Visual Tasks with Sim to Real Transfer2019/9/1