Tao Kong
収録論文 29本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- BridgeVLA++: 3次元操作のためのデータ効率的で汎化可能なメモリ拡張型視覚言語行動フレームワークVLA2026/8/1
事前学習済み視覚言語モデルを活用した3次元ロボット操作フレームワークBridgeVLAを拡張し、空間的・時間的メモリを統合することで、データ効率と汎化性能を保ちつつ、記憶依存の操作タスクで最先端の性能を達成した。
- SpatialVAM: 空間認識型マルチビュービデオ拡散によるデータ効率的なロボットポリシーVLA/操作2026/4/1
3D空間構造と時間変化を同時に捉えるため、空間認識型のマルチビューヒートマップビデオとRGBビデオを生成する初の3Dビデオ行動モデルを提案し、少数のデモで汎用的な操作を実現した。
- GR-RL:長期的器用マニピュレーションのための器用で精密なロボット学習マニピュレーション2025/12/1
人間のデモンストレーションをフィルタリング・拡張・強化学習で強化し、VLAポリシーを長期的で精密な器用マニピュレーションに特化させるフレームワークを提案。靴紐を穴に通して結ぶタスクを83.3%の成功率で自律的に達成。
- シミュレーションと同じ操作を実現:ロボットにおける正確な幾何認識の実現sim2real2025/9/1
深度カメラのノイズを除去して正確なメートル深度を推定するCamera Depth Models(CDMs)を提案し、シミュレーションで訓練した方策を実世界ロボットにそのまま適用可能にした。
- GR-3 汎用ロボットポリシー構築に向けた大規模VLAモデルVLA2025/7/1
ウェブ規模の視覚言語データとVR収集の人間軌道データ、ロボット軌道データを組み合わせて訓練した大規模VLAモデルGR-3を開発し、両腕移動ロボットByteMiniと統合して新規物体・環境・長期タスクへの汎化性能を示した。
- 人間支援によるロボット政策の行動選好最適化VLA2025/6/1
人間とのインタラクションから得た選好信号を用いてVLAモデルを事後的に改善するAPOを提案し、失敗からの学習を可能にした。
- BridgeVLA: 視覚言語モデルによる効率的な3Dマニピュレーション学習のための入出力アラインメントVLA2025/6/1
3D入力を複数の2D画像に投影し、2Dヒートマップで行動予測を行うことで、VLMを活用した3Dマニピュレーション学習を効率化する手法を提案。
- Chain-of-Action: ロボットマニピュレーションのための軌道自己回帰モデリングマニピュレーション2025/6/1
目標から逆算して行動系列を自己回帰的に生成する視覚運動ポリシーを提案し、RLBenchと実機タスクで最先端性能を達成した。
- 汎用ロボットのための視覚言語行動モデル構築で重要な要素VLA2024/12/1
視覚言語行動モデル(VLA)の性能を左右する設計要因を大規模実験で分析し、汎用ロボット向けの新しいVLAファミリーRoboVLMsを提案した論文。
- GR-2: ウェブ規模の知識を持つ生成型ビデオ・言語・行動モデルによるロボットマニピュレーションVLA2024/10/1
3800万本のインターネット動画で事前学習した大規模モデルをロボット軌道で微調整し、100以上のタスクで平均97.7%の成功率と未知環境への高い汎化性能を実現した。
- 世界モデルに基づく知覚による視覚的脚式移動歩行2024/9/1
環境の世界モデルを構築し、それを用いて視覚入力から直接脚式ロボットの制御方策を学習する手法を提案。シミュレーションで訓練しながら実世界でも正確な予測が可能で、従来手法より高い走破性と頑健性を示した。
- GR-MG: 部分注釈データを活用するマルチモーダル目標条件付きポリシーマニピュレーション2024/8/1
テキスト指示と目標画像の両方で条件付けできるポリシーを提案し、部分的に注釈されたデータを活用してロボット操作の汎化性能を向上させた。
- IRASim: ロボットマニピュレーションのための細粒度ワールドモデルワールドモデル2024/6/1
拡散トランスフォーマーとフレーム単位の行動条件付けモジュールを導入し、ロボットと物体の細かな相互作用を捉えた動画を生成するワールドモデルを提案。方策評価の加速やモデルベース計画による性能向上を実証した。
- SInViG: A Self-Evolving Interactive Visual Agent for Human-Robot Interaction2024/2/1
- Towards Unified Interactive Visual Grounding in The Wild2024/1/1
- Unleashing Large-Scale Video Generative Pre-training for Visual Robot Manipulation2023/12/1
- Vision-Language Foundation Models as Effective Robot Imitators2023/11/1
- InViG: Benchmarking Interactive Visual Grounding with 500K Human-Robot Interactions2023/10/1
- MOMA-Force: Visual-Force Imitation for Real-World Mobile Manipulation2023/8/1
- Exploring Visual Pre-training for Robot Manipulation: Datasets, Models and Methods2023/8/1
- Learning to Explore Informative Trajectories and Samples for Embodied Perception2023/3/1
- Generative Category-Level Shape and Pose Estimation with Semantic Primitives2022/10/1
- 3D Part Assembly Generation with Instance Encoded Transformer2022/7/1
- Learning Design and Construction with Varying-Sized Materials via Prioritized Memory Resets2022/4/1
- Navigating to Objects in Unseen Environments by Distance Prediction2022/2/1
- Simultaneous Semantic and Collision Learning for 6-DoF Grasp Pose Estimation2021/8/1
- ICM-3D: Instantiated Category Modeling for 3D Instance Segmentation2021/8/1
- Learning to Design and Construct Bridge without Blueprint2021/8/1
- Adversarial Option-Aware Hierarchical Imitation Learning2021/6/1