Alex Bewley
収録論文 18本 ・ フィジカルAI/ロボット学習
VLAsim2real視覚関係検出
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- Gemini Robotics 1.5:高度な身体性推論・思考・動作転移で汎用ロボットの最前線を押し広げるVLA2025/10/1
異種ロボットデータから学ぶ動作転移機構と自然言語での多段階推論を組み合わせたVLAモデルと、身体性推論に特化したモデルを発表し、複雑な多段階タスクの実行と解釈性を向上させた。
- SAS-Prompt: 大規模言語モデルを数値最適化器として活用したロボットの自己改善VLA2025/4/1
LLMが数値最適化を行える点に着目し、過去のロボット軌道を要約・分析・統合する単一プロンプト(SAS-Prompt)でロボット方策を反復的に自己改善する手法を提案。シミュレーションと実機の卓球タスクで検証した。
- RoPEを超えて:STRINGによる2D・3D位置エンコーディングの改善VLA2025/2/1
大規模言語モデルで広く使われるRotary Position Encodingsを統一的な理論枠組みで拡張し、任意次元のトークン座標に対して厳密な並進不変性を保ちつつ低計算コストで2D・3D位置エンコーディングを実現するSTRINGを提案。Vision Transformerに統合し、オープンボキャブラリ物体検出やロボティクス制御で性能向上を示した。
- 人間レベルの競技卓球を実現するロボットエージェントsim2real2024/8/1
階層型ポリシーとsim-to-real技術により、アマチュア人間レベルの競技卓球を実現したロボットを開発し、人間との試合で45%の勝率を達成した。
- シーングラフViT:オープンボキャブラリな視覚関係検出のためのエンドツーエンド手法視覚関係検出2024/3/1
Transformerベースの画像エンコーダで物体をトークンとして表現し、関係を暗黙的にモデル化することで、追加のデコーダなしにオープンボキャブラリな視覚関係検出をエンドツーエンドで実現した。
- 言語モデル予測制御による人間フィードバックからの高速学習VLA2024/2/1
人間との対話履歴を遷移モデルとしてLLMに微調整し、モデル予測制御と組み合わせることで、ロボットの教示効率と成功率を向上させるフレームワークLMPCを提案。
- Open X-Embodiment: Robotic Learning Datasets and RT-X Models2023/10/1
- Robots That Can See: Leveraging Human Pose for Trajectory Prediction2023/9/1
- Robotic Table Tennis: A Case Study into a High Speed Learning System2023/9/1
- Agile Catching with Whole-Body MPC and Blackbox Policy Learning2023/6/1
- i-Sim2Real: Reinforcement Learning of Robotic Policies in Tight Human-Robot Interaction Loops2022/7/1
- Scene Transformer: A unified architecture for predicting multiple agent trajectories2021/6/1
- Range Conditioned Dilated Convolutions for Scale Invariant 3D Object Detection2020/5/1
- Learning to Drive in a Day2018/7/1
- Meshed Up: Learnt Error Correction in 3D Reconstructions2018/1/1
- Incremental Adversarial Domain Adaptation for Continually Changing Environments2017/12/1
- What Makes a Place? Building Bespoke Place Dependent Object Detectors for Robotics2017/8/1
- Addressing Appearance Change in Outdoor Robotics with Adversarial Domain Adaptation2017/3/1