Dmitry Kalashnikov
収録論文 20本 ・ フィジカルAI/ロボット学習
VLA安全性sim2realマニピュレーション
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- Gemini Robotics 1.5:高度な身体性推論・思考・動作転移で汎用ロボットの最前線を押し広げるVLA2025/10/1
異種ロボットデータから学ぶ動作転移機構と自然言語での多段階推論を組み合わせたVLAモデルと、身体性推論に特化したモデルを発表し、複雑な多段階タスクの実行と解釈性を向上させた。
- Gemini Robotics:AIを物理世界へVLA2025/3/1
Gemini 2.0を基盤に、ロボットを直接制御できる汎用VLAモデル「Gemini Robotics」と、空間・時間理解を強化した推論モデル「Gemini Robotics-ER」を提案した論文。
- ロボット憲法の生成と意味的安全性のためのベンチマーク安全性2025/3/1
視覚言語モデルを搭載したロボットの意味的安全性を評価する大規模ベンチマークASIMOVを公開し、実世界データからロボット憲法を自動生成する枠組みを提案した。
- 予測的レッドチーミング:ロボットを壊さずにポリシーを破るsim2real2025/2/1
生成画像編集とポリシー固有の異常検知器を用いて、視覚運動ポリシーの環境要因に対する脆弱性をハードウェア評価なしで予測するRoboARTを提案し、予測精度と的を絞ったデータ収集による性能向上を実証した。
- RoPEを超えて:STRINGによる2D・3D位置エンコーディングの改善VLA2025/2/1
大規模言語モデルで広く使われるRotary Position Encodingsを統一的な理論枠組みで拡張し、任意次元のトークン座標に対して厳密な並進不変性を保ちつつ低計算コストで2D・3D位置エンコーディングを実現するSTRINGを提案。Vision Transformerに統合し、オープンボキャブラリ物体検出やロボティクス制御で性能向上を示した。
- STEER: 密な言語グラウンディングによる柔軟なロボットマニピュレーションマニピュレーション2024/11/1
自然言語で表現された基本的な操作スキルを密なアノテーションで学習し、それらを組み合わせて未見の状況や新規タスクに適応できるロボット学習フレームワークSTEERを提案。
- Open X-Embodiment: Robotic Learning Datasets and RT-X Models2023/10/1
- RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control2023/7/1
- RT-1: Robotics Transformer for Real-World Control at Scale2022/12/1
- Learning Model Predictive Controllers with Real-Time Attention for Real-World Navigation2022/9/1
- Do As I Can, Not As I Say: Grounding Language in Robotic Affordances2022/4/1
- AW-Opt: Learning Robotic Skills with Imitation and Reinforcement at Scale2021/11/1
- MT-Opt: Continuous Multi-Task Robotic Reinforcement Learning at Scale2021/4/1
- Actionable Models: Unsupervised Offline Reinforcement Learning of Robotic Skills2021/4/1
- Visionary: Vision architecture discovery for robot learning2021/3/1
- Disentangled Planning and Control in Vision Based Robotics via Reward Machines2020/12/1
- Thinking While Moving: Deep Reinforcement Learning with Concurrent Control2020/4/1
- Learning Precise 3D Manipulation from Multiple Uncalibrated Cameras2020/2/1
- Sim-to-Real via Sim-to-Sim: Data-efficient Robotic Grasping via Randomized-to-Canonical Adaptation Networks2018/12/1
- QT-Opt: Scalable Deep Reinforcement Learning for Vision-Based Robotic Manipulation2018/6/1