Pierre Sermanet
収録論文 27本 ・ フィジカルAI/ロボット学習
安全性VLAAI倫理sim2real
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- ロボット憲法の生成と意味的安全性のためのベンチマーク安全性2025/3/1
視覚言語モデルを搭載したロボットの意味的安全性を評価する大規模ベンチマークASIMOVを公開し、実世界データからロボット憲法を自動生成する枠組みを提案した。
- Gemini Robotics:AIを物理世界へVLA2025/3/1
Gemini 2.0を基盤に、ロボットを直接制御できる汎用VLAモデル「Gemini Robotics」と、空間・時間理解を強化した推論モデル「Gemini Robotics-ER」を提案した論文。
- SF作品からロボットの倫理を学ぶ:SciFi-BenchmarkAI倫理2025/3/1
824のSF作品でAIやロボットが下した重要な決断を収集し、LLMの人間価値への整合性を測るベンチマークを構築。憲法生成により倫理的行動を促進できることを示した。
- 予測的レッドチーミング:ロボットを壊さずにポリシーを破るsim2real2025/2/1
生成画像編集とポリシー固有の異常検知器を用いて、視覚運動ポリシーの環境要因に対する脆弱性をハードウェア評価なしで予測するRoboARTを提案し、予測精度と的を絞ったデータ収集による性能向上を実証した。
- RT-H: 言語による行動階層VLA2024/3/1
低レベル動作を「腕を前に動かす」のような言語フレーズで表現し、タスクと行動の間に言語動作を介在させることで、多様なタスク間でデータを共有し、人間の言語介入による修正も可能にする模倣学習手法を提案。
- Vid2Robot: クロスアテンションTransformerによる動画条件付きエンドツーエンド方策学習VLA2024/3/1
人間の操作動画を入力として、クロスアテンションTransformerでロボットの行動を生成するエンドツーエンド方策を提案し、実機で従来手法を20%以上上回る性能と物体間の動作転移を実現した。
- AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents2024/1/1
- RoboVQA: Multimodal Long-Horizon Reasoning for Robotics2023/11/1
- Video Language Planning2023/10/1
- Open X-Embodiment: Robotic Learning Datasets and RT-X Models2023/10/1
- Robotic Table Tennis: A Case Study into a High Speed Learning System2023/9/1
- RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control2023/7/1
- PaLM-E: An Embodied Multimodal Language Model2023/3/1
- Robotic Skill Acquisition via Instruction Augmentation with Vision-Language Models2022/11/1
- GoalsEye: Learning High Speed Precision Table Tennis on a Physical Robot2022/10/1
- Inner Monologue: Embodied Reasoning through Planning with Language Models2022/7/1
- Visuomotor Control in Multi-Object Scenes Using Object-Aware Representations2022/5/1
- Do As I Can, Not As I Say: Grounding Language in Robotic Affordances2022/4/1
- Broadly-Exploring, Local-Policy Trees for Long-Horizon Task Planning2020/10/1
- Learning to Play by Imitating Humans2020/6/1
- Motion2Vec: Semi-Supervised Representation Learning from Surgical Videos2020/6/1
- Language Conditioned Imitation Learning over Unstructured Data2020/5/1
- Online Object Representations with Contrastive Learning2019/6/1
- Learning Latent Plans from Play2019/3/1
- Learning Actionable Representations from Visual Observations2018/8/1
- Time-Contrastive Networks: Self-Supervised Learning from Video2017/4/1
- Unsupervised Perceptual Rewards for Imitation Learning2016/12/1