Jesse Thomason
University of Southern California
収録論文 32本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 対話を通じたコードAPI理解への挑戦コード理解/エージェント2026/9/25
ブラックボックスなPython APIを対話的に探索して機能を理解するベンチマークPAUを提案し、ロボット学習のAAC手法を応用して探索を改善する手法を示した。
- SAFECAST: コントラストセット学習とキャリブレーションによるVLAポリシーの堅牢な故障検出VLA/故障検出2026/8/1
VLAポリシーの展開時分布シフトによる失敗を検出するため、コントラストセット摂動を用いて隠れ状態プローブの訓練とキャリブレーションを改善する手法を提案。実世界とシミュレーションで故障検出のROC-AUCを向上させた。
- Colosseum V2: 視覚言語行動モデルの汎化性能を評価するベンチマークVLA/ベンチマーク2026/5/1
VLAモデルの汎化性能を体系的に評価する大規模シミュレーションベンチマークColosseum V2を構築し、既存手法の限界を明らかにした。
- 少数デモンストレーションによる視覚-言語-行動モデルのメカニズム的解釈に基づくファインチューニングVLA2025/11/1
少数の実演からタスク固有のアテンションヘッドを特定し選択的にファインチューニングするRobotic Steeringを提案し、LoRAを上回る性能とロバスト性、計算コスト削減、解釈性向上を実機で示した。
- RobotFleet:集中型マルチロボットタスクプランニングのためのオープンソースフレームワーク群制御2025/10/1
異種ロボット群のタスク計画・スケジューリング・実行を集中管理するオープンソースフレームワークを提案。LLMを活用し、コンテナ化されたロボット群の拡張と管理を容易にする。
- PEEK: ロボットマニピュレーションポリシーのゼロショット汎化のための誘導と最小画像表現マニピュレーション2025/9/1
VLMを使ってエンドエフェクタ経路とタスク関連マスクを予測し、ポリシーに必要な最小限の手がかりを与えることで、シミュレーションのみで訓練したポリシーの実世界ゼロショット汎化を大幅に向上させる手法を提案。
- PSALM-V: 大規模言語モデルによる対話型視覚環境での記号計画の自動化VLA2025/6/1
視覚環境での試行錯誤を通じて行動の事前・事後条件を自動学習し、LLMで記号計画を立案するシステムを提案。部分的観測下でも計画成功率を37%から74%に向上させた。
- 手の軌道検索によるロボットの高速適応マニピュレーション2025/5/1
人間の手のデモンストレーションからロボットの動作データを検索し、4分以内に新しいマニピュレーションタスクを学習する手法を提案。
- ReWiND: 言語ガイド報酬で新規デモなしにロボット方策を教えるVLA2025/5/1
言語指示から報酬関数を学習し、オフラインRLで事前学習した方策を新規タスクに少ない試行で適応させるフレームワークを提案。
- 能動的実験選択によるマルチタスクロボット方策の効率的評価評価/ベンチマーク2025/2/1
ロボット方策の評価を能動的テスト問題として定式化し、自然言語をタスク間の関係の事前情報として用いることで、情報量の多い試行を効率的に選択し評価コストを削減するフレームワークを提案した。
- M3PT: 人物認識ブロックワイズ注意機構を備えたマルチモーダル多人数ソーシャルシグナル予測トランスフォーママルチモーダル行動予測2025/1/1
多人数会話における身体姿勢・頭部姿勢・発話・食事行動などのマルチモーダルなソーシャルシグナルを、モダリティと時間のブロックワイズ注意マスクを持つ因果トランスフォーマで同時に予測する単一モデルM3PTを提案した。
- 言語モデルは環境フィードバックから記号プランナーの行動意味論を推論できるVLA2024/6/1
LLMと記号プランナーを組み合わせ、環境からの実行結果を基に行動の意味論を自動学習するPSALMを提案。7環境で成功率を36.4%から100%に向上させた。
- 言語誘導ロボット政策評価のためのコントラストセットVLA2024/6/1
言語指示に基づくロボットの評価において、テスト事例に小さな摂動を加える「コントラストセット」を導入し、実験者の負担を抑えつつ政策の特性を明らかにする手法を提案した。
- TwoStep: 古典的プランナと大規模言語モデルを組み合わせたマルチエージェントタスク計画マルチエージェント計画2024/3/1
LLMで目標をサブゴールに分解し、古典的プランナで各サブゴールを解くことで、マルチエージェント計画を高速かつ実行成功を保証しつつ効率的に行う手法を提案。
- ViSaRL: 人間の顕著性に導かれた視覚強化学習VLA2024/3/1
人間の視覚的注意(顕著性)を強化学習に組み込み、高次元画像入力からの効率的な視覚表現学習を実現し、サンプル効率・成功率・汎化性能を向上させた。
- コロッセウム:ロボットマニピュレーションの汎化性能を評価するベンチマークマニピュレーション2024/2/1
環境の色・テクスチャ・照明・カメラ位置など14種類の摂動に対するロボットマニピュレーションの汎化性能を評価するシミュレーションベンチマークを提案し、最先端モデルの成功率が30〜50%低下することを示した。
- Bridging Language and Action: A Survey of Language-Conditioned Robot Manipulation2023/12/1
- Which One? Leveraging Context Between Objects and Multiple Views for Language Grounding2023/11/1
- RREx-BoT: Remote Referring Expressions with a Bag of Tricks2023/1/1
- CLIP-Nav: Using CLIP for Zero-Shot Vision-and-Language Navigation2022/11/1
- Iterative Vision-and-Language Navigation2022/10/1
- ProgPrompt: Generating Situated Robot Task Plans using Large Language Models2022/9/1
- TEACh: Task-driven Embodied Agents that Chat2021/10/1
- Language Grounding with 3D Objects2021/7/1
- The RobotSlang Benchmark: Dialog-guided Robot Localization and Navigation2020/10/1
- RMM: A Recursive Mental Model for Dialog Navigation2020/5/1
- ALFRED: A Benchmark for Interpreting Grounded Instructions for Everyday Tasks2019/12/1
- Augmenting Knowledge through Statistical, Goal-oriented Human-Robot Dialog2019/7/1
- Vision-and-Dialog Navigation2019/7/1
- Improving Robot Success Detection using Static Object Data2019/4/1
- Prospection: Interpretable Plans From Language By Predicting the Future2019/3/1
- Interaction and Autonomy in RoboCup@Home and Building-Wide Intelligence2018/10/1