Paarth Shah
収録論文 19本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 連続ロボット学習のためのメモリアンカー連続学習2026/8/27
ロボットが新しいタスクを学習しても過去のタスクを忘れないようにするため、リプレイバッファ内の重要経験(メモリアンカー)を特定し、それを活用することで破滅的忘却を大幅に軽減する手法を提案した。
- 潜在記憶宮殿:制御のための推論を自己回帰変分推論として捉える制御/強化学習2026/7/1
連続制御ポリシーに適応的な推論能力を持たせるため、自己回帰潜在空間での変分推論として推論を定式化し、潜在空間強化学習で変分下界を最適化する手法を提案した。
- 模倣学習のための差分認識検索ポリシー模倣学習2026/6/8
模倣学習の汎化性能を向上させるため、推論時に訓練データを再利用する半パラメトリックな検索ベース手法DARPを提案。局所近傍構造に基づいて行動を予測し、連続制御やロボット操作で標準的な行動クローニングより15-46%性能が向上した。
- OGPO: 生成制御ポリシーのサンプル効率的な完全ファインチューニングロボット学習2026/5/1
拡散やフローベースの生成制御ポリシーを、オフポリシーな批判ネットワークとPPO目的関数を用いて効率的にファインチューニングする手法OGPOを提案し、操作タスクで最先端の性能を達成した。
- VLA Foundry: 視覚言語行動モデル訓練のための統合フレームワークVLA2026/4/1
LLM、VLM、VLAの訓練を単一コードベースで統合するオープンソースフレームワークを提案し、スクラッチからの訓練と事前学習済みバックボーンを用いた訓練の両方をサポートし、シミュレータ上で評価した。
- ロボットマニピュレーションのための大規模行動モデルの共訓練におけるデータモダリティと戦略の系統的研究マニピュレーション2026/2/1
ロボット操作のための大規模行動モデルを共訓練する際に、5種類のデータモダリティと訓練戦略が性能に与える影響を大規模実験で調査し、視覚言語データと異なる身体のロボットデータの共訓練が汎化を大幅に改善することを示した。
- 非専門家データを活用したオフライン強化学習による模倣学習のロバスト化模倣学習/オフライン強化学習2025/10/1
非専門家データ(プレイデータや不完全なデモ)をオフライン強化学習で活用し、模倣学習ポリシーの回復性と汎化性能を高める手法を提案。
- 動画生成器はロボットポリシーであるVLA2025/8/1
動画生成をロボットポリシー学習の代理として用いる「Video Policy」を提案し、少ない実演データで未知の物体・背景・タスクへの汎化性能とサンプル効率を大幅に向上させた。
- マルチタスク巧みな操作のための大規模行動モデルの慎重な検証マニピュレーション2025/7/1
大規模行動モデル(LBM)をシミュレーションと実世界で厳密に評価し、マルチタスク事前学習が単一タスクより成功率・堅牢性・データ効率を高めることを統計的に示した。
- CodeDiffuser: VLM生成コードによる曖昧な指示に対応する注意強化拡散ポリシーVLA2025/6/1
VLMが自然言語指示を解釈してタスク固有のコードを生成し、そのコードから3D注意マップを作って拡散ポリシーを誘導することで、曖昧な指示下のロボットマニピュレーションを実現するフレームワーク。
- 統合ワールドモデル:大規模ロボットデータセットの事前学習に向けた動画と行動の拡散の結合VLA2025/4/1
行動拡散と動画拡散を単一のトランスフォーマーに統合し、拡散タイムステップを制御することで政策・順動力学・逆動力学・動画生成を柔軟に表現できるUWMを提案。大規模マルチタスクデータでの事前学習と行動なし動画からの学習を可能にした。
- 失敗データなしで失敗を検出できるか?模倣学習ポリシーの不確実性を考慮した実行時失敗検出マニピュレーション2025/3/1
模倣学習ポリシーの失敗を、成功データのみから逐次的な分布外検出として捉え、不確実性を定量化するスカラー信号とConformal Predictionで検出する手法FAIL-Detectを提案。
- 経験科学としてのロボット学習:政策評価のためのベストプラクティスマニピュレーション2024/9/1
ロボット学習の物理実験における評価が成功率のみに偏っている現状を指摘し、実験条件の明示、複数指標の評価、統計解析、失敗モードの定性的記述といったベストプラクティスを提案し、マニピュレーションタスクで実証した。
- 行動クローニング方策の汎化性能を統計的に評価する枠組みVLA2024/5/1
少数のロールアウトから、行動クローニング方策の性能分布の下限をユーザー指定の信頼度で保証する統計的評価フレームワークを提案し、シミュレーションと実機で検証した。
- Proximity and Visuotactile Point Cloud Fusion for Contact Patches in Extreme Deformation2023/7/1
- Visual-Inertial and Leg Odometry Fusion for Dynamic Locomotion2022/10/1
- Differentiable and Learnable Robot Models2022/2/1
- BiConMP: A Nonlinear Model Predictive Control Framework for Whole Body Motion Planning2022/1/1
- Rapid Convex Optimization of Centroidal Dynamics using Block Coordinate Descent2021/8/1