Jiayuan Mao
University of Pennsylvania
収録論文 27本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- RAPID: 実演からのロボットエージェントプログラミングVLA2026/9/24
人間の一回の視覚的実演から、コード生成エージェントがロボットプログラムを自動生成・検証・改良し、物体中心の関係表現で汎化を実現する手法を提案。
- SimLife:長期的な人間とエージェントの協調のためのパターン理解長期記憶・パターン理解2026/9/17
家庭生活を長期シミュレーションするSimLifeを構築し、数週間〜数ヶ月の観察から潜在的な行動規則を推論する能力を評価するベンチマークSimLife-BPを提案した。
- Retriever: 閉ループ非同期ロボットプログラムの合成システム/プログラミング2026/7/1
ロボットの長時間タスクを実現するため、異なるクロックと遅延を持つコンポーネントを組み合わせた閉ループパイプラインを、非同期意思決定モデルとプログラミングモデル、ランタイム、パイプライン例として提供する。
- 時間的比率によるビデオ行動汎化ギャップの理解と緩和VLA2026/7/1
ビデオ基盤モデルをロボット行動データで微調整すると構成的一般化能力が失われる問題を分析し、注意機構に基づく指標「時間的比率」を導入してその原因を解明し、推論時に適応的にガイドする手法を提案した。
- グアバ:身体的操作のための効果的で普遍的なハーネス操作2026/6/16
言語モデルを外部モジュールと組み合わせるハーネスフレームワーク「Guava」を提案し、反復的な知覚-推論-行動ループ、意味的アクション抽象化、マルチモーダル観測が重要であることを示した。シミュレーションで収集した少数の軌道から4Bモデルへの蒸留を行い、実世界でも高い性能と汎化を達成した。
- ForceBand: sEMGを用いた力強い操作の学習マニピュレーション2026/6/1
筋電位センサを搭載したリストバンドで人間の指先の力を推定し、力情報を含むデモンストレーションを生成してロボットの力制御を学習する手法を提案した。
- SIMPACT: 視覚言語モデルによるシミュレーション活用型行動計画マニピュレーション2025/12/1
視覚言語モデルにテスト時に物理シミュレーションを組み合わせ、追加学習なしで接触を伴う細かいマニピュレーションの行動計画を可能にした手法。
- 敵対的ゲーム理論による多指ハンドの把持合成アルゴリズムマニピュレーション2025/11/1
把持生成を2人ゲームとして定式化し、ロボット側と物体の脱出運動を敵対的に競わせることで、外乱に強い多指ハンドの把持姿勢を高速に合成する手法を提案した。
- ビデオ再計画による暗黙的な状態推定VLA2025/10/1
ビデオベースの計画フレームワークにインタラクション時のデータを統合し、モデルパラメータをオンライン更新して失敗した計画を除外することで、暗黙的な状態推定を実現する手法を提案。
- マルチモーダル政策コンセンサスによるマルチモーダルマニピュレーションマニピュレーション2025/9/1
視覚や触覚など複数の感覚モダリティを、それぞれに特化した拡散モデルと適応的な重み付けを行うルータネットワークで統合し、接触の多いタスクや遮蔽された物体の操作を可能にする手法を提案。
- Set It Up:構成可能な生成モデルによる機能的物体配置物体配置2025/8/1
大規模言語モデルと拡散モデルを組み合わせ、食卓や本棚、家具の配置など、指示に応じた機能的で美的な物体配置を実現するフレームワークを提案。
- 言語と実演から構成可能な行動を学習するフレームワークBLADEマニピュレーション2025/5/1
言語注釈付き実演とLLMを活用し、長期ロボットマニピュレーションのための構造化された高レベル行動表現を自動構築する手法を提案。新規状況への一般化性能をシミュレーションと実機で検証した。
- 神経記号的コンセプトVLA2025/5/1
感覚入力と行動出力に基づく神経記号的コンセプトの語彙を用いて、継続学習と柔軟な推論が可能なエージェントを構築する概念中心の枠組みを提案。
- 接触のアナロジーによるワンショット操作戦略学習マニピュレーション2024/11/1
参照軌道を基に新規物体上の類似接触点と行動系列を見つけ、フックで物を引き寄せるなどの操作戦略をワンショットで汎化する手法MAGICを提案。
- 身体性エージェントインターフェース:身体的意思決定のためのLLMベンチマークVLA2024/10/1
LLMを用いた身体的意思決定を統一的に評価するための汎用インターフェースを提案し、多様なタスク・モジュール・細粒度エラー指標でLLMの能力を体系的に分析するベンチマークを構築した。
- 大規模モデルによるキーポイント抽象化を用いた物体相対模倣学習模倣学習2024/10/1
大規模視覚言語モデルを活用してタスクに関連し物体間で一貫したキーポイントを自動生成し、少数の実演データから物体姿勢や視点の変化に頑健な模倣学習を実現するフレームワークKALMを提案。
- セット・イット・アップ!:構成的生成モデルによる機能的物体配置物体配置2024/5/1
「二人用の食卓をセットして」のような曖昧な指示から、物体間の抽象的な空間関係をLLMで推論し、拡散モデルを組み合わせて機能的で美しい配置を生成するフレームワークを提案。
- 部品ベースの組み合わせ可能なマニピュレーションマニピュレーション2024/5/1
物体を部品に分解し、部品間の機能的対応関係を拡散モデルで学習することで、新しい物体やカテゴリにも汎化するロボット操作手法を提案した。
- 言語から計画抽象を学習するVLA2024/5/1
言語注釈付きデモンストレーションを用いて、記号的な抽象行動空間と潜在状態抽象を自動獲得し、長期的な計画を可能にするフレームワークPARLを提案。
- 反事実的摂動による実演からの言語プランの接地VLA2024/3/1
LLMの言語プランをロボットの実演に基づくモード族で接地し、反事実的摂動を加えた実演から成功・失敗を学習して解釈可能な反応的方策を生成する手法を提案。
- Learning adaptive planning representations with natural language guidance2023/12/1
- Learning Reusable Manipulation Strategies2023/11/1
- HandMeThat: Human-Robot Communication in Physical and Social Environments2023/10/1
- Learning to Act from Actionless Videos through Dense Correspondences2023/10/1
- Compositional Diffusion-Based Continuous Constraint Solvers2023/9/1
- Programmatically Grounded, Compositionally Generalizable Robotic Manipulation2023/4/1
- PDSketch: Integrated Planning Domain Programming and Learning2023/3/1