Katerina Fragkiadaki
Carnegie Mellon University
収録論文 39本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- SkillWeaver: 神経インタラクションスキルを活用したエージェント的探索によるスケーラブルなロボットデータ生成データ生成2026/9/28
VLMエージェントが学習済みの閉ループ操作スキルを再利用・パラメータ化しながら探索し、長期的な操作データを自動生成するフレームワークを提案。
- TrackEverything: 3Dシーン表現の重複排除による長距離高密度トラッキング3Dトラッキング2026/9/24
動画を3Dシーンの持続的なトラックとして表現し、重複排除により1000フレーム超の動画でも全可視点を追跡可能にした3Dポイントトラッカー。
- EmbodiedSWE:長期的器用ロボティクスのためのコーディングエージェントVLA2026/9/23
コーディングエージェントが長期的・器用なロボットタスクを解き、その解を多様な軌道に拡張してVLAを訓練し、実機タスクまで完了できることを示した研究。
- HIGenNTO: ノイズ空間軌道最適化によるスケーラブルなヒューマノイドインタラクション生成ヒューマノイド/動作生成2026/9/18
事前学習済みテキスト条件付き動作モデルの初期ノイズを最適化し、接触を伴うヒューマノイドの動作参照を生成するフレームワーク。シミュレーションと実機Unitree G1で検証。
- GeomVLA: 3D空間でシーン・運動・行動を統合するVLAモデルVLA2026/9/12
深度とカメラキャリブレーションでVLM特徴を3Dシーントークンに持ち上げ、シーン点の将来運動を潜在表現として予測し、それを条件に3Dフロー型行動生成を行うVLAモデルを提案。CALVINなどで高性能を示した。
- 触覚ジェネシス:巧みな作業学習のための大規模触覚センサの探求触覚/シミュレーション/器用操作2026/6/1
GPU並列の触覚センサシミュレーションプラットフォームを構築し、多様な触覚センサを共通インターフェースで提供。巧みな操作タスクでセンサの種類・配置・解像度の影響を分析し、実機への転移も検証した。
- 物理シミュレータ上での強化学習による物理オリンピック問題解決物理推論/LLM/強化学習2026/4/1
物理シミュレータでランダムなシーンを生成し、合成の問答データを作ってLLMを強化学習で訓練し、実世界の物理ベンチマーク(IPhOなど)へのゼロショット転移を実証した論文。
- 支援動作の学習:マルチエージェント強化学習による物理基盤の人間-人間制御マルチエージェント強化学習2026/3/1
人間同士の支援動作(力のやり取りを伴う)を物理シミュレータ上でマルチエージェント強化学習により模倣する手法を提案し、支援者と被支援者の双方のポリシーを協調学習させることで、従来手法では困難だった支援動作の追跡を可能にした。
- Dex4D: タスク非依存の点追跡ポリシーによるSim-to-Real巧みな操作マニピュレーション2026/2/1
シミュレーションでタスク非依存の3D点追跡ポリシーを学習し、実世界の多様な巧みな操作タスクにゼロショット転移するフレームワークを提案。
- 反復的な自己修正による構成的画像生成の改善画像生成2026/1/1
視覚言語モデルを批評役として用い、テキスト画像生成モデルが複数ステップで生成を反復的に洗練させる手法を提案し、構成的なプロンプトでの生成精度を向上させた。
- RoboTAG: トポロジカルアラインメントグラフによるエンドツーエンドのロボット姿勢推定姿勢推定2025/11/1
単眼RGB画像からロボットの姿勢を推定するため、2Dと3Dの表現を協調進化させるトポロジカルアラインメントグラフを提案し、ラベルデータへの依存を軽減した。
- RobotArena ∞: 実機からシミュレーションへの変換によるスケーラブルなロボットベンチマークVLA2025/10/1
実機の動画デモを生成モデルでシミュレーション環境に自動変換し、VLAポリシーを大規模かつ再現可能に評価するベンチマークフレームワークを提案。
- 3D FlowMatch Actor:単腕・双腕マニピュレーションのための統合3Dポリシーマニピュレーション2025/8/1
流れマッチングと3D事前学習済み視覚表現を組み合わせ、単腕・双腕ロボット操作を高速かつ高精度に行う3Dポリシーを提案。
- データ制約下では拡散モデルが自己回帰モデルを上回る拡散言語モデル2025/7/1
データが乏しく計算資源が豊富な状況でマスク付き拡散言語モデルを系統的に検証し、自己回帰モデルより優れることとその理由(ランダムマスクによる暗黙のデータ拡張)を明らかにした。
- 統合マルチモーダル離散拡散モデルマルチモーダル生成2025/3/1
テキストと画像を統一的に理解・生成できる離散拡散モデルUniDiscを提案し、自己回帰型モデルより高性能かつ制御性・編集性・インペインティングに優れることを示した。
- 2Dと3Dの視覚言語理解を統合するUniVLGVLA2025/3/1
2Dの事前学習モデルを活用し、2Dと3Dの視覚言語データで学習する統合アーキテクチャUniVLGを提案。3D視覚言語グラウンディングで最先端性能を達成した。
- ロボティクスにおける深層生成モデル:マルチモーダル実演からの学習に関するサーベイ模倣学習2024/8/1
ロボットの実演学習に深層生成モデル(拡散モデルやGANなど)を活用する近年の研究を、モデル種別・応用・分布外汎化の観点から統一的に整理したサーベイ。
- 報酬勾配による動画拡散モデルのアラインメント動画生成2024/7/1
事前学習済み報酬モデルから動画拡散モデルへ勾配を逆伝播させ、少ない計算量とサンプルで下流タスクに適応させる手法を提案。
- 都市運転における離散的行動モードのための実行可能な統合予測と計画自動運転/計画2024/3/1
マルチモーダル軌道予測モデルを再学習なしで閉ループ計画に統合し、離散的な行動モード上で反応的な計画を行う手法を提案。動的な合流シナリオで従来のプランナーが陥る「凍結ロボット問題」を回避し、CARLAの高密度交通シナリオで最先端性能を達成。
- Diffusion-ES: 拡散モデルと勾配不要最適化による自動運転とゼロショット指示追従自動運転/計画2024/2/1
拡散モデルから軌道をサンプリングし、進化的探索と黒箱報酬で評価・改良することで、微分不可能な目的関数でもデータ多様体上で最適化できる手法を提案し、自動運転ベンチマークnuPlanで最高性能を達成した。
- 3D Diffuser Actor:3Dシーン表現を用いた拡散ポリシーVLA2024/2/1
3Dシーン特徴と言語指示・固有感覚を融合する新しい3DデノイジングTransformerにより、ロボットの3D姿勢軌道を拡散モデルで生成するポリシーを提案し、RLBenchやCALVINでSOTAを達成した。
- ODIN: A Single Model for 2D and 3D Segmentation2024/1/1
- Diffusion-TTA: Test-time Adaptation of Discriminative Models via Generative Feedback2023/11/1
- RoboGen: Towards Unleashing Infinite Data for Automated Robot Learning via Generative Simulation2023/11/1
- Gen2Sim: Scaling up Robot Learning in Simulation with Generative Models2023/10/1
- Aligning Text-to-Image Diffusion Models with Reward Backpropagation2023/10/1
- Open-Ended Instructable Embodied Agents with Memory-Augmented Large Language Models2023/10/1
- Act3D: 3D Feature Field Transformers for Multi-Task Robotic Manipulation2023/6/1
- Energy-based Models are Zero-Shot Planners for Compositional Scene Rearrangement2023/4/1
- FluidLab: A Differentiable Environment for Benchmarking Complex Fluid Manipulation2023/3/1
- Planning with Spatial-Temporal Abstraction from Point Clouds for Deformable Object Manipulation2022/10/1
- Test-time Adaptation with Slot-Centric Models2022/3/1
- HyperDynamics: Meta-Learning Object and Agent Dynamics with Hypernetworks2021/3/1
- 3D-OES: Viewpoint-Invariant Object-Factorized Environment Simulators2020/11/1
- Embodied Language Grounding with 3D Visual Feature Representations2019/10/1
- Graph-Structured Visual Imitation2019/7/1
- Reinforcement Learning of Active Vision for Manipulating Objects under Occlusions2018/11/1
- Model Learning for Look-ahead Exploration in Continuous Control2018/11/1
- Reward Learning from Narrated Demonstrations2018/4/1