Ondrej Biza
収録論文 15本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- BCでQ関数を作る:模倣学習からQ値を抽出してロボット上で強化学習を行うロボット学習2026/5/1
模倣学習(BC)のポリシーからQ関数を抽出し、オンライン強化学習でBCとRLの行動をQ値で切り替えることで、効率的なオフラインからオンラインへの学習を実現する手法Q2RLを提案した。
- 部品分解によるワンショット形状横断スキル転移スキル転移2026/4/1
デモンストレーションから物体を意味的部品に分解し、生成形状モデルを用いて相互作用点を新規物体へ転移させることで、未知形状へのスキル転移を実現した。
- 黄金のチケット:単一のノイズベクトルで生成ロボットポリシーを改善VLA2026/3/1
事前学習済みの拡散・フローマッチングポリシーに対し、ガウス分布から毎回サンプリングする代わりに固定の初期ノイズ(黄金のチケット)を与えることで、追加学習なしにタスク成功率を向上させる手法を提案。
- SOLE-R1: ビデオ言語推論を唯一の報酬とするオンボット強化学習VLA2026/3/1
ビデオと言語目標からタスク進捗を推論するモデルSOLE-R1を開発し、これを唯一の報酬としてロボットが未見の操作タスクをゼロショットで強化学習できるようにした。
- ROVER: 視覚言語モデルによる身体性タスクのための動画再帰推論VLA2025/8/1
長い動画を短いサブタスクに再帰的に分割し、視覚言語モデルが局所的なフレーム列を正確に推論できるようにするフレームワークROVERを提案。ロボット操作動画でのタスク進捗推定や動画QAで性能を向上させた。
- 目標対比報酬による実機ロボット強化学習強化学習2024/10/1
人間や他ロボットの行動なし動画から密な報酬関数を学習し、実機ロボットの強化学習を効率化する手法GCRを提案。
- ThinkGrasp: 散乱環境での戦略的パーツ把持のための視覚言語システムマニピュレーション2024/7/1
GPT-4oの文脈推論を活用し、散乱環境で対象物を段階的に露出させて把持するプラグアンドプレイの視覚言語把持システムを開発した。
- 同変オフライン強化学習オフラインRL2024/6/1
ロボット操作タスクを回転対称問題として捉え、SO(2)同変ニューラルネットワークをオフラインRL(CQL・IQL)に導入し、少数のデモンストレーションでも性能が向上することを示した。
- 想像ポリシー:生成的点群モデルを用いたマニピュレーションポリシーの学習マニピュレーション2024/6/1
目標状態の点群を生成し、剛体動作推定で行動に変換するマルチタスク・キーフレームポリシーを提案。RLbenchで高性能を示し、実機でも検証した。
- One-shot Imitation Learning via Interaction Warping2023/6/1
- On Robot Grasp Learning Using Equivariant Models2023/6/1
- Graph-Structured Policy Learning for Multi-Goal Manipulation Tasks2022/7/1
- Factored World Models for Zero-Shot Generalization in Robotic Manipulation2022/2/1
- Sample Efficient Grasp Learning Using Equivariant Models2022/2/1
- Action Priors for Large Action Spaces in Robotics2021/1/1