Roei Herzig
University of California, Berkeley
収録論文 12本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- ContextFlow: ロボット操作のためのインコンテキストフローマッチングマニピュレーション2026/9/6
連続的な行動分布を学習する条件付きフローマッチングモデルを導入し、デモンストレーションと観察に基づいて行動生成を行い、未見のタスク設定での汎化性能を向上させた。
- Webエージェントのための判別的世界モデルWebエージェント2026/9/2
Webエージェントの行動選択を改善するため、予測状態マッチングという新しい学習目的を導入し、真の結果状態と代替行動の結果を区別できる世界モデルを訓練した。
- 視覚運動制御のための対比的行動-画像事前学習視覚エンコーダ/事前学習/模倣学習2026/6/15
大規模な人間の第一人称ビデオから手のキーポイントを行動の代理として抽出し、対比学習でロボットの視覚エンコーダを事前学習する手法を提案。実機の器用操作タスクで既存手法を30%以上上回る性能を達成した。
- T-Rex: 触覚反応型巧みな操作触覚/操作2026/6/1
触覚信号に動的に反応する操作を実現するため、大規模な触覚データセットと可変レートのMixture-of-Transformersアーキテクチャを導入し、12の操作タスクで成功率を大幅に向上させた。
- 遊び心のあるエージェント型ロボット学習スキル獲得2026/6/1
ロボットエージェントが指示なしで自己主導の「遊び」を通じてスキルを獲得し、後続タスクに活用する手法を提案。コード生成エージェントチーム(RATs)が探索タスクを生成・実行・検証・修正し、成功体験をコードスキルライブラリに蓄積する。
- 生成された人間動画から物理的に妥当なロボット軌道へヒューマノイド2025/12/1
生成動画から人間の動きを4D表現に変換し、強化学習方策GenMimicでヒューマノイドの物理的に安定した動作として再現する手法を提案。
- 少数デモンストレーションによる視覚-言語-行動モデルのメカニズム的解釈に基づくファインチューニングVLA2025/11/1
少数の実演からタスク固有のアテンションヘッドを特定し選択的にファインチューニングするRobotic Steeringを提案し、LoRAを上回る性能とロバスト性、計算コスト削減、解釈性向上を実機で示した。
- ランダムなおもちゃで遊んで何でも掴めるようになる学習マニピュレーション2025/10/1
球・直方体・円柱・リングの4つの基本形状をランダムに組み合わせた「おもちゃ」で訓練することで、実世界の多様な物体をゼロショットで掴める汎化可能な把持方策を実現した研究。
- 何をする?不可能な指示を拒否するよう視覚-言語-行動モデルを教えるVLA2025/8/1
VLAモデルが環境に存在しない物体を参照する偽前提の指示を検出し、言語で確認・訂正して代替案を実行するInstruct-Verify-and-Actフレームワークを提案。
- 4D表現で事前学習する自己回帰ロボットモデルVLA2025/2/1
人間の動画から得た3D点追跡の4D表現を活用し、ロボット制御に効率的に転移できる自己回帰モデルARM4Rを提案した。
- 文脈内学習でLLMにロボット動作を予測させるRoboPromptVLA2024/10/1
訓練なしのテキストのみのLLMが、キーフレームから抽出した動作と物体姿勢をテキスト化した実演を文脈内学習に用いてロボット動作を直接予測するフレームワークを提案。
- LLARVA: 視覚-行動インストラクションチューニングによるロボット学習の強化VLA2024/6/1
構造化プロンプトで多様なロボットタスクを統合するインストラクションチューニング手法と、中間2D表現「ビジュアルトレース」の予測により視覚と行動を整合させ、RLBenchと実機Frankaで高い汎化性能を示した研究。