Zsolt Kira
収録論文 45本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- CAPEX: 経験適応型推論による基盤モデル行動の展開可能なロボットポリシーへの効率的蒸留VLA2026/9/26
マルチモーダル基盤モデルを自律的な実演者として使い、過去の実行経験に応じて再計画の頻度を適応させることで、低コストでロボットポリシー学習用データを収集するフレームワークCAPEXを提案した。
- Opt2VLA: 接触の多いヒューマノイド全身マニピュレーションのための力認識型視覚-言語-行動モデルVLA2026/9/21
ヒューマノイドの全身操作において、VLAモデルが運動目標と接触力の指令を同時に予測し、強化学習ベースの全身制御器で追従する力認識型フレームワークを提案。軌道最適化で接触を考慮した訓練データを生成し、接触の多い3タスクで力の調整精度が向上することを示した。
- 私たちが見抜ける嘘:身体的社会的相互作用におけるVLMエージェントによる言語・非言語連携欺瞞VLA/社会的相互作用2026/8/31
3Dマルチモーダル環境『MineAmongUs』を構築し、VLMエージェントが言語と非言語行動を組み合わせて欺瞞を行う様子を分析。非言語チャネルが勝利に重要であることを示した。
- K9-Bench:犬中心の動画におけるマルチモーダルLLMの評価ベンチマーク2026/7/2
犬の行動理解に特化したベンチマークK9-Benchを構築し、907本の動画と約5000のQAペアを用いて、最先端のマルチモーダルLLMのゼロショット性能を評価した。
- ビデオからシミュレーション、そして実世界へ:単一の人間ビデオからの全自動器用スキル獲得器用操作/sim2real2026/6/1
単一の人間操作ビデオから、シミュレーション環境でのデジタルツイン構築と物体中心のキーフレーム最適化によりロボット動作を獲得し、さらに実世界のノイズや不完全な知覚への頑健性を分離するsim-to-real戦略で器用な操作スキルを自律的に獲得するフレームワークを提案した。
- SeeTraceAct: クロス身体性デモ動画からの可視性を考慮した潜在プランニングVLA2026/6/1
デモ動画1本で未知タスクを実行するVLAモデルを提案し、小さな対象領域の正確な位置決めを可能にする可視性を考慮した未来のエンドエフェクタ軌跡予測を導入。新ベンチマークと実機で性能を実証した。
- 軌跡の中のかくれんぼ:VLA実行時監視のための失敗シグナル発見VLA/失敗検出2026/5/1
軌跡レベルのラベルのみから、ステップ単位の注釈なしで失敗を示す行動を特定するフレームワークを提案し、VLAモデルの実行時失敗検出性能を向上させた。
- SafeManip: ロボット操作における時間的安全評価のためのプロパティ駆動型ベンチマーク操作/安全性評価2026/5/1
ロボット操作の安全性を時間的性質(例:汚染後の接触、完全な格納前の解放)に焦点を当てて評価するベンチマークを提案し、LTLfを用いて安全性を検証する。
- Sim2real画像変換による固定カメラデータからの視点ロバスト方策sim2real2026/1/1
固定カメラの実世界データとシミュレーションを組み合わせ、未見の視点でも頑健に動作するロボットマニピュレーション方策を実現する画像変換手法MANGOを提案。
- EVE: 生成的ポリシーのための生成器-検証器システムVLA2025/12/1
拡散・フローマッチングなどの生成的視覚運動ポリシーを、追加学習なしでテスト時にVLMベースの検証器群と組み合わせて性能を向上させるフレームワークEVEを提案。
- MAPS: モジュール別近接スケジューリングによる視覚言語表現の保持と視覚言語行動モデルの汎化向上VLA2025/11/1
VLAモデルのファインチューニング時に、モジュールごとに事前学習VLMへの近接制約を段階的に緩めるスケジューリングを導入し、追加パラメータなしで分布内外の性能を最大30%向上させた。
- Memo: 強化学習による記憶効率の良い身体性エージェントの訓練VLA2025/10/1
Transformerベースの強化学習において、定期的な要約トークンを入力に挟み込むことで記憶の生成と検索を行い、長期的なタスクを効率的に学習する手法を提案。
- EmbodiedSplat: モバイル端末からのガウススプラッティングによる個人化されたReal-to-Sim-to-Realナビゲーションsim2real2025/9/1
iPhoneで撮影した実環境を3Dガウススプラッティングで再構築し、Habitat-Sim上で方策を微調整することで、実世界の画像ナビゲーション性能を大幅に向上させる手法を提案。
- 二段階で考えよう:自己接地検証によるMLLMの同意バイアス緩和VLA2025/7/1
マルチモーダルLLM検証器がエージェント行動を過剰に承認する「同意バイアス」を指摘し、望ましい行動の事前知識を自己生成してから評価する軽量手法SGVを提案。失敗検出を25ポイント改善した。
- 挑戦的な四足歩行のための階層型強化学習と価値最適化歩行2025/6/1
高レベル方策が低レベル方策の学習済み価値関数をオンライン最適化して足場を選ぶ二層階層型強化学習を提案し、難地形での衝突を減らし報酬を改善した。
- FindingDory: 身体性エージェントの記憶評価ベンチマーク身体性エージェント/記憶/ベンチマーク2025/6/1
Habitatシミュレータ上で長期的な記憶を要する60の身体性タスクを評価するベンチマークを提案し、視覚言語モデルの長期記憶能力を測定する。
- 非凸固定翼飛行制御と自動運転のためのバリア関数オーバーライド安全制御2025/5/1
強化学習の安全性を確保するため、非凸な制御入力を持つ固定翼機と自動運転車の離散時間系に対してバリア関数を設計し、近似オーバーライドで安全違反ゼロを達成した。
- ロボティクスにおけるニューラルフィールド:サーベイニューラルフィールド2024/10/1
ニューラルフィールドのロボティクス応用を200本以上の論文に基づき、4つの主要フレームワークと5つの応用領域(姿勢推定、マニピュレーション、ナビゲーション、物理、自動運転)に分類してレビューしたサーベイ論文。
- 家庭内でのオープンワールド移動マニピュレーションに向けて:NeurIPS 2023 HomeRobotオープン語彙移動マニピュレーションチャレンジからの教訓移動マニピュレーション2024/7/1
家庭環境で任意の物体を見つけて任意の場所に置くオープン語彙移動マニピュレーションのベンチマークを提案し、NeurIPS 2023コンペを実施。シミュレーションと実世界で評価し、成功チームに共通するエラー検出・回復と知覚・意思決定の統合の重要性を示した。
- 補助タスク蒸留による強化学習強化学習2024/6/1
補助的な強化学習タスクから振る舞いを蒸留し、長期的なロボット制御タスクを実現する手法を提案。物体再配置ベンチマークで従来手法を上回る成功率を達成。
- 事前学習済みテキスト画像拡散モデルは制御のための万能な表現学習器であるVLA2024/5/1
テキストから画像を生成する拡散モデルの内部表現を制御ポリシー学習に転用し、操作・ナビゲーションタスクで既存手法に匹敵する性能を達成した。
- GOAT-Bench: マルチモーダル生涯ナビゲーションのベンチマークナビゲーション2024/4/1
カテゴリ名・言語記述・画像など様々な形式の目標に対応する万能ナビゲーションタスク「GOAT」のベンチマークを提案し、RLやモジュラー手法を評価した。
- N-QR: マルチロボット個体対応のための自然クイックレスポンスコードマルチロボット2024/3/1
自然な画像パターンをQRコードのように使って、大規模な異種ロボット群間で素早く正確に対応付けを行う手法を提案し、農場での植物マッチングに応用した。
- Toward General-Purpose Robots via Foundation Models: A Survey and Meta-Analysis2023/12/1
- FSD: Fast Self-Supervised Single RGB-D to Categorical 3D Objects2023/10/1
- Habitat 3.0: A Co-Habitat for Humans, Avatars and Robots2023/10/1
- Adaptive Coordination in Social Embodied Rearrangement2023/6/1
- HomeRobot: Open-Vocabulary Mobile Manipulation2023/6/1
- We Need to Talk: Identifying and Overcoming Communication-Critical Scenarios for Self-Driving2023/5/1
- Communication-Critical Planning via Multi-Agent Trajectory Exchange2023/3/1
- ShAPO: Implicit Representations for Multi-Object Shape, Appearance, and Pose Optimization2022/7/1
- CenterSnap: Single-Shot Multi-Object 3D Shape Reconstruction and Categorical 6D Pose and Size Estimation2022/3/1
- Safe Reinforcement Learning Using Robust Control Barrier Functions2021/10/1
- Enhancing Multi-Robot Perception via Learned Data Association2021/7/1
- Overcoming Obstructions via Bandwidth-Limited Multi-Agent Spatial Handshaking2021/7/1
- Habitat 2.0: Training Home Assistants to Rearrange their Habitat2021/6/1
- Hierarchical Cross-Modal Agent for Robotics Vision-and-Language Navigation2021/4/1
- LRGNet: Learnable Region Growing for Class-Agnostic Point Cloud Segmentation2021/3/1
- When2com: Multi-Agent Perception via Communication Graph Grouping2020/6/1
- Who2com: Collaborative Perception via Learnable Handshake Communication2020/3/1
- UNO: Uncertainty-aware Noisy-Or Multimodal Fusion for Unanticipated Input Degradation2019/11/1
- RoboCSE: Robot Common Sense Embedding2019/3/1
- The Regretful Agent: Heuristic-Aided Navigation through Progress Estimation2019/3/1
- Multi-view Incremental Segmentation of 3D Point Clouds for Mobile Robots2019/2/1
- Self-Monitoring Navigation Agent via Auxiliary Progress Estimation2019/1/1