Bo Zhao
収録論文 18本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- EgoFound3R: 世界座標空間における一人称視点手再構成と点単位のインタラクション属性推定一人称視点手再構成2026/10/1
一人称視点動画から、シーンと共通のメートルスケールで世界座標空間の手形状を再構成し、可視性・接触・距離といった点単位のインタラクション属性を単一パスで推定する統合エンドツーエンドモデルを提案。
- ATI-VLA: 行動中心の予測型視覚-言語-行動モデルVLA2026/10/1
予測観測と行動の表現を共有コードブックで揃え、予測潜在を行動生成に適応的に注入することで、操作タスクの性能と収束速度を向上させたVLAモデル。
- Imagine-RL:予測残差信頼度で導くクロスアテンションによる世界モデル拡張VLA強化学習VLA2026/9/21
凍結したVLA方針をノイズ空間強化学習で微調整する際、視覚・力覚の潜在世界モデルで将来の結果を予測し、その予測残差を信頼度として活用することで接触の多い操作タスクの成功率を大幅に向上させた。
- Homer: 階層的メモリとエージェント的推論による長時間動画理解動画理解2026/7/1
長時間動画をオンラインで理解するための階層的メモリとエージェント的推論フレームワークを提案し、既存手法を上回る性能を達成した。
- LA4VLA: 視覚なしで行動を学習する言語-行動事前学習VLA2026/6/1
視覚-言語-行動モデルが視覚情報に過度に依存する問題を解決するため、視覚観察なしで言語条件付き行動の事前学習を行うフレームワークを提案し、シミュレーションと実世界で性能向上を確認した。
- 焦点可能な単眼深度推定深度推定2026/5/12
指定された対象領域に焦点を当てて深度推定を行う新しいタスクと、プロンプト条件付きのフレームワークを提案した論文。
- Evo-Depth: 軽量な深度強化型視覚言語行動モデルVLA2026/5/1
追加センサーや高コストな幾何基盤モデルを使わずに、多視点RGB画像から軽量な暗黙的深度符号化モジュールで深度特徴を抽出し、空間セマンティクスを強化するVLAモデルを提案した。
- Afford-VLA: 内在化されたアフォーダンスによる行動整合的な視覚プランニングVLA2026/5/1
VLAモデルにタスク条件付きアフォーダンスを内部生成・利用する視覚プランニング機構を導入し、行動予測と密結合させることで操作性能を向上させた。
- ConLA: 人間動画からの対照的潜在行動学習によるロボットマニピュレーションVLA2026/2/1
人間の動画からロボットの行動を教師なしで学習する際、対照学習で動きと見た目を分離し、実ロボット軌道での事前学習を上回る性能を実現した。
- 一度注入すれば生き残る:下流ファインチューニングを耐え抜くVLAモデルへのバックドア攻撃VLAセキュリティ2026/2/1
VLAモデルのファインチューニングで消えにくいモジュールにバックドアを注入し、ユーザー側の追加学習後も攻撃が持続する手法INFUSEを提案した。
- デジタルからフィジカルへ:物理知能のための自律型コーチとしてのデジタルエージェントVLA2026/1/1
LLMエージェントが強化学習や模倣学習のタスク設計・デバッグ・最適化を自律的に行うベンチマークEmboCoach-Benchを提案し、人間設計を上回る性能を実証した。
- Evo-1: 意味的整合性を保つ軽量Vision-Language-ActionモデルVLA2025/11/1
ロボットデータでの事前学習なしに、VLMの知覚表現を保ちながら軽量・高性能を実現したVLAモデルを提案。
- Mask2IV: マスク軌跡によるインタラクション中心の動画生成動画生成2025/10/1
人間やロボットが物体と相互作用する動画を、アクターと物体の軌跡を予測してから生成する2段階フレームワークで高品質に生成する手法。
- U-Arm:ロボットマニピュレーション向け超低コスト汎用遠隔操作インターフェース遠隔操作2025/9/1
3Dプリント製リーダーアームで様々な商用ロボットアームを遠隔操作できる低コストフレームワークを提案し、データ収集効率を39%向上させた。
- Evo-0: 暗黙的な空間理解を備えた視覚-言語-行動モデルVLA2025/7/1
既存の視覚基盤モデルを活用し、RGB画像のみから3D幾何特徴を暗黙的に取り込むプラグアンドプレイモジュールを提案し、VLAモデルの空間理解能力を向上させた。
- RoboFAC: ロボット失敗分析と修正のための包括的フレームワークVLA2025/5/1
ロボット操作の失敗を診断・修正するための大規模データセットと軽量マルチモーダルモデルを構築し、VLA制御の回復性能を向上させた。
- RAG-Driver: Generalisable Driving Explanations with Retrieval-Augmented In-Context Learning in Multi-Modal Large Language Model2024/2/1
- Multiple Plans are Better than One: Diverse Stochastic Planning2020/12/1