Vitor Guizilini
Toyota Research Institute
収録論文 34本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- BIND: 3Dロボット動作を2D画像特徴に結びつける新表現VLA2026/9/29
カメラ幾何学を用いて3D動作候補を各視点の2D画像特徴に投影・スコアリングすることで、データ効率と視点・物体位置の変化への頑健性を高めた視覚運動ポリシーを提案。
- PhysWAM: 自動運転のための物理的に整合した世界行動モデル自動運転/世界モデル2026/9/29
マルチビュー動画・深度・自車運動を単一のフローマッチングTransformerで同時生成し、生成した深度と運動をLiDAR点群に整合させる幾何制約CPPを導入した自動運転向け世界行動モデル。
- Rolling-WAM: 転がる想像による世界行動モデルVLA2026/9/24
ロボット操作のための世界行動モデルにおいて、映像と行動のノイズ除去を再計画サイクルごとに分割して行うことで、計算遅延を抑えつつ4.5倍の再計画高速化を実現した手法。
- RoboDream: スケーラブルなロボットデータ合成のための構成的世界モデルデータ生成/世界モデル2026/6/1
ロボット学習のための大規模データ生成を実現する、エンボディメント中心の世界モデルを提案。実ロボットの動作をレンダリングし、シーンや物体の事前知識を条件付けすることで、物理的に実現可能なフォトリアリスティックなデモを合成し、データスケーリングを可能にする。
- 大規模報酬モデル:視覚言語モデルによる汎用的なオンラインロボット報酬生成強化学習2026/3/1
ロボット操作の強化学習において、視覚言語モデルをオンライン報酬生成器として活用し、模倣学習で初期化した方策を少数の反復で改善する枠組みを提案した。
- DreamPlan: ビデオワールドモデルによる視覚言語プランナーの効率的な強化学習ファインチューニング操作2026/3/1
ロボット操作のための視覚言語モデルプランナーを、実世界での試行錯誤を避け、ビデオ生成モデルによる仮想ロールアウトを用いて強化学習でファインチューニングする手法を提案した。
- フィデューシャル・エクソスケルトン:画像中心のロボット状態推定状態推定2026/1/1
各リンクにマーカー付きの軽量3Dプリント製マウントを取り付け、単一RGB画像からロボットの関節角度やカメラとの位置関係を推定する手法を提案。低コストなロボットアームでも高精度な状態推定と制御を可能にする。
- AnchorDream: 動画拡散モデルを活用した身体性を考慮したロボットデータ合成データ合成/拡散モデル2025/12/1
ロボットの動作レンダリングを条件に事前学習済み動画拡散モデルを再利用し、身体性の一貫性を保ちながら多様なロボット実演データを合成する手法を提案。
- 位相保存拡散による構造整合生成sim2real2025/12/1
拡散過程のノイズを位相保存型に再定式化し、構造を保った画像・動画生成やsim2real転移を可能にした手法を提案。
- 物理世界モデルからのロボット学習マニピュレーション2025/11/1
動画生成モデルと物理世界再構成を組み合わせ、実機データなしでゼロショットのロボットマニピュレーションを実現するフレームワークPhysWorldを提案。
- Humanoid Everyday:オープンワールドヒューマノイド操作のための包括的ロボットデータセットヒューマノイド操作2025/10/1
ヒューマノイドロボットの器用な操作・人間とのインタラクション・移動を伴う動作を含む大規模マルチモーダルデータセットを構築し、クラウド評価基盤も提供した研究。
- カメラ外部パラメータ条件付けによる視点不変な模倣学習模倣学習2025/10/1
カメラの外部パラメータを条件として与えることで、視点が変化しても汎化する模倣学習ポリシーを実現し、背景手がかりへの依存を解消する手法を提案。
- あらゆる画像からのロボット学習sim2real2025/9/1
1枚の画像から物理シミュレーション可能なロボット環境を生成し、大規模な視覚運動デモンストレーションデータを自動収集するフレームワークRoLAを提案。
- ZeroGrasp: ゼロショット形状復元によるロボット把持マニピュレーション2025/4/1
遮蔽推論と物体間の空間関係を活用し、3D復元と把持姿勢予測を同時に行うフレームワークを提案。大規模合成データセットで学習し、実世界の新規物体にも汎化する。
- PhysBench:視覚言語モデルの物理世界理解を評価・強化するベンチマークVLA2025/1/1
視覚言語モデル(VLM)の物理世界理解を評価する10,002件のベンチマークPhysBenchを提案し、75モデルの評価と、視覚モデルを組み合わせて物理理解を強化するPhysAgentを開発した。
- 大規模人間動画から学ぶ汎用人型ポーズ制御VLA2024/12/1
2000万件超の人間動画から人型ロボットのポーズとテキスト指示のデータセットHumanoid-Xを構築し、テキスト入力で人型ロボットを制御する大規模モデルUH-1を学習した。
- 密なメトリック深度を組み込んだニューラル3D表現による視点合成と再照明ニューラルレンダリング2024/9/1
ロボット環境で撮影した少数視点の画像と密な深度情報をニューラル3D表現の学習に統合し、テクスチャと形状のエッジを区別することで高品質な視点合成と再照明を実現する手法を提案。
- ゼロショット新規視点合成による視点不変な方策学習マニピュレーション2024/9/1
単一画像から新規視点を合成するモデルをデータ拡張に用い、単一視点の実演データから視点に頑健な操作方策を学習する手法を提案し、実機・シミュレーションで有効性を示した。
- 自己教師あり幾何誘導初期化によるロバスト単眼視覚オドメトリ視覚オドメトリ2024/6/1
学習ベースの高密度SLAMの失敗事例を分析し、大規模事前学習済み単眼深度推定器を自己教師あり事前情報として活用して最適化を初期化することで、微調整なしにロバストな視覚オドメトリを実現した。
- LiDAR拡散モデルによるリアルなシーン生成に向けて生成モデル2024/4/1
LiDARシーンのリアルさを保つため、曲線パターン・3D幾何・物体文脈を考慮した潜在空間で拡散モデルを学習し、高効率かつ制御可能なシーン生成を実現した論文。
- DROID: 大規模実環境ロボットマニピュレーションデータセットマニピュレーション2024/3/1
北米・アジア・欧州の50名が12ヶ月かけて564シーン・84タスクで収集した76k軌道・350時間のロボット操作データセットを構築し、学習ポリシーの性能と汎化性能が向上することを示した。
- Open X-Embodiment: Robotic Learning Datasets and RT-X Models2023/10/1
- Viewpoint Equivariance for Multi-View 3D Object Detection2023/3/1
- Photo-realistic Neural Domain Randomization2022/10/1
- Self-Supervised Camera Self-Calibration from Video2021/12/1
- DETR3D: 3D Object Detection from Multi-view Images via 3D-to-2D Queries2021/10/1
- Monocular Depth Estimation for Soft Visuotactile Sensors2021/1/1
- Neural Ray Surfaces for Self-Supervised Learning of Depth and Ego-motion2020/8/1
- Neural Outlier Rejection for Self-Supervised Keypoint Learning2019/12/1
- Self-Supervised 3D Keypoint Learning for Ego-motion Estimation2019/12/1
- Dynamic Hilbert Maps: Real-Time Occupancy Predictions in Changing Environment2019/12/1
- 3D Packing for Self-Supervised Monocular Depth Estimation2019/5/1
- Learning to Race through Coordinate Descent Bayesian Optimisation2018/2/1
- Bayesian Optimisation for Safe Navigation under Localisation Uncertainty2017/9/1