Sergey Zakharov
Toyota Research Institute
収録論文 29本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- BIND: 3Dロボット動作を2D画像特徴に結びつける新表現VLA2026/9/29
カメラ幾何学を用いて3D動作候補を各視点の2D画像特徴に投影・スコアリングすることで、データ効率と視点・物体位置の変化への頑健性を高めた視覚運動ポリシーを提案。
- H2RBench:人間からロボットへの転移を評価するReal-to-Simベンチマークsim2real2026/9/21
人間の動画デモからロボット操作を学習するH2R転移手法を公平に比較するため、実人間動画とシミュレーションロボット実演に基づく標準ベンチマークを構築し、複数手法の性能を体系的に評価した。
- DemoBridge: 単一視点の人間デモンストレーション再ターゲティングのためのシミュレーション・イン・ザ・ループ・ツールキットデモンストレーション学習/軌道生成2026/7/1
単一視点のRGBステレオ映像から人間の手のデモンストレーションを取得し、物理検証済みのロボットアーム軌道に変換するツールキットを提案。衝突回避プランナーと物理シミュレータをループさせ、再プランニングにより実行可能な軌道を生成する。
- デモから報酬へ:VLM報酬モデルのテスト時プロンプト最適化報酬学習/VLM2026/6/1
ロボットのデモンストレーション数本を用いて、VLM報酬モデルの言語指示をテスト時に最適化し、誤検出を減らして報酬精度を向上させる手法を提案した。追加学習や計算資源を必要とせず、シミュレーションと実機で有効性を実証した。
- デュエット:効率的な教示による二台ロボットの協調理解群制御2026/6/1
二台のロボットが協調して作業するための学習フレームワークを提案。VR遠隔操作と人間同士の協調動作データを活用し、少ない実機データで高性能な協調ポリシーを学習する。
- 生成による再構築:スパース観測からの3D複数物体シーン再構築3D再構築2026/4/1
RGB-D画像のスパースな観測から、物体や部品の形状と姿勢を確率的に推定する生成フレームワークRecGenを提案し、複雑な遮蔽や対称物体に対応して高精度な再構築を実現した。
- SceneSmith: エージェントによるシミュレーション可能な屋内シーン生成sim2real2026/2/1
VLMエージェントが協調して自然言語から家具や小物まで揃った物理シミュレーション可能な屋内シーンを自動生成するフレームワーク。
- AnyView: 動的シーンにおける任意の新規視点を合成動的視点合成2026/1/1
拡散モデルベースの動画生成フレームワークで、動的な実世界シーンにおいて任意のカメラ視点からの時空間的に一貫した新規動画を生成する。
- PolaRiS: 汎用ロボットポリシーのためのスケーラブルな実世界→シミュレーション評価sim2real2025/12/1
実世界の短い動画スキャンからニューラル再構成で高忠実度なシミュレーション環境を構築し、汎用ロボットポリシーを実世界と強く相関する形で評価できるようにしたフレームワーク。
- Humanoid Everyday:オープンワールドヒューマノイド操作のための包括的ロボットデータセットヒューマノイド操作2025/10/1
ヒューマノイドロボットの器用な操作・人間とのインタラクション・移動を伴う動作を含む大規模マルチモーダルデータセットを構築し、クラウド評価基盤も提供した研究。
- あらゆる画像からのロボット学習sim2real2025/9/1
1枚の画像から物理シミュレーション可能なロボット環境を生成し、大規模な視覚運動デモンストレーションデータを自動収集するフレームワークRoLAを提案。
- OmniShape: 実世界におけるゼロショット多仮説形状・姿勢推定形状・姿勢推定2025/8/1
単一観測から未知物体の姿勢と完全形状を推定するため、形状補完を2つのマルチモーダル分布に分離し、条件付き拡散モデルで複数仮説を生成する手法を提案。
- マルチタスク巧みな操作のための大規模行動モデルの慎重な検証マニピュレーション2025/7/1
大規模行動モデル(LBM)をシミュレーションと実世界で厳密に評価し、マルチタスク事前学習が単一タスクより成功率・堅牢性・データ効率を高めることを統計的に示した。
- 後学習と推論時探索による操作可能なシーン生成シーン生成2025/5/1
拡散モデルで物体配置とSE(3)姿勢を生成し、強化学習による後学習や推論時探索で下流タスクに合わせてシーンを制御する手法を提案。
- GTR: 外観と幾何学的複雑さに基づく未知物体のガウシアンスプラッティング追跡と再構成3D再構成/物体追跡2025/5/1
単眼RGBD動画から未知物体の6自由度追跡と高品質な3D再構成を同時に行う手法を提案。3Dガウシアンスプラッティングと外観・形状のハイブリッド追跡、キーフレーム選択を組み合わせ、対称性や複雑な形状・外観を持つ物体でも頑健に動作する。
- ZeroGrasp: ゼロショット形状復元によるロボット把持マニピュレーション2025/4/1
遮蔽推論と物体間の空間関係を活用し、3D復元と把持姿勢予測を同時に行うフレームワークを提案。大規模合成データセットで学習し、実世界の新規物体にも汎化する。
- 密なメトリック深度を組み込んだニューラル3D表現による視点合成と再照明ニューラルレンダリング2024/9/1
ロボット環境で撮影した少数視点の画像と密な深度情報をニューラル3D表現の学習に統合し、テクスチャと形状のエッジを区別することで高品質な視点合成と再照明を実現する手法を提案。
- ゼロショット新規視点合成による視点不変な方策学習マニピュレーション2024/9/1
単一画像から新規視点を合成するモデルをデータ拡張に用い、単一視点の実演データから視点に頑健な操作方策を学習する手法を提案し、実機・シミュレーションで有効性を示した。
- DiffusionNOCS: Managing Symmetry and Uncertainty in Sim2Real Multi-Modal Category-level Pose Estimation2024/2/1
- FSD: Fast Self-Supervised Single RGB-D to Categorical 3D Objects2023/10/1
- Multi-Object Manipulation via Object-Centric Neural Scattering Functions2023/6/1
- CARTO: Category and Joint Agnostic Reconstruction of ARTiculated Objects2023/3/1
- Zero-1-to-3: Zero-shot One Image to 3D Object2023/3/1
- ROAD: Learning an Implicit Recursive Octree Auto-Decoder to Efficiently Encode 3D Shapes2022/12/1
- Photo-realistic Neural Domain Randomization2022/10/1
- ShAPO: Implicit Representations for Multi-Object Shape, Appearance, and Pose Optimization2022/7/1
- 3D Object Instance Recognition and Pose Estimation Using Triplet Loss with Dynamic Margin2019/4/1
- HomebrewedDB: RGB-D Dataset for 6D Pose Estimation of 3D Objects2019/4/1
- DPOD: 6D Pose Object Detector and Refiner2019/2/1