Shun Iwase
収録論文 8本 ・ フィジカルAI/ロボット学習
VLA動的視点合成マニピュレーションシーン生成3D再構成/物体追跡
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- VLA Foundry: 視覚言語行動モデル訓練のための統合フレームワークVLA2026/4/1
LLM、VLM、VLAの訓練を単一コードベースで統合するオープンソースフレームワークを提案し、スクラッチからの訓練と事前学習済みバックボーンを用いた訓練の両方をサポートし、シミュレータ上で評価した。
- AnyView: 動的シーンにおける任意の新規視点を合成動的視点合成2026/1/1
拡散モデルベースの動画生成フレームワークで、動的な実世界シーンにおいて任意のカメラ視点からの時空間的に一貫した新規動画を生成する。
- マルチタスク巧みな操作のための大規模行動モデルの慎重な検証マニピュレーション2025/7/1
大規模行動モデル(LBM)をシミュレーションと実世界で厳密に評価し、マルチタスク事前学習が単一タスクより成功率・堅牢性・データ効率を高めることを統計的に示した。
- 後学習と推論時探索による操作可能なシーン生成シーン生成2025/5/1
拡散モデルで物体配置とSE(3)姿勢を生成し、強化学習による後学習や推論時探索で下流タスクに合わせてシーンを制御する手法を提案。
- GTR: 外観と幾何学的複雑さに基づく未知物体のガウシアンスプラッティング追跡と再構成3D再構成/物体追跡2025/5/1
単眼RGBD動画から未知物体の6自由度追跡と高品質な3D再構成を同時に行う手法を提案。3Dガウシアンスプラッティングと外観・形状のハイブリッド追跡、キーフレーム選択を組み合わせ、対称性や複雑な形状・外観を持つ物体でも頑健に動作する。
- ZeroGrasp: ゼロショット形状復元によるロボット把持マニピュレーション2025/4/1
遮蔽推論と物体間の空間関係を活用し、3D復元と把持姿勢予測を同時に行うフレームワークを提案。大規模合成データセットで学習し、実世界の新規物体にも汎化する。
- KDFNet: Learning Keypoint Distance Field for 6D Object Pose Estimation2021/9/1
- StereOBJ-1M: Large-scale Stereo Image Dataset for 6D Object Pose Estimation2021/9/1