Shuhei Kurita
収録論文 7本 ・ フィジカルAI/ロボット学習
VLAナビゲーション視覚探索/ベンチマークタスク計画
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 敵対的学習はマルチビューVLAの汎化を改善するか?ビュー崩壊の解明と緩和VLA2026/9/27
マルチビューVLAに敵対的学習を適用すると、特定の視点変化には強くなる一方で「ビュー崩壊」と呼ばれる現象が起こり、手首視点に過度に依存することを明らかにし、ビュースワップ介入で緩和を試みた研究。
- NavWAM: 目標条件付き視覚ナビゲーションのためのナビゲーションワールドアクションモデルナビゲーション2026/6/11
将来の視覚予測と行動生成を統合した拡散トランスフォーマーポリシーを提案し、シミュレーション事前学習と実機適応により、計画ベースのワールドモデルより高い性能を実現した。
- E3VS-Bench: 3Dガウススプラッティングシーンにおける視点依存型能動知覚のベンチマーク視覚探索/ベンチマーク2026/4/20
5自由度の視点制御で視点依存の証拠を集める必要がある、3Dガウススプラッティングで再構築された高精細シーンを用いた視覚探索ベンチマークを提案し、複数のVLMと人間の性能差を評価した。
- HiFlow: トークン化不要のスケール単位自己回帰ポリシー学習をフローマッチングで実現VLA2026/3/1
ロボットの行動は低次元連続ベクトルであるため、離散トークン化を不要とし、時間プーリングで多スケールの連続行動目標を構築する自己回帰ポリシーHiFlowを提案。単一ステージでエンドツーエンドに学習し、既存手法を上回る性能を示した。
- 対話から実行へ:MoA支援型対話計画によるビヘイビアツリーを用いた長期的ロボット実行タスク計画2026/3/1
大規模言語モデルによる対話型タスク計画で、複数の専門エージェント(MoA)が代理回答することで人間の介入を減らし、ビヘイビアツリーで構造化された長期実行を実現する手法を提案。実験で人間の応答要求を約27%削減しつつ、実ロボットでの長期的実行と障害回復を確認した。
- 一人称視点動画から視覚-言語-行動モデルを構築するVLA2025/9/1
一人称視点の動画から6DoF物体操作軌跡を抽出し、大規模なVLA事前学習データセットを構築。シミュレーションと実機で成功率が20%以上向上することを示した。
- 地図ベースのモジュラー手法によるゼロショット身体性質問応答VLA2024/5/1
基盤モデルと地図構築を組み合わせ、未知環境でロボットが自然言語の質問に答えるゼロショットEQA手法を提案し、実環境でも検証した。