Komei Sugiura
収録論文 36本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- NarrativeFlow: ロボット速度場を用いたフローベース視覚-言語-行動モデルVLA2026/10/1
言語条件付き操作において、ロボットの速度場を連続的なフローとしてモデル化し、フローマッチングで生成する手法を提案。複数ロボットのデータを活用でき、実世界タスクで成功率が向上。
- フローをフローとして:ロボット速度場を確率速度場としてモデル化しフローベース物体操作を実現操作2026/6/1
ロボットの動作を確率フローとしてモデル化し、フローマッチングに基づいて高品質かつ高速なロボットフロー生成を実現した物体操作フレームワークを提案。
- HiFlow: トークン化不要のスケール単位自己回帰ポリシー学習をフローマッチングで実現VLA2026/3/1
ロボットの行動は低次元連続ベクトルであるため、離散トークン化を不要とし、時間プーリングで多スケールの連続行動目標を構築する自己回帰ポリシーHiFlowを提案。単一ステージでエンドツーエンドに学習し、既存手法を上回る性能を示した。
- LILAC: 言語条件付きオブジェクト中心オプティカルフローによるオープンループ軌道生成VLA2026/3/1
人間やWeb動画から学習可能なフローベースの軌道生成を用いて、言語指示に従った物体操作を実現する手法を提案。指示とフローを整合させる損失関数とクロスモーダルアダプタを導入し、既存手法より高品質なフロー生成と高いタスク成功率を達成した。
- AnoleVLA: 深い状態空間モデルを用いたモバイル操作のための軽量視覚言語行動モデルVLA2026/3/1
言語指示に基づくロボット操作のための軽量な視覚言語行動モデルを提案し、深い状態空間モデルを用いて効率的に動作させ、実機で高い成功率と高速な推論を達成した。
- アフォーダンスRAG:モバイルマニピュレーションのためのアフォーダンス認識型身体化記憶を用いた階層的マルチモーダル検索マニピュレーション2025/12/1
自由形式の指示に基づく移動マニピュレーションのため、事前探索画像からアフォーダンス認識型の身体化記憶を構築し、階層的マルチモーダル検索で対象物を特定するゼロショット手法を提案した。
- 操作前アライメント予測:並列深層状態空間モデルとTransformerによるアプローチマニピュレーション2025/9/1
操作前の一人称視点画像と計画軌道、自然言語指示の整合性を予測し、タスク成功を事前に判断するモデルを提案。深層状態空間モデルとTransformerを並列に用いて軌道の多層的な時系列相関を捉える。
- GENNAV: 一般化された参照可能領域のためのポリゴンマスク生成セグメンテーション2025/8/1
自然言語指示と車載カメラ画像から、境界が曖昧な領域も含めて対象領域の有無を予測し、複数領域のセグメンテーションマスクを生成する手法を提案。新ベンチマークGRiN-Driveと実車実験で有効性を検証した。
- 複数画像からの移動マニピュレーション指示生成と自動評価指標の強化移動マニピュレーション2025/1/1
対象物体と収納場所の画像から移動マニピュレーション用の自由形式指示文を生成するモデルを提案し、学習ベースとn-gramベースの自動評価指標を報酬として組み込む訓練法で性能を向上させた。
- エンドエフェクタ軌道に基づくオープンボキャブラリ物体操作タスクの将来成否予測マニピュレーション2024/12/1
自然言語指示・視点画像・エンドエフェクタ軌道を統合し、操作実行前に成否を予測する手法を提案。軌道に学習可能な重み付けを行うTrajectory Encoderで精度を向上させた。
- 二重緩和コントラスト学習と密ラベリングによるオープンボキャブラリ移動マニピュレーション移動マニピュレーション2024/12/1
家庭内画像から指示に合う物体と収納先を検索し、ロボットが物体を運ぶオープンボキャブラリ移動マニピュレーション手法RelaX-Formerを提案。実画像データセットと実機ゼロショット実験で有効性を示した。
- マルチレベル整列表現に基づくオープンボキャブラリマニピュレーションのタスク成功予測マニピュレーション2024/10/1
指示文と操作前後の視点画像から、卓上マニピュレーションの成否を予測する手法を提案。局所画像情報・言語整列特徴・言語構造化特徴を統合したマルチレベル表現で、MLLMを上回る精度を達成した。
- DM2RM: オープンボキャブラリ指示に基づく対象物と設置場所のデュアルモードマルチモーダルランキングマニピュレーション2024/8/1
家庭用サービスロボットがオープンボキャブラリの指示に従い、対象物とその設置場所の画像を単一モデルで検索できるデュアルモードランキング手法を提案し、実環境で82%のタスク成功率を達成した。
- 最近傍未来キャプショニング:物体配置タスクにおける衝突可能性の記述生成VLA2024/7/1
家庭用サービスロボットが物体を配置する際に起こりうる衝突を予測し、その領域に注目して自然言語で説明する手法を提案。最近傍言語モデルと衝突注意モジュールにより、既存手法を上回る性能を達成した。
- 再配置対象検出のための協調スケールクロスアテンションTransformer物体検出2024/7/1
家庭用サービスロボットの再配置タスクにおいて、目標状態と現在状態の画像から再配置すべき物体を検出するTransformerベースの手法を提案し、新データセットでベースラインを上回る性能を示した。
- マルチモーダル基盤モデルと最適輸送ポリゴンマッチングによるオープン語彙操作指示からの物体セグメンテーションセグメンテーション2024/7/1
家庭用サービスロボットへのオープン語彙な操作指示から対象物体のセグメンテーションマスクを生成する手法を提案し、頂点順序の違いを最適輸送で扱う損失関数と新データセットで有効性を示した。
- Learning-To-Rank Approach for Identifying Everyday Objects Using a Physical-World Search Engine2023/12/1
- DialMAT: Dialogue-Enabled Transformer with Moment-Based Adversarial Training2023/11/1
- Fully Automated Task Management for Generation, Execution, and Evaluation: A Framework for Fetch-and-Carry Tasks with Natural Language Instructions in Continuous Space2023/11/1
- Switching Head-Tail Funnel UNITER for Dual Referring Expression Comprehension with Fetch-and-Carry Tasks2023/7/1
- Multimodal Diffusion Segmentation Model for Object Segmentation from Manipulation Instructions2023/7/1
- Prototypical Contrastive Transfer Learning for Multimodal Language Understanding2023/7/1
- Visual Explanation of Deep Q-Network for Robot Navigation by Fine-tuning Attention Branch2022/8/1
- Relational Future Captioning Model for Explaining Likely Collisions in Daily Tasks2022/7/1
- Moment-based Adversarial Training for Embodied Language Comprehension2022/4/1
- Case Relation Transformer: A Crossmodal Language Generation Model for Fetching Instructions2021/7/1
- Target-dependent UNITER: A Transformer-Based Multimodal Language Comprehension Model for Domestic Service Robots2021/7/1
- CrossMap Transformer: A Crossmodal Masked Path Transformer Using Double Back-Translation for Vision-and-Language Navigation2021/3/1
- Predicting and Attending to Damaging Collisions for Placing Everyday Objects in Photo-Realistic Simulations2021/2/1
- Alleviating the Burden of Labeling: Sentence Generation by Attention Branch Encoder-Decoder Network2020/7/1
- A Multimodal Target-Source Classifier with Attention Branches to Understand Ambiguous Instructions for Fetching Daily Objects2019/12/1
- Multimodal Attention Branch Network for Perspective-Free Sentence Generation2019/9/1
- Understanding Natural Language Instructions for Fetching Daily Objects Using GAN-Based Multimodal Target-Source Classification2019/6/1
- SuMo-SS: Submodular Optimization Sensor Scattering for Deploying Sensor Networks by Drones2018/6/1
- A Multimodal Classifier Generative Adversarial Network for Carry and Place Tasks from Ambiguous Language Instructions2018/6/1
- Grounded Language Understanding for Manipulation Instructions Using GAN-Based Classification2018/1/1