Motonari Kambara
収録論文 15本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- AnoleVLA: 深い状態空間モデルを用いたモバイル操作のための軽量視覚言語行動モデルVLA2026/3/1
言語指示に基づくロボット操作のための軽量な視覚言語行動モデルを提案し、深い状態空間モデルを用いて効率的に動作させ、実機で高い成功率と高速な推論を達成した。
- LILAC: 言語条件付きオブジェクト中心オプティカルフローによるオープンループ軌道生成VLA2026/3/1
人間やWeb動画から学習可能なフローベースの軌道生成を用いて、言語指示に従った物体操作を実現する手法を提案。指示とフローを整合させる損失関数とクロスモーダルアダプタを導入し、既存手法より高品質なフロー生成と高いタスク成功率を達成した。
- 操作前アライメント予測:並列深層状態空間モデルとTransformerによるアプローチマニピュレーション2025/9/1
操作前の一人称視点画像と計画軌道、自然言語指示の整合性を予測し、タスク成功を事前に判断するモデルを提案。深層状態空間モデルとTransformerを並列に用いて軌道の多層的な時系列相関を捉える。
- AIRoA MoMaデータセット:移動マニピュレーションのための大規模階層データセットマニピュレーション2025/9/1
移動マニピュレーション向けに、RGB画像・関節状態・6軸力覚センサ・ロボット内部状態を同期収録し、サブゴールとプリミティブ動作の2層注釈を付けた大規模実世界データセットを構築した。
- 複数画像からの移動マニピュレーション指示生成と自動評価指標の強化移動マニピュレーション2025/1/1
対象物体と収納場所の画像から移動マニピュレーション用の自由形式指示文を生成するモデルを提案し、学習ベースとn-gramベースの自動評価指標を報酬として組み込む訓練法で性能を向上させた。
- エンドエフェクタ軌道に基づくオープンボキャブラリ物体操作タスクの将来成否予測マニピュレーション2024/12/1
自然言語指示・視点画像・エンドエフェクタ軌道を統合し、操作実行前に成否を予測する手法を提案。軌道に学習可能な重み付けを行うTrajectory Encoderで精度を向上させた。
- マルチレベル整列表現に基づくオープンボキャブラリマニピュレーションのタスク成功予測マニピュレーション2024/10/1
指示文と操作前後の視点画像から、卓上マニピュレーションの成否を予測する手法を提案。局所画像情報・言語整列特徴・言語構造化特徴を統合したマルチレベル表現で、MLLMを上回る精度を達成した。
- マルチモーダル基盤モデルと最適輸送ポリゴンマッチングによるオープン語彙操作指示からの物体セグメンテーションセグメンテーション2024/7/1
家庭用サービスロボットへのオープン語彙な操作指示から対象物体のセグメンテーションマスクを生成する手法を提案し、頂点順序の違いを最適輸送で扱う損失関数と新データセットで有効性を示した。
- 最近傍未来キャプショニング:物体配置タスクにおける衝突可能性の記述生成VLA2024/7/1
家庭用サービスロボットが物体を配置する際に起こりうる衝突を予測し、その領域に注目して自然言語で説明する手法を提案。最近傍言語モデルと衝突注意モジュールにより、既存手法を上回る性能を達成した。
- Learning-To-Rank Approach for Identifying Everyday Objects Using a Physical-World Search Engine2023/12/1
- DialMAT: Dialogue-Enabled Transformer with Moment-Based Adversarial Training2023/11/1
- Fully Automated Task Management for Generation, Execution, and Evaluation: A Framework for Fetch-and-Carry Tasks with Natural Language Instructions in Continuous Space2023/11/1
- Switching Head-Tail Funnel UNITER for Dual Referring Expression Comprehension with Fetch-and-Carry Tasks2023/7/1
- Relational Future Captioning Model for Explaining Likely Collisions in Daily Tasks2022/7/1
- Case Relation Transformer: A Crossmodal Language Generation Model for Fetching Instructions2021/7/1