何が起きたか

arXivは2026年10月7日、論文「iAm.md: Robot Skill Self-Assessment through Agentic Introspection for Unknown Open-Vocabulary Domains」を公開した。論文は、開放語彙の意味地図と永続的なオブジェクト記録を組み合わせたMarkdown標準「iAm.md」と生成フレームワークを提案し、ロボットが自身の技能を自己評価できるようにする枠組みを示した。

詳細

論文は、基盤モデルを使ったエージェント型ロボットが、観測環境と実機の条件に照らして要求操作の実行可能性を確かめないまま行動を生成してしまう問題をgrounding failureと位置づけた。そのうえで、局所的な視覚言語検出、物体分割、永続オブジェクト記録をMarkdown表現に統合し、agentic introspectionを成立させると説明している。 評価はシミュレーション上のTIAGoで行われ、navigation-and-manipulation tasksにおいて、この標準化表現がskill self-assessmentとexecutabile task generalizationを同時に支えるかを調べたとしている。

Key Facts

論文名は「iAm.md: Robot Skill Self-Assessment through Agentic Introspection for Unknown Open-Vocabulary Domains」である。[1]
掲載日は2026年10月7日である。[1]
提案手法はiAm.mdというMarkdown標準と生成フレームワークである。[1]
手法はopen-vocabulary semantic mapping、local vision-language detections、object segmentation、persistent object recordsを組み合わせる。[1]
シミュレーション上のTIAGoで、navigation-and-manipulation tasksを評価した。[1]

本紙の見方

この論文の新しさは、ロボットの行動計画そのものではなく、計画を実行してよいかを事前に点検する中間表現をMarkdownとして定義した点にある。従来の基盤モデルは、もっともらしい行動列を出せても、環境に本当に根拠づけられているかを明示しにくかった。iAm.mdは、その弱点を局所検出、物体分割、永続記録をつないだ「確認可能な状態表現」で補おうとする構成であり、生成AIの出力をそのまま動かすのではなく、実行前検証を挟む設計である。 本紙の関連記事はないが、公開情報で見ると、ロボット分野の基盤モデルは近年、行動生成と知覚の統合を急いでいる一方で、実環境への接続は依然として難所である。本稿は、その中でも開放語彙環境を前提にしている点が特徴で、固定された物体集合を前提にした従来の認識・計画系とは射程が異なる。つまり、対象物の名前や状態が事前に完全には決まっていない現場で、どこまで自己評価を機械化できるかが焦点になる。競合という観点では、純粋な方策学習よりも、知覚・記述・検証をまたぐ中間層の設計競争に重心が移る可能性があるとみられる。 一方で、評価はシミュレーション上のTIAGoに限られており、実機での頑健性、異なるロボット本体への移植性、Markdown表現の記述コストは未確認である。今後確認すべき点は、1) 実機でgrounding failureをどこまで減らせるか、2) 他の移動・把持プラットフォームへどの程度移植できるか、3) 開放語彙環境での物体記録と自己評価がどのくらいの追加計算・運用負担を要するか、である。

なぜ重要か

論文が示す狙いは、ロボットが行動を出す前に環境との整合性を点検することで、実行不能な指示を減らす点にある。開放語彙環境を対象にしているため、現場で対象物の名称や状態が固定されない用途での適用が論点になる。

日本への影響

日本のロボット研究や現場導入では、把持・移動の精度だけでなく、知覚結果をどう記録し、実行可否をどう説明可能にするかが焦点になりうる。特に、現場ごとに対象物が変わる運用では、固定ラベル前提の認識よりも、この論文のような中間表現の整備が課題として残る。