何が起きたか

The Robot Reportは2026年10月6日、TwelveLabs Inc.がPegasus 1.6を発表し、フィジカルAI向けの映像理解機能を加えたと報じた。記事は、同社がこのモデルを、ロボットやドローン、自動運転車が現実世界を扱う用途に向けたものだと位置づけている。

本紙の見方

TwelveLabsのPegasus 1.6は、単なる動画検索や要約の延長ではなく、フィジカルAIの学習素材として第一人称映像を扱う方向に軸足を寄せた点が特徴だとみられる。ただし、今回の原典はインタビューを含む二次報道であり、モデルの性能指標、価格、提供形態、対応データ規模といった比較可能な条件は示されていない。したがって、現時点で読めるのは「何ができるか」よりも「どの層の映像を主対象にするか」という製品方針である。 本紙の関連記事として挙げられていないため過去報道との直接比較はできないが、公開情報の文脈では、映像理解モデルは一般に、収集した映像をそのまま学習可能な形に整える中間層として位置づけられる。Pegasus 1.6が第一人称映像に焦点を当てるなら、ロボットの遠隔操作ログや作業映像のように、行為の変化が細かく出るデータを前処理して使う発想に近い。逆に、第三者視点の監視映像や一般的な検索用途とは要件が異なるため、同社がどこまで専用化を進めたかが今後の論点になる。 この種のモデルで重要なのは、映像を「見せる」ことではなく、行動単位でラベル化し、再学習に回せるかどうかである。TwelveLabsが言うフィジカルAI向けの位置づけは、ロボット、ドローン、自動運転車のいずれにも共通するが、実際には用途ごとに必要な解像度や安全確認の粒度が違う。詳細は原典を参照されたい。今後確認すべき点は、第一にPegasus 1.6の提供開始形態と料金、第二に対応する映像長や処理速度、第三にフィジカルAI向けにどの程度の作業ラベル生成を自動化できるか、である。

なぜ重要か

TwelveLabsがフィジカルAI向けを明示したことで、映像理解は検索補助から学習データ整備の工程に近づいたとみられる。ロボットや自動運転の現場では、映像をそのまま蓄積するだけでは再利用しにくく、行動単位で整理できるかが課題になるためだ。