何が起きたか

Google DeepMindは2026年1月、単一の動画から3D空間と時間の流れを同時に再構成する4D視覚技術「D4RT(DeepMind 4D Reasoning Toolkit)」を発表した。同社はD4RTについて、従来手法より最大300倍高速な統合的な4D再構成と追跡を実現するとしている。

詳細

D4RTは、単一の動画から3D空間と時間の流れを同時に再構成する4D視覚技術である。従来のAIは静止物体の3Dモデル作成や写真内の物体認識に優れていたが、時間の流れに沿った3D空間の理解は困難だった。D4RTは、空間の再構成だけでなく、時間経過に伴う物体の変化や移動を理解することを目指す。 Google DeepMindは、D4RTがロボットやARデバイスに人間に近い空間認識をもたらすことを目指していると説明している。例えば、家庭用ロボットがリビングルームを移動する際、単に「壁がある」と認識するだけでなく、「子供がその方向から走ってくる」といった人間らしい判断が可能になるとしている。

Key Facts

Google DeepMindは2026年1月にD4RT(DeepMind 4D Reasoning Toolkit)を発表した。[1]
D4RTは単一の動画から3D空間と時間の流れを同時に再構成する4D視覚技術である。[1]
D4RTは従来手法より最大300倍高速な統合的な4D再構成と追跡を実現する。[0]
D4RTはロボットやARデバイスに人間に近い空間認識をもたらすことを目指している。[1]
従来のAIは静止物体の3Dモデル作成や写真内の物体認識に優れていたが、時間の流れに沿った3D空間の理解は困難だった。[1]
D4RTは空間の再構成だけでなく、時間経過に伴う物体の変化や移動を理解することを目指す。[1]

なぜ重要か

D4RTは、AIが動く世界を時間の流れに沿って3Dで理解するための新たな手法を提供する。これにより、ロボットやARデバイスの空間認識能力が向上し、より自然なインタラクションが可能になると期待される。