日本フィジカルAI新聞

世界のフィジカルAIを、日本語で。

週刊ニュースレター購読
インタラクティブアートarXiv:2609.05404

拡散TV:拡散モデルを触覚的・身体的に体験するインタラクティブアート

Diffusion TV: Experiencing Diffusion Models through Tangible, Embodied Interaction

シェア:XThreadsFacebookLINEはてブBluesky

拡散TVは、改造したCRTテレビのアンテナを物理的に操作することで、AI生成画像のノイズ除去過程を体験できるインタラクティブアート作品を提案した論文。

詳しい要約

1. どんなもの?

Diffusion TVは、改造したCRT TVを用いて拡散モデルを触覚的・身体的に体験できるインタラクティブなAIアートインスタレーションである。アンテナを物理的に操作することで、AI生成画像と音声の明瞭さを制御し、拡散ベース生成の基盤となるdenoisingプロセスを比喩的に演じる。チューニングノブで3つのチャンネル(過去の絶滅種、現在の絶滅危惧種、未来の想像上の生き物)を切り替え、時間的・生態学的な物語を提示する。連続的な視聴覚フィードバックと物理的インタラクションを通じて、最終出力よりも生成プロセスを前景化し、中間状態を体験的素材として探求させる。明示的な技術説明ではなく、生成的技術への探索的関与と内省を促す、説明可能なAIの代替的・身体的なモードを提示する。

2. 先行研究と比べてどこがすごい?

先行研究(従来のexplainable AIや生成モデルの可視化手法)は、主に視覚的・概念的な説明や、画面上の操作に依存することが多い。Diffusion TVは、物理的な身体動作(アンテナ操作)と連続的な視聴覚フィードバックを通じて、拡散モデルの内部プロセス(denoising)を直感的に体験させる点で独自性がある。また、技術的な詳細を説明するのではなく、アートインスタレーションとして生成的プロセスを鑑賞・探求の対象とし、時間的・生態学的な物語(過去・現在・未来の種)を組み込むことで、生成的技術に対する批判的・内省的な関与を促す点が新しい。

3. 技術・手法の肝は?

手法の肝は、拡散モデルのdenoisingプロセスを、CRT TVのアンテナ操作によるノイズ調整として物理的にマッピングした点にある。アンテナを動かすと、生成画像と音声のノイズ量が変化し、ユーザーはノイズ除去の段階を身体で操作できる。チューニングノブでチャンネルを切り替えることで、異なるカテゴリ(過去・現在・未来の動物)の生成を選択する。システムは、拡散モデルをリアルタイムで実行し、アンテナの位置に応じてノイズレベルを制御する。視覚と聴覚の連続的なフィードバックにより、ユーザーは生成過程の中間状態を探索できる。技術的な説明は意図的に省かれ、体験自体が説明の役割を果たす。

4. どうやって有効だと検証した?

要旨からは、定量的な評価やユーザースタディの詳細は不明である。ただし、アートインスタレーションとしての展示を通じて、参加者が身体的インタラクションを通じて拡散モデルのプロセスを体験し、生成的技術に対する内省を促すことを意図している。具体的な検証方法(例:参加者の観察、インタビュー、アンケートなど)は要旨には記載されていない。

5. 議論はある?

議論としては、明示的な技術説明を避けることで、explainable AIとしての有効性が疑問視される可能性がある。身体的操作がdenoisingプロセスの理解にどの程度寄与するかは、主観的な体験に依存する。また、CRT TVというレトロな媒体と拡散モデルの組み合わせは、ノスタルジーと新技術の対比を生むが、技術的な正確さよりも芸術的表現を優先している。さらに、過去・現在・未来の種という物語は、生態学的なメッセージを含むが、生成的AIの社会的影響(例:偽情報、著作権)については直接扱っていない。

6. 次に読むべき論文は?

要旨で参照されている研究や関連手法は明示されていないが、同分野の定番として、explainable AIの研究(例:Saliency Maps, Activation Maximization)、拡散モデルの可視化・解釈手法(例:Diffusion Models Beat GANs on Image Synthesis)、インタラクティブアートとAIの融合事例(例:Learning to See, GANism)などが関連する。次に読むべき論文としては、拡散モデルの内部表現を分析した研究や、身体的インタラクションを用いたAI可視化の事例を挙げることができる。

※ AIが要旨から生成した要約です。正確性は原文をご確認ください。

著者: Sihwa Park

分類: cs.HC, cs.AI

原文アブストラクト

Diffusion TV is an interactive AI art installation that offers a tangible and embodied experience of diffusion models through a modified CRT TV. By physically manipulating the TV's antenna, audiences control the clarity of AI-generated images and sounds, metaphorically enacting the denoising process that underlies diffusion-based generation. Using the tuning knob, participants switch between three channels featuring AI-generated animals from the Past (extinct species), Present (endangered species), and Future (speculative creatures), situating the interaction within a temporal and ecological narrative. Through continuous audiovisual feedback and physical interaction, Diffusion TV foregrounds the generative process over final outputs, allowing audiences to explore intermediate states as experiential material. Rather than providing explicit technical explanation, the work presents an alternative, embodied mode of explainable AI that invites exploratory engagement with and reflection on generative technologies.