論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/6/29 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文視覚ポインティング画像認識
具現化AIのための効率的視覚ポインティング:エージェント駆動データ合成、クロスブロック注意、反復補正
言語指示からピクセル座標を推定する視覚ポインティングの精度向上を目指し、データ合成とモデル改良を組み合わせてPointArena 2026で77.2%の精度を達成した。
原題: Efficient Visual Pointing for Embodied AI:Agent-Driven Data Synthesis, Cross-Block Attention, and Iterative Correction / Zijian Hong, Qi Lv, Yuxiang Xie 他
日本語で読む → - 論文3D再構成画像認識
UnfoldArt: テキストまたは画像からの完全な関節3Dオブジェクトのゼロショット復元
テキストや画像から、関節構造と隠れた内部形状を含む完全な3Dオブジェクトを復元する、エージェントベースの新しい手法を提案。
原題: UnfoldArt: Zero-Shot Recovery of Full Articulated 3D Objects from Text or Image / Mohamed el Amine Boudjoghra, Ivan Laptev, Angela Dai
日本語で読む → - 論文動画編集画像認識
Goku: 命令ベース動画編集のための100万規模のユニバーサルデータセットとベンチマーク
複雑な編集指示に応えるため、200万ペアの大規模データセットと、マスク分岐と外観レンダリング分岐を分離したデュアルブランチモデルを構築し、新ベンチマークで性能を検証した論文。
原題: Goku: A Million-Scale Universal Dataset and Benchmark for Instruction-Based Video Editing / Sen Liang, Cong Wang, Zhentao Yu 他
日本語で読む → - 論文3Dシーン理解画像認識
2D検出器を用いた3Dガウシアンのオープンボキャブラリおよび参照セグメンテーション
3Dガウシアンスプラッティングのシーン表現に、2D物体検出器のセマンティック投票を集約してインスタンス特徴を学習し、言語クエリによるオープンボキャブラリ・参照セグメンテーションを実現する手法を提案した。
原題: Open-Vocabulary and Referring Segmentation for 3D Gaussians Using 2D Detectors / Jameel Hassan, Yasiru Ranasinghe, Vishal Patel
日本語で読む → - 論文把持生成画像認識
DCGrasp: 距離認識型の制御可能な把持生成
手と物体の3Dインタラクション生成において、距離プロファイルと距離認識重み付けを用いた新しい把持エネルギー項を導入し、拡散トランスフォーマーと最適化により制御可能で多様な物体形状に汎化する把持を生成するシステムを提案した。
原題: DCGrasp: Distance-aware Controllable Grasp Generation / Hiroyasu Akada, Jesús Pérez, Emre Aksan 他
日本語で読む → - 論文画像編集画像認識
GeoEdit: 幾何認識オブジェクト編集のためのデュアルブランチ拡散
3D物理制約を守りながら写真内のオブジェクトを正確に操作するための、トレーニング不要のLift-Manipulate-Render-Denoiseパイプラインを提案。
原題: GeoEdit: Geometry-Aware Object Editing via Dual-Branch Denoising / Yi He, Jiangming Wang, Xinyu Wang 他
日本語で読む → - 論文水中画像強調画像認識
周波数誘導デュアルパス注意によるリアルタイム水中画像強調
水中画像の劣化は周波数特性に敏感であることに着目し、構造的再パラメータ化可能な軽量CNNにDCT事前分布と周波数誘導デュアルパス注意を統合したリアルタイム水中画像強調フレームワークを提案。4.23Kパラメータで600FPS以上を達成し、大規模モデルを凌ぐ性能を示した。
原題: Real-Time Underwater Image Enhancement via Frequency-Guided Dual-Path Attention / Leshen Zhang, Ao Li, Ce Zhu
日本語で読む → - 論文3D再構成/物体分離/ロボット操作画像認識
物理ベースのロボット操作のための遮蔽に頑健な多物体分離
遮蔽や視点不足による物体の結合を、スパースビューからの3D再構成問題として捉え、マスク不要で複数物体を分離・再構成する手法を提案。3Dガウシアンスプラッティングと拡散モデルを組み合わせ、シミュレーション可能な物体を生成する。
原題: Occlusion-Robust Multi-Object Decoupling for Physics-Based Robotic Interaction / Xin Dong, Lihan Zhang, Tianru Dai 他
日本語で読む → - 論文言語モデル機械学習
言語モデルの潜在軌跡における不変推論方向
強力な推論軌跡と弱い推論軌跡の差が低ランク構造を持つことを発見し、その不変方向を操作する介入手法TILRを提案した。パラフレーズや摂動に対する一貫性を向上させる。
原題: Invariant Reasoning Directions in Latent Trajectories of Language Models / Arun Vignesh Malarkkan, Manan Roy Choudhury, Utkarsh Byahut 他
日本語で読む → - 論文視覚接地画像認識
任意のオープンソースMLLMの部品レベル点接地を強化する手法
MLLMの注意機構を利用し、凍結したまま部品レベルの2D点接地を可能にする軽量デコーダを提案した。
原題: Enhancing Part-Level Point Grounding for Any Open-Source MLLMs / Jin-Cheng Jhang, Fu-En Wang, Xin Yang 他
日本語で読む → - 論文VLA/推論高速化画像認識
行動に足る速さで:低遅延ロボットVLM/VLAのための時空間ビジュアルトークン統合
ロボット向け視覚言語モデルや行動モデルの推論遅延を減らすため、視覚エンコード段階で冗長なトークンを時空間的に統合するプラグアンドプレイのフレームワークST-Mergeを提案した。
原題: Fast Enough to Act: Spatio-Temporal Visual Token Merging for Low-Latency Robotic VLMs and VLAs / Junzhou Chen, Jindong Wang, Gang Zhou
日本語で読む → - 論文VLA/評価ベンチマークAI
SurgVLA-Bench: 腹腔鏡手術ロボットのための視覚言語行動モデル評価ベンチマーク
腹腔鏡手術ロボット向けのVLAモデルを評価する初の包括的ベンチマークを提案し、SurRoLシミュレーション上で階層的タスクと多次元評価フレームワークを構築した。
原題: SurgVLA-Bench: Towards Evaluating Vision-Language-Action Models for Laparoscopic Surgical Robotics / Jiashuo Sun, Yue He, Wenxuan Liu 他
日本語で読む → - 論文3Dビジョン/シーン理解画像認識
シーンはプリミティブではなくオブジェクトとして捉える:非ポーズ視点からのインスタンス構造化3Dトークン化
非ポーズの多視点画像から、シーンをオブジェクト単位の3Dトークングループに分解するフィードフォワード手法を提案。再構成・セグメンテーション・操作を統一的に扱える。
原題: Scenes as Objects, Not Primitives: Instance-Structured 3D Tokenization from Unposed Views / Mijin Yoo, In Cho, Subin Jeon 他
日本語で読む → - 論文クラス増分学習機械学習
クラス増分学習のためのプロトタイプ潜在世界モデルリプレイ
古いクラスの画像を保存せず、潜在空間上のプロトタイプ分布として記憶し、新しいクラス学習時にその分布からサンプリングしてリプレイするメモリフリーのクラス増分学習手法を提案した。
原題: Prototype Latent World Model Replay for Class-Incremental Learning / Weizhi Nie, Hui Wang, Weijie Wang 他
日本語で読む → - 論文3D再構成画像認識
DR-GS: 物理ベースの変形・再照明可能な2Dガウシアン
変形物体のガウシアンスプラッティングにおいて、照明と材質を分離し、再照明や変形後の編集を可能にする統一フレームワークを提案した。
原題: DR-GS: Physically-Based Deformable and Relightable 2D Gaussians / Jiaxin Li, Tong Wu, Yi Wei 他
日本語で読む → - 論文ワールドモデル機械学習
ワールドモデルにおける予測の経路空間定式化:単一の行動から予測・計画・不可逆性へ
AIワールドモデルの予測を、将来の軌跡上の確率測度として定式化し、予測・計画・不確実性を単一の作用汎関数の操作として統一的に扱う。学習された注意の非対称性がデータの不可逆性と関連し、不可逆性が予測の計算資源となることを示した。
原題: A Path-Space Formulation of Prediction in World Models: From a Single Action to Prediction, Planning, and Irreversibility / Gunn Kim
日本語で読む → - 論文動的シーン再構成画像認識
CoGS: 単眼ビデオからの動的ヒューマン・オブジェクトシーンの合成ガウススプラッティング
単眼ビデオから人間と物体の相互作用シーンを再構成するため、人間・物体・背景をそれぞれ異なる動きモデルで分離し、協調的に最適化する合成ガウススプラッティングフレームワークを提案した。
原題: CoGS: Compositional Dynamic Human-Object Scenes Gaussian Splatting from Monocular Video / Jerrin Bright, John Zelek
日本語で読む → - 論文モーションキャプチャ画像認識
IMU-HOI: 接触を考慮した慣性融合による人間と物体の相互作用とモーションキャプチャの共生フレームワーク
身体と物体に装着したスパースIMUから、人間の全身姿勢と物体の6自由度軌跡を同時推定するフレームワークを提案。IMUデータから手と物体の接触を確率的に推定し、それを手がかりに人間と物体の動きを統合的に復元する。
原題: IMU-HOI: A Symbiotic Framework for Coherent Human-Object Interaction and Motion Capture via Contact-Conscious Inertial Fusion / Lizhou Lin, Songpengcheng Xia, Zengyuan Lai 他
日本語で読む → - 論文世界モデル/表現学習機械学習
世界モデルのためのテキスト信念状態:厳密な媒介下での識別可能な表現学習
LLMベースの世界モデルで、履歴バイパスによる表現の未識別性問題を解決するため、テキスト潜在状態と木構造強化学習法fGRPOを導入し、厳密な媒介を強制して表現品質とロールアウト性能を大幅に向上させた。
原題: Textual Belief States for World Models: Identifiable Representation Learning Under Strict Mediation / Xiang Gao, Kaiwen Dong, Yuguang Yao 他
日本語で読む → - 論文身体化AI/規範遵守AI
NormAct: 暗黙の社会規範への能動的遵守における身体化エージェントのベンチマーク
身体化エージェントが明示されていない社会的規範を能動的に守るかを評価するベンチマークNormActを提案し、MLLMプランナーが目標達成はできても規範遵守は不十分であることを示した。
原題: NormAct: Benchmarking Embodied Agents' Proactive Compliance with Unspoken Social Norms / Shiyun Zhao, Xinwei Song, Tianyu Guo 他
日本語で読む → - 論文認知モデルq-bio.NC
身体化された能動視覚における視空間複雑性の人間工学的認知モデル
視覚・聴覚・空間刺激を含むマルチモーダルデータの複雑性を、身体化認知と能動視覚の理論に基づいて分析する枠組みを提案し、運転などの日常環境での応用を示した論文。
原題: A Human-Factors Guided Cognitive Model of Visuospatial Complexity in Embodied Active Vision / Vasiliki Kondyli, Jakob Suchan, Mehul Bhatt
日本語で読む → - 論文動作評価画像認識
伝統中国医学リハビリテーション訓練のためのクロスビュー・マルチモーダル視覚評価フレームワーク
伝統中国医学のリハビリ訓練における動作品質評価を、単一視点の骨格データに頼らず、一人称・三人称の映像と視覚・ポーズ融合を統合したクロスビュー・マルチモーダルフレームワークCME-AQAを提案し、鍼灸と推拿のデータセットで評価精度を向上させた。
原題: Cross-view Multimodal Vision-Based Assessment Framework for Traditional Chinese Medicine Rehabilitation Training / Francis Xiatian Zhang, Hao Yao, Shengxuan Chen 他
日本語で読む → - 論文動作予測画像認識
遮蔽回復を伴う局所・全体人体動作の長期予測
非自己回帰型トランスフォーマーを用いて、局所的なポーズ予測と空間内の全体動作予測を同時に行い、遮蔽による欠損関節の回復も可能にする人体動作予測手法を提案した。
原題: Long-Term Prediction of Local and Global Human Motion with Occlusion Recovery / Qiaoyue Yang, Sven Heutger, Christopher Niemann 他
日本語で読む → - 論文世界モデル自然言語
トークンから状態へ:LLMを世界モデルの特殊ケースとして捉え、その先の連続的な道筋を探る
LLMは世界モデルの退化した特殊ケースであり、トークン予測からJEPAへ至る連続スペクトラムが存在することを論じ、その中間段階と課題を考察した理論論文。
原題: From Tokens to States: LLMs as a Special Case of World Models and the Continuous Path Beyond / Paul Dubois
日本語で読む → - 論文3D再構築画像認識
ReScene: マルチビューキャプチャからの構造化屋内シーン再構築
マルチビュー画像から物理的に整合性のある構造化3Dシーンを再構築するフレームワークを提案し、幾何・画質・知覚品質で最先端を達成した。
原題: ReScene: Structured Indoor Scene Reconstruction from Multi-View Captures / Haoran Xu, Lechao Zhang, Daoguo Dong 他
日本語で読む → - 論文身体的安全性機械学習
自己進化型ジャストインタイムメモリによる能動的身体的安全性の実現
視覚言語モデル搭載エージェントが家庭内タスク中に動的危険を能動的に緩和できるよう、リスク追跡・予測・緩和スキルを自己進化させるメモリフレームワークを提案した。
原題: Self-Evolving Just-In-Time Memory for Proactive Embodied Safety / Bingrui Sima, Lizhong Wang, Xiaoya Lu 他
日本語で読む → - 論文ベンチマーク/空間知能/マルチモーダル画像認識
AirGroundBench: 異種マルチビュー身体化コラボレーションにおけるマルチモーダル大規模モデルの空間知能の評価
UAVとUGVの協調におけるマルチビュー空間知能を評価するベンチマークを構築し、13のMLLMの性能を分析した。
原題: AirGroundBench: Probing Spatial Intelligence in Multimodal Large Models under Heterogeneous Multi-View Embodied Collaboration / Haotian Li, Yida Wang, Leyuan Wang 他
日本語で読む → - 論文4D再構成画像認識
HAT-4D: 人間とエージェントの協調による単眼ビデオからの4D複数物体インタラクション復元
単眼ビデオから複数物体の3D形状・時間変化・物理的相互作用を復元するエージェントフレームワークを提案し、人間のフィードバックを統合して深度曖昧性や遮蔽問題を解決する。
原題: HAT-4D: Lifting Monocular Video for 4D Multi-Object Interactions via Human-Agent Collaboration / Jiaxin Li, Yuxiang Wu, Zhenkai Zhang 他
日本語で読む → - 論文バーチャル試着画像認識
ModaFlow: モダリティ認識フローマッチングによる高忠実度バーチャル試着
テキストと画像のモダリティを区別してガイドするフローマッチング手法を提案し、バーチャル試着の品質を大幅に向上させた。
原題: ModaFlow: Modality-Aware Flow Matching for High-Fidelity Virtual Try-On / Xiangyu Sai, Meysam Madadi, Sergio Escalera 他
日本語で読む → - 論文LLMエージェントAI
ARdena: シナリオ駆動によるリアルタイムLLMエージェントの制御
LLMエージェントの動作を、モデル変更なしにシナリオ定義のプロンプトでリアルタイム制御するフレームワークを提案し、実装と評価を行った。
原題: ARdena: Scenario-driven control of real-time LLM agents / Luka Borozan, Domagoj Matijević
日本語で読む →