論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/4/15 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文セグメンテーション画像認識
VGGT-Segmentor: 幾何学強化によるクロスビューセグメンテーション
異なる視点(自己中心視点と外部視点)間での物体インスタンスセグメンテーションを、幾何学モデルVGGTと新しいUnionセグメンテーションヘッドを組み合わせて高精度化し、教師なし学習で汎化を実現した。
原題: VGGT-Segmentor: Geometry-Enhanced Cross-View Segmentation / Yulu Gao, Bohao Zhang, Zongheng Tang 他
日本語で読む → - 論文世界モデル機械学習
状態一貫性を超えて:テキストベース世界モデルにおける行動一貫性
テキストベース環境の世界モデルを、状態の一致ではなく行動の一貫性に基づいて訓練する新しい手法を提案し、長期的な整合性と計画性能の向上を示した。
原題: Beyond State Consistency: Behavior Consistency in Text-Based World Models / Youling Huang, Guanqiao Chen, Junchi Yao 他
日本語で読む → - 論文群制御制御
ホモトピー誘導ポテンシャルゲームによる混雑を考慮したナビゲーション
マルチエージェントの動作計画において、ホモトピークラスを戦略集合として用い、ポテンシャルゲームと組み合わせることで、混雑を回避しつつ効率的で安全な経路を生成する新しいフレームワークを提案した。
原題: Homotopy-Guided Potential Games for Congestion-Aware Navigation / Mohammed Irshadh Ismaaeel Sathyamangalam Imran, Lasse Peters, Michael Khayyat 他
日本語で読む → - 論文適応制御制御
ロボットシステムの適応安全性のための高次チューナー
制御バリア関数と適応制御を組み合わせた適応安全性の枠組みにおいて、高次の適応則を用いることで、従来の保守的な条件を緩和し、システムの不変性を保証する方法を提案した論文。
原題: High Order Tuners for Adaptive Safety of Robotic Systems / Mohammad Mirtaba, Max H. Cohen
日本語で読む → - 論文3Dプリンティング制御
カスタム自動車部品のための多軸積層造形
多軸DLP 3Dプリンティングで生じる非均一な層厚に対し、層をサブ層に分割し露光時間を局所厚さに比例して変調する可変露光法を導入し、層数を減らして印刷時間と支持構造を削減する手法を提案した。
原題: Multi-Axis Additive Manufacturing for Customized Automotive Components / Uzair Aziz Muhammad, Zheng Liu
日本語で読む → - 論文VLMセキュリティ画像認識
ピクセルの隙間を読む:テキスト-画像埋め込みの整合性と視覚言語モデルにおけるタイポグラフィ攻撃成功率の関連性
視覚言語モデルに対するタイポグラフィ・プロンプトインジェクション攻撃の成功率が、フォントサイズや視覚的変換、テキスト-画像埋め込み距離とどう相関するかを体系的に評価した研究。
原題: Reading Between the Pixels: Linking Text-Image Embedding Alignment to Typographic Attack Success on Vision-Language Models / Ravikumar Balakrishnan, Sanket Mendapara, Ankit Garg
日本語で読む → - 論文3D再構成/インタラクティブ物体画像認識
EgoFun3D: 一人称視点動画からの関数テンプレートを用いたインタラクティブ物体のモデリング
一人称視点動画から、シミュレーション可能なインタラクティブ3D物体を復元するタスク・データセット・ベンチマークを提案。物体の関節構造に加え、部品間の機能マッピング(例:つまみの回転が温度を制御)を関数テンプレートとして表現し、4段階パイプラインで推定する。
原題: EgoFun3D: Modeling Interactive Objects from Egocentric Videos using Function Templates / Weikun Peng, Denys Iliash, Manolis Savva
日本語で読む → - 論文制御理論制御
部分観測確率システムの階層制御
部分観測と確率的ノイズ下での階層制御の理論基盤を確立し、各層の状態推定器間の出力距離を事前計算可能な範囲に保つ確率的シミュレーション関数を導入。線形システムとカルマンフィルタに対して構築法を示し、航空ロボットの例で実証した。
原題: Layered Control of Partially Observed Stochastic Systems / Charis Stamouli, Anastasios Tsiamis, George J. Pappas
日本語で読む → - 論文CAD生成画像認識
ArtiCAD: マルチエージェントコード生成による関節CADアセンブリ設計
テキストや画像から編集可能な関節CADアセンブリを生成する、訓練不要のマルチエージェントシステムを提案。設計段階で接続関係を予測し、検証とロールバック機構で品質を確保する。
原題: ArtiCAD: Articulated CAD Assembly Design via Multi-Agent Code Generation / Yuan Shui, Yandong Guan, Zhanwei Zhang 他
日本語で読む → - 論文3Dシーン生成画像認識
Rein3D: パノラマビデオ拡散モデルによる強化学習型3D屋内シーン生成
3Dガウススプラッティングとビデオ拡散モデルを組み合わせ、疎な入力から360度の一貫した3D屋内シーンを復元・生成するフレームワークを提案した。
原題: Rein3D: Reinforced 3D Indoor Scene Generation with Panoramic Video Diffusion Models / Dehui Wang, Rong Wei, Yue Shi 他
日本語で読む → - 論文3D再構成画像認識
ReplicateAnyScene: テキスト・視覚・空間の整合によるゼロショット動画から3Dシーンへの構成
動画から自動で物体を分割し、3Dシーンとして構成するフレームワークを提案。手動プロンプトや追加視覚入力なしで、テキスト・視覚・空間の事前知識を統合し、高品質な構成3Dシーンを生成する。
原題: ReplicateAnyScene: Zero-Shot Video-to-3D Composition via Textual-Visual-Spatial Alignment / Mingyu Dong, Chong Xia, Mingyuan Jia 他
日本語で読む → - 論文3Dシーン生成画像認識
HOG-Layout: 視覚言語モデルによる階層的3Dシーン生成・最適化・編集
大規模言語モデルと視覚言語モデルを用いて、テキストから階層的に3Dシーンを生成・最適化・編集する手法を提案した。物理的整合性と意味的一貫性を向上させ、リアルタイム編集を実現する。
原題: HOG-Layout: Hierarchical 3D Scene Generation, Optimization and Editing via Vision-Language Models / Haiyan Jiang, Deyu Zhang, Dongdong Weng 他
日本語で読む → - 論文3D表現学習画像認識
非位置合わせ多視点画像からの空間知能のための3D表現学習
本論文は、カメラ位置情報なしの多視点画像から3D表現を学習するフレームワークUniSplatを提案し、幾何・外観・意味の一貫性を高めるためのデュアルマスキング、粗密ガウススプラッティング、ポーズ条件付き再較正機構を導入した。
原題: Learning 3D Representations for Spatial Intelligence from Unposed Multi-View Images / Bo Zhou, Qiuxia Lai, Zeren Sun 他
日本語で読む → - 論文3Dシーン生成画像認識
PhyMix: 暗黙的・明示的最適化による物理的に整合的な単一画像3D屋内シーン生成
単一画像から3D屋内シーンを生成する際に物理的整合性を評価する統一ベンチマークを構築し、物理評価器のフィードバックを訓練と推論に統合するフレームワークPhyMixを提案した。
原題: PhyMix: Towards Physically Consistent Single-Image 3D Indoor Scene Generation with Implicit--Explicit Optimization / Dongli Wu, Jingyu Hu, Ka-Hei Hui 他
日本語で読む → - 論文VLA/エージェント基盤画像認識
ABot-Claw: 持続的・協調的・自己進化型ロボットエージェントの基盤
OpenClawを拡張し、異種ロボットの協調、視覚中心のマルチモーダル記憶、批評家ベースの閉ループフィードバックを統合することで、実世界での長期的・自己進化的なロボットエージェントを実現する基盤を提案した。
原題: ABot-Claw: A Foundation for Persistent, Cooperative, and Self-Evolving Robotic Agents / Dongjie Huo, Haoyun Liu, Guoqing Liu 他
日本語で読む → - 論文3D再構成画像認識
FF3R: 非拘束視点からのフィードフォワード特徴3D再構成
カメラ位置や深度、セマンティックラベルを必要とせず、RGBと特徴マップのレンダリング監視のみで幾何学的・意味的推論を統合するアノテーションフリーのフィードフォワード3D再構成フレームワークを提案した。
原題: FF3R: Feedforward Feature 3D Reconstruction from Unconstrained views / Chaoyi Zhou, Run Wang, Feng Luo 他
日本語で読む → - 論文VLA画像認識
EgoTL: 長時間タスクのための自己中心視点シンクアラウド連鎖
自己中心視点のデータに、発話と行動のタイムスタンプ付き思考連鎖とメートルスケールの空間情報を付与するパイプラインを構築し、VLMやワールドモデルの評価・微調整を行う。
原題: EgoTL: Egocentric Think-Aloud Chains for Long-Horizon Tasks / Lulin Liu, Dayou Li, Yiqing Liang 他
日本語で読む → - 論文群制御機械学習
価値認識型逐次通信によるマルチエージェント意思決定焦点学習
部分観測下のマルチエージェント協調において、意思決定の質を直接最適化する逐次通信手法SeqComm-DFLを提案し、医療やSMACベンチマークで高い性能向上を実証した。
原題: Multi-Agent Decision-Focused Learning via Value-Aware Sequential Communication / Benjamin Amoh, Geoffrey Parker, Wesley Marrero
日本語で読む → - 論文強化学習AI
モデルベース強化学習のためのアドバンテージ誘導拡散
拡散世界モデルを用いたモデルベース強化学習において、報酬ではなくアドバンテージ推定で逆拡散過程を誘導し、長期的なリターンが高い軌道を生成する手法を提案した。
原題: Advantage-Guided Diffusion for Model-Based Reinforcement Learning / Daniele Foffano, Arvid Eriksson, David Broman 他
日本語で読む → - 論文ヒューマンロボットインタラクション画像認識
TAIHRI: 近接ヒューマンロボットインタラクションのためのタスク認識型3D人体キーポイント位置推定
ロボットがユーザーの動作指示を理解し、タスクに関連する身体部位の3D座標を正確に推定する、初の視覚言語モデルを提案した。
原題: TAIHRI: Task-Aware 3D Human Keypoints Localization for Close-Range Human-Robot Interaction / Ao Li, Yonggen Ling, Yiyang Lin 他
日本語で読む → - 論文疫学モデル機械学習
疫学のためのワールドモデルに向けて
疫学における意思決定を、潜伏状態と政策依存の観測を扱う制御された部分観測動的システムとして捉え、ワールドモデルの枠組みを提案する論文。
原題: Toward World Models for Epidemiology / Zeeshan Memon, Yiqi Su, Christo Kurisummoottil Thomas 他
日本語で読む → - 論文空間理解/ベンチマーク画像認識
PinpointQA: 屋内ビデオにおける小型物体中心の空間理解のためのベンチマーク
屋内ビデオから小型物体の正確な位置特定能力を評価するベンチマークを提案し、既存のMLLMの性能低下と微調整による改善を示した。
原題: PinpointQA: A Benchmark for Small Object-Centric Spatial Understanding in Indoor Videos / Zhiyu Zhou, Peilin Liu, Ruoxuan Zhang 他
日本語で読む → - 論文3D生成cs.GR
AniGen: アニメーション可能な3Dアセット生成のための統一的S^3フィールド
単一画像から、形状・骨格・スキニングを整合的に生成するアニメーション可能な3Dアセット生成フレームワークを提案した論文。
原題: AniGen: Unified $S^3$ Fields for Animatable 3D Asset Generation / Yi-Hua Huang, Zi-Xin Zou, Yuting He 他
日本語で読む → - 論文関節推定画像認識
DailyArt: 潜在ダイナミクスによる単一静止画像からの関節構造の発見
単一の閉じた状態の画像から、物体の関節パラメータを推定する新しい手法を提案。まず開いた状態の画像を合成して関節の手がかりを露出させ、観測画像との差分から全関節を同時に推定する。
原題: DailyArt: Discovering Articulation from Single Static Images via Latent Dynamics / Hang Zhang, Qijian Tian, Jingyu Gong 他
日本語で読む → - 論文データセット画像認識
MotionScape:ワールドモデルのための大規模実世界高ダイナミックUAVビデオデータセット
UAV視点の高ダイナミックな6自由度カメラ軌道を含む、30時間以上の4Kビデオ(450万フレーム以上)からなる大規模実世界データセットを構築し、ワールドモデルの学習を支援する。
原題: MotionScape: A Large-Scale Real-World Highly Dynamic UAV Video Dataset for World Models / Zile Guo, Zhan Chen, Enze Zhu 他
日本語で読む → - 論文ビデオ物体分割画像認識
PanoSAM2: 360度ビデオ物体分割のためのSAM2の軽量な歪み・メモリ適応
360度ビデオ物体分割のためのSAM2の軽量な歪み・メモリ適応手法を提案し、投影歪みや左右の意味的不整合、メモリ内の物体情報の疎さを解決する。
原題: PanoSAM2: Lightweight Distortion- and Memory-aware Adaptions of SAM2 for 360 Video Object Segmentation / Dingwen Xiao, Weiming Zhang, Shiqi Wen 他
日本語で読む → - 論文対話生成画像認識
PolySLGen: 多人数対話におけるオンライン多感覚発話・傾聴反応生成
多人数対話での自然な反応生成のため、過去の会話と動作から対象者の発話または傾聴反応(音声・身体動作・発話状態スコア)をオンライン生成するフレームワークを提案した。
原題: PolySLGen: Online Multimodal Speaking-Listening Reaction Generation in Polyadic Interaction / Zhi-Yi Lin, Thomas Markhorst, Jouh Yeong Chew 他
日本語で読む → - 論文3D物体検出画像認識
動的屋内環境における少数ショット増分3D物体検出
動的屋内環境での3D物体認識を効率的に行うため、視覚言語モデルを活用して未知カテゴリの知識を学習し、少数の新規サンプルで検出性能を向上させるFI3Detフレームワークを提案した。
原題: Few-Shot Incremental 3D Object Detection in Dynamic Indoor Environments / Yun Zhu, Jianjun Qian, Jian Yang 他
日本語で読む → - 論文世界モデル/因果推論機械学習
世界モデルのプラグインとしてのCausalVAE:信頼できる反事実ダイナミクスに向けて
潜在世界モデルに因果構造を組み込むプラグインモジュールCausalVAEを提案し、反事実的推論の精度を大幅に向上させた。
原題: CausalVAE as a Plug-in for World Models: Towards Reliable Counterfactual Dynamics / Ziyi Ding, Xianxin Lai, Weiyu Chen 他
日本語で読む → - 論文群制御制御
有界合理性を持つネットワーク上の協調学習
有界な合理性を持つエージェントがネットワーク上で協調ゲームを行う際の、完全協調状態の定常確率が合理性パラメータやネットワーク構造にどう依存するかを理論的に解析した論文。
原題: Learning to Coordinate over Networks with Bounded Rationality / Zhewei Wang, Emrah Akyol, Marcos M. Vasconcelos
日本語で読む →