論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/4/24 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文群制御制御
非凝集ターゲットの障害物回避型マルチロボット羊飼い制御
障害物の多い環境で、互いに凝集しないターゲット群を誘導するためのマルチロボット制御戦略を提案し、シミュレーションと実機実験で有効性を検証した。
原題: Multi-robot obstacle-aware shepherding of non-cohesive target agents / Cinzia Tomaselli, Stefano Covone, Andreagiovanni Reina 他
日本語で読む → - 論文マルチエージェントシステムcs.MA
単一エージェントの整合を超えて:マルチエージェントシステムにおけるコンテキスト断片化違反の防止
個々のエージェントの行動は安全に見えるが、組織ポリシーに違反する「コンテキスト断片化違反」を特定し、分散型ゼロトラスト執行アーキテクチャ「Distributed Sentinel」を提案する。
原題: Beyond Single-Agent Alignment: Preventing Context-Fragmented Violations in Multi-Agent Systems / Jie Wu, Ming Gong
日本語で読む → - 論文空間推論画像認識
SpaMEM: 身体化環境における知覚-記憶統合による動的空間推論のベンチマーク
マルチモーダル大規模言語モデルの身体化環境での長期的空間推論能力を評価する大規模ベンチマークSpaMEMを提案し、行動系列による空間状態変化を伴うタスクでモデルの限界を明らかにした。
原題: SpaMEM: Benchmarking Dynamic Spatial Reasoning via Perception-Memory Integration in Embodied Environments / Chih-Ting Liao, Xi Xiao, Chunlei Meng 他
日本語で読む → - 論文ビデオ生成画像認識
制御可能な人間中心ビデオ生成における合成データ拡張の役割の探求
合成データが人間のビデオ生成に与える影響を体系的に調査し、拡散ベースのフレームワークで合成データと実データの補完的役割を明らかにした。
原題: Exploring the Role of Synthetic Data Augmentation in Controllable Human-Centric Video Generation / Yuanchen Fei, Yude Zou, Zejian Kang 他
日本語で読む → - 論文VLA画像認識
幾何学的報酬クレジット割当によるPoint-VLMの3D理解の強化
点群と言語を扱うモデルが3D構造を誤って幻覚する問題を、報酬をトークン単位に分解して割り当てる手法と再投影整合性の制約で改善した論文。
原題: Reinforcing 3D Understanding in Point-VLMs via Geometric Reward Credit Assignment / Jingkun Chen, Ruoshi Xu, Mingqi Gao 他
日本語で読む → - 論文能動センシング機械学習
LASER: 連続場再構成のための能動センシング学習
固定センサ配置に依存せず、物理場の状態に応じてセンサを動かす能動センシングを強化学習で実現し、疎な観測から高精度に場を再構成する手法を提案した。
原題: LASER: Learning Active Sensing for Continuum Field Reconstruction / Huayu Deng, Jinghui Zhong, Xiangming Zhu 他
日本語で読む → - 論文VLA画像認識
具現化ミッドトレーニング:視覚言語モデルと視覚言語行動モデルのギャップを埋める
視覚言語モデル(VLM)をロボット行動データに適応させる中間学習手法を提案し、操作ベンチマークで性能向上を確認した。
原題: EmbodiedMidtrain: Bridging the Gap between Vision-Language Models and Vision-Language-Action Models via Mid-training / Yiyang Du, Zhanqiu Guo, Xin Ye 他
日本語で読む → - 論文VLA画像認識
身体化エージェントのための環境理解ビジョン言語モデル
身体化エージェントの指示追従性能を高めるため、物体認識・タスク計画・行動理解・目標認識の4技能を微調整した環境理解フレームワークを提案し、失敗時の回復ステップとGRPOによる最適化で成功率を向上させた。
原題: Environmental Understanding Vision-Language Model for Embodied Agent / Jinsik Bang, Jaeyeon Bae, Donggyu Lee 他
日本語で読む → - 論文データ生成画像認識
InHabit: 画像基盤モデルを活用したスケーラブルな3D人間配置
3Dシーンに人間を自然に配置する大規模データセットを自動生成する手法を提案。2D基盤モデルの知識を3Dに転写し、78Kサンプルのデータセットを構築した。
原題: InHabit: Leveraging Image Foundation Models for Scalable 3D Human Placement / Nikita Kister, Pradyumna YM, István Sárándi 他
日本語で読む → - 論文VLA/セキュリティ画像認識
「サインを待っているなら…それは違うかも!」視覚注入による信頼境界の混乱を軽減するビジョン言語エージェントシステムの防御
ビジョン言語エージェントが環境の視覚情報(例:信号)に従うべきか、悪意ある視覚注入を無視すべきかの「信頼境界の混乱」問題を定義し、マルチエージェント防御フレームワークを提案して誤誘導を低減した。
原題: If you're waiting for a sign... that might not be it! Mitigating Trust Boundary Confusion from Visual Injections on Vision-Language Agentic Systems / Jiamin Chang, Minhui Xue, Ruoxi Sun 他
日本語で読む → - 論文モーション生成画像認識
EgoMotion: 一人称視点の視覚言語モーション生成のための階層的推論と拡散
一人称視点の映像と言語指示から3D人間動作を生成するタスクを扱い、推論と生成の絡み合い問題を解決するため、認知推論段階と動作生成段階からなる階層的生成フレームワークEgoMotionを提案した。
原題: EgoMotion: Hierarchical Reasoning and Diffusion for Egocentric Vision-Language Motion Generation / Ruibing Hou, Mingyue Zhou, Yuwei Gui 他
日本語で読む → - 論文探索画像認識
人間のように探索する:身体化エージェントのためのオンラインSGメモ構築による自律探索
本論文は、大規模視覚言語モデルを用いて意味的ナビゲーション可能性を抽出し、階層的なSGメモをオンラインで構築しながら探索を行うことで、効率的な環境探索を実現するフレームワークABot-Explorerを提案する。
原題: Explore Like Humans: Autonomous Exploration with Online SG-Memo Construction for Embodied Agents / Xu Chen, Shichao Xie, Zhining Gu 他
日本語で読む → - 論文RTL生成cs.AR
ChipCraftBrain: 検証優先型RTL生成のためのマルチエージェントオーケストレーション
LLMによるRTLコード生成の精度を高めるため、6つの専門エージェントを適応的に調整するフレームワークを提案し、VerilogEvalやCVDPベンチマークで高い成功率を達成した。
原題: ChipCraftBrain: Validation-First RTL Generation via Multi-Agent Orchestration / Cagri Eryilmaz
日本語で読む → - 論文視覚探索/ベンチマーク画像認識
E3VS-Bench: 3Dガウススプラッティングシーンにおける視点依存型能動知覚のベンチマーク
5自由度の視点制御で視点依存の証拠を集める必要がある、3Dガウススプラッティングで再構築された高精細シーンを用いた視覚探索ベンチマークを提案し、複数のVLMと人間の性能差を評価した。
原題: E3VS-Bench: A Benchmark for Viewpoint-Dependent Active Perception in 3D Gaussian Splatting Scenes / Koya Sakamoto, Taiki Miyanishi, Daichi Azuma 他
日本語で読む → - 論文マニピュレーション機械学習
HELM: 長期的記憶を強化した視覚言語行動操作のためのハーネス
長期的な操作タスクで失敗するVLAモデルに対し、エピソード記憶、状態検証器、ハーネス制御を組み合わせたモデル非依存のフレームワークHELMを提案し、成功率を大幅に向上させた。
原題: HELM: Harness-Enhanced Long-horizon Memory for Vision-Language-Action Manipulation / Zijian Zeng, Fei Ding, Huiming Yang 他
日本語で読む → - 論文表現学習q-bio.NC
環世界表現仮説:普遍性の再考
人工ニューラルネットワークと生物の脳の表現が一致するのは普遍的な最適解への収束ではなく、生態学的制約の重複によるものだとする「環世界表現仮説」を提案し、モデル比較の新たな視点を示した論文。
原題: The Umwelt Representation Hypothesis: Rethinking Universality / Victoria Bosch, Rowan Sommers, Adrien Doerig 他
日本語で読む → - 論文世界モデル/探索機械学習
好奇心批評家:累積予測誤差の改善を利用した世界モデル学習のための扱いやすい内的報酬
世界モデルの累積予測誤差の改善を内的報酬とする手法を提案し、現在の遷移の予測誤差と漸近誤差ベースラインの差という扱いやすい代理報酬を導入した。確率的グリッドワールドで既存手法より高速かつ高精度な学習を実証した。
原題: Curiosity-Critic: Cumulative Prediction Error Improvement as a Tractable Intrinsic Reward for World Model Training / Vin Bhaskara, Haicheng Wang
日本語で読む → - 論文ソフトウェア工学cs.SE
人間とAIのコーディング協調のスケールには、統治可能なコンセンサス層が必要
AI支援開発の成果物をコードとチャット履歴から、型付きプロパティグラフで表現されるコンセンサス層に置き換えるパラダイムを提案し、監査可能性と介入距離の削減を目指す。
原題: Scaling Human-AI Coding Collaboration Requires a Governable Consensus Layer / Tianfu Wang, Zhezheng Hao, Yin Wu 他
日本語で読む → - 論文センサ基盤学習機械学習
ソナタ:臨床データ不足下での慣性キネマティクスのためのハイブリッド世界モデル
臨床データが少ない状況で、6軸トランクIMU表現学習のためのコンパクトな潜在世界モデル「Sonata」を導入し、将来状態予測により臨床判別と転倒リスク予測を向上させる。
原題: Sonata: A Hybrid World Model for Inertial Kinematics under Clinical Data Scarcity / Blaise Delaney, Salil Patel, Yuji Xing 他
日本語で読む → - 論文強化学習機械学習
有界比率強化学習
PPOのヒューリスティックなクリップ目的と信頼領域法の理論的ギャップを埋めるため、有界比率強化学習(BRRL)フレームワークを提案し、解析的最適解と単調性能改善を保証する新しいポリシー最適化アルゴリズムBPOを開発した。
原題: Bounded Ratio Reinforcement Learning / Yunke Ao, Le Chen, Bruce D. Lee 他
日本語で読む → - 論文アバター生成画像認識
EmbodiedHead: 会話エージェントのためのリアルタイム聴話アバター
LLMと会話できるリアルタイムの音声駆動型アバターを生成するフレームワークを提案。単一ストリームの音声入力と状態制御により、聞き手と話し手の動作をシームレスに切り替え、高品質な映像を少数ステップで生成する。
原題: EmbodiedHead: Real-Time Listening and Speaking Avatar for Conversational Agents / Yu Zhang, Kaiyuan Shen, Yang Li
日本語で読む → - 論文システムcs.DC
TStore: テンソル中心の圧縮によるAIモデルハブの再考
モデルハブのストレージ削減のため、テンソル単位の重複排除と圧縮を行うシステムTStoreを提案した。
原題: TStore: Rethinking AI Model Hub with Tensor-Centric Compression / Tingfeng Lan, Zirui Wang, Yunjia Zheng 他
日本語で読む → - 論文姿勢推定画像認識
TSM-Pose: カテゴリレベル物体姿勢推定のためのトポロジー認識学習とセマンティックMamba
カテゴリレベル物体姿勢推定の汎化性能を高めるため、点群のトポロジー構造を捉える抽出器と、Mambaベースのセマンティック集約器を導入したフレームワークを提案した。
原題: TSM-Pose: Topology-Aware Learning with Semantic Mamba for Category-Level Object Pose Estimation / Jinshuo Liu, Bingtao Ma, Junlin Su 他
日本語で読む → - 論文世界モデル機械学習
グローバルニューラルワールドモデル:行動条件付き計画のための空間的に接地された離散トポロジー
連続的な行動条件付きJEPAを用いて環境を離散2Dグリッドに写像し、再構成なしで遷移ダイナミクスを学習する世界モデルを提案。
原題: The Global Neural World Model: Spatially Grounded Discrete Topologies for Action-Conditioned Planning / Noureddine Kermiche
日本語で読む → - 論文感情理解画像認識
人間のように映画を観る:身体化されたコンパニオンのための自己中心視点の感情理解
映画を自己中心的なスクリーン視点で観るロボットの感情理解を扱い、新しいデータセットとマルチモーダル推論フレームワークを提案した論文。
原題: Watching Movies Like a Human: Egocentric Emotion Understanding for Embodied Companions / Ze Dong, Hao Shi, Zejia Gao 他
日本語で読む → - 論文強化学習機械学習
拡張ベスト・オブ・Nサンプリングによる推論時の柔軟なエンパワーメント
強化学習において、エンパワーメントを報酬ボーナスとして与える代わりに、ベスト・オブ・Nサンプリングを適用し、探索と活用のバランスを柔軟に調整する手法を提案した。
原題: Flexible Empowerment at Reasoning with Extended Best-of-N Sampling / Taisuke Kobayashi
日本語で読む → - 論文群制御機械学習
グラフ構造世界モデルによるアドホックネットワーク動的学習
ノードごとの潜在状態とクロスノード注意機構を持つグラフ構造のリカレント状態空間モデルを提案し、オフライン軌跡からネットワーク動態を学習してクラスタヘッド選択ポリシーを想像上のロールアウトで訓練する。
原題: Learning Ad Hoc Network Dynamics via Graph-Structured World Models / Can Karacelebi, Yusuf Talha Sahin, Elif Surer 他
日本語で読む → - 論文群制御制御
「疎らであることは接続されるよりはるかに安全」:状態制約付きPDE最適化によるロボット群密度ダイナミクスの安全制御
Fokker-Planck方程式に従うロボット群の空間密度を目標分布へ導く、閉ループの安全制御戦略を提案。Voronoi分割による分散展開も可能で、理論的な安全性保証と実機実験で有効性を示した。
原題: ''It Is Much Safer to Be Sparse than Connected'': Safe Control of Robotic Swarm Density Dynamics with PDE-Optimization with State Constraints / Longchen Niu, Gennaro Notomista
日本語で読む → - 論文最適制御/ポリシー反復制御
軌道駆動型ポリシー生成によるオンラインポリシー反復法
固定初期状態の決定論的有限ホライズン最適制御問題に対し、軌道データを用いてコストを単調に改善するポリシーを逐次生成するオンライン手法を提案した。
原題: On-Line Policy Iteration with Trajectory-Driven Policy Generation / Yuchao Li, Fei Chen, Yingke Li 他
日本語で読む → - 論文群制御制御
ホモトピー誘導ポテンシャルゲームによる混雑を考慮したナビゲーション
マルチエージェントの動作計画において、ホモトピークラスを戦略集合として用い、ポテンシャルゲームと組み合わせることで、混雑を回避しつつ効率的で安全な経路を生成する新しいフレームワークを提案した。
原題: Homotopy-Guided Potential Games for Congestion-Aware Navigation / Mohammed Irshadh Ismaaeel Sathyamangalam Imran, Lasse Peters, Michael Khayyat 他
日本語で読む →