論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/8/3 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文進化戦略/継続学習cs.NE
制御タスクにおける継続的進化戦略
連続制御タスクで進化戦略を用い、逐次的なタスク変更に対する適応と忘却防止を検証。リプレイが忘却を軽減し正の転移を促すことを示した。
原題: Continual Evolution Strategies in Control Tasks / Nicola Pitzalis, Eleni Nisioti, Antonio Carta 他
日本語で読む → - 論文VLAロボティクス
ProtoAct: ウェットラボのプロトコルを具現化ロボット動作へ変換する
生物学のウェットラボ手順書を、状態を考慮したロボット実行可能な行動系列に変換するフレームワークを提案。手順の欠落や不整合を検出・修正し、JSON形式の関数系列にマッピングする。
原題: ProtoAct: Turning Wet-Lab Protocols into Embodied Robotic Actions / Zhe Liu, Jiaming Gu, Zhaohui Du 他
日本語で読む → - 論文ナビゲーションロボティクス
ODG-NoMaD: 天井カメラによる方向誘導型NoMaD
NoMaDの探索モードに、天井カメラで構築した占有地図と大域経路から得た進行方向を、拡散過程の最終ステップで注入することで、未学習環境でも衝突回避しつつ目標へ効率的に到達できるようにした。
原題: ODG-NoMaD: Overhead-Camera Direction-Guided NoMaD / Blossom Treesa Bastian, Keerthi S. Shetty, Manish Kolachalam 他
日本語で読む → - 論文ロボット制御ロボティクス
行動チャンキングがロボット制御における行動クローニングの性能を向上させる理由
行動チャンキングの性能向上の理由を実験的に検証し、既存の仮説が不十分であることを示し、遅延ポリシーや暗黙のアンサンブル効果が重要であることを明らかにした。
原題: Why Does Action Chunking Improve Behavioral Cloning Performance in Robotic Control? / Filippo Lazzati, Kyle Stachowicz, William Chen 他
日本語で読む → - 論文農業ロボットロボティクス
TS-MAMP:第二寿命EV部品とNMSフリーのオンデバイス雑草検出を搭載した再生農業ロボット
退役した低速電気自動車の部品を再利用し、低コストでAI搭載の農業ロボットを構築した。NMSフリーのYOLOv10n検出器をJetson Nano上で動作させ、雑草検出精度80.87%を達成した。
原題: TS-MAMP: A Remanufactured Agricultural Robot Powered by Second-Life EV Components and NMS-Free On-Device Weed Detection / Weijie Shi, Zicheng Xu, Zhenbang Cheng 他
日本語で読む → - 論文拡散モデル/推論高速化機械学習
WorldDynCache:拡散ワールドモデルのためのリスク制御型潜在ダイナミクス近似
拡散ワールドモデルの推論を高速化するため、潜在状態遷移のリスクを推定し、条件やフェーズに応じた軽量サロゲートで潜在ダイナミクスを近似するフレームワークを提案。既存のキャッシュ手法より高品質で高速。
原題: WorldDynCache: Risk-Controlled Latent Dynamics Approximation for Diffusion World Model / Leyang Chen, Junyi Wu, Shaoqiu Zhang 他
日本語で読む → - 論文VLA/操作ロボティクス
ChainVLA: 統一実行状態による長期的操作のためのビジョン・言語・行動クエリの連鎖
長期的な操作タスクにおいて、過去の行動の結果と現在の動作を連鎖させる新しいVLAポリシーを提案。進行状況コンテキストとモーションテールを統合し、高い成功率を達成。
原題: ChainVLA: Chaining Vision-Language-Action Queries through a Unified Execution State for Long-Horizon Manipulation / Yuzhi Huang, Weijue Bu, Ziyi Xiong 他
日本語で読む → - 論文ディープフェイク検出画像認識
FairForensics: 視覚言語モデルによる表情認識と人口統計解析を用いた汎化可能な公平なディープフェイク検出
人口統計的にバランスの取れたベンチマークを構築し、表情と人口統計を考慮した視覚言語モデルを導入して、未見の操作や人口統計グループ間での公平性を向上させるディープフェイク検出器を提案した。
原題: FairForensics: Seeing Expressions and Parsing Demographics via Vision-Language Modeling for Generalizable Fair Deepfake Detection / Yaning Zhang, Jiao Wu, Zan Gao 他
日本語で読む → - 論文セキュリティ/攻撃cs.CR
安全クリティカルな映像認識システムに対する高速物体除去攻撃
映像ベースの認識システムを欺くため、物体をリアルタイムに近い速度で除去する攻撃手法を提案し、交差点データで高い攻撃成功率と画質維持を実証した。
原題: Fast Object Removal Attacks on Safety-Critical Video-based Perception Systems / Mohammad Imtiaz Hasan, M Sabbir Salek, Nathan Jones 他
日本語で読む → - 論文強化学習/制御理論機械学習
強化学習と制御理論の基礎:接点と新たな視点
強化学習と適応制御の違いを解説し、両者を組み合わせたデータ駆動型意思決定を古典的な移動制御問題で実証するチュートリアル。
原題: Foundations of Reinforcement Learning and Control:Connections and New Perspectives / Claire Vernade, Onno Eberhard, Martha White 他
日本語で読む → - 論文ビデオ生成画像認識
MiniWorld: ビデオワールドモデルのスクラッチ学習を民主化する
ビデオワールドモデルをスクラッチから効率的に学習するための軽量で再現可能なフレームワークMiniWorldを提案した。
原題: MiniWorld: Democratizing the Training of Video World Models from Scratch / Yian Zhao, Ruochong Zheng, Hongcan Guo 他
日本語で読む → - 論文評価指標AI
スコアリングルール!テキスト評価指標の統計的・戦略的整合性
参照ベースのテキスト評価指標について、人間の評価との統計的相関と、戦略的な操作への耐性という2つの整合性を提案し、相互情報量に基づく統一的な設計枠組みを導入して、既存指標の特性を分析した。
原題: Scoring Rules! Statistical and Strategic Alignment for Text Evaluation Metrics / Shengwei Xu, Yuxuan Lu, Yifan Wu 他
日本語で読む → - 論文3Dシーン編集画像認識
GaussianSelector: グラフ最適化による3Dガウススプラッティングでの軽量な人間誘導オブジェクト選択
スパースな視点とスパースなユーザースクラブルから、トレーニング不要で3Dオブジェクトを選択するフレームワークを提案。ガウスプリミティブをスーパーポイントに粗視化し、グラフカットで選択を最適化する。
原題: GaussianSelector: Lightweight Human-Guided Object Selection in 3D Gaussian Splatting with Graph Optimization / Baihan Yang, Tiexin Li, Yuheng Liu 他
日本語で読む → - 論文金融リスク管理q-fin.MF
気候ダイナ・ディープヘッジングによるXVA:モデルベース強化学習、残差気候HVA、ヘッジ手段の発見
気候変動リスクの残差評価を、ペア環境での比較と最適化により計算し、モデルベース強化学習で非線形補正を学習する手法を提案。実データ較正の半合成実験で有効性を示した。
原題: Climate-Dyna Deep Hedging for XVAs: Model-Based Reinforcement Learning, Residual Climate HVA, and Hedge-Instrument Discovery / Xiaozhen Wang, Francois Buet-Golfouse
日本語で読む → - 論文データセット画像認識
InteracVid: ライブチャット動画から構築した実インタラクティブ音声視覚応答データセット
ライブ配信動画から、外部刺激に対する実際のインタラクティブな音声・視覚応答を抽出した大規模データセットを構築し、マルチモーダルAIの応答生成性能を向上させた。
原題: InteracVid: Building a Real Interactive Audio-Visual Response Dataset from Live-Chat Videos / Chi Zhang, Haoyang Shi, Yueyi Liu 他
日本語で読む → - 論文手術ビデオ解析画像認識
拡張KAFR:手術ビデオの効率的解析のための運動適応パラダイム
手術ビデオ解析の計算負荷を減らすため、ツールの動きに基づいて重要なフレームだけを選ぶKAFR法を腹腔鏡手術に拡張し、わずか0.58%のフレームで高い精度を達成した。
原題: Extended KAFR: A kinematic-adaptive paradigm for the efficient analysis of surgical video / Huu Phong Nguyen, Shekhar Madhav Khairnar, Ganesh Sankaranarayanan
日本語で読む → - 論文意思決定/ベンチマーク画像認識
マルチモーダルメモリ圧縮による長期的身体化意思決定
長期的な身体化意思決定のためのベンチマークDunphyBenchを提案し、VLMエージェントの性能が人間に及ばないこと、メモリ管理がボトルネックであることを示した。さらに、ユーザー嗜好に基づいて情報を圧縮するMeMentoを設計し、精度向上とメモリ削減を実現した。
原題: Long-Horizon Embodied Decision-Making via Multimodal Memory Compression / Bingxuan Li, Rui Yang, Cheng Qian 他
日本語で読む → - 論文マニピュレーションロボティクス
GraRe: 凍結された6-DoF把握検出器のための把握候補再ランキング
既存の6-DoF把握検出器の信頼度スコアは把握品質と一致しないことがあるため、検出器を変更せずに候補の順序を改善する再ランキング手法GraReを提案。候補属性、局所幾何、物体文脈をTransformerで融合し、把握品質を予測して最終順位を決定する。
原題: GraRe: Grasp Candidate Re-Ranking for Frozen 6-DoF Grasp Detectors / Jibao Yuan, Yuhui Zhao, Yinzhen Lv 他
日本語で読む → - 論文エージェント安全性AI
FraudBench: 適応的詐欺に対するポリシー基盤型銀行エージェントのストレステスト
銀行の会話エージェントが、対話を通じて顧客情報や内部ポリシーにアクセスしながら、詐欺的な操作にどう対応するかを評価するための実行可能なベンチマークを提案した論文。
原題: FraudBench: Stress-Testing Policy-Grounded Banking Agents Against Adaptive Fraud / Dheeraj Mohandas Pai, Lu Xian
日本語で読む → - 論文レイアウト生成画像認識
SG-Layout: LLMを用いた構造化シーングラフ誘導レイアウト生成
自然言語から空間的に一貫したレイアウトを生成するため、シーングラフの構造知識をLLMに明示的に組み込むフレームワークSG-Layoutを提案した。
原題: SG-Layout: Structured Scene Graph-Guided Layout Generation with LLMs / Junsheng Wang, Chao Chen, Mengying Xie 他
日本語で読む → - 論文フェデレーテッドラーニング/深度推定ロボティクス
FeDepth: ロボットの異種性を考慮した深度推定のためのフェデレーテッドラーニング
ロボットの異種環境下での深度推定において、クライアント間の連続的で曖昧なドメイン遷移を捉えるソフトクラスタリングを用いたフェデレーテッドラーニング手法を提案し、既存手法より堅牢性を向上させた。
原題: FeDepth: Federated Learning for Depth Estimation under Robot Heterogeneity / Ganghyeon Lee, Inha Lee, Junhee Lee 他
日本語で読む → - 論文世界モデルAI
FactorJEPA:混雑した混沌とした南半球の都市世界におけるレイアウト・エージェント・相互作用チャネルへのモノリシックな未来の因子分解
南半球の混雑した都市環境(DENSEWORLD)向けに、世界モデルの予測をレイアウト・エンティティ・相互作用に分解するFactorJEPAを提案し、1000時間の大規模データセットで精度とロバスト性を向上させた。
原題: FactorJEPA: Factorizing Monolithic Futures into Layout-Agent-Interaction Channels for Crowded and Chaotic Global South Urban Worlds / Kapil Wanaskar, Gaytri Jena, Aman Chadha 他
日本語で読む → - 論文最適化ソルバーcs.GT
MixedComplementarityProblems.jl: 混合相補性問題のための高速・バッチ処理対応・オープンソース内点法ソルバー
ロボティクスで頻出する混合相補性問題(MCP)を解く、Julia製のオープンソース内点法ソルバーを提案。PATHと同等の信頼性を持ちつつ、CPU/GPUでのバッチ並列処理と自動微分をサポートし、マルチエージェント軌道最適化でPATHより約100倍高速に解けることを示した。
原題: MixedComplementarityProblems.jl: A Fast, Batched, Open-Source Interior Point Solver for Mixed Complementarity Problems / David Fridovich-Keil
日本語で読む → - 論文VLA/ロバスト性ロボティクス
VLAGuard: ワイヤレスセンサネットワークにおける視覚言語行動ロボットの物理的注意ハイジャック評価・緩和フレームワーク
VLAロボットの注意機構を妨害する物理的攻撃を評価し、注意保護ファインチューニングにより攻撃耐性を大幅に向上させるフレームワークを提案した。
原題: VLAGuard: A Framework for Evaluating and Mitigating Physical Attention Hijacking in Vision-Language-Action Robots within Wireless Sensor Networks / Dongfu Yin, Jinquan Zhang
日本語で読む → - 論文VLA画像認識
STAR-VLM: 自動車レーダー監視による動きと速度推定のための時空間接地視覚言語モデル
自動車レーダーのドップラー計測を教師信号として用い、視覚言語モデルの時空間推論とメートル単位の速度推定能力を向上させるフレームワークを提案した。
原題: STAR-VLM: Spatiotemporal Grounding Vision-Language Models for Motion and Velocity Estimation via Automotive Radar Supervision / Pou-Chun Kung, Aryaman Rao, Utkrisht Sahai 他
日本語で読む → - 論文知覚/アクセシビリティ推定eess.IV
可視性を超えて:スパースLiDARからのリアルタイム表面アクセシビリティ場
スパースLiDAR点群から、ツールの形状と接近経路のクリアランスを考慮した表面のアクセシビリティをリアルタイムに推定する手法を提案。GPU上で動作し、センサレートで更新される。
原題: Beyond Visibility: Real-Time Surface Accessibility Fields from Sparse LiDAR / Bradley Scott, Sam Schofield, Richard Green
日本語で読む → - 論文LLM/制御設計ロボティクス
複雑な動的システムにおけるフィードバックコントローラ設計のための大規模言語モデルのベンチマーキングと推論蒸留
複雑な動的システムのフィードバックコントローラ設計におけるLLMの性能を評価するベンチマークを構築し、エッジ展開向けに推論蒸留で小型モデルを開発した。
原題: Benchmarking and Reasoning Distillation of Large Language Models for Feedback Controller Design in Complex Dynamical Systems / Zhongchao Zhou, Yixuan Xie, Wenwei Yu 他
日本語で読む → - 論文軌道予測ロボティクス
SIPTraj: 物理誘導によるシーン相互作用を用いたマップフリーのエンドツーエンド軌道予測
高精細地図を使わずに、エージェントの軌道予測を物理的制約を考慮して行う新しいフレームワークを提案。階層的エンコーダと物理誘導デコーダにより、シーン文脈の接地と運動学的実現可能性を同時に改善した。
原題: SIPTraj: Map-Free End-to-End Trajectory Prediction via Physics-Guided Scene Interaction / Feifei Liu, Zejun Wei, Haozhe Wang 他
日本語で読む → - 論文歩行ロボティクス
四足歩行のための迅速な身体適応フレームワーク
四足ロボットが身体の変化(関節の制限や質量の変化)に迅速に適応するためのオンライン適応フレームワークを提案し、シミュレーションと実機で有効性を示した。
原題: Rapid Embodiment Adaptation for Quadrupedal Locomotion / Dichen Li, Bo Ai, Nico Bohlinger 他
日本語で読む → - 論文VLAロボティクス
G0.5: ロボットの推論と行動のための単一自己回帰ストリーム
単一のトランスフォーマーデコーダが推論トークンと行動トークンを同一の目的で生成する、事前学習済み自己回帰VLAモデルG0.5を提案。異なるロボットの行動を共有語彙に変換するトークナイザーや、チェーン・オブ・ソート、視覚メモリを導入し、複数のベンチマークでSOTAを達成。
原題: G0.5: One Autoregressive Stream for Robot Reasoning and Action / Yicheng Liu, Zibin Dong, Baijun Ye 他
日本語で読む →