論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/9/17 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文sim2realロボティクス
MILER: 非構造自律運転のためのsim-to-real強化学習に向けた意味的中間表現
意味的な中間表現シミュレータとBEVFusionによる知覚・制御のゼロショットsim-to-real転移を実現し、非構造環境での実車自律走行を達成した。
原題: MILER: Semantic Mid-Level Representation for Sim-to-Real Reinforcement Learning in Unstructured Autonomous Driving / Thomas Steinecker, Denis Trescher, Alexander Bienemann 他
日本語で読む → - 論文3Dグラウンディング画像認識
CitySTAR: オープンボキャブラリ都市3Dグラウンディングのための構造的・トポロジー認識推論
都市規模の3D点群において、自然言語指示から対象を特定するタスクを構造的制約推論として再定式化し、シーングラフとハイパーグラフによるトポロジー検証で高精度にグラウンディングする学習不要のフレームワークを提案。
原題: CitySTAR: Structured and Topology-Aware Reasoning for Open-Vocabulary Urban 3D Grounding / Shuai Zhang, Hongye Hou, Qinghe Liu 他
日本語で読む → - 論文VLAロボティクス
VLMベースの目標探索における空間・意味的不確かさ:探索と識別のバランス
VLMを用いた目標探索で、位置の空間的不確かさと目標同一性の意味的不確かさを分離して扱い、情報利得に基づく計画で探索と識別のトレードオフを最適化する手法を提案した。
原題: Spatial-Semantic Uncertainty in VLM-Based Target Search: Balancing Exploration and Identification / Alkesh K. Srivastava, Jonathan Diller, Vijay Kumar 他
日本語で読む → - 論文マルウェア検出cs.CR
Delphi Scanner: API系列モデリングによる効率的で解釈可能な静的マルウェア検出
Windows PEファイルのAPI系列をCNNでモデル化し、ルールベースの解釈層で悪意ある機能を分類する静的マルウェア検出システムを提案。19万件超で95.35%の精度を達成し、軽量かつ解釈可能で敵対的回避にも頑健。
原題: Delphi Scanner: efficient and interpretable static malware detection via API sequence modeling / Bijied Brahimi, Vincent Cohadon, Gabriel Glazman 他
日本語で読む → - 論文SLAM画像認識
AMB3R-SLAM: 階層型バックエンドによるキロメートル規模SLAM
単一の民生用GPUで1万フレーム超のキロメートル規模軌跡をリアルタイム復元できる単眼SLAMを提案し、階層型バックエンドで動的環境にも対応、LiDAR等の追加入力にも拡張可能。
原題: AMB3R-SLAM: Kilometer-scale SLAM with Hierarchical Backend / Hengyi Wang, Lourdes Agapito
日本語で読む → - 論文VLA機械学習
Uni-LaDiR:潜在拡散がマルチモーダル推論を統合する
異なるモダリティの推論過程を共有潜在空間のトークンに変換し、拡散モデルで次の思考ブロックを予測する統合推論フレームワークを提案。視覚言語タスクとロボット操作タスクで性能を向上させた。
原題: Uni-LaDiR: Latent Diffusion Unifies Multimodal Reasoning / Haoqiang Kang, Yizhe Zhang, Nikki Lijing Kuang 他
日本語で読む → - 論文物理シミュレーション機械学習
物理世界モデルにおける安定性と反事実的推論の構造的基盤
学習した物理シミュレータの長期安定性にはシンプレクティック積分によるエネルギー保存が、未知の物理パラメータへの適応には明示的な線形因子分解がそれぞれ必要であり、両者は独立した構造的メカニズムであることを示した。
原題: Conservation Buys Stability and Factoring Buys Counterfactuals in Physical World Models / Yufeng Wang, Parivesh Priye, Lu Wei 他
日本語で読む → - 論文農業ロボティクス画像認識
ロボット収穫のための選択的ワタボール位置推定:圃場条件下での深層学習視覚モデル評価
圃場で撮影したワタの画像データセットを用い、YOLO系やSAM系の深層学習モデルによるワタボールの検出・セグメンテーション性能を比較評価した。
原題: Selective Cotton Boll Localization for Robotic Harvesting: Evaluation of Deep Learning Vision Models Under Field Conditions / Thevathayarajh Thayananthan, Xin Zhang, Isuru Laddusinghe Badu 他
日本語で読む → - 論文触覚画像認識
TouchSight: 一人称視野映像からの素手触覚予測
手袋型圧力センサの記録を生成AIで素手映像に変換し、一人称視野の動画から手全体の接触力を予測する手法を提案。触覚センサなしで密な触覚情報を推定できる。
原題: TouchSight: Bare-Handed Tactile Prediction from Egocentric Video via Generative Visual Augmentation / Danyan Zhou, Jinxuan Lu, Jiawei Lin 他
日本語で読む → - 論文sim2realロボティクス
単一スキャンからのガウシアンスプラッティングによる実演合成と視覚運動ポリシー学習
1回の動画スキャンから3Dガウシアンスプラッティングで環境を再構成し、物理シミュレータなしで把持・軌道を生成して高忠実な実演を量産、拡散ポリシー学習に活用するデータエンジンを提案。
原題: Demonstration Synthesis from a Single Scan via Gaussian Splatting for Visuomotor Policy Learning / Beichen Wang, Yuen-Hei Yeung, V. R. Sridhar Devarakonda 他
日本語で読む → - 論文3Dシーングラフ画像認識
3Dシーングラフにおける意味的不確実性の階層的集約
既存の3Dシーングラフが持つ検出器信頼度と埋め込みから、物体エントリの正しさを確率化し、包含階層を通じて部屋レベルの信念に伝播させる枠組みを提案。追加の知覚や学習なしで物体検索と部屋レベルの主張の精度を向上。
原題: Hierarchical Aggregation of Semantic Uncertainty in 3D Scene Graphs / Carlos Cueto Zumaya, Iacopo Catalano, Wallace Moreira Bessa 他
日本語で読む → - 論文音声アシスタント機械学習
話しかけて、ジャービス:自律走行レースカー向けのオープンソース・エッジ展開可能な音声アシスタントフレームワーク
自律走行車の高レベルな行動指示を音声で行うためのオフライン音声アシスタント「Jarvis」を開発し、Mistral 7Bのドメイン特化ファインチューニングにより97.63%の意図認識精度と平均1.39秒の低遅延を実現した。
原題: Talk to Me, Jarvis: An Open-Source Edge-Deployable Voice Assistant Framework for Autonomous Racecars / Daniel Henel, Frederik Werner, Alexander Langmann 他
日本語で読む → - 論文歩行ロボティクス
没入型人間デモンストレーションによる3D障害物環境でのシーン認識型ヒューマノイド歩行の学習
VRで収集した人間の動作をシーン認識型にリターゲティングし、障害物を避けながら全身で移動するヒューマノイド歩行ポリシーを学習させた。
原題: Learning Scene-Aware Humanoid Locomotion through 3D Clutter from Immersive Human Demonstrations / Beichen Wang, Tong Xu, Daniel Kosukhin 他
日本語で読む → - 論文歩行ロボティクス
DR-MPC:脚式移動のための高速で実行可能な動力学緩和モデル予測制御
脚式ロボットの歩行制御において、動力学制約を二次ペナルティに緩和し、接触を考慮した入力パラメータ化と専用の内点法ソルバを組み合わせることで、従来手法より大幅に高速なモデル予測制御を実現し、四足歩行ロボットで検証した。
原題: DR-MPC: Fast and Feasible Dynamics-Relaxed Model-Predictive Control for Legged Locomotion / Run Wang, Alapati Tuerxun, Shuo Liu 他
日本語で読む → - 論文経路計画ロボティクス
HOPHY: オフロード経路・ミッション計画のための階層的ハイパーグラフ表現
地形を意味的領域とハイパーエッジで階層化し、オフロードでの経路・ミッション計画を高速化する手法を提案。実地図で成功率100%・コスト誤差0.01%未満を達成し、実機で1.5kmのミッションを実証した。
原題: HOPHY: A Hierarchical Hypergraph Representation for Off-Road Path and Mission Planning / Pranay Meshram, Charuvahan Adhivarahan, Prithvi Poddar 他
日本語で読む → - 論文sim2realロボティクス
DEXTERA: 単一画像から実機展開可能な巧みなマニピュレーションへ向けたReal-to-Sim-to-Real
1枚のRGB画像からシーンを分解し、物理パラメータ推定・ロボットキャリブレーション・軌道生成を自動化して、シミュレーションのみで学習した巧みなマニピュレーション方策を実機にゼロショット展開できるようにしたフレームワーク。
原題: DEXTERA: From a Single Image to Deployable Dexterous Manipulation via Real-to-Sim-to-Real / Jin Wu, Lianjie Yuan, Zeyan Sun 他
日本語で読む → - 論文物理シミュレーションcs.GR
S4R: 剛体の相互貫入を解消するスケーリング手法
物体を一度小さく縮めてから徐々に元のサイズに戻すことで、剛体同士のめり込みを解消する手法を提案し、大規模シーンでも高速かつ高精度に処理できることを示した。
原題: S4R: Scaling for Rigid-Body Interpenetration Resolution / Zhiyang Dou, Ang Zhao, Chen Peng 他
日本語で読む → - 論文脚式ロボットロボティクス
情報理論による脚式ロボットの機械的知能の定量化
脚式ロボットを例に、身体ダイナミクスを計算過程かつ通信路とみなし、機械的知能を情報理論的指標で定量化する手法を提案した。
原題: Quantifying Mechanical Intelligence in Legged Robots with Information Theory / Zach J. Patterson
日本語で読む → - 論文報酬モデル/マルチビュー画像認識
AnyviewMeter: カメラ幾何とマルチビュー注意によるロボット報酬モデルの適応
カメラ視点の変化に頑健なロボット報酬モデルを実現するため、低ランク微調整とPlucker光線条件付け、同期ブロック注意を組み合わせた適応フレームワークを提案し、視点変更時の誤差を約21%削減した。
原題: AnyviewMeter: Adapting Robotic Reward Models with Camera Geometry and Multi-View Attention / Yuang Tu, Runjia Tan, Yujie Yan 他
日本語で読む → - 論文VLAロボティクス
オフライン隠れ状態蒸留による強剪定VLAモデルの復元
幅方向の構造的剪定で縮小したVLAモデルを、教師モデルの隠れ状態をオフラインで蒸留することで、オンライン強化学習なしに性能を大幅に回復させる手法を提案。
原題: Recovering Aggressively Pruned Vision-Language-Action Models with Offline Hidden-State Distillation / Chiyoung Kim, Sanghyuk Roy Choi, Minhyeok Lee
日本語で読む → - 論文マニピュレーションロボティクス
ロボット収穫のための能動的知覚:地中海温室におけるトマトのクラスタ内隠蔽果実の3D再構成と位置推定
トマトの房内に隠れた果実を、次善視点計画による点群取得とクラスタリングで3D再構成し、90%以上の精度で位置・姿勢を推定する手法を提案。
原題: Active perception for robotic harvesting: 3D reconstruction and localisation of tomatoes hidden within clusters in a Mediterranean greenhouse / Fernando Cañadas-Aránega, Rowan Border, José C. Moreno 他
日本語で読む → - 論文歩行ロボティクス
PASSAGE: 雑然環境における知覚型ヒューマノイド移動のためのシーン整合運動学習のスケーリング
VRと慣性モーションキャプチャで収集した1500の雑然シーンにおける100時間の人間動作データを用い、条件付きフローマッチングプランナと全身トラッカーを組み合わせて、未知の障害物環境でもヒューマノイドが知覚に基づき踏み越え・すり抜け・くぐり抜けを選択・実行できる枠組みを提案。
原題: PASSAGE: Scaling Scene-Aligned Motion Learning for Perceptive Humanoid Traversal in Cluttered Environments / Yuxuan Ma, Zicheng Zeng, Chunlin Peng 他
日本語で読む → - 論文VLAロボティクス
M²Tok: 視覚言語行動モデルのためのマルチヘッド・マルチコードブック離散行動トークン化
連続的な行動信号を複数のヘッドと独立したコードブックで離散トークン化し、再構成誤差を抑えつつVLAモデルの性能を向上させる手法を提案。
原題: ${M}^2$Tok: Multi-head Multi-codebook Discrete Action Tokenization for Vision-Language-Action Models / Chunpu Xu, Zhixuan Liang, Yuhao Zhang 他
日本語で読む → - 論文動画世界モデル画像認識
StrucPhysVideo: 構造化キャプションとロボット行動から物理ダイナミクスを学習する動画世界モデル
物体の動きや相互作用を記述した構造化キャプションとロボットの行動を条件として、物理的に妥当な動画を生成・予測する動画世界モデルを提案し、Physics-IQで最高性能を達成した。
原題: StrucPhysVideo: Learning Physical Dynamics from Structured Captions and Robot Actions / Awomo-WM Team, :, Enhui Ma 他
日本語で読む → - 論文触覚ロボティクス
能動的固定のための3Dプリント可能な非平面エレクトロアドヘッション構造に向けて
マルチマテリアル3Dプリンティングを用いて、導電性櫛歯電極を構造に直接印刷した非平面(円筒形)エレクトロアドヘッション・パッドを試作し、電圧による吸着力制御を実証した。
原題: Toward 3D Printable Non-Planar Electroadhesive Structures for Active Anchoring / Mostafa A. Atalla, Carol R. Derla, Pep Canyelles Pericàs 他
日本語で読む → - 論文マニピュレーションロボティクス
WeaveRL:知覚的強化学習のためのシーン認識型ファブリックへの再構成の織り込み
GPU加速により数千の並列シミュレーションでシーンをサーフェルとして再構成し、センサ由来の幾何情報に基づく衝突回避型強化学習を実現した。複雑な操作タスクで性能とsim-to-real転移、未知障害物への堅牢性を向上。
原題: WeaveRL: Weaving Reconstruction into Scene-Aware Fabrics for Perceptive Reinforcement Learning / Remo Steiner, Vikram Ramasamy, David Tingdahl 他
日本語で読む → - 論文群制御ロボティクス
TRACER: 人間応答予測とインタラクションを考慮した再計画による適応型マルチロボット社会ナビゲーション
複数ロボットが人間と共存する空間で、ロボットの動きに対する人間の応答を予測し、その結果をオンラインで学習しながら再計画する双方向フレームワークを提案。
原題: TRACER: Adaptive Multi-Robot Social Navigation via Joint Human-Response Prediction and Interaction-Aware Replanning / Lan Hu, Minghui Liwang, Wenbo Zhu 他
日本語で読む → - 論文オープンボキャブラリ検索/水中画像ロボティクス
QMSR: クエリ条件付きマスク単位エキスパートルーティングによる頑健なオープンボキャブラリ水中物体検索
水中画像検索において、クエリと候補のペアごとに最適な画像強調エキスパートと融合強度を適応的に選ぶルーティング手法を提案し、固定の強調処理より高精度を実現した。
原題: QMSR: Query-Conditioned Mask-wise Expert Routing for Robust Open-Vocabulary Underwater Object Retrieval / Fuming Zhang, Dongyue Huang, Junjie Wen 他
日本語で読む → - 論文sim2realロボティクス
機能を保つデータ生成によるゼロショット実機-シミュレーション-実機マニピュレーション
接触を伴うタスクで形状を多様化しても機能的な接触面を保つメッシュ変形により、実機データなしでゼロショットの実機-シミュレーション-実機マニピュレーションを実現する手法を提案。
原題: Function-Preserving Data Generation for Zero-Shot Real-to-Sim-to-Real Manipulation / Tianyi Xiang, Xupeng Xie, Jiahang Cao 他
日本語で読む → - 論文強化学習理論機械学習
深層V学習の収束フレームワーク:誤差伝播と鋭い行動ギャップ境界
深層V学習の収束を6つの誤差成分に分解し、L^s集中性の下で政策損失を評価する枠組みを提案。最適なサンプル配分と行動ギャップの鋭い境界も導出した。
原題: A Convergence Framework for Deep $V$-Learning: Error Propagation and Sharp Action-Gap Bounds / Yury Kolomeytsev
日本語で読む →