論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/8/24 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文強化学習/故障適応ロボティクス
特権的批評家トレーニングによるセンサ不要のスラスタ故障適応:エンドツーエンド強化学習
スラスタ駆動ロボットの故障耐性ナビゲーションにおいて、訓練中にのみ真の故障状態を価値関数へ与える特権的批評家トレーニングにより、センサなしで故障適応を実現する手法RAFTを提案した。
原題: Privileged Critic Training Enables Sensor-Free Thruster Fault Adaptation in End-to-End RL / Ricard Marsal I Castan, Miguel A. Olivares-Méndez
日本語で読む → - 論文ヒューマノイド/触覚/自己受容感覚ロボティクス
組織様構造を持つ生体模倣関節被覆皮膚の設計:筋骨格ヒューマノイドの自己受容感覚向上
筋骨格ヒューマノイドの関節角度推定を、筋肉センサに加えて関節を覆う皮膚の変形情報で補完するため、圧力・伸縮センサを内蔵した組織様多層構造の皮膚を設計し、実機で約3度の精度を達成した。
原題: Design of a Biomimetic Joint-Covering Skin with Tissue-Like Structure to Enhance Proprioception in a Musculoskeletal Humanoid / Akihiro Miki, Shun Hasegawa, Yoshimoto Ribayashi 他
日本語で読む → - 論文身体化推論AI
ParallelWorld: 身体化推論のためのテスト時スケーリング
身体化推論における探索を、単一ステップの貪欲な選択ではなく、複数ステップの未来軌道を並列にシミュレーションして評価するフレームワークを提案した論文。
原題: ParallelWorld: Test-Time Scaling for Embodied Reasoning / Min Chen, Shengjun Zhang, Yuxin Li 他
日本語で読む → - 論文設計生成/ソフトロボティクスロボティクス
RoboLDA: ボクセルベースソフトロボットの身体階層構造を確率的生成モデルで解明
高性能なボクセルベースソフトロボットの設計から「タスク-ロボット-器官-ボクセル」の4階層構造をベイズ生成モデルで抽出し、未見タスクのゼロショット設計に活用できることを示した。
原題: RoboLDA: A Probabilistic Generative Model for Uncovering Embodied Hierarchical Structures in Voxel-based Soft Robots / Junru Song, Yang Yang, Jingdan Shi 他
日本語で読む → - 論文システム同定ロボティクス
条件付きフローマッチングによる制御潜在変数の解釈とシステム同定
適応制御ポリシーの潜在変数を、条件付きフローマッチングを用いて物理モデルの分布にデコードし、固定ポリシーのチューニングやロバスト性解析に活用する手法を提案した。
原題: Interpreting Control Latents for System Identification via Conditional Flow Matching / Dingqi Zhang, Ruiqi Zhang, Mark W. Mueller
日本語で読む → - 論文3D生成/物理シミュレーション画像認識
Gen2Physics: マルチビュー素材分解による生成3Dメッシュの物理的接地
生成された3Dメッシュを物理シミュレーション可能な資産に変換するため、素材セグメンテーションと物理特性の割り当てを自動化するフレームワークを提案。
原題: Gen2Physics: Grounding Generated 3D Meshes in Physics via Multi-View Material Decomposition / Mauro Comi, Jordi Serrano Berbel, Kevis-Kokitsi Maninis 他
日本語で読む → - 論文自動運転画像認識
MomADv2: エンドツーエンド自動運転のための信頼性の高い時間的記憶
運転コマンドの変化に応じて履歴情報を選択的に活用し、コマンドと矛盾する記憶を抑制する信頼性の高い状態空間記憶フレームワークを提案。長期的な計画の一貫性を向上させ、衝突率を低減した。
原題: MomADv2: Reliable Temporal Memory for End-to-End Autonomous Driving / Ziying Song, Shengkai Zhang, Lin Liu 他
日本語で読む → - 論文強化学習/適応ロボティクス
報酬なし連続適応による耐障害宇宙ロボット
宇宙ロボットのハードウェア劣化に対応するため、報酬信号なしで適応可能な報酬フリー連続学習フレームワークを提案。事前学習した世界モデルの遷移ダイナミクスのみを更新し、想像上の軌道でポリシーを訓練する。
原題: Reward-Free Continual Adaptation for Resilient Space Robots / Andrej Orsula, Miguel Olivares-Mendez, Carol Martinez
日本語で読む → - 論文視覚位置推定画像認識
Spotter: GPS劣化環境における地理参照ファサードランドマークを用いた効率的な都市視覚位置推定
GPSが不安定な都市環境で、建物のファサードを地理参照ランドマークとして利用し、リアルタイムで高精度な視覚位置推定を実現するフレームワークを提案した。
原題: Spotter: Efficient Urban Visual Localization via Geo-Referenced Facade Landmarks in GPS-Degraded Environments / Antoni Valls, Jordi Sanchez-Riera
日本語で読む → - 論文身体化知覚AI
予算制約下の身体化知覚:四つの資源の壁と、31B未満のオープンモデルにおけるアクセス構造化知覚の事前登録評価
固定トークン予算下での身体化マルチモーダルエージェントの知覚を、四つの資源の壁として形式化し、訓練不要のラッパーASPを提案・評価した。結果、エピソード検索精度は向上するが、圧縮状態の有効性は確認できず、事前登録した反証基準の一部が発動した。
原題: Budget-Constrained Embodied Perception: Four Resource Walls and a Pre-Registered Evaluation of Access-Structured Perception on Open Models at less than 31B / Defu Lin, Wenhui Chen, Ziyao Lin 他
日本語で読む → - 論文画像編集画像認識
Mover360: 360度パノラマ画像における制御可能な物体操作
360度パノラマ画像内の物体を移動・挿入・削除できる操作フレームワークを提案。等距離円筒投影の特性に対応し、点・バウンディングボックス・マスクによる直感的な操作を実現する。
原題: Mover360: Controllable Object Manipulation in 360° Panoramic Images / Haoyi Zhong, Fang-Lue Zhang, Andrew Chalmers 他
日本語で読む → - 論文水中ロボット/センサ融合ロボティクス
AUVのためのニューラル支援による統合アライメント・キャリブレーション手法
AUVの慣性航法とDVLの融合に必要な初期化処理を、2つのニューラルネットワーク(ResAlignNetとDCNet)で置き換え、単一のほぼ等速度軌道と25秒のデータだけで従来法より速度誤差を平均68.7%削減する手法を提案した。
原題: A Unified Neural-Aided Alignment and Calibration Method for AUVs / Guy Damari, Zeev Yampolsky, Itzik Klein
日本語で読む → - 論文世界モデル/計画ロボティクス
インスタンススロットを超えて:物理的相互作用計画のための意味的に豊かな世界モデル
物理的相互作用の計画に適した、タスクの役割(グリッパー、ターゲット、ゴール、関係、フェーズ)を明示的に扱う世界モデルSR-WMを提案し、行動生成や再ランキングに活用する。
原題: Beyond Instance Slots: Semantically Rich World Models for Physical Interaction Planning / Juntao Cheng, Jingkai Wang, Yijun Shen 他
日本語で読む → - 論文安全制御制御
非ホロノミック移動ロボットのためのスケーリングに基づく相互制御障壁関数
非ホロノミック移動ロボットの位置レベルの障害物回避における相対次数2の安全制約に対して、運動依存のスケーリング因子を導入した相互障壁関数の構築法を提案し、安全集合の内部不変性を保証する。
原題: Scaling-Based Reciprocal Control Barrier Functions for Nonholonomic Mobile Robots / Tianyu Han, Bo Wang
日本語で読む → - 論文農業ロボティクス/物体検出画像認識
複雑な果樹園における微細小物体検出とインスタンス分割のためのYOLOv26、YOLOv11、YOLOv8の世代間最適化
果樹園環境での小物体検出とセグメンテーションの課題に対し、YOLOv8、YOLOv11、YOLOv26を比較し、小物体向けトレーニング設定が精度と効率のバランスに優れることを示した。
原題: Cross-Generation Optimization of YOLOv26, YOLOv11, and YOLOv8 for Fine-Grained Small-Object Detection and Instance Segmentation in Complex Orchards / Ranjan Sapkota, Manoj Karkee
日本語で読む → - 論文群制御ロボティクス
物理エージェンティックAI:LLMによるロボットクルー編成のためのアーキテクチャ
ロボット群をLLMで編成する際、計画と実行の間に検証層を設け、各動作をスキル・状態・制約に照らして確認するフレームワークを提案し、ドローンとUGVの探索・配送任務などで実証した。
原題: Physical Agentic AI: An Architecture for Orchestrating a Robot Crew with LLMs / Xinyuan Liu, Eren Sadikoglu, Riana Chatterjee 他
日本語で読む → - 論文ハンドモーション予測ロボティクス
EMPIRE: 明示的操作計画を学習可能な中間表現として用いた自己中心視ハンドモーション予測
自己中心視の映像から将来の両手の動きを予測する際に、操作計画を中間表現として明示的に学習する2段階フレームワークを提案し、大規模データセットを構築してSOTA精度を達成した。
原題: EMPIRE: Explicit Manipulation Planning as a Learnable Intermediate Representation for Egocentric Hand-Motion Forecasting / Wen Wang, Ruibing Hou, Hong Chang 他
日本語で読む → - 論文農業ロボティクス画像認識
商業果樹園における初期段階の解剖学的青果物分類のための軽量マルチモーダル視覚言語フレームワーク
商業果樹園で初期段階のリンゴ果実の解剖学的構造(がく片、果実本体、果梗)を分類する軽量な視覚言語モデルを提案し、スライディングウィンドウ推論でヒートマップを生成してロボット間引きに活用する。
原題: A Lightweight Multimodal Vision-Language Framework for Early-Stage Anatomical Green Fruit Classification in Commercial Orchards / Ranjan Sapkota, William Bu, Chen Chen 他
日本語で読む → - 論文プランニングロボティクス
Meta-Ctrl: 構文制約と意味制約の分離による保証付きプラン生成
LLMが生成するロボットのプランが構文・意味制約を必ず満たすようにする制約付きデコーディング手法を提案。メタトークン導入でメモリ消費を大幅削減し、小型モデルでもGPT-4を超える性能を実現。
原題: Meta-Ctrl: Guaranteed Plan Generation by Decoupling Syntactic and Semantic Constraints / Gwen Yidou-Weng, Edward Sun, Tianyi Ma 他
日本語で読む → - 論文TAMPロボティクス
TAMPオペレータ学習のためのマクロオペレータ生成と述語選択
タスク・動作計画(TAMP)のシンボリックオペレータをデモデータから学習する際、繰り返し現れる複数ステップの構造を捉えるマクロオペレータを自動生成し、不要な述語を刈り込むことで、長いシーケンシャルタスクの計画を高速化する手法を提案した。
原題: Macro-Operator Generation and Predicate Selection for TAMP Operator Learning / Can Emir Bora, Emre Ugur
日本語で読む → - 論文VLAロボティクス
LD4WAM: 人間のビデオから潜在ダイナミクスを学習するワールドアクションモデル
人間のビデオからロボットの行動に直接使える潜在ダイナミクスを学習し、将来のビデオ生成と行動条件付けを組み合わせたワールドアクションモデルを提案。5,000時間以上のデータで事前学習し、シミュレーションと実機で高い性能を達成。
原題: LD4WAM: Learning Latent Dynamics from Human Videos for World Action Models / Zhenhao Shen, Jiaqi Liang, Jasper Lu 他
日本語で読む → - 論文生体力学/最適制御ロボティクス
ランニング用義足が走り幅跳びに与える影響は?生体力学的モデルを用いた最適化予測と分析
下腿切断者がランニング用義足で走り幅跳びを行う際の動作を、筋骨格モデルと最適制御問題を用いて再現・比較し、義足のバネ特性が跳躍距離に与える影響を分析した。
原題: What is the effect of running-specific prostheses on long jumps? Optimization-based prediction and analysis using biomechanical models / Anna Lena Emonds, Johannes Funken, Wolfgang Potthast 他
日本語で読む → - 論文自動運転/シミュレーションロボティクス
BehaviorWorldGen: 行動モデルとワールドシミュレータのループを閉じる、制御可能な行動認識型構造化ワールド生成
運転行動モデルの自己改善ループにおいて、周辺エージェントの行動的に妥当な応答を生成できるシミュレータの欠如がボトルネックであることを指摘し、解釈可能な行動制御を注入してマルチエージェントの軌跡を生成するBehaviorFlowを中核とするフレームワークを提案した。
原題: BehaviorWorldGen: Closing the Loop between Action Models and World Simulators via Controllable Behavior-Aware Structured World Generation / Jiaqi Wang, Zhuo Zhang, Haining Guan 他
日本語で読む → - 論文空間推論/ベンチマーク画像認識
OmniCAD: ロボット組立における3D空間推論のための大規模ベンチマーク
産業用機械組立品の3D空間推論を評価する大規模ベンチマークを構築し、現在の視覚言語モデルが複雑な組立推論に苦戦することを示した。
原題: OmniCAD: A Large-Scale Benchmark for 3D Spatial Reasoning in Robotics Assemblies / Mingjia Wang, Taiting Lu, Ziwei Dong 他
日本語で読む → - 論文変形物体追跡ロボティクス
MotionDLO: イベントカメラとフレームカメラを併用した変形線状物体の追跡
イベントカメラの高時間分解能とフレームカメラの空間精度を組み合わせ、変形する線状物体(ケーブルなど)をリアルタイムで追跡するハイブリッド手法を提案した。
原題: MotionDLO: Hybrid Event- and Frame-Based Tracking of Deformable Linear Objects / Annalena Hartmann, Priyamvada Ajithkumar, Patrick Bründl 他
日本語で読む → - 論文農業AI/植物病害診断画像認識
説明可能な植物病害診断のための知覚専門家とマルチモーダル大規模言語モデルの融合:ベンチマーク画像から実世界ロボットフィールド検証まで
植物病害診断の精度向上のため、CNNモデルと大規模言語モデルを組み合わせたハイブリッド階層マルチエージェントフレームワークを提案し、ベンチマークとロボット取得画像で検証した。
原題: Fusing Perceptual Vision Experts with Multimodal Large Language Models for Explainable Plant Disease Diagnosis: From Benchmark Imagery to Real-World Robotic Field Validation / Ranjan Sapkota, Konstantinos I. Roumeliotis, Pengyao Xie 他
日本語で読む → - 論文模倣学習ロボティクス
模倣者ゲーム:行動予測を超えたロボットの模倣能力のベンチマーク
人間のデモンストレーションから意図を推論して実行するロボットの能力を評価するため、4段階のベンチマーク「The Imitator Game」と大規模データセット「IG-10K」を構築し、既存モデルが意図レベルの模倣で失敗することを示した。
原題: The Imitator Game: Benchmarking Robot Imitative Ability Beyond Action Prediction / Xunzhe Zhou, Yiyang Cai, Fengyi Wang 他
日本語で読む → - 論文分散学習cs.DC
モデル整合性を保証するビザンチン耐性を持つ分散型フェデレーテッドラーニング
分散型フェデレーテッドラーニングにおいて、全ノードが同じモデル更新を集約する非同期コンセンサスプロトコルと二重領域の信頼スコアリングを導入し、ビザンチン攻撃下でもグローバルなモデル整合性を維持する手法を提案した。
原題: Model-Consistent Byzantine-Resilient Decentralized Federated Learning for Collaborative Missions / Yue Li, Sudip Bhujel, Cameron Lira 他
日本語で読む → - 論文ロコマニピュレーションロボティクス
DreamMimic: ワールドモデルによる視覚運動全身ロコマニピュレーションの学習
ヒューマノイドロボットの視覚ベース全身ロコマニピュレーションを、ワールドモデル支援蒸留により学習するフレームワークを提案。特権教師ポリシーを視覚ベースの学生ポリシーに蒸留し、予測潜在ダイナミクスと補助予測ヘッド、適応蒸留スケジュールを導入して性能を向上させた。
原題: DreamMimic: Learning Visuomotor Whole-Body Loco-Manipulation via World Model / Jie Yin, Xingyu Lai
日本語で読む → - 論文BMI/脳波-筋電図デコーディング制御
ST-Topo GAN:手首運動の複雑さに対応した脳波-筋電図デコーディングモデル
脳波から筋電図への連続デコーディングにおいて、手首運動の複雑な神経筋活動に対応するため、時空間トポロジーを考慮したGANモデルを提案し、従来手法を上回る精度を達成した。
原題: ST-Topo GAN: A Motor EEG-to-EMG Decoding Model Matched to Wrist Movement Complexity / Ye Sun, Mingxuan Qu, Jing Wang 他
日本語で読む →