論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/7/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文エッジAI/ナノドローンeess.IV
自動エンドツーエンド最適化とDNN展開による自律ナノドローンの性能向上
ナノドローン向けの視覚ベースCNNナビゲーションの展開を自動化し、メモリ使用量と推論時間を削減しつつ、実機での性能を大幅に向上させた。
原題: Improving Autonomous Nano-drones Performance via Automated End-to-End Optimization and Deployment of DNNs / Vlad Niculescu, Lorenzo Lamberti, Francesco Conti 他
日本語で読む → - 論文医用画像処理画像認識
グローバルに見て、ローカルに精緻化する:ロバストなフリーハンド3次元超音波再構成のためのグローバル視覚ガイダンスとローカル超音波手がかり
フリーハンド3次元超音波再構成の精度を高めるため、外部カメラによる大域的な位置推定とBモード超音波画像による局所的な解剖学的動きの補正を組み合わせたフレームワークを提案した。
原題: Seeing Globally, Refining Locally: Global Visual Guidance and Local Ultrasound Cues for Robust Freehand 3-D Ultrasound Reconstruction / Yameng Zhang, Zhongyu Chen, Dianye Huang 他
日本語で読む → - 論文HRI/個人化ロボティクス
StARS: レコメンダシステム駆動アプローチによる社会的に適切なロボット行動
人によって異なる社会的適切性の判断を、レコメンダシステムの嗜好モデリングとして捉え、ユーザー固有の適切性スコアを生成するフレームワークStARSを提案した。
原題: StARS: Socially Appropriate Robot Actions via a Recommender System-Driven Approach / Erencem Ozbey, Fethiye Irmak Dogan, Jin Huang 他
日本語で読む → - 論文選好学習ロボティクス
ロボットにおける展開可能な人間の選好アライメント:多様な人間の選好から代表的な報酬を学習する
多様なユーザーの選好をクラスタリングして代表的な報酬モデルを学習し、少数のポリシーで個別選好に適応するフレームワークPRECを提案した。
原題: Deployable Human Preference Alignment in Robotics: Learning Representative Rewards from Diverse Human Preferences / Taehyung Kim, Gwangmo Lee, Minjun Chang 他
日本語で読む → - 論文ビデオワールドモデル画像認識
小売業における外在視点と内在視点の基盤ビデオワールドモデル適応の比較
小売店舗の同期した外在視点・内在視点ビデオを用いて、事前学習済みビデオ拡散モデルを小売シーンに適応させる際、どの視点のデータが最も効果的かを検証した。外在視点のみの適応が、組み合わせ適応と同等以上の性能を示した。
原題: RetailSMV: Exocentric vs. Egocentric Adaptation of Foundation Video World Models in Retail / Amirreza Rouhi, Rajat Aggarwal, Parikshit Sakurikar 他
日本語で読む → - 論文群制御ロボティクス
Infra-Swarm: 近赤外スペクトル視覚による堅牢なビジョンベースのマルチロボット群制御
各ロボットに近赤外光源とグレースケールカメラを搭載し、光のフレアの位置と強度から隣接ロボットの3D位置を計測することで、照明変化に強い分散群制御を実現した。
原題: Infra-Swarm: Robust Vision-Based Multi-Robot Swarming via Near-Infrared Spectral Vision / Haoyu Chen, Qijin Li, Wanyu Xiang 他
日本語で読む → - 論文強化学習AI
インタラクティブなゲームプレイのためのコーチ可能なエージェント
強化学習エージェントに、実行時にスタイル(タスクの解き方の変更)を指示できるフレームワークを提案し、複数の複雑なドメインで有効性を示した論文。
原題: Coachable agents for interactive gameplay / Roberto Capobianco, Harm van Seijen, Nolan D. Bard 他
日本語で読む → - 論文画像分類画像認識
深層学習によるマルチラベル画像分類の再考:分類体系、課題、展望
深層学習を用いたマルチラベル画像分類(MLIC)の包括的なサーベイ論文であり、手法を6つのグループに分類し、課題と将来の研究方向をまとめている。
原題: Rethinking Multi-Label Image Classification With Deep Learning: Taxonomy, Challenge, and Outlook / Xuelin Zhu, Xiu-Shen Wei, Jiawei Ge 他
日本語で読む → - 論文3Dシーングラフ生成画像認識
DeWorldSG: ワールドモデル事前知識による深度認識3Dセマンティックシーングラフ生成
RGB-Dシーケンスから時間的に安定した3Dセマンティックシーングラフを生成するフレームワークを提案。物体を確率的3Dノードとして表現し、ワールドモデルの事前知識で関係性を補完することで精度を大幅に向上させた。
原題: DeWorldSG: Depth-Aware 3D Semantic Scene Graph Generation via World-Model Priors / Seok-Young Kim, Abdelrahman Elskhawy, Taewook Ha 他
日本語で読む → - 論文ワールドモデル機械学習
Valdi: 価値拡散ワールドモデル
拡散モデルを用いた不確実な未来予測と、オンラインMPCのための高速な潜在計画を両立するワールドモデルを提案。CarRacing環境での予備実験により、単一拡散ステップで決定論的MLPベースラインに匹敵する性能を示した。
原題: Valdi: Value Diffusion World Models / Christopher Lindenberg, Kashyap Chitta
日本語で読む → - 論文サイバーフィジカルシステム/セキュリティcs.CR
カメレオン:MLサロゲートによるメモリ破壊攻撃からのサイバーフィジカルシステムの回復
メモリ破壊攻撃を受けたCPSを、機械学習ベースのサロゲートでコンパートメントを置き換えることで、システムを停止させずに回復させるフレームワークを提案した。
原題: Chameleon: Recovering Cyber-Physical Systems from Memory Corruption Attacks via ML Surrogates / Mohsen Salehi, Karthik Pattabiraman
日本語で読む → - 論文マニピュレーションロボティクス
テキスト目標と実画像変換によるシミュレーションから実機への一般化を備えたアフォーダンスベース操作計画
アフォーダンス認識と行動効果予測に基づく操作計画システムを提案し、テキストで指定された目標と予測結果を照合して計画を評価する。また、実世界の画像を統一的な見た目に変換するモジュールを導入し、シミュレーションと実機の両方で有効性を示した。
原題: Affordance-Based Manipulation Planning with Text Goals and Sim-to-Real Generalisation via Real-to-Sim Image Conversion / Solvi Arnold, Rin Karashima, Tadashi Adachi 他
日本語で読む → - 論文ナビゲーションロボティクス
全方位における身体化推論のためのEAGOR
360度カメラを用いた身体化エージェントの方向推論を、球面調和関数によるベイズ推定として定式化し、学習不要でカメラ回転に不変な方向推定を実現するフレームワークを提案した。
原題: EAGOR: Embodied Reasoning in Omni-direction / Shriram Damodaran, Soumyaratna Debnath, Yan Wu 他
日本語で読む → - 論文群制御ロボティクス
GNSS劣化下での学習型小型無人機分離ポリシーに対する実行時安全性フィルタリング
GNSSが劣化する環境下で、学習された小型無人機の分離ポリシーに対し、行動フィルタリングと観測フィルタリングの2つの安全機構を比較し、観測フィルタリングが衝突を90%削減することを示した論文。
原題: Runtime Safety Filtering for Learned Small UAS Separation Policies under GNSS Degradation / Alex Zongo, Peng Wei
日本語で読む → - 論文模倣学習ロボティクス
容量ではなく構造:視覚運動模倣学習のためのオブジェクト中心表現
ロボット操作の模倣学習において、オブジェクト中心のスロット表現が、従来の密な特徴表現よりも高い成功率を達成することを示した論文。
原題: More Structure, Not More Capacity: Object-Centric Representations for Visuomotor Imitation Learning / Yi Li, Alexandre Chapin, Liming Chen 他
日本語で読む → - 論文群制御ロボティクス
SEAMLiS: 知覚制限下のマルチロボット探査における可視性を考慮した安全性
限られたセンサー範囲と視野を持つマルチロボット探査において、隠れた障害物を回避するための可視性を考慮した実行層の安全フレームワークを提案した。
原題: SEAMLiS: Visibility-Aware Safety for Perception-Limited Multi-Robot Exploration / Taekyung Kim, Rahul H Kumar, Aswin D. Menon 他
日本語で読む → - 論文マニピュレーションロボティクス
Pix2Act: 等変オーグメンテーションを用いた画像空間操作ポリシー
カメラ平面上の2D軌跡として操作行動を表現し、三角測量でエンドエフェクタの姿勢を復元する模倣学習手法を提案。観測と行動を同じ座標系に揃えることで等変変換を可能にし、汎化性能を向上させた。
原題: Pix2Act: Image-Space Manipulation Policies with Equivariant Augmentation / Haojie Huang, Linfeng Zhao, Haotian Liu 他
日本語で読む → - 論文動作計画ロボティクス
多様な実現可能なロボット動作計画のためのグローバル化制約付きスタイン変分推論
ロボット動作計画における多様な解の生成を目的とし、制約を直接組み込んだスタイン変分推論法(SteinSQP)を提案。GPU対応の行列フリーアルゴリズムで粒子群を更新し、実現可能かつ多様な動作集合を効率的に得る。
原題: Globalized Constrained Stein Variational Inference for Diverse Feasible Robot Motion Planning / Jiayun Li, Georgia Chalvatzaki
日本語で読む → - 論文群制御ロボティクス
スケッチ事前情報から軌道へ:屋内UAV群のためのミッション指向協調ナビゲーションフレームワーク
屋内点検や警備などのミッション指向タスクにおいて、スケッチマップの事前情報を活用し、2Dガイド経路と3D軌道最適化を組み合わせたUAV群の協調ナビゲーションフレームワークを提案した。
原題: From Sketch Prior to Trajectories: A Mission-Oriented Coordinated Navigation Framework for Indoor UAV Swarm / Xinhang Xu, Ruiyang Liu, Haotian Jin 他
日本語で読む → - 論文3次元再構成ロボティクス
VIDAR: 幾何基盤モデルによる視覚慣性密位置合わせと再構成
単眼基盤モデルの密な幾何予測に、視覚慣性オドメトリをメトリックアンカーとして組み合わせ、スケール安定な密再構成を実現するフレームワークを提案した。
原題: VIDAR: Visual-Inertial Dense Alignment and Reconstruction via a Geometric Foundation Model / Diyari Mohammed Salih, Lingxiang Hu, Naima AitOufroukh-Mammar 他
日本語で読む → - 論文模倣学習/適応ロボティクス
FlowDAgger: 潜在空間における人間参加型生成ロボットポリシーの適応
事前学習済みの生成ロボットポリシーを、人間の介入から潜在空間で適応させる手法を提案。介入行動を逆変換してノイズに変換し、軽量な潜在ポリシーで基盤モデルを操縦することで、少数の介入から迅速にスキル獲得する。
原題: FlowDAgger: Human-in-the-Loop Adaptation of Generative Robot Policies in Latent Space / Michael Murray, Daphne Chen, Simran Bagaria 他
日本語で読む → - 論文ソフトロボティクスcs.CE
インピーダンス誘導によるモジュール型ソフトメタマテリアルの局所変形のプログラム可能な伝達
ソフトメタマテリアルにおいて、局所変形の伝達をインピーダンス設計フレームワークによりプログラム可能にし、障害物回避や欠陥耐性グリッパーなどの応用を実現した。
原題: Impedance-Guided Programmable Transmission of Localized Deformation in Modular Soft Metamaterials / Weiyun Xu, Daewon Hong, Zhi Zhao 他
日本語で読む → - 論文組込みAI/セグメンテーション画像認識
RGB-Dカメラを用いた組込みデバイス上のアフォーダンスセグメンテーションのパレート最適フロントの充填
ウェアラブルロボット向けに、RGB-Dカメラの深度情報を小型深層ネットワークに統合するためのハードウェア認識型ニューラルアーキテクチャ探索と専用ファインチューニング手法を提案し、実時間性能とエネルギー効率を両立するパレート最適解を生成する。
原題: Filling the Pareto-Optimal Front for Affordance Segmentation on Embedded Devices Using RGB-D Cameras / Edoardo Ragusa, Giovanni Paolo Canuti, Simone Lugani 他
日本語で読む → - 論文データセットロボティクス
Open-AoE: 身体化学習のためのオープンな自己中心視操作データセットとツールチェーン
スマートフォンで撮影した自己中心視の操作動画約2000時間と、それをロボット学習用に加工するツールチェーンを公開した論文。
原題: Open-AoE: An Open Egocentric Manipulation Dataset and Toolchain for Embodied Learning / Zishuo Li, Bowen Yang, Changtao Miao 他
日本語で読む → - 論文空中マニピュレーションロボティクス
気流曝露制約下におけるモジュール型空中マニピュレータのタスク適応設計
マルチロータの気流が対象物に与える影響を考慮し、タスクの力学的要件とエンドエフェクタ配置を同時に最適化するモジュール型空中マニピュレータの設計フレームワークを提案した。
原題: Task-Adaptive Design of Modular Aerial Manipulators Under Airflow Exposure Constraints / Mengguang Li, Heinz Koeppl
日本語で読む → - 論文群制御ロボティクス
適応質量推定を備えたケーブル吊り下げペイロード輸送のための分散幾何制御
本論文は、複数のクワッドローターが中央調整なしでケーブル吊り下げペイロードを輸送するための階層的分散制御アーキテクチャを提案し、各エージェントが局所的なケーブル測定から質量分担を推定して協調を実現する。
原題: Decentralized Geometric Control for Cable-Suspended Payload Transport with Adaptive Mass Estimation / Hadi Hajieghrary, Benedikt Walter, Paul Schmitt 他
日本語で読む → - 論文世界モデル/器用操作/sim2realロボティクス
Mask2Real-WM: セグメンテーションマスクをシミュレーションから実世界への橋渡しとして用いた制御可能な器用な世界モデル
シミュレーションで大規模事前学習したダイナミクスモデルがセグメンテーションマスクの未来を予測し、それをレンダリングモデルで実写風RGBに変換することで、少ない実データで23自由度の器用な操作を制御可能にする世界モデルを提案した。
原題: Mask2Real-WM: Segmentation Masks as a Sim-to-Real Bridge for Controllable Dexterous World Models / Riccardo O. Feingold, Davide Liconti, Chenyu Yang 他
日本語で読む → - 論文VLA/行動生成ロボティクス
VLA-Corrector: 適応アクションホライズンのための軽量検出・修正推論
VLA-Correctorは、アクションチャンク方式のVLAポリシーに軽量な視覚モニタとオンライン勾配ガイダンスを追加し、実行中のずれを検出して修正再計画を行うことで、閉ループ応答性を向上させる。
原題: VLA-Corrector: Lightweight Detect-and-Correct Inference for Adaptive Action Horizon / Yi Pan, Miao Pan, Qi Lu 他
日本語で読む → - 論文触覚/操作ロボティクス
TouchWorld: 器用な操作のための予測・反応型触覚基盤モデル
触覚を予測と高速フィードバックの両方に活用する階層型ポリシーを提案し、視覚言語によるタスク計画と触覚による接触適応を分離することで、長期的な操作タスクの成功率を向上させた。
原題: TouchWorld: A Predictive and Reactive Tactile Foundation Model for Dexterous Manipulation / Jianyi Zhou, Feiyang Hong, Yunhao Li 他
日本語で読む → - 論文群制御ロボティクス
HydraCollab: 分散自律システムのための適応型協調認識
通信帯域と認識精度のトレードオフを解決するため、最も情報価値の高いセンサ特徴を選択的に送信し、空間信頼度マップに基づいて協調戦略を動的に切り替える適応型協調認識フレームワークを提案した。
原題: HydraCollab: Adaptive Collaborative-Perception for Distributed Autonomous Systems / Luke Chen, Cheng-Ju Wu, David R. Martin 他
日本語で読む →