論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/6/8 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文3Dセグメンテーション画像認識
EPS3D: エンドツーエンドのフィードフォワード型3Dパノプティックセグメンテーション
多視点画像から3Dセマンティック特徴とインスタンス特徴を直接予測するエンドツーエンドのフレームワークを提案し、相互強化モジュールでセマンティクスとインスタンスの一貫性を高めた。
原題: EPS3D: End-to-End Feed-Forward 3D Panoptic Segmentation / Runsong Zhu, Jiaxin Guo, Xiaoyang Guo 他
日本語で読む → - 論文位置姿勢推定画像認識
仮想点に基づく一般化絶対位置姿勢問題の解法
複数の投影中心を持つカメラシステムの位置姿勢推定を、仮想点を用いて標準PnP問題に変換し、既存のPnPソルバーを一般化姿勢ソルバーとして利用できるようにする手法を提案した。
原題: Virtual-point-based Solutions to Handle Generalized Absolute Pose Problem / Bin Li, Banglei Guan, Shunkun Liang 他
日本語で読む → - 論文VLA/障害回復ロボティクス
ReCoVLA: VLMガイドによる報酬生成で視覚言語行動ポリシーの障害回復を実現
事前学習済みのVLAポリシーを凍結し、外部VLMで障害モードと回復段階を推定して報酬を構成することで、シミュレーションでの残差ポリシー訓練と実機へのゼロショット転送を行う障害回復フレームワークを提案した。
原題: ReCoVLA: VLM-Guided Reward Compilation for Failure Recovery in Vision-Language-Action Policies / Haodi Hu, Chung-Ta Huang, Jing Liu 他
日本語で読む → - 論文ケアロボティクスロボティクス
基盤モデルを用いたロボットの患者・高齢者ケアへの応用の探求
この論文は、基盤モデルを搭載したケアロボットの設計、ユーザー体験、ケア成果のエビデンスをレビューし、現状の限界と将来の研究方向性を提案している。
原題: Exploration of Foundation Model-Based Robots in Patient and Elderly Care / Zhiwen Qiu, Wei Liu, Yuexing Hao
日本語で読む → - 論文VLAロボティクス
MemoryVLA++:視覚言語行動モデルにおける記憶と想像による時間的モデリング
ロボット操作のためのVLAモデルに、作業記憶・エピソード記憶・未来想像の仕組みを組み込み、長期的な時間依存タスクを可能にするフレームワークを提案した。
原題: MemoryVLA++: Temporal Modeling via Memory and Imagination in Vision-Language-Action Models / Hao Shi, Weiye Li, Bin Xie 他
日本語で読む → - 論文安全フィルタロボティクス
モデルはすでに知っている:視覚言語行動モデルのための注意誘導型安全フィルタ
VLAモデルの注意ヘッドを利用して、各ステップで操作対象を特定し、残りを障害物として扱うCBFフィルタを構築。動的障害物を含む環境で安全性能を向上させた。
原題: Your Model Already Knows: Attention-Guided Safety Filter for Vision-Language-Action Models / Seongbin Park, Fan Zhang, Baharan Mirzasoleiman 他
日本語で読む → - 論文コンパイラ最適化機械学習
コンパイラ世界モデルに向けて:効率的なテンソルプログラム探索のための潜在ダイナミクス学習
テンソルプログラム最適化の探索コストを削減するため、スケジュール評価を行動条件付きの潜在ダイナミクスとしてモデル化する世界モデル風評価器を提案し、TVM AutoSchedulerでAnsorを上回る性能を達成した。
原題: Toward Compiler World Models: Learning Latent Dynamics for Efficient Tensor Program Search / Haolin Pan, Lianghong Huang, Xvlin Zhou 他
日本語で読む → - 論文姿勢推定ロボティクス
自動運転における相対姿勢推定のための効率的な最小解ソルバー
自動運転やロボットナビゲーション向けに、IMUや回転軸、平面運動などの事前情報を活用した3つの効率的な最小解ソルバーを提案し、RANSACパイプラインでの高速な仮説生成を実現した。
原題: Efficient Minimal Solvers for Relative Pose Estimation in Autonomous Driving Applications / Tao Li, Liang Liu, Jianli Han 他
日本語で読む → - 論文操作学習ロボティクス
AHA-WAM:非同期・地平線適応型ワールドアクションモデルと観測誘導コンテキストルーティング
世界予測と行動実行を異なる時間解像度で行う非同期ワールドアクションモデルを提案し、ロボット操作タスクで性能を向上させた。
原題: AHA-WAM:Asynchronous Horizon-Adaptive World-Action Modeling with Observation-Guided Context Routing / Jisong Cai, Long Ling, Shiwei Chu 他
日本語で読む → - 論文運動推定画像認識
非同期微分SfMによる全自由度運動推定のための最小解法
イベントカメラの非同期データから、角速度と線速度を同時に推定する全自由度の自己運動推定フレームワークを提案し、5点を用いた最小解法を初めて導出した。
原題: Minimal Solvers for Full-DoF Motion Estimation from Asynchronous Differential SfM / Shuo Pan, Banglei Guan, Bin Li 他
日本語で読む → - 論文イベントカメラ/姿勢推定画像認識
イベントカメラによる絶対姿勢と速度推定のための幾何学的フレームワーク
イベントカメラのストリームから3Dラインとイベント平面の幾何学的制約を用いて、絶対姿勢と速度を同時に推定する新しい幾何学的フレームワークを提案した。
原題: A Geometric Framework for Absolute Pose and Velocity Estimation with Event Cameras / Zibin Liu, Shunkun Liang, Banglei Guan 他
日本語で読む → - 論文マニピュレーションロボティクス
GHOST: ロボット操作の汎化を実現する階層的サブゴールポリシー
多視点RGB-D観測から3Dエンドエフェクタのポーズを予測する高レベルポリシーと、その目標を達成する低レベルコントローラを組み合わせた階層的枠組みを提案し、操作タスクの汎化性能を向上させた。
原題: GHOST: Hierarchical Sub-Goal Policies for Generalizing Robot Manipulation / Sriram Krishna, Ben Eisner, Haotian Zhan 他
日本語で読む → - 論文器用操作/模倣学習ロボティクス
DexPIE: 実世界経験からの安定した器用なポリシー改善
実世界展開で収集した経験を用いて、器用な操作ポリシーを事後訓練で改善するフレームワークを提案。介入システムとDAgger風データ収集、相対行動空間での非同期推論、連続最適性指標による条件付けで、デモデータのみのポリシーより成功率を37%向上させた。
原題: DexPIE: Stable Dexterous Policy Improvement from Real-World Experience / Ruizhe Liao, Wenrui Chen, Liangji Zeng 他
日本語で読む → - 論文VLA/推論高速化機械学習
C$^3$ache: クロス推論チャンクキャッシュによるワールドアクションモデルの高速化
ワールドアクションモデル(WAM)の推論を高速化するため、異なる推論チャンク間で残差をキャッシュして再利用する学習不要の手法C$^3$acheを提案し、最大2.5倍の高速化を達成した。
原題: C$^3$ache: Accelerating World Action Models with Cross Inference Chunk Cache / Weisen Zhao, Lam Nguyen, Zhicong Lu 他
日本語で読む → - 論文ナビゲーションロボティクス
SpaceVLN: オンライン空間認知記憶と推論を備えたゼロショット視覚言語ナビゲーションエージェント
連続環境での視覚言語ナビゲーションにおいて、空間構造を理解し指示に従うゼロショットエージェントを提案。空間認知記憶とタスク誘導型空間推論を導入し、探索領域を階層的に抽象化してナビゲーションを効率化する。
原題: SpaceVLN: A Zero-Shot Vision-and-Language Navigation Agent with Online Spatial Cognitive Memory and Reasoning / Yucheng Deng, Pingrui Lai, Xinhai Li 他
日本語で読む → - 論文触覚ロボティクス
イベントベース光触覚センサによる高密度力推定
イベントベースの光触覚センサを用いて、3次元の高密度力場を再構成する初のフレームワークを提案。イベントデータから表面変位を推定し、逆有限要素法で力に変換する。
原題: Dense Force Estimation with an Event-based Optical Tactile Sensor / Agis Politis, René Zurbrügg, Valentina Cavinato
日本語で読む → - 論文制御ロボティクス
ToFカメラのフィードバックで倒立振子を安定化できるか?
低解像度で安価なToFカメラのフィードバックだけで、倒立振子を正確に安定してバランスできることを実証した論文。
原題: Can we stabilize an inverted pendulum with feedback from a time-of-flight camera? / Anthony Czubarow, Antonio Terpin, Raffaello D'Andrea
日本語で読む → - 論文VLAロボティクス
iMaC: 動作と接触画像への変換による具現化ワールドモデル
ロボット操作のための新しい制御パラダイムを提案し、画像をアクション表現として用いることで、従来のベクトルベースのアクションよりも表現力と汎化性を向上させる。
原題: iMaC: Translating Actions into Motion and Contact Images for Embodied World Models / Zhenyu Wu, Xiuwei Xu, Yukun Zhou 他
日本語で読む → - 論文触覚推定画像認識
EgoTactile: 一人称視点ビデオから日常物体の把持圧力を学習する
一人称視点ビデオと全手の圧力データを組み合わせたベンチマークを構築し、拡散モデルを用いて視覚情報から把持圧力を推定する手法を提案した。
原題: EgoTactile: Learning Grasp Pressure for Everyday Objects from Egocentric Video / Yuan Zeng, Yujia Shi, Tiao Tan 他
日本語で読む → - 論文医療AI/マルチモーダル画像認識
XMedFusion: 自律医療システムのための知識誘導型マルチモーダル知覚・推論フレームワーク
放射線科レポート生成を強化するため、視覚エージェントと知識グラフ構築、検索支援ドラフト、合成エージェントを組み合わせたモジュール型AIフレームワークを提案し、胸部X線データセットで既存モデルより高い性能を示した。
原題: XMedFusion: A Knowledge-Guided Multimodal Perception and Reasoning Framework for Autonomous Medical Systems / Hamza Riaz, Arham Haroon, Maha Baig 他
日本語で読む → - 論文VLA画像認識
多様な経験によるスケーリング:視覚言語行動モデルのための手法
視覚言語行動モデルの実世界展開における課題を解決するため、意図分離アルゴリズムと類似サンプル誘導型強化学習を導入し、ロボットタスクとマルチモーダルベンチマークで優れた性能を達成した。
原題: Scaling by Diversified Experience for Vision-Language-Action Models / Leiyu Wang, Zhaofengnian Wang, Xueqi Li 他
日本語で読む → - 論文模倣学習ロボティクス
模倣学習のための差分認識検索ポリシー
模倣学習の汎化性能を向上させるため、推論時に訓練データを再利用する半パラメトリックな検索ベース手法DARPを提案。局所近傍構造に基づいて行動を予測し、連続制御やロボット操作で標準的な行動クローニングより15-46%性能が向上した。
原題: Difference-Aware Retrieval Policies for Imitation Learning / Quinn Pfeifer, Ethan Pronovost, Paarth Shah 他
日本語で読む → - 論文知識グラフ/LLMロボティクス
USDシーンから知識グラフへ:LLMによるゼロショットオントロジー接地
3Dシミュレーションシーンから知識グラフを構築する際の物体とオントロジークラスの対応付けを、大規模言語モデルを用いてゼロショットで自動化する手法を提案・評価した論文。
原題: From USD Scenes to Knowledge Graphs: Zero-Shot Ontology Grounding with LLMs / Jiangtao Shuai, Zongxiong Chen, Manfred Hauswirth 他
日本語で読む → - 論文物体検出画像認識
ContextShift: 物体検出における文脈依存性のための制御されたベンチマーク
物体検出器の文脈変化に対する頑健性を評価するため、物体の見た目を保ちつつ文脈関係を系統的に操作する制御ベンチマークContextShiftを導入し、既存の指標では隠れる性能低下を明らかにした。
原題: ContextShift: A Controlled Benchmark for Context Dependence in Object Detection / Dan Zlotnikov, Alex Lazarovich, Ohad Ben-Shahar
日本語で読む → - 論文AI査読自然言語
AI支援ピアレビューへのゲーミング攻撃が科学コミュニティにもたらす新たなリスク
AIによる査読システムが、抄録の言い換えという低コストな操作で評価を不当に引き上げられる脆弱性を持つことを実証した論文。
原題: Gaming AI-Assisted Peer Reviews Poses New Risks to the Scientific Community / Lin Li, Qi Zhang, Xander Davies 他
日本語で読む → - 論文敵対的攻撃cs.CR
目は見えてもLLMは見逃す:人間の知覚を利用した敵対的テキスト攻撃
LLMベースのコンテンツモデレーションが視覚的手がかりを無視する脆弱性を突き、人間には有害と認識されるが機械には検出されにくいタイポグラフィ操作による敵対的攻撃手法を提案した。
原題: What the Eyes See, the LLMs Miss: Exploiting Human Perception for Adversarial Text Attacks / Qin Yang, Lu Malloy, Joshua Lee 他
日本語で読む → - 論文位置推定ロボティクス
GPS非依存環境でのナビゲーションのための二重クォータニオンに基づくUnscented Kalman FilterとVisual Inertial Odometry
GPSが使えない環境でのナビゲーションのために、二重クォータニオンを用いた誤差状態Unscented Kalman FilterとVisual Inertial Odometryを組み合わせた手法を提案し、EuRoCデータセットで高い精度を実証した。
原題: Dual Quaternion-Based Unscented Kalman Filter with Visual Inertial Odometry for Navigation in GPS-Denied Environments / Mohamed Khalifa, Hashim A. Hashim
日本語で読む → - 論文世界モデル画像認識
エコー・メモリ:行動世界モデルにおける記憶の制御研究
行動条件付き世界モデルにおける記憶機構を制御された条件下で比較し、記憶の容量・圧縮・読み出し・再帰の各軸が性能に与える影響を明らかにした研究。
原題: Echo-Memory: A Controlled Study of Memory in Action World Models / Wayne King, Zeyue Xue, Yuxuan Bian 他
日本語で読む → - 論文3D生成画像認識
ABot-Earth 0.5: 生成型3D地球モデル
衛星画像から広大な3D環境を生成する生成モデルを提案し、3Dガウススプラッティングを用いてリアルな都市景観を高速に合成する。
原題: ABot-Earth 0.5: Generative 3D Earth Model / Ming Qian, Tianjian Ouyang, Mingchao Sun 他
日本語で読む → - 論文非言語コミュニケーション/ポーズ認識画像認識
一貫性に基づく信頼性指標を用いた実時間ボディポーズ非言語コミュニケーション
2Dボディポーズのみからコミュニケーション意図を認識する手法を研究し、新しいデータセットとベンチマークを提供。モデルの自己回帰的自己一貫性を教師なし信頼性指標として用いることを提案・証明した。
原題: Real-time body pose non-verbal communication with a consistency-based reliability measure / Alina Marcu, Dragos Costea, Cristina Lazar 他
日本語で読む →