論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/8/31 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文触覚画像認識
近接3D:センシング多様体上の容量近接による形状復元
曲面状の容量性テキスタイルを形状センサとして用い、その表面を非平面センシング多様体として扱い、容量近接場から物体形状を復元する多視点フィードフォワードモデルを提案した。
原題: Proximity3D: Shape from Capacitive Proximity on Sensing Manifold / Hao Chen, Chenming Wu, Chun Ping Lam 他
日本語で読む → - 論文HRI/目標推論ロボティクス
協調と競争におけるロボットによる人間の目標顕在化の促進
人間とロボットの相互作用において、人間を臨界決定点へ導くことで目標推論を高速化する統一戦略を提案し、協調的調理タスクと競争的かくれんぼゲームで評価した。
原題: Robots Influencing Humans to Reveal their Goals during Collaboration and Competition / Debasmita Ghose, Oz Gitelson, Michal Lewkowicz 他
日本語で読む → - 論文VLA画像認識
ZimaBlue: スケーラブルなビデオ事前学習による汎化可能な世界行動モデルの進化
大規模な一人称視点ビデオからロボット制御のための世界行動モデルを学習するフレームワークを提案し、実機ゼロショット評価で成功率を大幅に向上させた。
原題: ZimaBlue: Evolving Generalizable World Action Models through Scalable Video Pre-training / Xionghao Wu, Yijun Yang, Shiyang Zhou 他
日本語で読む → - 論文ヒューマンマシンインターフェースロボティクス
データ中心型ニューロモーターインターフェースによる携帯型ヒューマンマシンインタラクション
筋電信号を利用した携帯型のジェスチャー認識インターフェースを開発し、データ中心のアプローチにより小型モデルで高精度な認識を実現した。
原題: Data-Centric Neuromotor Interfaces for Portable Human-Machine Interaction / Jiaxuan Li, Di Wu, Jianhua Liu 他
日本語で読む → - 論文群制御math.OC
状態情報のみと限られたセンシング下での非線形マルチエージェントシステムに対する安全性が保証された分散型緊急時MPC
状態情報のみで動作し、センシング範囲が限られたマルチエージェントシステム向けに、安全性と再帰的実行可能性を保証する分散型緊急時MPCを提案した。エージェントごとの安全領域を更新する新機構により、保守性を低減しつつ理論的保証を維持する。
原題: Provably Safe Decentralized Contingency MPC under State-Only Information and Limited Sensing for Nonlinear Multi-agent Systems / Max Studt, Georg Schildbach
日本語で読む → - 論文VLAロボティクス
PAVE: 世界行動ポリシーのための予測的アライメントと価値誘導進化
視覚言語行動ポリシーに、複数時間スケールの遷移予測と価値ベースの条件付けを導入し、軌道の質を考慮した学習を可能にする手法を提案した。
原題: PAVE: Predictive Alignment and Value-Guided Evolution for World-Action Policies / Botong Zhao, Fang Yu, Tim 他
日本語で読む → - 論文自動運転/推論画像認識
テキストの思考連鎖を超えて:自動運転における行動基盤推論のサーベイ
自動運転における推論を、テキストベースの思考連鎖から物理世界に基づく行動基盤推論への移行として捉え、171本の論文を中間表現の形式に基づいて分類したサーベイ論文。
原題: Beyond Textual Chain-of-Thought: A Survey on Action-Grounded Reasoning in Autonomous Driving / Zhengxu Tang, Xiaozhou Zhang, Guofeng Cui 他
日本語で読む → - 論文VLAロボティクス
時間的強制:視覚・言語・行動モデルのための4D表現アライメント
VLAモデルに履歴パスを導入し、4D基盤モデルの幾何特徴と整列させることで、時間情報を活用した操作性能を向上させた。
原題: Temporal Forcing: 4D Representation Alignment for Vision-Language-Action Models / Xingyu Ding, Yuzhong Zhao, Chunhai Zhao 他
日本語で読む → - 論文ワールドモデルAI
因果的作用効果の再重み付けによるワールドモデル学習の改善
アクション条件付きビデオ生成のワールドモデル学習において、背景トークンに偏った損失を避け、アクションの影響を受けるトークンに重点を置く再重み付け手法を提案した。
原題: CAER: Causal Action Effect Reweighting for World Model Training / Jianjie Fang, Xvyuan Liu, Ziyou Wang 他
日本語で読む → - 論文自動運転cs.SE
オープンソース自動運転システムの解析と、強化学習テストおよび大規模言語モデルを用いた学際的ハードウェアインザループ研究パラダイム
複数車両の実車実験、コード再利用、ソフトウェア・ハードウェア連携テストを統一的にレビュー可能な枠組みを提案し、Apollo-on-Hongqi EV環境で実証した。
原題: Open-Source Autonomous Driving System Analysis and Multi-Disciplinary Hardware-in-the-Loop Research Paradigm with Reinforcement-Learning Testing and Large Language Models / Dianjing Cheng, Yike Li, Lan Yang 他
日本語で読む → - 論文VLA/自動運転画像認識
VLA運転のためのマルチ軌道教師信号とポリシー最適化の整合
VLA運転モデルにおいて、マルチ軌道模倣学習とGRPOを整合させる新しいフレームワークを提案し、非実行可能な軌道による勾配バイアスをパレート最適性と動的蒸留で解消する。
原題: Aligning Multi-Trajectory Supervision with Policy Optimization for VLA Driving / Tian Zhang, Zhuo Huang, Hongrui Ye 他
日本語で読む → - 論文逆運動学ロボティクス
共形幾何代数を用いた汎用3R位置決めロボットの逆運動学解法
共形幾何代数を用いて、汎用3Rロボットの逆運動学問題を2つの円の交点として再定式化し、theta_2に関する単変数多項式を直接導出する新しい解法を提案した。
原題: Inverse kinematic solution for generic 3R positional robots using Conformal Geometric Algebra / Abhilash Nayak, Durgesh Haribhau Salunkhe
日本語で読む → - 論文ジェスチャ生成画像認識
パペッティア:物体接地・姿勢認識型の共話ジェスチャ生成
音声に合わせたジェスチャ生成において、姿勢制約と周囲の物体を考慮した拡散モデルを提案し、因果的潜在空間での条件付き拡散により、物体と整合した多様で時間的に同期したジェスチャを生成する。
原題: Puppeteer: Object-Grounded Posture-Aware Co-Speech Gesture Generation / Vida Adeli, Soroush Mehraban, Jacob Rommann 他
日本語で読む → - 論文マルチエージェント自然言語
言語エージェントと非言語エージェントの協調の探求
LLMと非言語エージェント(チェスエンジンなど)の協調において、連続表現をテキストに圧縮する言語化がボトルネックとなることを示し、潜在状態を直接LLMのトークン列に投影する手法を提案した。
原題: Exploring Collaboration between a language and a non-language agent / Harini S, Somesh Singh, Yaman K Singla 他
日本語で読む → - 論文操作学習ロボティクス
言語駆動の品質多様性によるロボット操作スキルの自律獲得
品質多様性アルゴリズムと大規模言語モデルを組み合わせ、タスクの自由記述のみから多様な動作プリミティブのアーカイブを自律的に生成する手法を提案した。
原題: Autonomously Acquiring Robot Manipulation Skills with Language-Driven Quality-Diversity / Émiland Garrabé, Mahdi Khoramshahi, Stéphane Doncieux
日本語で読む → - 論文VLM/ナビゲーション/ベンチマーク画像認識
GeoAgent: 身体化ナビゲーションによるVLMの地理的位置特定能力の評価
視覚言語モデル(VLM)の地理的位置特定能力を、静的画像ではなく身体化ナビゲーション環境で評価するベンチマークGeoAgentを提案した。エージェントがストリートビューを探索して位置を推定する過程で、VLMの性能やバイアスを分析している。
原題: GeoAgent: Evaluating VLM Geolocalization Through Embodied Navigation / Arka Mukherjee, Soham Roy, Kartikeya Trivedi 他
日本語で読む → - 論文歩行ロボティクス
人型ロボットのための疎な3次元構造物の俊敏な知覚横断学習
人型ロボットが猿渡りバーを跳び移りながら渡り切るタスクを強化学習で実現。頭部搭載ライダーの生データを注意機構付きエンコーダで処理し、実機で高い成功率を達成した。
原題: Learning Agile Perceptive Traversal of Sparse 3D Structures for Humanoids / Efe Ongan, Chong Zhang, Boyang Sun 他
日本語で読む → - 論文航法/状態推定ロボティクス
未知の測定遅延を伴う一貫した支援慣性航法のためのガリレイ群上のスライディングウィンドウフィルタ
支援慣性航法において、センサ測定に未知の一定遅延がある場合に、遅延と航法状態を同時に推定する手法を提案した。ガリレイ群上で問題を定式化し、観測可能性を解析した上で、スライディングウィンドウフィルタを用いて遅延補正を適用することで推定の一貫性を向上させる。
原題: A Sliding Window Filter on the Galilean Group for Consistent Aided Inertial Navigation with Unknown Measurement Delays / Jonathan Kelly
日本語で読む → - 論文VLA/蒸留/操作制御
対称性を活用した視覚言語行動蒸留によるロボット操作
大規模VLAモデルの知識を、操作タスクの幾何学的対称性を利用して小型の学生ポリシーに蒸留するフレームワークを提案し、サンプル効率と汎化性を向上させた。
原題: SymVD: Symmetric Vision Language Action Distillation for Robot Manipulation / Hyewon Choi, Donggyu Kim, Soojean Han
日本語で読む → - 論文視覚認識画像認識
極度な視覚的疎密を透視する:単一のランダム視覚パッチからの表面理解
本研究は、画像の10%しか見えない極端に疎な観測から表面の再構築と材質分類を同時に行う統一フレームワークSSUFを提案し、4つの事前学習モデルを比較評価した。
原題: Seeing Through Extreme Visual Sparsity: Surface Understanding from a Single Random Visual Patch / Sindhuja Penchala, Sudip Mittal, Noorbakhsh Amiri Golilarz
日本語で読む → - 論文VLA/操作ロボティクス
凍結VLAポリシーのための達成基盤メモリによる閉ループエージェント
凍結された視覚-言語-行動(VLA)ポリシーに、物理的証拠で検証されたサブゴール進行ポインタを持つ軽量メモリを追加し、開ループ実行を閉ループ化するフレームワークを提案。
原題: AGM: Achievement-Grounded Memory for Closed-Loop Agents with Frozen VLA Policies / Hongbo Gao, Zeyu Ni, Xin Wen 他
日本語で読む → - 論文世界モデル/ベンチマーク調査ロボティクス
世界モデルはより優れたロボットを作るのか?予測的身体知能の評価ベンチマーク調査
ロボット学習における世界モデルとVLA政策の評価手法の乖離を指摘し、2017〜2026年の160件のベンチマークを分類・分析した調査論文。
原題: Do World Models Make Better Robots? A Survey of Evaluation Benchmarks for Predictive Embodied Intelligence / Gaytri Jena, Kapil Wanaskar, Vinija Jain 他
日本語で読む → - 論文エージェント基盤AI
エージェントスキルへのシステム基盤:アーキテクチャ、ライフサイクル、セキュリティ
大規模言語モデルエージェントの複雑な長期的タスクにおける信頼性や実行安定性の問題を解決するため、モジュール化された手続き的抽象化である「エージェントスキル」の統一的なシステム基盤と参照アーキテクチャを提案し、9段階のライフサイクルやセキュリティ課題を体系的に整理した論文。
原題: Towards a Systems Foundation for Agentic Skills: Architecture, Lifecycle, and Security / Sanket Badhe, Deep Shah, Priyanka Tiwari 他
日本語で読む → - 論文深度推定画像認識
OptiGeo: 光学的に困難なシーンにおける身体化知覚のための効率的な単眼幾何学
透明・反射・鏡面環境での単眼深度推定の信頼性を向上させるため、センサ由来のバイアスを補正する学習フレームワークOptiGeoを提案した。
原題: OptiGeo: Efficient Monocular Geometry for Embodied Perception in Optically Challenging Scenes / Muxin Liu, Tianbo Liu, Jing Xia 他
日本語で読む → - 論文自動運転/能動学習ロボティクス
自己認識型能動学習による自動運転の継続的改善
自動運転システムが稀な分布シフトや長尾イベントで失敗する問題に対し、予測世界モデルから得られる「恐怖」と「好奇心」の信号を用いて介入閾値を適応的に調整し、専門家への制御移行と模倣学習で継続的に改善する能動学習フレームワークSAGEを提案した。
原題: Self-Aware Active Learning Enables Continual Improvement in Autonomous Driving / Dong Hu, Chao Huang, Carman K. M. Lee 他
日本語で読む → - 論文3Dスタイライゼーション画像認識
OrnaStyler: 装飾を考慮した潜在編集によるコンテンツ保存型3Dスタイライゼーション
テキスト指示に基づき、既存の3Dアセットの幾何学と外観を保ちつつ、微細な装飾構造を追加するゼロショットの3Dスタイライゼーションフレームワークを提案した。
原題: OrnaStyler: Ornament-Aware Latent Editing for Content-Preserving 3D Stylization / Tomohiro Aizawa, Shigeru Kuriyama, Chunzhi Gu
日本語で読む → - 論文群制御機械学習
計算遅延下におけるマルチロボット制御のための非同期協調オンライン学習
計算遅延やクエリ点の違いを考慮した非同期協調学習戦略を提案し、ガウス過程回帰を用いた分散制御則によりマルチエージェントシステムの安全性と性能を向上させた。
原題: Asynchronous Cooperative Online Learning for Multi-Robot Control under Computational Delays / Xiaobing Dai, Zewen Yang, Wei Ren 他
日本語で読む → - 論文世界モデル機械学習
潜在世界モデルにおける介入ギャップ
学習された世界モデルが、環境への介入と同様の効果をタスク変数に与えるかどうかを評価する「介入忠実度」という指標を提案し、既存のモデルでは報酬予測誤差が小さくても介入効果が不正確であることを示した。
原題: The Intervention Gap in Latent World Models / Donna Vakalis
日本語で読む → - 論文ウェアラブルロボット/マッサージロボティクス
MiBOT: 人間のようなソフトマッサージで心血管反応を調整する頭部装着型ロボット
頭部に装着するマッサージロボットMiBOTを開発し、空気圧人工筋肉による静かな動作で人間のマッサージに似た触覚刺激を提供。被験者の血圧と心拍数を下げる効果を実証した。
原題: MiBOT: A head-worn robot that modulates cardiovascular responses through human-like soft massage / Alice Mylaeus, Stephanie Vogt, Berken Utku Demirel 他
日本語で読む → - 論文ワールドモデル画像認識
マトリックスゲーム3.5:パッチメモリによるリアルタイムストリーミング対話型ワールドモデルの強化
本論文は、対話型ワールドモデルをリアルタイムで長時間安定生成するため、幾何認識メモリ、静的動的分解表現、二段階蒸留を導入したMatrix-Game 3.5を提案する。
原題: Matrix-Game 3.5: Enhancing Real-Time Streaming Interactive World Models with Patch Memory / Runjia Qian, Zile Wang, Jihai Zhang 他
日本語で読む →