論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/8/25 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文把持制御ロボティクス
センサレス損傷安全把持
エンコーダ位置とモータ電流のみを用いて、物体の圧縮ひずみを目標値以下に保つ把持制御を提案。力センサなしで損傷を防ぎつつ把持成功率を維持する。
原題: Sensorless damage-safe grasping / Yusei Shuto, Danilo Vasconcellos Vargas
日本語で読む → - 論文世界モデル機械学習
潜在世界モデルにおける長期予測のためのロールアウト復号再構成
潜在世界モデルの訓練時に、評価時と同じロールアウトを行い、各潜在変数を復号して再構成誤差をペナルティとして加えることで、長期予測性能を向上させる手法を提案した。
原題: Rollout-Decoded Reconstruction for Long-Horizon Prediction in Latent World Models / Rishi Shah, Rishav Shrestha
日本語で読む → - 論文安全性AI
自動スキルではなく自動ポリシー:物理世界のためのコンパイルされたエージェントスキル
スキル生成の自動化は効率向上に寄与するが安全性を欠くため、スキルに型付き権限層を組み込むEdge Skillguardを提案し、悪意あるスキルによる物理的危害を防ぐことを実証した。
原題: Auto-Policy, not Auto-Skill: Compiled Agent Skills for the Physical World / Zhonghao Zhan, Hamed Haddadi
日本語で読む → - 論文スマートグラス/一人称知能/サーベイ画像認識
見ることから行動へ:スマートグラスを一人称知能プラットフォームとして捉える
スマートグラスを、人間の知覚・文脈・行動をつなぐ一人称知能プラットフォームとして体系的に調査し、ハードウェア能力軸や基盤能力、L0-L5フレームワークを提案したサーベイ論文。
原題: From Seeing to Acting: Smart Glasses as First-Person Intelligence Platforms / Jiangning Zhang, Haojun Chen, Yong Liu
日本語で読む → - 論文ソフトロボティクス/制御ロボティクス
ソフト空気圧アクチュエータの動的追従と安定性解析のための制御指向学習
ソフト空気圧アクチュエータの非線形動特性を、静的平衡モデルと線形残差動的モデルに分解し、EDMDcで学習して制御と安定性解析を行う枠組みを提案。実験で高精度な軌道追従とリアルタイム障害物回避を実現し、安定性解析の有効性も検証した。
原題: Control-Oriented Learning for Dynamic Tracking and Stability Analysis of Soft Pneumatic Actuators / Nithin S. Kumar, Eric J. Barth
日本語で読む → - 論文計画・制御ロボティクス
信号時相論理を用いた安全性を考慮したモデル予測経路積分制御
信号時相論理(STL)で表される制約を制御バリア関数に変換し、MPPIコントローラに組み込むことで、安全性と効率性を両立するサンプリングベースの計画手法を提案した。火星探査車とクアッドコプターの実験で有効性を示した。
原題: Safety-aware Model Predictive Path Integral Control with Signal Temporal Logic / Yiqi Zhao, Taekyung Kim, Hideki Okamoto 他
日本語で読む → - 論文VLA/世界モデルロボティクス
TrAct: ロボット制御と視覚予測を視覚トラックで橋渡しする
ロボットの行動と画像変化の弱い対応を補うため、視覚トラックを中間表現として用いる世界モデルベースの意思決定フレームワークTrActを提案。シミュレーションと実機で成功率を大幅に向上させた。
原題: TrAct: Bridging Robot Control and Visual Prediction with Visual Tracks / Zhi Cao, Howard Ji, Kevin Zhang 他
日本語で読む → - 論文3D再構築画像認識
SceneReGen: 単一画像からの3Dシーン生成再構築
単一画像から3Dシーンを再構築する際、物体の生成とシーン配置のギャップを埋めるため、観測された姿勢を直接メッシュにエンコードし、位置とスケールを推定する生成フレームワークを提案。
原題: SceneReGen: Generative Reconstruction of 3D Scenes from a Single Image / Zefan Tian, Yuteng Ye, Yiheng Zhang 他
日本語で読む → - 論文モーションプランニング制御
劣駆動システムの高速計画のための信頼できる多面体アクションセット
劣駆動システム向けに、非線形ダイナミクスと整合する信頼できる凸な短時間アクション集合をオンラインで高速生成し、線形計画で再利用可能な計画手法を提案した。
原題: Trusted Polytopic Action Sets for Fast Planning in Underactuated Systems / Akshay Jaitly, Siavash Farzan
日本語で読む → - 論文行動セグメンテーション画像認識
ConsensusTAS: 長尺建設ビデオのための自己教師あり時間行動セグメンテーション
建設現場の長尺ビデオから、ラベルなしで行動の時間的区切りを自動的にセグメント化する自己教師あり学習手法を提案した。
原題: ConsensusTAS: Self-Supervised Temporal Action Segmentation for Long-Horizon Construction Videos / Xiaoshan Zhou, Yafei Sun
日本語で読む → - 論文マニピュレーションロボティクス
ロボット操作のための軌道レベル連続行動表現
制御周波数に依存せず、固定時間間隔の行動軌跡を連続潜在トークンで表現する新しい行動表現フレームワークCATを提案し、LIBEROや実機の長期的操作タスクで既存手法より高い成功率を達成した。
原題: Trajectory-Level Continuous Action Representation for Robotic Manipulation / Tong Yang, Jingkai Jia, Yuecheng Xu 他
日本語で読む → - 論文VLAロボティクス
グリッパー認識型視覚言語行動モデル
異なるグリッパー種別に応じた戦略を学習できるよう、5種類のグリッパーを含む大規模データセットと、専用トークナイザーとポリシールーティングを備えたモデルを提案した。
原題: Gripper-aware Vision Language Action Models / Hanyi Zhang, Zihong Luo, Tianyu Li 他
日本語で読む → - 論文VLAロボティクス
GaussianWAM: 3Dガウス場から世界行動モデルへの幾何学と意味の蒸留
多視点観測から3Dガウス場を介して幾何・意味情報を世界行動モデルに蒸留し、ロボット操作の視覚予測と行動生成を強化する手法を提案。
原題: GaussianWAM: Distilling Geometry and Semantics from 3D Gaussian Fields into World-Action Models / Zijian Zhang, Yuqing Jiang, Weitao Zhou 他
日本語で読む → - 論文VLA画像認識
GlanceWAM: 世界行動モデルのためのスパースなテスト時想像
ビデオ生成モデルの物理的知識をロボット学習に活用しつつ、制御レートでの同期生成の遅延問題を回避するため、非同期に未来フレームを想像し、潜在空間で直接行動を生成する手法を提案。RoboCasaやLIBEROで高い成功率と高速推論を実現。
原題: GlanceWAM: Sparse Test-Time Imagination for World-Action Models / Linhan Wang, Zijian An, Mingyuan Zhang 他
日本語で読む → - 論文人間ロボットインタラクションロボティクス
教師の期待とロボット学習を結ぶ結合ダイナミクス
人間とロボットの教示インタラクションを結合ダイナミクスに基づいて分類する尺度を提案し、教示効果と人間の認識に与える影響を分析した。
原題: Bridging Teacher Expectations and Robot Learning via Coupling Dynamics / Evan Dallas, Sean Dallas, Wing-Yue Geoffrey Louie
日本語で読む → - 論文オフライン強化学習機械学習
CoDrift: オフライン強化学習のための合成的ドリフト
オフライン強化学習の複数の目的をアクション空間の運動場として捉え、それらを合成して一つの生成ポリシーを学習するフレームワークCoDriftを提案。73タスクで最先端手法と同等以上の性能を達成。
原題: CoDrift: Compositional Drifting for Offline Reinforcement Learning / Xiewei Ni, Ruofeng Mei, Xiangyu Xu
日本語で読む → - 論文模倣学習/制御制御
動的システムに基づく模倣学習とニューロ適応制御による自律船舶の軌道回復
模倣学習と動的システムを組み合わせ、外乱下で自律船舶をデモ軌道に復帰させるハイブリッド制御アーキテクチャを提案し、シミュレーションで有効性を検証した。
原題: Dynamical System-Based Imitation Learning and Neuroadaptive Control for Trajectory Recovery in Autonomous Ships / Yeyson A. Becerra-Mora, José Ángel Acosta
日本語で読む → - 論文自動運転ロボティクス
RoG-DAgger: ロールアウト誘導によるエンドツーエンド運転の事後学習
エンドツーエンド運転システムの訓練と推論の不一致を解消するため、ロールアウトを用いて安全上重要な状態での高品質な専門家デモを生成し、DAggerによる事後学習を行うフレームワークを提案した。
原題: RoG-DAgger: Rollout-Guided Post-Training for End-to-End Driving / Liangyu Zhong, Joachim Sicking, Fabian Hueger 他
日本語で読む → - 論文群制御AI
ピボット・ステーション型マルチエージェント経路探索:可解性、複雑性、およびアルゴリズム
倉庫やロボット駐車場などで、タスクを持つエージェントがピボット(作業台)を経由してからステーションに停車する問題(PS-MAPF)を新たに定義し、可解条件の解明、NP困難性の証明、および3つの解法アルゴリズムを提案した。
原題: Pivot-and-Station Multi-Agent Path Finding: Solvability, Complexity, and Algorithms / Andrea Di Nezza, Mihir Patel, Fabio Fagnani 他
日本語で読む → - 論文検証機械学習
二重非負緩和による深層ニューラルネットワークの検証
ReLUニューラルネットワークの検証において、完全正値計画法の緩和である二重非負計画法を大規模に解く手法を提案し、既存のSDP緩和より厳しい境界を計算できることを示した。
原題: $(\text{DNN})^2$: Doubly Non-Negative Relaxations for Deep Neural Networks / Hanna Jiamei Zhang, Alan Papalia, Michael Everett 他
日本語で読む → - 論文世界モデル/行動条件付き生成ロボティクス
ロボットの世界モデルは本当に行動に従うのか?行動条件付き生成の診断とポリシー学習のための整合
ロボットの世界モデルが任意の行動に正しく従うかを評価するベンチマークWorldEchoを導入し、既存モデルが専門家の行動は再現できるが多様な非専門家軌道では失敗することを示した。さらに、行動追従を強化するWorldSyncを提案し、シミュレーションと実機タスクでポリシー改善の信頼性を向上させた。
原題: Do Robotic World Models Really Follow Actions? Diagnosing and Aligning Action-Conditioned Generation for Policy Learning / Sixiang Chen, Jiaming Liu, Jixian Wu 他
日本語で読む → - 論文VLAロボティクス
潜在アクションを意図として用いた効率的な未来想像による世界行動モデル
ロボット制御のための世界行動モデルにおいて、テスト時の未来観測生成の遅延を削減するため、潜在アクションを意図の表現として用いるLAWAを提案。将来の観測を生成せずに効率的な未来想像を実現し、少ないデモデータや分布外シナリオでの性能を向上させた。
原題: Latent Action as Intention Enables Efficient Future Imagination for World Action Models / Xiang Li, Yupeng Zheng, Songen Gu 他
日本語で読む → - 論文画像編集画像認識
Mover360: 360度パノラマ画像における制御可能な物体操作
360度パノラマ画像内の物体を移動・挿入・削除できる操作フレームワークを提案。等距離円筒投影の特性に対応し、点・バウンディングボックス・マスクによる直感的な操作を実現する。
原題: Mover360: Controllable Object Manipulation in 360° Panoramic Images / Haoyi Zhong, Fang-Lue Zhang, Andrew Chalmers 他
日本語で読む → - 論文評価指標ロボティクス
具現化エージェントシステムにおけるレジリエンスの重要性:新指標、体系的評価、最適化
具現化エージェントシステムの信頼性を評価するために、結果指標では捉えられない回復力(レジリエンス)を定義し、新しい評価フレームワークと指標群を提案した。400の家庭タスクと10のシステムで評価し、プロセスレベルの差異を明らかにした。
原題: Resilience Matters for Embodied Agents System: New Metrics, Systematic Evaluation, and Optimization / Yapeng Liu, Yuanzhao Zhai, Xudong Gong 他
日本語で読む → - 論文シミュレーションロボティクス
RoboRacer Arena: Isaac Simにおける高忠実度自動運転レースのスケーリング
占有グリッドマップから3Dレーシング環境を自動生成するシステムを開発し、Isaac Sim上で高忠実度の自動運転レースシミュレーションをスケーラブルに実現した。
原題: RoboRacer Arena: Scaling High-Fidelity Autonomous Racing in Isaac Sim / Mihaela-Larisa Clement, Agnes Poks, Ezio Bartocci
日本語で読む → - 論文マニピュレーションロボティクス
ブラウザ制御と混合ステッパードライバ構成による再現可能な視覚誘導6自由度ロボットアーム
低コストで再現可能な6自由度ロボットアームを設計・製作し、混合ステッパードライバ構成とブラウザネイティブ制御、視覚パイプラインによる自動ピックアンドプレースを実現した。
原題: Reproducible Vision-Guided 6-DoF Robotic Manipulator with a Mixed Stepper-Driver Architecture and Browser-Native Control / Lasan Perera, Deneth Priyadarshana, Dulana Pitiwaduge 他
日本語で読む → - 論文UAVナビゲーションロボティクス
RACO: 点検指向UAV視覚言語ナビゲーションのための信頼性を考慮した粗目標最適化
UAVの視覚言語ナビゲーションにおいて、点検用途では目標領域内で停止し、類似する偽目標を避ける必要があるが、既存の粗密ナビゲーションは粗目標の信頼性を考慮せず失敗する。本論文では、この問題を評価するベンチマークLG-UVIを導入し、粗目標を実行時仮説として扱い、物体レベルのアンカーで補正するRACOフレームワークを提案する。
原題: RACO: Reliability-Aware Coarse-Goal Optimization for Inspection-Oriented UAV Vision-Language Navigation / Sen Wang, Yiming Sun, Jiaxuan He 他
日本語で読む → - 論文ナビゲーションロボティクス
OptiSight:意味推論と幾何制御を橋渡しする身体化ナビゲーション
視覚言語モデルによる意味推論と視覚サーボによる幾何制御を組み合わせたハイブリッドな屋内ナビゲーション手法を提案。AI Habitatでのゼロショット実験で有効性を確認。
原題: OptiSight: Bridging Semantic Reasoning and Geometric Control for Embodied Navigation / Alperen Avan, Jordi Sanchez-Riera
日本語で読む → - 論文世界モデル機械学習
MOSH-WM: マスク接地ソフトハミルトン力学によるオブジェクト中心世界モデル
オブジェクト中心の世界モデルで、マスクの空間モーメントから位置・運動量状態を構成し、学習したエネルギーでソフトな方向バイアスを与えて将来映像を予測する手法を提案。OBJ3DとCLEVRERで既存手法より高精度な予測を達成。
原題: MOSH-WM: Mask-Grounded Soft-Hamiltonian Dynamics for Object-Centric World Models / Zhekai Wang, Haoxiang Huang, Xiang Liu 他
日本語で読む → - 論文セマンティックセグメンテーション画像認識
Contextrast++: セマンティックセグメンテーションのためのロバストなマルチスケール文脈対比学習
セマンティックセグメンテーションの性能向上のため、文脈対比学習と境界認識ネガティブサンプリングを組み合わせた新しい対比学習手法を提案した。
原題: Contextrast++: Robust Multi-Scale Contextual Contrastive Learning for Semantic Segmentation / Changki Sung, Hyungtae Lim, Wanhee Kim 他
日本語で読む →