論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/8/19 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文プランニング機械学習
潜在世界モデルを用いた強化学習によるプランニング
プラン改善のための探索ルールを強化学習で学習する手法RP1を提案し、事前学習済みの潜在世界モデルに接続可能で、視覚ナビゲーションやロボット操作などで既存の探索アルゴリズムを大幅に上回る性能を示した。
原題: Reinforced Planning with Latent World Models / Armin Sommer, Jannik Schilling
日本語で読む → - 論文医療ロボティクス/制御ロボティクス
進行性経験融合による血管内ナビゲーションのマルチタスク世界モデル制御
血管内ナビゲーションのマルチタスク制御において、進行性経験融合(PEF)を用いてTD-MPC2コントローラを訓練し、適応的計画地平線と患者特異的微調整により成功率を向上させた。
原題: Progressive Experience Fusion for Multi-Task World Model Control in Endovascular Navigation / Harry Robertshaw, Maxence Boels, Nikola Fischer 他
日本語で読む → - 論文マルチモーダル学習機械学習
マルチモーダルアライメントを超えて:応答置換と順序実行による物理言語の認証
異なるセンサーが同じ実行可能な意味を持つか、新しい行動の組み合わせで意味が保たれるかを検証するための運用能力階層と証明書(DBOSC)を導入し、触覚・音声・加速度表現の応答空間での近接性や順序実行の能力を実験的に評価した。
原題: Beyond Multimodal Alignment: Certifying Physical Language through Response Substitution and Ordered Execution / Kaizhen Tan, Xin Xu, Siru Tao 他
日本語で読む → - 論文農業ロボティクスロボティクス
自律型農業トラクタ:精密水田農業のための統合雑草検出とLiDARナビゲーション
GNSSが劣化する環境下でも作物列ナビゲーションと雑草検出を統合した自律トラクタシステムを提案し、LiDARとカメラの融合によりロバストな動作を実現した。
原題: Autonomous Agricultural Tractor: Integrated Weed Detection and LiDAR Navigation for Precision Paddy Farming / Benjamin Merryman-Smith, Tony Nguyen, Bilal Dogutas 他
日本語で読む → - 論文歩行ロボティクス
劣駆動脚式ロボットの実時間制約付きDDPによるバランス制御
制約付きDDPを高速化し、劣駆動脚式ロボットの静的二脚立ちや歩行・走行を実時間MPCで実現した。
原題: Real-Time Control-Constrained DDP for Underactuated Balancing of Legged Robots / SeongWon Nam, Hyunyong Lee, Hansol Kang 他
日本語で読む → - 論文空中マニピュレーションロボティクス
マルチロータUAVに統合された連続体マニピュレータにおけるダウンウォッシュ効果の実験的研究
マルチロータUAVに搭載した腱駆動型連続体マニピュレータの、プロペラダウンウォッシュによる姿勢偏差を実験的に定量化し、ガウス過程回帰による残差モデルで予測精度を大幅に改善した。
原題: An Experimental Study of Downwash Effects on a Continuum Manipulator Integrated with a Multirotor UAV / Anuraj Uthayasooriyan, Krishna Manaswi Digumarti, ernando Vanegas 他
日本語で読む → - 論文組立計画ロボティクス
シーケンス制約付きロボット組立のための後向きレイアウト探索
組立順序が決められたロボット組立において、各パーツの初期位置と組立場所を衝突なく計画する問題を扱い、逆順に初期位置を割り当てる後向き探索法を提案した。
原題: Backward Layout Search for Sequence-Constrained Robotic Assembly / Xi Zhang, Jiancong Dai, Hao Chen 他
日本語で読む → - 論文VLA機械学習
役割条件付きサブトークンルーティングによる効率的な視覚言語行動ポリシー
視覚言語行動モデルの推論コスト削減のため、保持トークンの値表現を役割に応じて圧縮する新しい手法RoleSubを提案。トークン削減と組み合わせ、LIBEROベンチマークで高い性能を達成。
原題: Role-Conditioned Sub-Token Routing for Efficient Vision-Language-Action Policies / Wei Jiang, Wei Wang
日本語で読む → - 論文HRIHCI
実世界HRIにおけるマルチモーダル親密性推定
実店舗での対話記録を用いて、第三者評価による親密性スコアを自動推定する手法を検証し、ゼロショットLLMが強力で、音声・視覚モデルとの融合が最良となることを示した論文。
原題: Multimodal Rapport Estimation in Real-World HRI / Akihiro Sakuramoto, Takato Hayashi, Ryo Miyoshi 他
日本語で読む → - 論文変形物体操作/データセット/ベンチマークロボティクス
SoftVTBench: 変形を考慮した視覚触覚データセットと変形物体操作のベンチマーク
変形物体操作の物理的相互作用品質を評価するため、視覚触覚データセットと閉ループベンチマークを構築し、変形許容度を考慮した成功率を提案した。
原題: SoftVTBench: A Deformation-Aware Visuo-Tactile Dataset and Benchmark for Deformable-Object Manipulation / Bowen Jing, Mingxin Wang, Ruiyang Hao 他
日本語で読む → - 論文解釈可能性機械学習
解釈可能なアーキテクチャのグラフィカル設計
解釈可能なAIアーキテクチャを設計・比較するためのグラフィカル表記法を提案し、PyTorchのeinsumコードと一対一対応することを示した。
原題: Graphical Design of Interpretable Architectures / Pietro Barbiero
日本語で読む → - 論文連合学習/セキュリティ機械学習
FedLNS: レイヤー正規化シグネチャモデリングを活用した連合LLMにおける敵対的操作の緩和
連合学習において、悪意のあるクライアントによる更新をサーバー側で軽量に検出するフレームワークFedLNSを提案。正規化層のパラメータ変化をシグネチャとして利用し、履歴を考慮した参照と比較することで、追加の通信なしに敵対的更新をスクリーニングする。
原題: FedLNS: Leverage LayerNorm Signature Modeling to Mitigate Adversarial Manipulation in Federated LLMs / Kai Li, Jong-Ik Park, Carlee Joe-Wong 他
日本語で読む → - 論文VLA/操作ロボティクス
自己実演生成制御によるVLAのファインチューニング:多タスク操作のための手法
新しいロボットにVLAモデルを展開する際の性能低下を防ぐため、ゼロショットVLAから生成したオンラインインタラクションロールアウトを追加学習データとして用いる自己教師ありファインチューニング手法を提案。
原題: Fine-Tuning VLAs with Self-Demonstrated Generative Control for Multi-Task Manipulation / Prachi Garg, Steve Xing, Prahit Yaugand 他
日本語で読む → - 論文評価手法ロボティクス
SCAPE: シナリオ条件付きシミュレーション拡張ポリシー評価
実世界でのポリシー性能を、限られた実機データと大量のシミュレーションデータを組み合わせてシナリオごとに予測する評価フレームワークを提案した。
原題: SCAPE: Scenario-Conditioned Simulation-Augmented Policy Evaluation / Dijie Zhu, Seunghun Oh, Ruopeng Huang 他
日本語で読む → - 論文エンドユーザー開発ロボティクス
APPROVE: 視覚的エンドユーザー参加型LLMロボットプログラミング
LLMが生成したロボットプログラムをブロック型インターフェースで可視化し、ユーザーが確認・修正・再利用できるフレームワークを提案した論文。
原題: APPROVE: Visual End-User-in-the-Loop Robot Programming with LLMs / Bijan Kavousian, Miray Özakkas, Josefine Monnet 他
日本語で読む → - 論文実験自動化cond-mat.mtrl-sci
マルチツールロボティクスによるシンクロトロン時間分解測定のためのその場サンプル操作
シンクロトロンX線実験中に人間の介入ができない制約を、多ツールロボットプラットフォームで解決し、ペロブスカイト薄膜の過渡的なその場ダイナミクスを測定可能にした。
原題: Multi-Tool Robotics Enables In-Situ Sample Manipulation for Time-Resolved Synchrotron Measurements / Aditya Bondada, Elizabeth M. Wall, Eric Yuan Xiao 他
日本語で読む → - 論文遠隔操作/触覚フィードバックロボティクス
失われた触覚:空間分布型触覚フィードバックが遠隔操作を人間の巧みさに近づける
遠隔操縦において、空間分布した触覚フィードバックを再現することで、作業効率が向上し、操作軌道が人間の自然な動きに近づくことを実証した論文。
原題: The Missing Touch: Spatially Distributed Tactile Feedback Brings Teleoperation Closer to Human Dexterity / Rohan Kota, Gregory Reardon, J. Edward Colgate
日本語で読む → - 論文群制御AI
安全重視のマルチドローンシステムにおけるエージェント型AI:課題と機会
本論文は、捜索救助や重要インフラ監視などの安全重視ミッションにおけるマルチドローンシステムへのエージェント型AI統合の課題を論じ、人間中心の社会技術的設計アプローチを提案する。
原題: Agentic AI for Safety-critical Multi-drone Systems: Challenges and Opportunities / Timothy Merritt, Alejandro Jarabo-Peñas, Juan Bravo-Arrabal 他
日本語で読む → - 論文強化学習/器用操作/sim2realロボティクス
ADEPT: 事前学習と強化学習による事後学習で器用さを加速する
高自由度ロボットの器用な操作を、事前学習と事後学習を組み合わせた強化学習フレームワークで実現し、シミュレーションから実機への転移を可能にした。
原題: ADEPT: Accelerating Dexterity via Pre-Training and Post-Training using Reinforcement Learning / Jayjun Lee, Jessica Yin, Asif Rana 他
日本語で読む → - 論文自動運転ロボティクス
DA-WAM: 運転ワールドモデルのための意思決定整合的未来潜在表現
自動運転のためのワールドモデルにおいて、将来予測が意思決定に直接寄与するよう、予測表現学習と軌道スコアリングを統合したフレームワークDA-WAMを提案した。
原題: DA-WAM: Decision-Aligned Future Latents for Driving World Models / Ruiguo Zhong, Benshan Ma, Xiaolong Chen 他
日本語で読む → - 論文生涯シーン理解ロボティクス
LT-Mem: 変動を考慮した時空間メモリによる生涯シーン理解
長期運用ロボットのための、物体の履歴を保持しつつ現在の状態も更新する揮発性対応メモリ構造を提案し、時間的質問応答で性能を向上させた。
原題: LT-Mem: Volatility-Aware Spatio-Temporal Memory for Lifelong Scene Understanding / Yumin Lee, Hyoseok Ju, Giseop Kim
日本語で読む → - 論文VLAロボティクス
RoboEdit: 人間の操作動画をスケーラブルなロボット経験へ変換する
人間の操作動画を、ロボットの学習に使えるアクション整合性のある物理的に妥当なロボット動画へ変換するビデオ編集スイートを提案。大規模データセットと編集エンジンを構築し、実世界の操作タスクで有効性を実証した。
原題: RoboEdit: Turning Human Manipulation Videos into Scalable Robot Experience / Yaowei Guo, Zeng Tao, Yuxin Jiang 他
日本語で読む → - 論文敵対的攻撃AI
最弱リンクを断つ:視覚言語モデルを回避する攻撃
視覚言語モデル(VLM)の視覚エンコーダのみに勾配ベースの最適化を適用し、人間には知覚できない小さな摂動でモデルの出力を改ざんする回避攻撃手法を提案した。
原題: Breaking the weakest link to evade vision language models / Ilan Zini, Boussad Addad, Katarzyna Kapusta
日本語で読む → - 論文口唇同期画像認識
EfficientSync: 変形ベースの参照テクスチャ混合によるリアルタイム口唇同期
音声駆動の口唇同期を、参照フレームのテクスチャを保持したまま変形ベースでリアルタイムに実現する新しいフレームワークを提案した論文。
原題: EfficientSync: Real-Time Lip Synchronization via Deformation-Based Reference Texture Mixing / Fa-Ting Hong, Runzhen Liu, Luchuan Song 他
日本語で読む → - 論文報酬設計機械学習
MLREF: 大規模言語モデルによる強化学習の報酬設計における効率的なモジュール再利用
報酬関数をモジュール単位で進化させるフレームワークMLREFを提案し、再利用可能なモジュールプールを導入して報酬設計の安定性と性能を向上させた。
原題: MLREF: Efficient Module Reuse for Reward Design in Reinforcement Learning via Large Language Models / Chenglin Liu, Xun Wang, Ruishuo Chen 他
日本語で読む → - 論文マニピュレーションロボティクス
Dream2Reward: 正のデモンストレーションからの遷移整合報酬モデルによるロボット操作
成功デモから遷移レベルの潜在変位を予測し、観測された動作との整合性で密な報酬を生成する手法を提案。失敗アノテーション不要で報酬ハッキングを軽減し、実ロボット操作を含む下流性能を向上させる。
原題: Dream2Reward: Transition-Alignment Reward Models from Positive Demonstrations for Robotic Manipulation / Haoyu Zhang, Zecui Zeng, Bin Wang 他
日本語で読む → - 論文AIアライメント機械学習
遠くへ行くには共に行け:多様な選好が報酬最適化のカリキュラムを生む
人間のフィードバックから報酬モデルを学習し、ポリシーを最適化する際に、ユーザーごとの報酬モデルの最適化の難しさに着目し、多様なユーザー集団に対して自然にカリキュラムが生じることを利用して、木構造のカリキュラムを自動構築するCurriPOを提案した。
原題: To Go Far, Go Together: Diverse Preferences Induce a Curriculum for Reward Optimization / Taehyung Kim, Jongeun Choi
日本語で読む → - 論文マニピュレーションロボティクス
LabDex: 実験室における器用な操作のための階層的ベンチマーク
化学実験室での器用な操作を評価するための大規模な実世界データセットとベンチマークを導入し、原子スキル、合成タスク、長期実験の階層的タスク分類を提供する。
原題: LabDex: A Hierarchical Benchmark for Dexterous Manipulation in Laboratories / Zhipeng Tang, Sihang Chen, Sha Zhang 他
日本語で読む → - 論文基盤モデルロボティクス
ロボット基盤モデルにおける身体性ギャップ
ロボット基盤モデル(RFM)の汎化性能と実ロボットへの適用に必要な作業の差を「身体性ギャップ」と定義し、既存手法を共有構造と適応段階の2軸で整理したサーベイ論文。
原題: The Embodiment Gap in Robot Foundation Models / Yukiyasu Domae, Keisuke Shirai, Hanbit Oh 他
日本語で読む → - 論文ビデオ生成/スパースアテンション画像認識
サポートを分割し、残差を再構成する:ビデオ生成とワールドモデルのための学習不要スパースアテンション
ビデオ生成やワールドモデルのトランスフォーマーを高速化するため、学習不要のブロックスパースアテンション手法SparsePRを提案。応答結合分割とプローブフィット残差再構成を組み合わせ、アテンション再構成誤差を低減しつつ、実行ペア密度22-26%で1.48-2.61倍の高速化を達成。
原題: Partition the Support, Reconstruct the Residual: Training-Free Sparse Attention for Video Generation and World Models / Pardis Taghavi, Reza Langari, Gaurav Pandey
日本語で読む →