論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/9/20 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文VLAロボティクス
接地行動モデル:ロボティクスの基盤としての3Dグラウンディング
言語・点・ボックス指示を対象物の3D表現に変換し、マルチストリームTransformerで行動を予測するロボット基盤モデルGAMを提案。RoboTwin 2.0やLIBERO-PROで高い成功率を示した。
原題: Grounded Action Model: 3D Grounding as a Foundation for Robotics / Gehao Zhang, Weikai Huang, Shailesh Shailesh 他
日本語で読む → - 論文モデル予測制御ロボティクス
STL仕様とパレート最適化に基づく実現可能性修復を備えたシナリオMPC
確率的で制御不能なエージェントが存在するマルチエージェント系において、STL制約の実現可能性修復をパレート最適化として扱うMPCフレームワークを提案し、自動運転シナリオで評価した。
原題: Scenario MPC with STL Specifications and Pareto-Based Feasibility Repair / Tianhao Wu, Yiwei Lyu
日本語で読む → - 論文水中HRIロボティクス
水中でのダイバーとロボットの信頼性高いインタラクションに向けて:ジェスチャ設計、対話ロジック、実環境評価
ダイバーが使いやすくロボットが認識しやすい7種類の水中ジェスチャと軽量な認識手法、コマンドレベルの対話ロジックを組み合わせた閉ループ型インタラクションを構築し、水槽とプールでの実験で有効性を検証した。
原題: Towards Reliable Underwater Diver-Robot Interaction: Gesture Design, Interaction Logic, and Real-World Evaluation / Yingqi Liu, Kanzhong Yao, Zimeng Peng 他
日本語で読む → - 論文安全制御/MPCロボティクス
適応的Conformal分位点予測区間による不確実性下の安全臨界制御
適応的Conformal予測とConformal分位点回帰を組み合わせ、状態依存で非対称な不確実性区間を構築し、確率的制御バリア関数とMPCに統合することで、保守性を抑えつつ高確率の安全性を保証する制御フレームワークを提案した。
原題: Safety-Critical Control under Uncertainty via Adaptive Conformal Quantile Prediction Intervals / Hao Zhou, Yanze Zhang, Yiwei Lyu 他
日本語で読む → - 論文sim2realロボティクス
ReVeal: VLAポリシー評価のための再構成誤差を考慮したReal-to-Simフレームワーク
実環境を再構成したシミュレータでVLAポリシーを評価する際の再構成精度を定量化し、再構成品質と実機-シミュレーション性能一致度の関係を明らかにするフレームワークを提案。
原題: ReVeal: A Reconstruction-Aware Real-to-Sim Framework for VLA Policy Evaluation / Xinyi Wang, Heng Hao, Wenjun Hu 他
日本語で読む → - 論文マルチロボット計画ロボティクス
MR-SPITE: 階層的掃引体積近似によるマルチロボット競合スキャンの高速化
各ロボットの経路を時間区間に分割し保守的な境界を割り当てることで、競合スキャンを高速化するフィルタMR-SPITEを提案。16台のFetchロボットで競合スキャンが7.18倍高速化し、計画時間が57%削減された。
原題: MR-SPITE: Accelerating Multi-Robot Conflict Scans via Hierarchical Swept-Volume Approximations / Marta Markowicz, James Motes, Marco Morales 他
日本語で読む → - 論文探索ロボティクス
WOLF: 予測フロンティアを用いた世界モデル誘導LiDAR探索
LiDAR搭載UAVの自律探索において、再帰的世界モデルで将来の観測を予測し、予測フロンティアを生成することで遮蔽物の先の有望領域を推定し探索効率を高める手法を提案。
原題: WOLF: World Model Guided LiDAR Exploration with Predictive Frontiers / Yuyang Tian, Penghui Yang, Pengyuan Wu 他
日本語で読む → - 論文VLAロボティクス
スパイキングニューラルネットワークによるActor-Critic PPO制御を用いた、インフラ・建築物内の狭所開口部を通過するUAV自律ナビゲーション
スパイキングニューラルネットワークとPPOを組み合わせたActor-Critic強化学習により、橋梁やトンネルなど制約の多い3次元環境でUAVを自律飛行させ、窓通過タスクで63.77%の成功率を達成した。
原題: Spiking Neural Network Actor-Critic Proximal Policy Optimization Control for Autonomous UAV Navigation Through Constrained Openings in Civil Infrastructure and Buildings / Francis Noah Walugembe, Maciej Wielgosz, Tomaž Goričan 他
日本語で読む → - 論文ロコマニピュレーションロボティクス
STRIDER: ヒューマノイドロボットのための歩行を活用した多歩容階層型3Dロコマニピュレーションフレームワーク
地形を考慮した足場選択と上半身操作を統合し、異なる歩行・踏み出しスキルを蒸留で1つの方策にまとめる階層型フレームワークを提案。実機で多歩容のロコマニピュレーションを実現した。
原題: STRIDER: Stepping-Enabled Multi-Gait Hierarchical 3D Loco-Manipulation Framework for Humanoid Robots / Yuanzhuo Li, Wen Zhao, Zhe Yong 他
日本語で読む → - 論文ナビゲーションロボティクス
離散接触プッシュを用いた可動障害物間の実行可能ナビゲーション
移動マニピュレータが大きな可動障害物を押しのけて進む階層型NAMOフレームワークを提案。LLMで補助操作依存を推論し、離散接触モードと強化学習で押し操作を実行する。
原題: Manipulation Feasible Navigation Among Movable Obstacles with Discrete Contact Pushing / Shaohu Wang, Aiguo Song, Yulong Yuan 他
日本語で読む → - 論文安全制御ロボティクス
BarrierFormer: Transformerによる予測的バリア制約を用いた安全なロボット制御
モデル不要のTransformerベース安全制御フレームワークを提案し、予測ロールアウト上でCBF制約を学習してオンライン計算なしに安全な制御を実現した。
原題: BarrierFormer: Transformer-Guided Predictive Barrier Enforcement for Safe Robot Control / Anandsingh Chauhan, Kunal Garg
日本語で読む → - 論文群制御cs.DC
匿名・完全無向ロボット群による相反するパターン形成
2次元平面上で、互いに識別できない2群のロボットが、集合と円形成という相反するタスクを同時に解くための分散アルゴリズムを提案した。
原題: Conflicting Pattern Formation by Teams of Anonymous, Fully Disoriented Robots / Animesh Maiti, Prakhar Shukla, Subhash Bhagat
日本語で読む → - 論文3D物体検出画像認識
視覚基盤モデルによる堅牢なマルチモーダル3D物体検出
自動運転向けにSAMを微調整したSAM-ADとLiDAR特徴を融合し、ノイズや悪天候下でも堅牢な3D物体検出を実現するRoboDistillを提案。
原題: Towards robust multimodal 3D object detection via visual foundation models / Ziying Song, Lin Liu, Hongyu Pan 他
日本語で読む → - 論文触覚画像認識
BiView-Touch: クロスハンド補完による両手触覚表現学習
一方の手の触覚潜在表現を、同期したもう一方の手の触覚情報から補完する自己教師あり学習フレームワークを提案し、少ないラベルで両手動作や力の認識精度を向上させた。
原題: BiView-Touch: Learning Bimanual Tactile Representations by Cross-Hand Completion / Chenxin Liang, Youchen Lai, Chuqiao Lyu 他
日本語で読む → - 論文ソースシーキング制御
移動ロボットのための部分スキャン・移動型ソースシーキング
オフセットスカラーセンサを搭載した移動ロボットが、毎回全周スキャンせずに部分的な測定だけで次の移動方向を判断し、ノイズ下でも高確率で有限回で源に到達する手法を提案。
原題: Partial-Scan-and-Move Source Seeking for Mobile Robots / Bo Wang, Ishvar Sitaldin
日本語で読む → - 論文VLAロボティクス
TaskAnchor: 長期的マニピュレーションのための反応型VLAにおけるタスク状態の接地
視覚的に似た観測でも実行段階によって行動が異なる「タスク状態の曖昧さ」を解消するため、実行履歴に基づく軽量アダプタTaskAnchorを提案し、VLAの成功率を大幅に向上させた。
原題: TaskAnchor: Grounding Task State in Reactive VLAs for Long-Horizon Manipulation / Hengyan Liu, Wenlve Zhou, Bo Yue 他
日本語で読む → - 論文sim2realロボティクス
FinsSim: 水中ロボット学習のための現実整合型統合シミュレーションプラットフォーム
水中ロボットのSim-to-Real学習向けに、高忠実度流体力学・学習インターフェース・低コスト高精度自己位置推定・推力モデルを統合したシミュレーションプラットフォームを構築し、実機実験で制御方策の転移を検証した。
原題: FinsSim: A Reality-Aligned Integrated Simulation Platform for Underwater Robot Learning / Yu Zhang, Yuanmingqing Song, Xiangyun Rao 他
日本語で読む → - 論文音響知覚cs.SD
OmniEcho: 身体性エージェントのための空間音響理解
実世界の空間音響・視覚シーンを集めたベンチマークOmniEchoBenchを構築し、一人称アンビソニックス音響を扱う全モーダルモデルOmniEchoを提案。音響による知覚・ナビゲーションで最先端性能を達成した。
原題: OmniEcho: Spatial Audio Understanding for Embodied Agents / Ruixun Liu, Yuxuan Wang, Jiacheng Xie 他
日本語で読む → - 論文VLAロボティクス
RiverVLN: フェーズ接地型時間的視覚言語ナビゲーションによる無人水上艇の河川航行
河川を航行する無人水上艇(USV)向けに、長期的な言語指示を視覚的に検証可能な意味フェーズ列に変換し、予測・実行・再観測ループで連続的なSE(2)姿勢増分を予測するナビゲーション手法PGT-NAVとベンチマークRiverVLNを提案した。
原題: RiverVLN: Phase-Grounded Temporal Vision--Language Navigation for Unmanned Surface Vehicles / Jieling Wu, Yuehao Huang, Jiajun Lv 他
日本語で読む → - 論文VLAAI
PhysAI-Bench:自律UAV物理AIにおけるLLMベースエージェント意思決定のベンチマーク
自律UAVミッションの対話ログから抽出した1万件超の意思決定インスタンスで、29の基盤モデルのエージェント的意思決定能力を評価するベンチマークを提案。
原題: PhysAI-Bench: A Benchmark for LLM-Based Agentic Decision-Making in Autonomous UAV-Centric Physical AI / Mohamed Amine Ferrag, Merouane Debbah, Abderrahmane Lakas 他
日本語で読む → - 論文マニピュレーションロボティクス
EgoWild2Dex: 野生の人間体験から器用なロボットマニピュレーションを学習
家庭や工場など実環境で頭部カメラにより収集した一人称視点の人間行動データを、視点のずれと身体差を補正して双腕ロボットの器用な操作に転移する手法を提案。
原題: EgoWild2Dex: Learning Dexterous Robotic Manipulation from In-the-Wild Human Experience / Kunyang Lin, Xutao Wen, Jingxi Lin 他
日本語で読む → - 論文ヘルスケア予測機械学習
デジタルヘルスキャンペーン成果の早期予測のための患者ワールドモデル:能力と限界
患者ごとの潜在状態を保持し、曝露条件付き状態ダイナミクスと週次転換ハザードを学習して将来の転換曲線を予測するコンパクトな患者ワールドモデルを構築し、米国のキャンペーンデータで評価した。
原題: A Patient World Model for Early Forecasting of Digital Health Campaign Outcomes: Capabilities and Limits / Yunlong Wang
日本語で読む → - 論文継続学習画像認識
CE$^4$L: 自己視点・他者視点・両視点の継続学習
自己視点・他者視点・両視点が混在する動画認識のための継続学習ベンチマークCE$^4$Lを提案し、視点間対応や非同期性に対応するパラメータ効率の良い手法VISTAを開発した。
原題: CE$^4$L: Continual Ego, Exo, and Ego-Exo Learning / Hongwei Yan, Kanglei Zhou, Yuchen Liu 他
日本語で読む → - 論文VLAロボティクス
CompVLA: 接触を伴うマニピュレーションのための可変コンプライアンス視覚-言語-行動モデル
RGB画像と言語入力から動作と剛性行列を同時に予測し、接触の多いタスクで高い成功率を達成するVLAフレームワークを提案した。
原題: CompVLA: A Variable Compliance Vision-Language-Action Model for Contact-rich Manipulation / Jongmin Kim, Junsu Ha, Che-Sang Park 他
日本語で読む → - 論文走行可能度推定/オフロードナビゲーション画像認識
どの地形が良いか?VLMプロトタイプによるオフロード走行可能度ランキングのための選好学習
既存のアノテーションを領域ペアの順序に変換し、凍結したVLMのパッチトークン上に小さな読み出し層を学習させることで、地形の走行しやすさをランキングする手法TravProを提案。RGB生徒モデルが密な選好マップを蒸留する。
原題: Which Terrain Is Better? Preference Learning with VLM Prototypes for Off-Road Traversability Ranking / Ji-Hoon Hwang, Jisung Bae, E-In Son 他
日本語で読む → - 論文ソーシャルボット検出機械学習
CSC: LLM時代のソーシャルボット検出における較正された簡潔性
LLMによる意味的偽装に対処するため、グラフ構造とテキストの矛盾を検出する較正された簡潔なフレームワークCSCを提案し、ソーシャルボット検出の精度を向上させた。
原題: CSC: Calibrated Simplicity for Conflict-Aware Social Bot Detection in the LLM Era / Yipeng Qian, Pengjie Zhao, Chaoxi Niu
日本語で読む → - 論文VLAロボティクス
人間中心マルチモーダル観測からの能動的ロボット行動推論
明示的な指示なしに、人間と環境のマルチモーダルな手がかりからロボットが取るべき行動を判断する「能動的ロボット行動推論」を定式化し、実世界データセットProActionと参照モデルMMC2Actを提案した。
原題: Cognitive Action Reasoning for Proactive Robots from Human-Centered Multimodal Observations / Zhihao Gu, Kechao Zhu, Yuanfeng Wu 他
日本語で読む → - 論文群制御ロボティクス
潜在テレパシー:自己教師あり知覚潜在表現によるマルチロボット通信
各ロボットが自己知覚用に計算済みの自己教師あり学習済み潜在ベクトルをそのままブロードキャストし、受け手はタスク報酬のみからその意味を学習して行動する通信手法を提案。追加計算なしで遮蔽物回避を99.7%で達成。
原題: Latent Telepathy: Multi-Robot Communication with Self-Supervised Perceptual Latents / Howard Wang, Han Zheng, Cathy Wu
日本語で読む → - 論文マニピュレーションロボティクス
PackLab: ロボットビンパッキングのためのMLLM開発・訓練・評価フレームワーク
物理シミュレータ・専用MLLM・ベンチマークを統合し、閉ループで物体選択と配置を予測するロボットビンパッキング用フレームワークを提案。従来のヒューリスティクスや強化学習、汎用MLLMを上回る性能を示した。
原題: PackLab: A Comprehensive Framework for Developing, Training, and Evaluating MLLMs in Robotic Bin Packing / Donghao Zhou, Jia-Hui Pan, Fan Zhang 他
日本語で読む → - 論文世界モデル画像認識
OnlineWM: 因果性を考慮した能動的オンライン学習による効果的な世界モデリング
シミュレータと能動的に対話しながら、モデルの弱点を狙ったデータを収集し、反事実学習で行動と状態遷移の因果関係を捉える世界モデルのオンライン学習フレームワークを提案。
原題: OnlineWM: Causality-Aware Active Online Learning for Effective World Modeling / Yikun Miao, Fangqi Zhu, Quanxin Shou 他
日本語で読む →