論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/9/21 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文VLAロボティクス
vla.simd: 言語条件付きマニピュレーションのための効率的なCPU推論
GPUなしで言語条件付きマニピュレーションを動かすため、SIMDカーネルと再利用計算を組み合わせたCPU推論エンジンvla.simdと、Raspberry Pi 5上で毎秒30動作以上を供給するACTベース方策IMPACTを提案した。
原題: vla.simd: Efficient CPU Inference for Language-Conditioned Manipulation / Khanh D. Nguyen, Hoang M. Truong, An T. Le
日本語で読む → - 論文歩行ロボティクス
REDACT: 未知の視覚劣化下での堅牢な知覚歩行
クリーンな深度画像のみで学習し、未知の視覚ノイズや遮蔽があっても有用な深度情報を保持する教示-生徒フレームワークを提案し、歩行性能の低下を抑えた。
原題: REDACT: Robust Perceptive Locomotion under Unseen Visual Corruption / Natapat Kirdwichai, Tobias Driskell-Poole, Andrei Sontea 他
日本語で読む → - 論文VLAロボティクス
Bridge3D:Vision-Language-Actionモデルに3D空間での知覚と行動を可能にする
2D中心のVLAモデルに3D基盤モデルの特徴と3Dセマンティックフィールドを組み込み、3D空間での精密なマニピュレーションを実現した。
原題: Bridge3D: Enabling Vision-Language-Action Models to See and Act in 3D / Haoxuan Li, Sixu Yan, Lianghui Zhu 他
日本語で読む → - 論文マニピュレーションロボティクス
触覚はいつ重要か? 混雑環境での巧みな把持における視覚とインタラクションのギャップを描く
混雑した卓上での巧みな把持において、視覚のみ・力覚・触覚・それらの統合を実機で比較し、インタラクション感覚が接触の早期棄却や再把持を可能にし、把持成功率を大きく向上させることを示した研究。
原題: When Does Touch Matter? Charting the Vision-Interaction Gap in Cluttered Dexterous Grasping / Hao Jiang, Luis Dominguez, Daniel Seita
日本語で読む → - 論文ロコマニピュレーションロボティクス
HOTICE: 混雑環境における全身ヒューマノイド物体搬送
混雑環境で物体を運ぶため、ロボットと荷物の衝突回避を統合したポテンシャル場と、上下半身を分離しつつ全身協調を保つ二重エージェント強化学習、専門家から一般化への蒸留を組み合わせた全身ロコマニピュレーション学習フレームワーク。
原題: HOTICE: Whole-Body Humanoid Object Transportation in Cluttered Environments / Toan Nguyen, Weiduo Yuan, Siheng Zhao 他
日本語で読む → - 論文共有制御ロボティクス
能力を考慮した意味意図に基づく共有制御のための調停
VLMによる人間意図の確信度とVLAの実行能力の確信度を組み合わせてロボットの権限を調停する共有制御フレームワークを提案し、12人での実験で成功率92%を達成した。
原題: Capability-Aware Arbitration for Semantic Intent-Based Shared Control / Zhaoda Du, Michael Bowman, Xiaoli Zhang
日本語で読む → - 論文音響センシング/マッピングロボティクス
平坦な海底を超えて:サイドスキャンソナー再構成を支援する閉形式二視点制約
サイドスキャンソナーの二視点幾何制約を定式化し、特徴点が球と平面の交線上に拘束されることを証明するとともに、モンテカルロシミュレーションで曖昧さの軌跡の大きさを特徴づけ、測量計画の指針を示した。
原題: Beyond the Flat Seafloor: A Closed-Form Two-View Constraint to Aid Sidescan Sonar Reconstruction / Kalin Norman, Joshua G. Mangelson
日本語で読む → - 論文世界モデル画像認識
NeuIDO: 物理情報に基づく4D世界モデルのためのニューラル内在ダイナミクス演算子
視覚観測から統一的な内在ダイナミクス表現を学習し、物理情報に基づく4D生成を世界モデルへと発展させるフレームワークを提案。
原題: NeuIDO: Neural Intrinsic Dynamics Operator for Physics-Informed 4D World Models / Jiajing Lin, Xin Zhang, Jianhua Sun
日本語で読む → - 論文VLAロボティクス
World Action Modelの設計で重要な要素とは:実証研究
World Action Modelの設計選択(因果構造、潜在空間、学習目的)を制御実験で分離し、ロボット制御性能への影響を体系的に分析した研究。
原題: What Matters in Designing World Action Models: An Empirical Study / Chao Tang, Haoqing Wang, Zilang Cen 他
日本語で読む → - 論文走行可能性推定/オフロードナビゲーションロボティクス
火星を走るための学習:オフワールドナビゲーションのための視覚マルチモーダル走行可能性推定
火星探査車パーサヴィアランスの500ソル・45kmの走行データセットを構築し、マルチモーダルな不確実性考慮型走行可能性推定手法を提案した。
原題: Learning to Drive on Mars: Visual Multimodal Traversability Estimation for Off-World Navigation / Darren Chiu, Cole Wilson, Andrei Tumbar 他
日本語で読む → - 論文VLAロボティクス
Opt2VLA: 接触の多いヒューマノイド全身マニピュレーションのための力認識型視覚-言語-行動モデル
ヒューマノイドの全身操作において、VLAモデルが運動目標と接触力の指令を同時に予測し、強化学習ベースの全身制御器で追従する力認識型フレームワークを提案。軌道最適化で接触を考慮した訓練データを生成し、接触の多い3タスクで力の調整精度が向上することを示した。
原題: Opt2VLA: Force-Aware Vision-Language-Action for Contact-Rich Humanoid Whole-Body Manipulation / Fukang Liu, Yipu Chen, Jaehwi Jang 他
日本語で読む → - 論文歩行ロボティクス
安定したヒューマノイド歩行のための制約としての滑らかさ
全身の滑らかさを上半身と下半身の制約に分離し、制約付き強化学習でヒューマノイドの安定した歩行を実現する手法DeCapを提案。
原題: Smoothness as a Constraint for Stable Humanoid Locomotion / Utsav Panchal, Denis Kleyko, Unal Artan 他
日本語で読む → - 論文柔軟ロボットモデリングロボティクス
分離断面構成則によるトリムヘリコイド柔軟アームのCosseratモデリング
トリムヘリコイド柔軟アームの荷重を支える螺旋領域が分離している構造を考慮し、各領域を局所座標で評価して背骨に引き戻す分離断面構成則を提案し、動的Cosseratモデルに組み込んで高精度な位置予測と高速計算を実現した。
原題: Cosserat Modeling of Trimmed Helicoid Soft Arms with a Separated-Section Constitutive Law / Zhihang Qin, Linxin Hou, Zeyu Zhong 他
日本語で読む → - 論文測位ロボティクス
スマートフォンGNSSブースター:携帯型信号再放射器によるセンチメートル級歩行者測位
スマホ内蔵GNSS受信機を使いつつ、外付けの再放射アンテナで信号品質を高め、歩行者の測位精度をセンチメートル級に向上させるシステムを提案した。
原題: Smartphone GNSS Booster: Centimeter-Level Pedestrian Positioning Using a Portable Signal Re-Radiator / Taro Suzuki
日本語で読む → - 論文安全制御/MPCロボティクス
適応的Conformal分位点予測区間による不確実性下の安全臨界制御
適応的Conformal予測とConformal分位点回帰を組み合わせ、状態依存で非対称な不確実性区間を構築し、確率的制御バリア関数とMPCに統合することで、保守性を抑えつつ高確率の安全性を保証する制御フレームワークを提案した。
原題: Safety-Critical Control under Uncertainty via Adaptive Conformal Quantile Prediction Intervals / Hao Zhou, Yanze Zhang, Yiwei Lyu 他
日本語で読む → - 論文ソースシーキング制御
移動ロボットのための部分スキャン・移動型ソースシーキング
オフセットスカラーセンサを搭載した移動ロボットが、毎回全周スキャンせずに部分的な測定だけで次の移動方向を判断し、ノイズ下でも高確率で有限回で源に到達する手法を提案。
原題: Partial-Scan-and-Move Source Seeking for Mobile Robots / Bo Wang, Ishvar Sitaldin
日本語で読む → - 論文3D物体検出画像認識
視覚基盤モデルによる堅牢なマルチモーダル3D物体検出
自動運転向けにSAMを微調整したSAM-ADとLiDAR特徴を融合し、ノイズや悪天候下でも堅牢な3D物体検出を実現するRoboDistillを提案。
原題: Towards robust multimodal 3D object detection via visual foundation models / Ziying Song, Lin Liu, Hongyu Pan 他
日本語で読む → - 論文sim2realロボティクス
FinsSim: 水中ロボット学習のための現実整合型統合シミュレーションプラットフォーム
水中ロボットのSim-to-Real学習向けに、高忠実度流体力学・学習インターフェース・低コスト高精度自己位置推定・推力モデルを統合したシミュレーションプラットフォームを構築し、実機実験で制御方策の転移を検証した。
原題: FinsSim: A Reality-Aligned Integrated Simulation Platform for Underwater Robot Learning / Yu Zhang, Yuanmingqing Song, Xiangyun Rao 他
日本語で読む → - 論文VLAロボティクス
RiverVLN: フェーズ接地型時間的視覚言語ナビゲーションによる無人水上艇の河川航行
河川を航行する無人水上艇(USV)向けに、長期的な言語指示を視覚的に検証可能な意味フェーズ列に変換し、予測・実行・再観測ループで連続的なSE(2)姿勢増分を予測するナビゲーション手法PGT-NAVとベンチマークRiverVLNを提案した。
原題: RiverVLN: Phase-Grounded Temporal Vision--Language Navigation for Unmanned Surface Vehicles / Jieling Wu, Yuehao Huang, Jiajun Lv 他
日本語で読む → - 論文音響知覚cs.SD
OmniEcho: 身体性エージェントのための空間音響理解
実世界の空間音響・視覚シーンを集めたベンチマークOmniEchoBenchを構築し、一人称アンビソニックス音響を扱う全モーダルモデルOmniEchoを提案。音響による知覚・ナビゲーションで最先端性能を達成した。
原題: OmniEcho: Spatial Audio Understanding for Embodied Agents / Ruixun Liu, Yuxuan Wang, Jiacheng Xie 他
日本語で読む → - 論文VLAAI
PhysAI-Bench:自律UAV物理AIにおけるLLMベースエージェント意思決定のベンチマーク
自律UAVミッションの対話ログから抽出した1万件超の意思決定インスタンスで、29の基盤モデルのエージェント的意思決定能力を評価するベンチマークを提案。
原題: PhysAI-Bench: A Benchmark for LLM-Based Agentic Decision-Making in Autonomous UAV-Centric Physical AI / Mohamed Amine Ferrag, Merouane Debbah, Abderrahmane Lakas 他
日本語で読む → - 論文力推定ロボティクス
物体中心再構成による視覚ベース3次元力推定
ステレオ内視鏡映像から軟組織の変形を解析し、物体中心座標系で点群を再構成してニューラルネットワークで3次元力を推定する手法を提案。ファントムと豚結腸で精度を検証した。
原題: Object-Centered Reconstruction for Vision-Based 3D Force Estimation / Zhonghao Zhang, Mingyeung Wu, Hao Yang 他
日本語で読む → - 論文探索ロボティクス
WOLF: 予測フロンティアを用いた世界モデル誘導LiDAR探索
LiDAR搭載UAVの自律探索において、再帰的世界モデルで将来の観測を予測し、予測フロンティアを生成することで遮蔽物の先の有望領域を推定し探索効率を高める手法を提案。
原題: WOLF: World Model Guided LiDAR Exploration with Predictive Frontiers / Yuyang Tian, Penghui Yang, Pengyuan Wu 他
日本語で読む → - 論文水中HRIロボティクス
水中でのダイバーとロボットの信頼性高いインタラクションに向けて:ジェスチャ設計、対話ロジック、実環境評価
ダイバーが使いやすくロボットが認識しやすい7種類の水中ジェスチャと軽量な認識手法、コマンドレベルの対話ロジックを組み合わせた閉ループ型インタラクションを構築し、水槽とプールでの実験で有効性を検証した。
原題: Towards Reliable Underwater Diver-Robot Interaction: Gesture Design, Interaction Logic, and Real-World Evaluation / Yingqi Liu, Kanzhong Yao, Zimeng Peng 他
日本語で読む → - 論文歩行ロボティクス
UniPoint:多様な地形を歩行するヒューマノイドのための統合ポイントレベルセンサフュージョン
LiDARと2台の深度カメラの点群を早期融合し、固定トークン数の自己注意で処理するヒューマノイド歩行ポリシーを提案。8種類の地形を単一ポリシーで走破し、実機で70cm段差や100cmギャップなどを検証した。
原題: UniPoint: Unified Point-Level Sensor Fusion for Humanoid Locomotion Across Challenging Terrains / Sicen Li, Zhen Chu, Chao Li 他
日本語で読む → - 論文継続学習画像認識
CE$^4$L: 自己視点・他者視点・両視点の継続学習
自己視点・他者視点・両視点が混在する動画認識のための継続学習ベンチマークCE$^4$Lを提案し、視点間対応や非同期性に対応するパラメータ効率の良い手法VISTAを開発した。
原題: CE$^4$L: Continual Ego, Exo, and Ego-Exo Learning / Hongwei Yan, Kanglei Zhou, Yuchen Liu 他
日本語で読む → - 論文VLAロボティクス
TaskAnchor: 長期的マニピュレーションのための反応型VLAにおけるタスク状態の接地
視覚的に似た観測でも実行段階によって行動が異なる「タスク状態の曖昧さ」を解消するため、実行履歴に基づく軽量アダプタTaskAnchorを提案し、VLAの成功率を大幅に向上させた。
原題: TaskAnchor: Grounding Task State in Reactive VLAs for Long-Horizon Manipulation / Hengyan Liu, Wenlve Zhou, Bo Yue 他
日本語で読む → - 論文群制御ロボティクス
FlockDiffusion: 割当条件付き拡散モデルによるマルチドローンタスク割当と完了
シーングラフエンコーダと拡散トランスフォーマを組み合わせ、複数ドローンのタスク割当と経路生成を高速かつ低コストで行う学習フレームワークを提案。
原題: FlockDiffusion: Assignment-Conditioned Diffusion for Multi-Drone Task Allocation and Completion / Iana Zhura, Satenik Akopyan, Roohan Ahmed Khan 他
日本語で読む → - 論文VLAロボティクス
人間中心マルチモーダル観測からの能動的ロボット行動推論
明示的な指示なしに、人間と環境のマルチモーダルな手がかりからロボットが取るべき行動を判断する「能動的ロボット行動推論」を定式化し、実世界データセットProActionと参照モデルMMC2Actを提案した。
原題: Cognitive Action Reasoning for Proactive Robots from Human-Centered Multimodal Observations / Zhihao Gu, Kechao Zhu, Yuanfeng Wu 他
日本語で読む → - 論文6D姿勢推定画像認識
G6D: ロボットマニピュレーションのための幾何学的学習不要RGB-D 6D姿勢ソルバ
大規模事前学習モデルを使わず、テンプレート幾何マッチングとシルエット・深度整合性でRGB-Dから6D物体姿勢を推定する学習不要手法を提案し、CPUのみでも動作する。
原題: G6D: Geometric Learning-Free RGB-D 6D Pose Solver for Robotic Manipulation / Yixuan Liang, William Chen, Yunan Wang 他
日本語で読む →