論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/9/21 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文社会ナビゲーションロボティクス
拡散ステアリングによる性能を維持した社会ナビゲーションのオンライン適応
拡散ポリシーを固定してノイズポリシーのみを強化学習で訓練するDSRLを提案し、複数シードの統合でベースポリシーを強化。性能を保ちつつ社会規範に適応する効率的な学習と実機検証を示した。
原題: Performance-Preserving Online Adaptation in Social Navigation via Diffusion Steering / Haruto Nagahisa, Kohei Matsumoto, Yuki Hyodo 他
日本語で読む → - 論文マニピュレーションロボティクス
不確実性下でのマルチモーダル指示グラウンディングによるマニピュレーション計画
言語とジェスチャーの不確実な手がかりを統合し、VLMの意味情報と3D幾何学的尤度をベイズ的に融合して対象物体を推定、必要に応じて確認質問も行うマニピュレーション計画フレームワークMIGUを提案した。
原題: MIGU: Multimodal Instruction Grounding under Uncertainty for Manipulation Planning / Mingke Lu, Anxing Xiao, David Hsu
日本語で読む → - 論文画像フォレンジック画像認識
エージェント型画像フォレンジックの解剖:トリアージ、プロンプティング、証拠仲裁の役割
専門検出器を組み合わせた訓練不要のエージェント型フレームワークで、トリアージ・プロンプティング・推論品質が性能に与える影響を分析し、推論能力が最も重要であることを示した。
原題: Dissecting Agentic Forensics: The Role of Triage, Prompting, and Evidence Arbitration in Open-World Fake Image Detection / Xianlong Li, Pietro Bongini, Niccoló Pancino 他
日本語で読む → - 論文VLAロボティクス
vla.simd: 言語条件付きマニピュレーションのための効率的なCPU推論
GPUなしで言語条件付きマニピュレーションを動かすため、SIMDカーネルと再利用計算を組み合わせたCPU推論エンジンvla.simdと、Raspberry Pi 5上で毎秒30動作以上を供給するACTベース方策IMPACTを提案した。
原題: vla.simd: Efficient CPU Inference for Language-Conditioned Manipulation / Khanh D. Nguyen, Hoang M. Truong, An T. Le
日本語で読む → - 論文ソフトアクチュエータロボティクス
単一材料3Dプリンティングによる一体型力覚・固有感覚ソフトアクチュエータ
導電性TPUを用いたFDM一回造形で、非対称折り紙曲げチャンバと力覚・固有感覚センサを一体化したソフトアクチュエータを開発し、把持と力覚検知を実証した。
原題: A Monolithic Force-Proprioception Soft Acutuator Enabled by Single-Material 3D printing / Nan Huang, Lele Liu, Junfeng Lu 他
日本語で読む → - 論文基盤モデルAI
UniK: デジタルAIとフィジカルAIのための普遍的知識知覚
異種モダリティの知識を統合・検索する共通基盤UniKを提案し、ファインチューニングなしで大規模専有LLMに匹敵または凌駕する性能を示した。
原題: UniK: Universal Knowledge Perception for Digital and Physical AI / Nirmit Desai, Kunal Sawarkar, Aditya Mahakali 他
日本語で読む → - 論文VLAロボティクス
StenoVLA-3D: 消化管狭窄ナビゲーションのための3D認識推論VLA
点群マップを統合した3D認識VLAフレームワークを提案し、狭窄領域の内視鏡ナビゲーションと病変報告を実現した。
原題: StenoVLA-3D: 3D-Aware Reasoning VLA for Navigation Through Gastrointestinal Stenoses / Tamima Tabassum, Yiming Huang, Tianchun Wu 他
日本語で読む → - 論文VLAロボティクス
視覚品質を超えて:ワールドアクションモデルによるテスト時計画の研究
ワールドアクションモデルが生成する行動と予測結果を用いた計画の可能性を検証し、視覚品質や物理整合性に基づく選択では限界があることを示した研究。
原題: Beyond Visual Quality: A Study of Test-Time Planning with World Action Models / Jianhao Yuan, Yu Yuan, Benjamin Ramtoula 他
日本語で読む → - 論文音響センシング/マッピングロボティクス
平坦な海底を超えて:サイドスキャンソナー再構成を支援する閉形式二視点制約
サイドスキャンソナーの二視点幾何制約を定式化し、特徴点が球と平面の交線上に拘束されることを証明するとともに、モンテカルロシミュレーションで曖昧さの軌跡の大きさを特徴づけ、測量計画の指針を示した。
原題: Beyond the Flat Seafloor: A Closed-Form Two-View Constraint to Aid Sidescan Sonar Reconstruction / Kalin Norman, Joshua G. Mangelson
日本語で読む → - 論文VLAロボティクス
CARE: 経験に基づく原子的修正実行によるVision-Language-Actionポリシーの回復
VLAポリシーの失敗ロールアウトから段階別の失敗分布を学習し、推論時に3Dモニタリングで原子的な修正動作をトリガーすることで、ロボット操作の回復性能を向上させるフレームワーク。
原題: CARE: Experience-Guided Atomic Corrective Execution for Vision-Language-Action Policies / Junlan Xiao, Junwei Jiang, Zaibin Zhang 他
日本語で読む → - 論文ロコマニピュレーションロボティクス
HOTICE: 混雑環境における全身ヒューマノイド物体搬送
混雑環境で物体を運ぶため、ロボットと荷物の衝突回避を統合したポテンシャル場と、上下半身を分離しつつ全身協調を保つ二重エージェント強化学習、専門家から一般化への蒸留を組み合わせた全身ロコマニピュレーション学習フレームワーク。
原題: HOTICE: Whole-Body Humanoid Object Transportation in Cluttered Environments / Toan Nguyen, Weiduo Yuan, Siheng Zhao 他
日本語で読む → - 論文柔軟ロボットモデリングロボティクス
分離断面構成則によるトリムヘリコイド柔軟アームのCosseratモデリング
トリムヘリコイド柔軟アームの荷重を支える螺旋領域が分離している構造を考慮し、各領域を局所座標で評価して背骨に引き戻す分離断面構成則を提案し、動的Cosseratモデルに組み込んで高精度な位置予測と高速計算を実現した。
原題: Cosserat Modeling of Trimmed Helicoid Soft Arms with a Separated-Section Constitutive Law / Zhihang Qin, Linxin Hou, Zeyu Zhong 他
日本語で読む → - 論文VLA画像認識
LiDAR言語モデルは時空間関係を本当に理解しているのか?
4D LiDAR言語モデルの時空間推論を診断するため、nuScenesを用いた1万問のベンチマークLiDAR-Halluを提案し、集計精度では隠れる失敗を明らかにした。
原題: Do LiDAR Language Models Really Understand Spatio-temporal Relationships? / Runyi Yang, Murat Akkoyun, Di Wen 他
日本語で読む → - 論文マニピュレーションロボティクス
DexTacWAM: 巧みな操作のための視触覚ワールドアクションモデル
各指先の触覚を個別に符号化し、指・姿勢を考慮した圧縮器で統合して動画拡散ワールドモデルに注入する視触覚ワールドアクションモデルを提案し、接触の多い両手巧み操作タスクで大幅な性能向上を達成した。
原題: DexTacWAM: A Visuo-Tactile World-Action Model for Dexterous Manipulation / Haoran Yuan, Zekai Wang, Boning Shao 他
日本語で読む → - 論文マニピュレーションロボティクス
InsertAnything: シミュレーションから現実への汎化可能な接触リッチ精密挿入
シミュレーションのみで強化学習を行い、実世界のデモや微調整なしに、様々な形状・クリアランスの穴への精密挿入を実現するフレームワークを提案。
原題: InsertAnything: Generalizable Contact-Rich Precision Insertion from Simulation to Reality / Zhenghua Ma, Xinpan Meng, Zeyu Liu 他
日本語で読む → - 論文SLAMロボティクス
SPARSER: ロボティクス知覚における分離可能構造を活用したスパース変数射影
ロボット知覚の非線形最小二乗問題において、変数射影とスパース性を組み合わせ、ゲージ対称性に対応した高速解法フレームワークを提案。SLAMやSfMで平均5〜7倍の高速化を実現。
原題: SPARSER: Sparse Variable Projection by Exploiting Separable Structure in Robotic Perception / Nikolas R. Sanderson, Andrew Fishberg, Haoyu Han 他
日本語で読む → - 論文歩行ロボティクス
REDACT: 未知の視覚劣化下での堅牢な知覚歩行
クリーンな深度画像のみで学習し、未知の視覚ノイズや遮蔽があっても有用な深度情報を保持する教示-生徒フレームワークを提案し、歩行性能の低下を抑えた。
原題: REDACT: Robust Perceptive Locomotion under Unseen Visual Corruption / Natapat Kirdwichai, Tobias Driskell-Poole, Andrei Sontea 他
日本語で読む → - 論文VLAロボティクス
世界モデルのように考え、VLAのように行動する:世界モデル表現をコンパクトなロボット方策に蒸留
凍結した世界モデルの内部特徴をVLA訓練に特徴整合項として一度だけ蒸留し、推論時コストを増やさずにロボット方策の堅牢性と成功率を向上させた。
原題: Think Like a World Model, Act Like a VLA: Distilling World-Model Representations into Compact Robot Policies / Trung Dao, Sankalp Yamsani, Jaden Park 他
日本語で読む → - 論文マニピュレーションロボティクス
ロボット構成空間における異種制約のための実行可能性距離場
関節空間の距離場として異種制約を統一的に扱い、衝突・関節限界・器用さ・トルクなどを同一尺度で合成できる枠組みを提案し、ニューラル近似で評価した。
原題: Feasibility Distance Fields for Heterogeneous Constraints in Robot Configuration Space / Xijing Cui, Huayan Pu, Jun Luo 他
日本語で読む → - 論文身体キュー認識/アシスティブロボットロボティクス
ベンチマークからロボット身体キューへの転移:質問優先型ベッドサイドロボットの評価
ベッドサイドロボットが検出した苦痛の身体キューを警告ではなく質問のきっかけとして扱う制御器を提案し、RGB外観分類器と姿勢中心ハイブリッドパイプラインを比較評価した。
原題: Ask Before It Tells: Benchmark-to-Robot Body-Cue Transfer for a Question-First Bedside Robot / Dongsik Yoon
日本語で読む → - 論文マニピュレーションロボティクス
接触アンカリング再ターゲティングと残差方策学習による人間実演からの器用なロボットマニピュレーション
人間の動作キャプチャから接触構造を抽出し、物理的に整合する軌道へ変換してロボットハンドの器用な操作方策を学習する3段階パイプラインを提案した。
原題: Dexterous Robot Manipulation from Human Demonstrations via Contact-Anchored Retargeting and Residual Policy Learning / Zihao Yang, Chengyuan Liu, Yu Zhou 他
日本語で読む → - 論文VLAロボティクス
Opt2VLA: 接触の多いヒューマノイド全身マニピュレーションのための力認識型視覚-言語-行動モデル
ヒューマノイドの全身操作において、VLAモデルが運動目標と接触力の指令を同時に予測し、強化学習ベースの全身制御器で追従する力認識型フレームワークを提案。軌道最適化で接触を考慮した訓練データを生成し、接触の多い3タスクで力の調整精度が向上することを示した。
原題: Opt2VLA: Force-Aware Vision-Language-Action for Contact-Rich Humanoid Whole-Body Manipulation / Fukang Liu, Yipu Chen, Jaehwi Jang 他
日本語で読む → - 論文マニピュレーションロボティクス
触覚はいつ重要か? 混雑環境での巧みな把持における視覚とインタラクションのギャップを描く
混雑した卓上での巧みな把持において、視覚のみ・力覚・触覚・それらの統合を実機で比較し、インタラクション感覚が接触の早期棄却や再把持を可能にし、把持成功率を大きく向上させることを示した研究。
原題: When Does Touch Matter? Charting the Vision-Interaction Gap in Cluttered Dexterous Grasping / Hao Jiang, Luis Dominguez, Daniel Seita
日本語で読む → - 論文VLA画像認識
ME-VLM:身体性認知とエージェント連携を統合した視覚言語モデル
身体性認知とマルチモーダルエージェント能力を統合したVLMを提案し、身体性・エージェント・自動運転・ナビゲーションのベンチマークで競争力のある性能を達成。エッジ展開向けの最適化も行った。
原題: ME-VLM:A Unified VLM for Embodied Cognition and Agent Coordination / Foundation Model, Li Auto Inc
日本語で読む → - 論文人間ロボット協働ロボティクス
人間参加型ロボット失敗回復に向けて:人間とロボットの協働におけるコミュニケーションギャップの橋渡し
ロボットが失敗から回復するために周囲の人に助けを求める際、聞き手の知識差を考慮したコミュニケーションの重要性を示し、その差を評価するゲーム・データセット・ベンチマークLD-HRIを提案した。
原題: Toward Human-in-the-Loop Robot Failure Recovery: Bridging Communication Gaps in Human-Robot Collaboration / Promise Ekpo, Teju Vijay, Dhruv Mandalik 他
日本語で読む → - 論文自動運転/ワールドモデル画像認識
関係性に基づく潜在ワールドモデルによる自動運転
交通シーングラフを意味的教師信号として使い、視覚的潜在表現を訓練時に整合させることで、推論時には追加計算なしに軌道予測誤差と衝突率を改善した。
原題: Relationally Grounded Latent World Models for Autonomous Driving / Fabian Schmidt, Markus Enzweiler, Abhinav Valada
日本語で読む → - 論文sim2realロボティクス
OpenFlyScan:民生ドローン向け品質誘導型空中再構成システム
3Dガウシアンスプラッティングの再構成品質を予測し、不足領域を補う追加撮影を計画・実行する民生ドローン向けシステムを提案。
原題: OpenFlyScan: A Quality-Guided Aerial Reconstruction System for Consumer Drones / Zhongrui You, Zhen Li, Junli Liu 他
日本語で読む → - 論文触覚ロボティクス
高帯域単点触覚センシングによる触覚知覚の学習
単点の高帯域触覚信号を時間周波数スペクトログラムに変換し、視覚用エンコーダで処理することで、遮蔽された操作タスクを実現するフレームワークを提案。
原題: Learning tactile perception from high-bandwidth single-point sensing / Joseph Rigal, Emmanuel Virot, Caroline Pascal
日本語で読む → - 論文世界モデル評価画像認識
HappyWorld-Bench:世界モデルの信頼性を評価する総合ベンチマーク
生成世界モデルがエージェントの相互作用下でどれだけ信頼できるかを、動画・空間・身体性の3トラックで評価するベンチマークを提案し、14の動画モデル、9の空間システム、8の身体性モデルを評価した。
原題: HappyWorld-Bench / Zhiqi Bai, Junai Cai, Yixin Chen 他
日本語で読む → - 論文VLAロボティクス
VLMベース視覚言語ナビゲーションモデルは何に依存しているのか:方策行動の解釈と操作
VLMベースの視覚言語ナビゲーションモデルが視覚・指示・記憶をどう統合し、内部表現を操作することで未知環境での性能を向上できるかを解明した研究。
原題: What do VLM-Based Vision-Language Navigation Models Rely on: Interpreting and Steering Policy Behavior / Débora Oliveira Makowski, Samiran Gode, Abhijeet Nayak 他
日本語で読む →