論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/6/2 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文推論システムcs.NE
スパイク言語モデルのためのスパース対応C++ INT8推論:汎用CPU上での実装と評価
スパイク言語モデルの活性化スパース性を活用するC++ CPU推論ランタイムを実装し、INT8量子化とAVX2カーネルにより、汎用CPU上で既存の量子化モデルより高速なデコードを達成した。
原題: Spike-Aware C++ INT8 Inference for Sparse Spiking Language Models on Commodity CPUs / Ting Liu
日本語で読む → - 論文ナビゲーション画像認識
報酬が見合うときだけ質問する:コストを考慮したオープンエンド対話によるインスタンス目標ナビゲーション
インスタンス目標ナビゲーションにおいて、曖昧な指示を解決するためのオラクルへの質問コストを考慮し、情報利得に基づいて質問タイプと重みを学習し、効率的な対話ナビゲーションを実現する手法を提案した論文。
原題: Ask When It Pays: Cost-Aware Open-Ended Interaction for Instance Goal Navigation / Xunyi Zhao, Sihao Lin, Gengze Zhou 他
日本語で読む → - 論文データセットAI
DeepSpeak-Agenticデータセット:人間と具現化AIエージェントの対話記録
人間と具現化AIエージェントの半構造化対話を37時間以上収録したビデオデータセットを構築し、AIエージェントの自動フォレンジック識別や人間とエージェントの相互作用の分析に活用する。
原題: The DeepSpeak-Agentic Dataset / Sarah Barrington, Maty Bohacek, Hany Farid
日本語で読む → - 論文VLA画像認識
シーンへのダイブ:焦点プラン生成による視覚言語意思決定における知覚ボトルネックの打破
ロボット操作やナビゲーションなどの視覚言語意思決定タスクにおいて、VLMとVLAの知覚ボトルネック(視覚的幻覚)を軽減するため、粗から精への焦点プラン生成法SceneDiverを提案した。
原題: Dive into the Scene: Breaking the Perceptual Bottleneck in Vision-Language Decision Making via Focus Plan Generation / Boyuan Xiao, Bohong Chen, Yumeng Li 他
日本語で読む → - 論文操作学習ロボティクス
静かな操作失敗はどの程度見えるか?シミュレーションロボットエピソードにおける偽成功検出の観測可能性研究
模倣学習のロボット操作において、成功と誤判定されたエピソード(偽成功)が、関節データのみでどれだけ検出可能か、視覚情報がどの程度必要かをシミュレーションで調査した。
原題: How Visible Are Silent Manipulation Failures? An Observability Study of False-Success Detection in Simulated Robot Episodes / Aarav Bedi
日本語で読む → - 論文誤情報検出画像認識
見ることが信じることではない ― 検索基盤型動画誤情報検出のベンチマーク
動画の誤情報を検出するため、ウェブ検索で関連動画を探し比較するベンチマークEVID-Benchを構築し、最先端モデルの性能が低いことを示した。
原題: When Seeing Is Not Believing -- A Benchmark for Search-Grounded Video Misinformation Detection / Tao Yu, Yujia Yang, Shenghua Chai 他
日本語で読む → - 論文ニューラルレンダリング画像認識
MLPスプラッティング:オブジェクト中心のニューラルフィールド
少数の表現力豊かな光場プリミティブを用いてシーンを分解し、フォトリアリスティックな新規視点合成を実現する手法を提案。各プリミティブは局所的なMLPで表現され、RGBのみの教師信号で学習され、オブジェクト単位の編集が可能。
原題: MLP Splatting: Object-Centric Neural Fields / Shinjeong Kim, Yuzhou Cheng, Xin Kong 他
日本語で読む → - 論文変形物操作/模倣学習ロボティクス
Instant-Fold: 変形物操作のための文脈内模倣学習
単一の人間デモから変形物の多様な操作モードを推論・実行する文脈内模倣学習フレームワークを提案し、シミュレーションのみで訓練し実世界へゼロショット転移する。
原題: Instant-Fold: In-Context Imitation Learning for Deformable Object Manipulation / Yilong Wang, Cheng Qian, Edward Johns
日本語で読む → - 論文最適化機械学習
WMLLM: 予測してから行動する世界モデルによる自己進化型最適化エージェント
大規模言語モデルを用いて、ブラックボックス最適化の探索効率を高める自己進化型エージェントフレームワークを提案した。候補生成前に有望な方向を予測する世界モデルを組み込み、分子最適化などで高い性能を示した。
原題: WMLLM: Self-Evolving Optimization Agents via Predict-Then-Act World Modeling / Zhongzheng Li, Qingsong Ran, Shikun Feng 他
日本語で読む → - 論文群制御ロボティクス
角度剛性に基づくマルチロボットの方位のみを用いた姿勢推定
本論文は、時間変動するマルチロボットシステムにおいて、各ロボットの姿勢(向き)を知らなくても、ボディフレーム内の方位から計算した角度を用いて位置を推定し、その後、姿勢を復元する分散型推定器を提案している。
原題: Multi-Robot Bearing-only Pose Estimation via Angle Rigidity / J. Francisco Presenza, Leonardo J. Colombo, Ignacio Mas 他
日本語で読む → - 論文LLM計画機械学習
教師あり微調整されたLLMプランナーにおける世界モデル回復の詳細な考察
教師あり微調整がLLMの計画能力を向上させる一方で、モデルが計画問題の世界モデルを内部表現として獲得しているかを解釈可能性実験で検証した論文。
原題: A Close Look At World Model Recovery In Supervised Fine-Tuned LLM Planners / Patrick Emami, Nan Qiang, Peter Graf
日本語で読む → - 論文ナビゲーション画像認識
EvoMemNav: ゼロショット具現化ナビゲーションのための自己進化型高精細メモリ
観測を細粒度で保持する視覚意味メモリグラフを構築し、予算制約付き粗密探索とサブタスク後のリフレクションによるメモリ更新で、ゼロショットの具現化ナビゲーション性能を向上させた。
原題: EvoMemNav: Efficient Self-Evolving Fine-Grained Memory for Zero-Shot Embodied Navigation / Zuhao Ge, Xiaosong Jia, Chao Wu 他
日本語で読む → - 論文計画/LLM/シミュレーションロボティクス
PerceptTwin: 反復LLM計画と検証のための意味的シーン再構築
ロボットの知覚スタックが生成する意味的シーン表現から、対話型シミュレーションを自動構築するパイプラインを提案。LLMプランナーの計画検証・改善に活用し、成功率を平均約39%向上させた。
原題: PerceptTwin: Semantic Scene Reconstruction for Iterative LLM Planning and Verification / Charlie Gauthier, Sacha Morin, Liam Paull
日本語で読む → - 論文強化学習/ドローン着陸ロボティクス
PerchRL: 高速・不規則運動する傾斜プラットフォームへの視覚ベース俊敏着陸
クアッドローターが高速で不規則に動く傾斜プラットフォームへ視覚のみで着陸する強化学習フレームワークを提案。状態ベース事前学習と視覚ベース微調整の二段階学習と、視覚喪失への頑健性向上手法により、シミュレーションと実機で有効性を実証した。
原題: PerchRL: Vision-Based Agile Perching on Inclined Platforms under Rapid and Irregular Motion / Zihong Lu, Zongzhuo Liu, Huaxu Li 他
日本語で読む → - 論文移動操作ロボティクス
SplitAdapter: 負荷を考慮したヒューマノイド移動操作の因子分解適応
物体の重さや持ち上げ高さの変化に頑健なヒューマノイドの移動操作を実現するため、事前学習済みポリシーを拡張し、負荷と動力学の文脈を分離して適応する手法を提案した。シミュレーションと実機で重い負荷条件下での成功率を向上させた。
原題: SplitAdapter: Load-Aware Humanoid Loco-Manipulation via Factorized Adaptation / Jeonguk Kang, Hanbyel Cho, Sanghyun Kang 他
日本語で読む → - 論文探索/プランニングロボティクス
雑然環境におけるMAVを用いた意味的ターゲット探索と探査
この論文は、MAV(小型無人航空機)が雑然とした3D環境でターゲットを効率的に見つけるための、意味情報を活用した視点プランナーを提案しています。
原題: STEM: Semantic Target Search and Exploration using MAVs in Cluttered Environments / Nikhil Sethi, Max Lodel, Laura Ferranti 他
日本語で読む → - 論文アクチュエータロボティクス
自転車シミュレータのリーン動作に適用した直並列統合非線形弾性アクチュエータ
単一の弾性要素が直列と並列の両方の役割を同時に果たす新しいアクチュエータSPINEAを提案し、高トルクと精密な力制御を両立させて、ハプティック自転車シミュレータのリーン動作に応用した。
原題: Series-Parallel Integrated Nonlinear Elastic Actuator applied to the lean motion of a bicycle simulator / Christina Kohler, Michiel Plooij, Nuria Peña-Perez 他
日本語で読む → - 論文外骨格制御ロボティクス
多タスク外骨格制御における相互作用安全性の確保:シミュレーション学習による可変インピーダンスフレームワーク
シミュレーションで学習した可変インピーダンス制御により、多様な動作タスクで外骨格の安全性を保証しつつ、代謝コストを低減する手法を提案した。
原題: Ensuring Interaction Safety in Multitask Exoskeleton Control: A Simulation-Trained Variable Impedance Framework / Muyuan Ma, Houcheng Li, Haotian Zhai 他
日本語で読む → - 論文ナビゲーションロボティクス
ロボットナビゲーションのアフォーダンスに基づく説明のためのオントロジー誘導推論
ロボットの経路が塞がれた際に、周囲の物体のアフォーダンスと状態変化をオントロジーで表現し、仮説的な変化を評価することで、意味的に根拠付けられかつ実行可能な説明を生成する手法を提案した。
原題: Ontology-Guided Reasoning for Affordance-Based Explanations of Robot Navigation / Amar Halilovic, Vahidin Hasic, Senka Krivic
日本語で読む → - 論文報酬モデルロボティクス
主張:優れた具現化報酬モデルには悪い行動データが必要
成功行動のみで訓練された具現化報酬モデルは、人間が評価すると罰するような危険・不完全な行動を過剰に報酬としてしまう。悪いロボットデータの不足が原因であり、悪いデータを少し加えるだけで人間の好みとの整合性が向上することを示し、悪いデータの収集・公開を提言する。
原題: Position: Good Embodied Reward Models Need Bad Behavior Data / Ran Tian, Yilin Wu, Andrea Bajcsy
日本語で読む → - 論文VLA/人間ロボット協調ロボティクス
協調的VLAによる暗黙的人間ロボット協調の学習支援
模倣学習で訓練したVLAモデルが人間とロボットの協調操作を支援できることを示し、動作チャンクの漏れによる早すぎる支援行動を防ぐ推論時ステアリング手法を提案した。
原題: Learning to Assist: Collaborative VLAs for Implicit Human-Robot Collaboration / Leo Xu, Letian Li, Alex Cuellar 他
日本語で読む → - 論文VLMナビゲーション画像認識
Goal2Pixel: ナビゲーション目標をピクセルに接地する視覚言語ナビゲーション
視覚言語ナビゲーションを、行動予測ではなく画像平面上のナビゲーション可能なピクセル接地として再定式化し、VLMの推論回数を大幅に削減しつつ高性能を達成した。
原題: Goal2Pixel: Grounding Goals to Pixels for Vision-Language Navigation / Muyi Bao, Yuxin Cai, Hang Xu 他
日本語で読む → - 論文シミュレーションロボティクス
MuJoCo-Drones-Gym: GPU加速によるマルチドローン制御・強化学習シミュレータ
MuJoCo物理エンジン上に構築された、多数のドローンを扱えるGymnasium互換のシミュレータを提案し、物理モデルや行動・観測インターフェースを柔軟に選択可能にした。
原題: MuJoCo-Drones-Gym: A GPU-Accelerated Multi-Drone Simulator for Control and Reinforcement Learning / Manan Tayal
日本語で読む → - 論文動作計画ロボティクス
動的環境における動作計画:古典的手法から現代的手法までのサーベイ
動的環境でのロボット動作計画手法を、古典的手法から学習ベース手法まで138件の研究を対象に包括的に調査・分類し、各手法の原理と課題を整理したサーベイ論文。
原題: Motion Planning in Dynamic Environments: A Survey from Classical to Modern Methods / Zongyuan Shen, Yaming Ou, Shalabh Gupta 他
日本語で読む → - 論文シミュレーションロボティクス
羽ばたき飛行体のためのシミュレーションプラットフォーム
羽ばたき飛行体の自律性開発を目的に、乱流やセンサノイズを高忠実に再現するUnityベースのシミュレーションフレームワークFWAV-Simを提案した。
原題: A Simulation Platform for Flapping-Wing Vehicles / Haichuan Li, Tomi Westerlund
日本語で読む → - 論文マニピュレーションロボティクス
Trans2Occ: 透明物体のボクセル占有推定と把持 - シミュレーションから実世界へ
単一RGB画像から透明物体のボクセル占有を直接予測し、シミュレーションで大規模学習したモデルを実ロボットに微調整なしで適用して把持を実現する枠組みを提案した。
原題: Trans2Occ: Voxel Occupancy Estimation and Grasp for Transparent Objects from Simulation to Reality / Yixuan Yang, Sha Zhang, Rui Li 他
日本語で読む → - 論文変形物体操作ロボティクス
DLO-Lab: 微分可能物理を用いた変形線状物体操作のベンチマーク
ロープやケーブルなどの変形線状物体(DLO)の操作を学習・評価するための、多様な材料特性を扱える微分可能シミュレータとベンチマークタスク群を提案した論文。
原題: DLO-Lab: Benchmarking Deformable Linear Object Manipulations with Differentiable Physics / Junyi Cao, Yian Wang, Ziyan Xiong 他
日本語で読む → - 論文LiDARクラスタリングロボティクス
C-ARC: 非反復型LiDARセンサのための連続適応レンジクラスタリング
非反復型LiDARセンサの特性に合わせたリアルタイムクラスタリング手法を提案し、スライディングウィンドウと適応グリッド解像度により高周波の点群挿入とクラスタ取得を分離した。
原題: C-ARC: Continuous-Adaptive Range Clustering for Non-Repetitive LiDAR Sensors / Nick B. Schroeder, Jonathan Lichtenfeld, Oskar von Stryk
日本語で読む → - 論文VLAロボティクス
GeoSem-WAM: 幾何・意味を考慮した世界行動モデル
将来のRGB予測に加えて、幾何と意味の予測を補助タスクとして導入し、ロボットの行動決定に有効な潜在表現を学習する世界モデルを提案した。
原題: GeoSem-WAM: Geometry- and Semantic-Aware World Action Models / Fulong Ma, Daojie Peng, Wenjun Yue 他
日本語で読む → - 論文自動運転ロボティクス
混在交通環境における不確実性を考慮した自動運転の動作計画
自動運転車と人間運転車が混在する環境で、人間の意図予測の不確実性を考慮した安全な動作計画手法UAMPを提案した。
原題: Uncertainty-Aware Motion Planning for Autonomous Driving in Mixed Traffic Environment / Ming Cheng, Hao Chen, Ziyi Yang 他
日本語で読む →