論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/8/29 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文VLAロボティクス
AdaVLA: 適応的ステップフローマッチングによる視覚言語行動モデルの学習不要高速化
フローマッチングに基づく視覚言語行動モデルの推論を、学習なしで適応的に高速化するフレームワークを提案。軌道曲率から生成信頼度を測り、ステップ数削減とMLP枝刈りを動的に調整する。
原題: AdaVLA: Adaptive Step Flow Matching for Training-free Acceleration of Vision-Language-Action Models / Sunghwan Han, Youngtae Han, Youngmin Yi
日本語で読む → - 論文農業ロボット画像認識
AGRICAM: トラック搭載型作物受粉モニタリングロボット
商業規模の受粉モニタリングを目的とした、低コストのレール上を自律走行するロボットシステムを開発し、ブルーベリー農場で実証した。
原題: AGRICAM: A Track-Mounted Crop Pollination Monitoring Robot / Malika Nisal Ratnayake, Adel N. Toosi, James Cook 他
日本語で読む → - 論文物体検出画像認識
背景フリー物体性学習によるクラス非依存検出
未ラベル領域を背景として扱わず、物体中心とスケールの密なフィールドを学習することで、クラス非依存の物体検出を実現する手法を提案した。
原題: Background-Free Objectness Learning for Class-Agnostic Detection / Dania Batool, Liliana Lo Presti, Marco La Cascia 他
日本語で読む → - 論文VLAロボティクス
DREAM: 実世界からシミュレーションへの変換による展開時デモ生成でスケーラブルなポリシー適応を実現
新しい作業環境でVLAモデルを微調整するためのデモデータを、人間の遠隔操作なしに自動生成するフレームワークDREAMを提案。実環境を再構築し、言語指示からタスク目標を自動翻訳して軌道を計画し、シミュレーションでデータを増強してVLAを微調整する。
原題: DREAM: Deployment-Time Demonstration Generation via Real-to-Sim for Scalable Policy Adaptation / Makoto Sato, Tatsuya Matsushima, Yutaka Matsuo 他
日本語で読む → - 論文遠隔操作ロボティクス
ロボットの中のGHOST: 搭載カメラによる実時間・外心視点の双腕ロボットVR遠隔操作
単一のオペレータが2台の移動マニピュレータを直接低レベルコマンドで遠隔操作できるオープンソースのVRシステムを提案し、学習ベースの点群補完で空間認識を向上させた。
原題: GHOST in the Robots: Real-Time Exocentric Dual-Robot VR Teleoperation from Onboard Cameras / Yichen Wei, Faisal Zaghloul, Soujanya C Aryal 他
日本語で読む → - 論文3D編集画像認識
Chat-Edit-3D++: 大規模言語モデルによる対話型3D・4Dシーン編集
大規模言語モデルを中心に対話で3D/4Dシーンを編集する手法を提案。2Dアトラス画像への変換で編集と再構成を分離し、多様な視覚ツールを自動的に呼び出す。
原題: Chat-Edit-3D++: Interactive 3D and 4D Scene Editing via Large Language Models / Shuangkang Fang, Yufeng Wang, Yi-Hsuan Tsai 他
日本語で読む → - 論文ワールドモデル機械学習
潜在計画は点群でも生き残るか?幾何学的観測のための行動条件付きJEPAワールドモデル
画像ベースのJEPAワールドモデルを点群観測に拡張し、潜在空間での計画が機能することを示した。特に、分布事前モデルが画像ベースと同等の性能を達成し、行動感応モデルが最も動きの多いシーンで最強の結果を得た。
原題: Does Latent Planning Survive Point Clouds? Action-Conditioned JEPA World Models for Geometric Observations / Fabio F. Oberweger, Michael Schwingshackl
日本語で読む → - 論文水中認識画像認識
前方視ソナーと3Dソナーのキャリブレーションと比較分析による水中物体認識の向上
2D画像を生成する前方視ソナーと3D点群を生成する3Dソナーを組み合わせ、自動キャリブレーションとノイズフィルタリングにより特徴抽出を大幅に改善した。
原題: Calibration and Comparative Analysis of Forward-Looking Sonar and 3D Sonar for Enhanced Underwater Object Recognition / Aditya Penumarti, Khanh Dong, Zi-Hao Zhang 他
日本語で読む → - 論文群制御機械学習
乗数コンセンサス不要な完全分散型GNEアルゴリズムによるマルチロボット配置
共有線形等式制約を持つ一般化ナッシュ均衡問題に対し、ラグランジュ乗数の交換なしで任意のGNEに収束する完全分散連続時間アルゴリズムを提案し、マルチロボット配置タスクで検証した。
原題: Fully Distributed GNE Algorithms for Multi-Robot Placement without Consensus on Multipliers / Shao-An Yin, Mingyi Hong, Nicola Elia
日本語で読む → - 論文世界モデル/操作ロボティクス
AnyWorld: 因子分解された自己中心的世界モデルによるクロス身体汎化
人間の単一インタラクション動画を、ロボット固有の多様なロールアウトに拡張する世界モデルフレームワークを提案。行動・カメラ・身体の因子に分解し、身体・視点・シーンの再構成を可能にする。
原題: AnyWorld: Factorized Egocentric World Models for Cross-Embodiment Generalization / Cheng Chen, Jerry Bai, Jiacheng Wei 他
日本語で読む → - 論文テレプレゼンスHCI
Feelium: 触れることができる飛行船型テレプレゼンスボディ
飛行船型のテレプレゼンスプラットフォームを提案し、遠隔者がVRで飛行船を操作し、現地の人がその膨らんだ表面に触れることで触覚インタラクションを実現する。
原題: Feelium: A Touchable Blimp Body for Aerial Telepresence / George Xi Wang, Henghao Li, Shan Lin 他
日本語で読む → - 論文VLA/動作生成ロボティクス
SMILE: 長期的VLA実行のための滑らかな動作生成
VLAモデルの長期的な動作実行精度を向上させるため、Bスプライン係数を予測して滑らかな動作列を生成する手法SMILEを提案。複数のベースラインに適用し、精度と推論効率を改善。
原題: SMILE: Smooth Motion for Improved Long-Horizon VLA Execution / Jongwoo Park, E-Ro Nguyen, Kanchana Ranasinghe 他
日本語で読む → - 論文軌道計画ロボティクス
マルチモーダル経路から実行可能な軌道へ:4WISロボットのための軌道計画フレームワーク
4輪独立操舵ロボットの多様な動作モードを活用するため、モード拡張フロントエンド探索とモード一貫セグメント軌道最適化を組み合わせた軌道計画フレームワークを提案した。
原題: From Multi-Modal Paths to Executable Trajectories: A Trajectory Planning Framework for 4WIS Robots / Runjiao Bao, Lin Zhang, Yongkang Xu 他
日本語で読む → - 論文ナビゲーションロボティクス
Hydra: 離散潜在プランニングと連続フローマッチング実行を備えたナビゲーション世界行動モデル
世界モデルを用いたロボットナビゲーションのリアルタイム制御を実現するため、プランナーをモデル内部に統合し、離散潜在空間でのプランニングと連続軌道生成を組み合わせたHydraを提案した。
原題: Hydra: A Navigation World Action Model with Discrete Latent Planning and Continuous Flow-Matching Execution / Mohammad Nazeri, Alexandyr Card, Samira Huber 他
日本語で読む → - 論文シミュレーションロボティクス
Agri-Sim: 温室ロボティクスにおける具現化知能評価のための農業シミュレーションプラットフォーム
温室環境での農業ロボット開発を支援するため、UnityとROS2を統合したシミュレーションプラットフォームを構築し、自律ナビゲーションと双腕トマト収穫の閉ループ評価を実証した。
原題: Agri-Sim: Agricultural Simulation Platform for Embodied Intelligence Evaluation in Greenhouse Robotics / Shuhan Shi, Zhenfeng Xue, Minghao Mei 他
日本語で読む → - 論文自動運転/省エネルギー/認識ロボティクス
意味を重視したメモリインターフェース符号化による自動運転の省エネルギー認識
自動運転車のカメラ画像をメモリに書き込む際のエネルギー消費を、画像の意味的重要度に基づいて削減する符号化手法を提案した。歩行者などの重要領域を保護しつつ、背景の精度を下げることで、認識性能を保ちながらメモリインターフェースのエネルギーを約36%削減する。
原題: Coding What Matters: A Semantic-Aware Memory Interface for Energy-Efficient Perception in Autonomous Vehicles / Haohua Que, Handong Yao
日本語で読む → - 論文VLAロボティクス
視覚エンコーダから言語モデルを解放する:小型言語モデルのための知覚インターフェースとしての意味直列化
視覚情報を言語モデルに入れず、知覚スタックの出力を決定に沿ったテキストに変換してテキスト専用LLMに回答させる手法を提案し、同規模のVLMより高い性能を示した。
原題: Free the Language Model From the Vision Encoder: Semantic Serialization as a Perception Interface for Small Language Models / Cong Xu, Ravi Sankar
日本語で読む → - 論文Human-Robot Collaborationロボティクス
誤った例を用いたロボットポリシーの人間への教授法
本論文は、教育分野で効果が知られる「誤った例」を用いてロボットの行動ポリシーを人間に教える手法を提案し、ユーザー実験によりその有効性を示した。
原題: Teaching Robot Policies to Humans Using Erroneous Examples / Rithika Narayan, Suresh Kumaar Jayaraman, Henny Admoni
日本語で読む → - 論文敵対的攻撃画像認識
テキスト誘導拡散モデルによる胸部X線画像への敵対的攻撃
胸部X線画像の分類モデルに対する、テキスト条件を最適化する拡散ベースの敵対的攻撃手法を提案し、既存の画素操作攻撃よりも高い攻撃成功率と画像品質を実現した。
原題: Text-Guided Diffusion-Based Adversarial Attacks on Chest X-Ray Images / Basudha Pal, Arjun Narayanan, Neha Ajith 他
日本語で読む → - 論文世界モデル評価ロボティクス
RoboPhys-3D: 3D再構成による包括的な具現化世界モデル評価
ロボット操作タスクのビデオ世界モデルを3D再構成に基づいて評価するベンチマークを提案し、生成ビデオの3Dシーン整合性とタスク実行可能性を測定する。
原題: RoboPhys-3D: A Comprehensive Embodied World Model Evaluation via 3D Reconstruction / Tianyi Wang, Jiazhou Chen, Yiming Xu 他
日本語で読む → - 論文マニピュレーションロボティクス
Aero Hand Open: 器用な操作学習のためのシミュレーション対応腱駆動ハンド
腱駆動の擬人化ハンドをシミュレーションで学習可能にし、実機で微調整なしで動作させるための設計、シミュレーションモデル、アクチュエーションマップ、強化学習パッケージを公開した。
原題: Aero Hand Open: A Simulation-Ready Tendon-Driven Hand for Dexterous Manipulation Learning / Nan Wang, Mohit Yadav, Jonathan Wulff 他
日本語で読む → - 論文VLAAI
CEDAR: 言語誘導型身体的行動のための検証可能なインターフェースとしてのオートマトン
自然言語の指示を正規言語として表現し、決定性有限オートマトンに変換することで、制約を検証可能な実行可能なオブジェクトとして扱うフレームワークを提案。Minecraftで時間的・空間的制約を維持し、LLMクエリを削減できることを示した。
原題: CEDAR: Automata as Verifiable Interfaces for Language-Guided Embodied Action / Lekai Chen, Alvaro Velasquez, Ashutosh Trivedi
日本語で読む → - 論文自動運転/制御ロボティクス
車両ドリフトの創発:境界探索学習モデル予測制御によるグリップ走行から限界域への連続的遷移
繰り返しラップタイム最小化タスクにおいて、明示的なドリフト参照なしに、学習モデル予測制御が安全集合と終端コストを更新しながら車両の横滑り角やヨーレートを徐々に拡大し、ドリフト走行が自律的に創発することを示した論文。
原題: Vehicle Drift Emergence: Continuous Evolution from Grip Driving to the Handling Limit via Boundary Exploration Learning Model Predictive Control / Sheng Zhao, Binh-Minh Nguyen, Hangyu Lu 他
日本語で読む → - 論文剛体運動補間ロボティクス
剛体運動のDual Park-Ravani補間:加速度場の連続性とホロノミック・エルミート修復
Park-Ravani補間を直交双対テンソル群に拡張し、剛体姿勢と速度・加速度の連続性を保証する手法を提案。さらに、非ホロノミックな欠陥を双対対数座標でのエルミート補間により修復する。
原題: Dual Park-Ravani Interpolation of Rigid Motions: Acceleration-Field Continuity and Holonomic Hermite Repair / Daniel Condurache
日本語で読む → - 論文マルチエージェント/ベンチマークロボティクス
CoCoBench: 具現化マルチエージェントタスク計画のための協調調整ベンチマーク
マルチエージェントの協調失敗を細かく診断できるベンチマークCoCoBenchを提案し、897の検証済みインスタンスで4種類の協調構造を評価する。
原題: CoCoBench: A Cooperative Coordination Benchmark for Embodied Multi-Agent Task Planning / Yang Chen, Ye-Xin Xie, Lirong Che 他
日本語で読む → - 論文動画予測AI
AcrossVAM1.0: テキスト支援ロボット動画予測のための粒子世界モデリング
ロボットの将来フレーム予測を、物体中心の動きと高周波の外観に分解し、軽量なTransformerと粒子表現で実現するモデルを提案した。
原題: AcrossVAM1.0: Particle World Modeling for Text-Assisted Robot Video Prediction / Yafei Zhang, Nan Wu
日本語で読む → - 論文自動運転/セキュリティロボティクス
自動運転車に対する敵対的キャリブレーション攻撃
自動運転車のカメラとLiDARのオンラインキャリブレーションを標的とした初の物理攻撃手法を提案し、単一の敵対的ポスターで誤検知を誘発しつつキャリブレーションを誤らせることで、物体検出や走行制御に深刻な影響を与えることを示した。
原題: Adversarial Calibration Attack on Autonomous Vehicles / Liangkai Liu, Qingzhao Zhang, Kang G. Shin
日本語で読む → - 論文惑星探査/認識画像認識
MANTLE: モジュラーアップリンク原理を用いた適応型惑星表面認識のためのフレームワーク
火星探査ローバーのための地形分類とボルダーセグメンテーションを同時に行うマルチタスクネットワークを提案。共有バックボーンを固定し、タスク特化ヘッドを地球で訓練してアップリンクするモジュラー設計が特徴。
原題: MANTLE: A Framework for Adaptive In-Situ Planetary Perception Using a Modular Uplink Principle / Pranav Durai, Gary Doran
日本語で読む → - 論文タスク計画ロボティクス
MaCoPlanner: LLM支援による手動コンパイル型タスク計画と能動的安全検証を備えた産業用パネル操作ロボット
産業用パネル操作ロボット向けに、機器マニュアルから知識をコンパイルし、計画生成前に安全制約を検証するタスク計画フレームワークを提案。独立評価で違反率2.7%を達成し、タスク成功率を大幅に向上させた。
原題: MaCoPlanner: LLM-Assisted Manual-Compiled Task Planning with Proactive Safety Verification for Robotic Industrial Panel Operation / Guipeng Xin, Jiahe Xua, Mohammad Deghat 他
日本語で読む → - 論文ナビゲーションロボティクス
STEGNav: 時空間イベントグラフ推論によるマルチモーダル生涯物体ナビゲーション
従来のシーングラフを時空間イベントグラフに拡張し、VLMベースのエージェントが目標物体と探索フロンティアを統合的に推論する訓練不要のナビゲーションフレームワークを提案した。
原題: STEGNav: Spatio-Temporal Event Graph Reasoning for Multimodal Lifelong Object Navigation / Yang Chen, Zhenyu Huang, Wenbo Fu 他
日本語で読む →