論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/8/29 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文BCI/ロボット制御ロボティクス
脳-言語-行動(BLA)モデル:ロボット制御のための言語条件付き脳波
脳波信号を直接分類する代わりに、言語指示で脳状態の解釈を条件付け、少数の脳状態から多様なロボット動作を生成するフレームワークを提案。ドローン制御で実証し、高い精度を達成。
原題: Brain-Language-Action (BLA) Models: Language-Conditioned EEG for Robotics Control / Alexandr Plashchinsky
日本語で読む → - 論文物体検出画像認識
背景フリー物体性学習によるクラス非依存検出
未ラベル領域を背景として扱わず、物体中心とスケールの密なフィールドを学習することで、クラス非依存の物体検出を実現する手法を提案した。
原題: Background-Free Objectness Learning for Class-Agnostic Detection / Dania Batool, Liliana Lo Presti, Marco La Cascia 他
日本語で読む → - 論文群制御機械学習
乗数コンセンサス不要な完全分散型GNEアルゴリズムによるマルチロボット配置
共有線形等式制約を持つ一般化ナッシュ均衡問題に対し、ラグランジュ乗数の交換なしで任意のGNEに収束する完全分散連続時間アルゴリズムを提案し、マルチロボット配置タスクで検証した。
原題: Fully Distributed GNE Algorithms for Multi-Robot Placement without Consensus on Multipliers / Shao-An Yin, Mingyi Hong, Nicola Elia
日本語で読む → - 論文3D編集画像認識
Chat-Edit-3D++: 大規模言語モデルによる対話型3D・4Dシーン編集
大規模言語モデルを中心に対話で3D/4Dシーンを編集する手法を提案。2Dアトラス画像への変換で編集と再構成を分離し、多様な視覚ツールを自動的に呼び出す。
原題: Chat-Edit-3D++: Interactive 3D and 4D Scene Editing via Large Language Models / Shuangkang Fang, Yufeng Wang, Yi-Hsuan Tsai 他
日本語で読む → - 論文ワールドモデル機械学習
潜在計画は点群でも生き残るか?幾何学的観測のための行動条件付きJEPAワールドモデル
画像ベースのJEPAワールドモデルを点群観測に拡張し、潜在空間での計画が機能することを示した。特に、分布事前モデルが画像ベースと同等の性能を達成し、行動感応モデルが最も動きの多いシーンで最強の結果を得た。
原題: Does Latent Planning Survive Point Clouds? Action-Conditioned JEPA World Models for Geometric Observations / Fabio F. Oberweger, Michael Schwingshackl
日本語で読む → - 論文水中認識画像認識
前方視ソナーと3Dソナーのキャリブレーションと比較分析による水中物体認識の向上
2D画像を生成する前方視ソナーと3D点群を生成する3Dソナーを組み合わせ、自動キャリブレーションとノイズフィルタリングにより特徴抽出を大幅に改善した。
原題: Calibration and Comparative Analysis of Forward-Looking Sonar and 3D Sonar for Enhanced Underwater Object Recognition / Aditya Penumarti, Khanh Dong, Zi-Hao Zhang 他
日本語で読む → - 論文テレプレゼンスHCI
Feelium: 触れることができる飛行船型テレプレゼンスボディ
飛行船型のテレプレゼンスプラットフォームを提案し、遠隔者がVRで飛行船を操作し、現地の人がその膨らんだ表面に触れることで触覚インタラクションを実現する。
原題: Feelium: A Touchable Blimp Body for Aerial Telepresence / George Xi Wang, Henghao Li, Shan Lin 他
日本語で読む → - 論文VLA/動作生成ロボティクス
SMILE: 長期的VLA実行のための滑らかな動作生成
VLAモデルの長期的な動作実行精度を向上させるため、Bスプライン係数を予測して滑らかな動作列を生成する手法SMILEを提案。複数のベースラインに適用し、精度と推論効率を改善。
原題: SMILE: Smooth Motion for Improved Long-Horizon VLA Execution / Jongwoo Park, E-Ro Nguyen, Kanchana Ranasinghe 他
日本語で読む → - 論文軌道計画ロボティクス
マルチモーダル経路から実行可能な軌道へ:4WISロボットのための軌道計画フレームワーク
4輪独立操舵ロボットの多様な動作モードを活用するため、モード拡張フロントエンド探索とモード一貫セグメント軌道最適化を組み合わせた軌道計画フレームワークを提案した。
原題: From Multi-Modal Paths to Executable Trajectories: A Trajectory Planning Framework for 4WIS Robots / Runjiao Bao, Lin Zhang, Yongkang Xu 他
日本語で読む → - 論文遠隔操作ロボティクス
ロボットの中のGHOST: 搭載カメラによる実時間・外心視点の双腕ロボットVR遠隔操作
単一のオペレータが2台の移動マニピュレータを直接低レベルコマンドで遠隔操作できるオープンソースのVRシステムを提案し、学習ベースの点群補完で空間認識を向上させた。
原題: GHOST in the Robots: Real-Time Exocentric Dual-Robot VR Teleoperation from Onboard Cameras / Yichen Wei, Faisal Zaghloul, Soujanya C Aryal 他
日本語で読む → - 論文敵対的攻撃画像認識
テキスト誘導拡散モデルによる胸部X線画像への敵対的攻撃
胸部X線画像の分類モデルに対する、テキスト条件を最適化する拡散ベースの敵対的攻撃手法を提案し、既存の画素操作攻撃よりも高い攻撃成功率と画像品質を実現した。
原題: Text-Guided Diffusion-Based Adversarial Attacks on Chest X-Ray Images / Basudha Pal, Arjun Narayanan, Neha Ajith 他
日本語で読む → - 論文VLAロボティクス
DREAM: 実世界からシミュレーションへの変換による展開時デモ生成でスケーラブルなポリシー適応を実現
新しい作業環境でVLAモデルを微調整するためのデモデータを、人間の遠隔操作なしに自動生成するフレームワークDREAMを提案。実環境を再構築し、言語指示からタスク目標を自動翻訳して軌道を計画し、シミュレーションでデータを増強してVLAを微調整する。
原題: DREAM: Deployment-Time Demonstration Generation via Real-to-Sim for Scalable Policy Adaptation / Makoto Sato, Tatsuya Matsushima, Yutaka Matsuo 他
日本語で読む → - 論文シミュレーションロボティクス
Agri-Sim: 温室ロボティクスにおける具現化知能評価のための農業シミュレーションプラットフォーム
温室環境での農業ロボット開発を支援するため、UnityとROS2を統合したシミュレーションプラットフォームを構築し、自律ナビゲーションと双腕トマト収穫の閉ループ評価を実証した。
原題: Agri-Sim: Agricultural Simulation Platform for Embodied Intelligence Evaluation in Greenhouse Robotics / Shuhan Shi, Zhenfeng Xue, Minghao Mei 他
日本語で読む → - 論文VLAロボティクス
視覚エンコーダから言語モデルを解放する:小型言語モデルのための知覚インターフェースとしての意味直列化
視覚情報を言語モデルに入れず、知覚スタックの出力を決定に沿ったテキストに変換してテキスト専用LLMに回答させる手法を提案し、同規模のVLMより高い性能を示した。
原題: Free the Language Model From the Vision Encoder: Semantic Serialization as a Perception Interface for Small Language Models / Cong Xu, Ravi Sankar
日本語で読む → - 論文世界モデル機械学習
Flow-JEPA: フローマッチングによるJEPA世界モデルの堅牢な潜在ダイナミクス
JEPA世界モデルの決定論的予測を条件付きフローマッチングに置き換え、ノイズ下での堅牢性と成功率を向上させた。
原題: Flow-JEPA: Flow Matching for Robust Latent Dynamics in JEPA World Models / Yanchen Huo, Ziying Song, Yadan Luo
日本語で読む → - 論文自動運転/省エネルギー/認識ロボティクス
意味を重視したメモリインターフェース符号化による自動運転の省エネルギー認識
自動運転車のカメラ画像をメモリに書き込む際のエネルギー消費を、画像の意味的重要度に基づいて削減する符号化手法を提案した。歩行者などの重要領域を保護しつつ、背景の精度を下げることで、認識性能を保ちながらメモリインターフェースのエネルギーを約36%削減する。
原題: Coding What Matters: A Semantic-Aware Memory Interface for Energy-Efficient Perception in Autonomous Vehicles / Haohua Que, Handong Yao
日本語で読む → - 論文ナビゲーションロボティクス
Hydra: 離散潜在プランニングと連続フローマッチング実行を備えたナビゲーション世界行動モデル
世界モデルを用いたロボットナビゲーションのリアルタイム制御を実現するため、プランナーをモデル内部に統合し、離散潜在空間でのプランニングと連続軌道生成を組み合わせたHydraを提案した。
原題: Hydra: A Navigation World Action Model with Discrete Latent Planning and Continuous Flow-Matching Execution / Mohammad Nazeri, Alexandyr Card, Samira Huber 他
日本語で読む → - 論文共有自律ロボティクス
AUV運用における共有自律のための認知アーキテクチャ
オペレータの状況認識向上と負荷軽減のため、オントロジーと複数の大規模言語モデルを組み合わせた認知アーキテクチャを提案し、ミッションの実現可能性評価、計画、実行を支援する。
原題: A Cognitive Architecture for Shared Autonomy in AUV Operations / Niamh Ellis, Thi Tran, Ignacio Carlucho 他
日本語で読む → - 論文構造最適化ロボティクス
ひずみエネルギー分布最適化に基づくロボットの体系的な軽量化手法
ロボットの軽量化を目的に、ひずみエネルギー密度を均一化するという基準に基づき、システム全体の最適化を部品ごとの最適化に分解する手法を提案した。ロボットアームの例で有効性を示した。
原題: Systematic Lightweight Method for Robotics Based on Strain Energy Distribution Optimization / Jingchen Li
日本語で読む → - 論文探索計画ロボティクス
意味的ガイド付き探索:画像空間ウェイポイントサンプリングによる非構造環境の探索
地上車両向けの探索フレームワークで、ピクセル単位の意味セグメンテーションをウェイポイント選択と経路最適化に統合し、地形の走行可能性や障害物、関心対象を考慮した意味的効用関数で探索目標を評価する。シミュレーションと実環境で性能を検証した。
原題: SGE: Semantically-Guided Exploration for Unstructured Environments via Image-Space Waypoint Sampling / Christopher Tatsch, Yu Gu
日本語で読む → - 論文Human-Robot Collaborationロボティクス
誤った例を用いたロボットポリシーの人間への教授法
本論文は、教育分野で効果が知られる「誤った例」を用いてロボットの行動ポリシーを人間に教える手法を提案し、ユーザー実験によりその有効性を示した。
原題: Teaching Robot Policies to Humans Using Erroneous Examples / Rithika Narayan, Suresh Kumaar Jayaraman, Henny Admoni
日本語で読む → - 論文VLAロボティクス
AdaVLA: 適応的ステップフローマッチングによる視覚言語行動モデルの学習不要高速化
フローマッチングに基づく視覚言語行動モデルの推論を、学習なしで適応的に高速化するフレームワークを提案。軌道曲率から生成信頼度を測り、ステップ数削減とMLP枝刈りを動的に調整する。
原題: AdaVLA: Adaptive Step Flow Matching for Training-free Acceleration of Vision-Language-Action Models / Sunghwan Han, Youngtae Han, Youngmin Yi
日本語で読む → - 論文強化学習機械学習
PathBridger: オフライン目標条件付き強化学習のためのサブゴール橋渡し
オフライン目標条件付き強化学習において、サブゴール選択と短期実行を明示的に橋渡しする階層的手法を提案し、多物体操作タスクで大きな性能向上を達成した。
原題: PathBridger: Subgoal Bridges for Offline Goal-Conditioned Reinforcement Learning / Soohyun Choi, Seonvin Cho, Songnam Hong
日本語で読む → - 論文ナビゲーションロボティクス
CGFM-Nav: 意味ガイド型生涯マルチモーダル具現化ナビゲーションのための認知グラフフィールドメモリ
視覚言語ナビゲーションのための、明示的な関係メモリと連続的な空間直感を組み合わせた永続的なマルチモーダルシーン表現を提案し、目標検索と探索ガイダンスを統合したフレームワークを構築した。
原題: CGFM-Nav: Cognitive Graph-Field Memory for Semantic-Guided Lifelong Multimodal Embodied Navigation / Yuxiang Xiao, Xibei Chen, Xin Zhou 他
日本語で読む → - 論文自動運転ロボティクス
カメラのみのエンドツーエンド運転のための劣化耐性ベンチマーク
カメラのみのエンドツーエンド運転モデルに対する画像劣化耐性を評価するベンチマークDriveDegradeを提案し、16種類の劣化を5段階で注入して計画性能への影響を分析した。
原題: A Degradation-Tolerance Benchmark for Camera-Only End-to-End Driving / Haohua Que, Handong Yao
日本語で読む → - 論文マニピュレーションロボティクス
Aero Hand Open: 器用な操作学習のためのシミュレーション対応腱駆動ハンド
腱駆動の擬人化ハンドをシミュレーションで学習可能にし、実機で微調整なしで動作させるための設計、シミュレーションモデル、アクチュエーションマップ、強化学習パッケージを公開した。
原題: Aero Hand Open: A Simulation-Ready Tendon-Driven Hand for Dexterous Manipulation Learning / Nan Wang, Mohit Yadav, Jonathan Wulff 他
日本語で読む → - 論文タスク仕様ロボティクス
人間の自己制約推論に基づくロボットタスク仕様のための線形時相論理変換
自然言語のロボット指示を線形時相論理(LTL)に変換する際、構造的知識をモデル内部に組み込む自己制約推論(SCR)フレームワークを提案し、制約充足と汎化性能を向上させた。
原題: Linear Temporal Logic Translation via Human-Inspired Self-Constrained Reasoning for Robot Task Specification / Haofei Hou, Fanxu Meng, Shunyi Zhao 他
日本語で読む → - 論文動画予測AI
AcrossVAM1.0: テキスト支援ロボット動画予測のための粒子世界モデリング
ロボットの将来フレーム予測を、物体中心の動きと高周波の外観に分解し、軽量なTransformerと粒子表現で実現するモデルを提案した。
原題: AcrossVAM1.0: Particle World Modeling for Text-Assisted Robot Video Prediction / Yafei Zhang, Nan Wu
日本語で読む → - 論文剛体運動補間ロボティクス
剛体運動のDual Park-Ravani補間:加速度場の連続性とホロノミック・エルミート修復
Park-Ravani補間を直交双対テンソル群に拡張し、剛体姿勢と速度・加速度の連続性を保証する手法を提案。さらに、非ホロノミックな欠陥を双対対数座標でのエルミート補間により修復する。
原題: Dual Park-Ravani Interpolation of Rigid Motions: Acceleration-Field Continuity and Holonomic Hermite Repair / Daniel Condurache
日本語で読む → - 論文クラウドロボティクス/無線リソース管理制御
LUCID: デジタルツイン・イン・ザ・ループによるQoS保証ロボット制御のためのエージェント型AIフレームワーク
クラウドロボティクスにおける軌道計画と無線リソース管理を、LLMエージェントが動的に最適化問題として再構成するフレームワークを提案。大規模シーンを無線対応デジタルツインに変換し、QoS違反を回避する。
原題: LUCID: An Agentic AI Framework on Digital-Twin in the Loop for QoS-Guaranteeing Robotic Control / Hyeonsu Lyu, Minwoo Kim, Sehyun Ryu 他
日本語で読む →