論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/8/31 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文ソフトロボティクス/強化学習ロボティクス
ソフトロボットにおける全身インタラクションによる推論と操作の学習
ソフトロボットの腕全体を使った接触から物体情報を推論し、把持操作を行う強化学習フレームワークを提案。探索と把持を統合したリカレントポリシーとsim-to-real適応により、視覚なしでの把持を実現。
原題: Learning to infer and manipulate through distributed whole-arm interaction in a soft robot / Chuhan Zhang, Ebrahim Shahabi, Kseniia Khomenko 他
日本語で読む → - 論文ナビゲーションロボティクス
LightNav-0: 汎用身体性ナビゲーションのためのVLM空間知能の引き出し
事前学習済み視覚言語モデルの空間知能をナビゲーション制御に直接活用する、タスク非依存の汎用ナビゲーションモデルLightNav-0を提案。統一トークンインターフェースと残差VQアクショントークナイザにより、指示追従・物体探索・視覚追跡を単一モデルで実現する。
原題: LightNav-0: Eliciting VLM Spatial Intelligence for Generalist Embodied Navigation / Shaoan Wang, Aocheng Luo, Fei Huang 他
日本語で読む → - 論文マルチタスク強化学習機械学習
T3S: タスク固有特徴セレクタとスケジューラによるマルチタスク強化学習の改善
マルチタスク強化学習におけるタスク間干渉を解決するため、ハイパーネットワークでタスク固有のソフトマスクを生成する特徴セレクタと、タスクの進捗と学習速度に基づいて学習タスクを選択するスケジューラを提案した。ロボット操作タスクで既存手法より優れた性能を示した。
原題: T3S: Improving Multi-Task Reinforcement Learning with Task-Specific Feature Selector and Scheduler / Yuanqiang Yu, Tianpei Yang, Yongliang Lv 他
日本語で読む → - 論文シーン構築画像認識
Lucida: 合成可能な実世界からシミュレーションへのシーン構築のための解析・生成・配置
実室内シーンを編集可能なオブジェクト資産として復元するパイプラインを提案し、各ステップが実際の観測で確実に得られる情報のみを消費するよう再設計。VLMポリシーによるGUI操作でオブジェクト配置を閉ループで行う。
原題: Lucida: Parse, Generate, and Place for Composable Real-to-Sim Scene Modeling / Minghan Qin, Yuang Wang, Xiuyu Yang 他
日本語で読む → - 論文VLA/自動運転ロボティクス
言語の役割を再考する:自動運転のための効率的VLAへ向けて
自動運転におけるVLAモデルで、推論時の言語使用を4段階に分類し、効率性と信頼性の観点から手法を整理・分析したサーベイ論文。
原題: Rethinking Language's Role in Efficient VLA for Autonomous Vehicles: Toward Smarter, Trustworthy Driving / Tongfei Guo, Lili Su
日本語で読む → - 論文群制御math.OC
状態情報のみと限られたセンシング下での非線形マルチエージェントシステムに対する安全性が保証された分散型緊急時MPC
状態情報のみで動作し、センシング範囲が限られたマルチエージェントシステム向けに、安全性と再帰的実行可能性を保証する分散型緊急時MPCを提案した。エージェントごとの安全領域を更新する新機構により、保守性を低減しつつ理論的保証を維持する。
原題: Provably Safe Decentralized Contingency MPC under State-Only Information and Limited Sensing for Nonlinear Multi-agent Systems / Max Studt, Georg Schildbach
日本語で読む → - 論文マニピュレーションロボティクス
Zeva: 文脈内因果学習による汎用身体操作の実現
ロボットが実環境での物理的相互作用からその場で学習し、その知識を次の行動に活かすフレームワークZevaを提案。ポリシーモデルを凍結したまま、因果相互作用抽出器と二重タイムスケールの因果メモリを用いて、実行した行動と状態変化を符号化し、後の行動の文脈として注入する。シミュレーションと実機操作で最先端のVLAやWAMを上回る性能を示し、勾配更新なしで自己進化を実現。
原題: Zeva: In-Context Causal Learning for Generalizable Embodied Manipulation / Fu Chen, Xin Ding, Bingjia Huang 他
日本語で読む → - 論文逆運動学ロボティクス
共形幾何代数を用いた汎用3R位置決めロボットの逆運動学解法
共形幾何代数を用いて、汎用3Rロボットの逆運動学問題を2つの円の交点として再定式化し、theta_2に関する単変数多項式を直接導出する新しい解法を提案した。
原題: Inverse kinematic solution for generic 3R positional robots using Conformal Geometric Algebra / Abhilash Nayak, Durgesh Haribhau Salunkhe
日本語で読む → - 論文アクチュエータ設計ロボティクス
ヒューマノイド足首向けデュアルカム・並列弾性アクチュエータ:共有ガススプリングによるトルク補償
ヒューマノイドの足首関節のトルク容量とエネルギー効率を向上させるため、2自由度の並列弾性アクチュエータを提案し、共有ガススプリングとカスタムカムでピッチ・ロール両方向のトルク補償を実現した。
原題: A Dual-Cam Parallel Elastic Actuator with Shared Gas-Spring Compensation for Humanoid Ankles / Jingcheng Jiang, Yifang Zhang, Nikos G. Tsagarakis
日本語で読む → - 論文安全制御制御
時空間変換:メモリ拡張制御バリア関数
制御バリア関数の構造的限界を解決するため、時間フィルタリングを安全制約に組み込む時空間変換を導入し、高周波ノイズを抑えつつ安全性を保証する手法を提案した。
原題: The Space-Time Transform: Memory-Augmented Control Barrier Functions / Avinash Malik
日本語で読む → - 論文自動運転/VRロボティクス
自動運転車の視点を体感する:映像拡張VRによる物理車両の可視化
実機のROS 2自律走行ロボットとMeta Quest 3S上のUnityアプリを連携し、車両状態と車載カメラ映像をVRで提示するフレームワークを構築、20回の走行実験で低遅延・高精度な同期を確認した。
原題: Seeing What the Vehicle Sees: Video-Augmented Virtual Reality for Physical Autonomous Vehicles / Md Tanjemul Islam, Mohammad Shafin, Md Rafiul Kabir
日本語で読む → - 論文異常検知/触覚センシングロボティクス
視覚ベース触覚センシングによる小型工業部品の異常検知
小型工業部品の異常検知に視覚ベース触覚センサを用い、実データで教師なし異常検知手法を系統的に比較評価した研究。
原題: Anomaly Detection on Small Industrial Components via Vision-Based Tactile Sensing / G. F. Preziosa, M. Casiglia, M. Faroni 他
日本語で読む → - 論文ワールドモデルAI
IMPACT: 注意はスケーラブルな相互作用認識ワールドモデル学習のための相互作用マップ
ワールドモデルの学習において、静的領域が支配的なMSE損失により動的物体の相互作用が過小評価される問題を指摘し、注意マップを用いて損失を再重み付けするフレームワークIMPACTを提案した。
原題: IMPACT: Attention Is the Interaction Map for Scalable Interaction-Aware World Model Training / Rongze Tang, Jianjie Fang, Zhaolu Wang 他
日本語で読む → - 論文群制御機械学習
軌道初期化を用いたニューラル二重Qルーティングによる大規模天井搬送システムの最適化
半導体工場などの大規模天井搬送システム(OHT)向けに、共有ニューラルネットワークで経路価値を学習し、シミュレーション軌道で初期化してからオンラインで二重Q学習を適用する新しいルーティング手法を提案した。
原題: Trajectory-Initialized Neural Double Q-Routing for Large-Scale Overhead Hoist Transport Systems / Cheng Gu, Qiusheng Zhao, Anbang Liu 他
日本語で読む → - 論文ナビゲーションAI
基盤モデルを物理世界エージェントに組み込むことで長期的ナビゲーションの限界を押し広げる
VLMによる推論エージェントとナビゲーション基盤モデルを組み合わせたフレームワークNavMCPを提案し、長期的な探索タスクで高い性能を達成した。
原題: Scaffolding Foundation Models into Physical-World Agents Pushes the Frontier of Long-Horizon Navigation / Zixing Lei, Gengze Zhou, Xiong-Hui Chen 他
日本語で読む → - 論文VLA画像認識
ZimaBlue: スケーラブルなビデオ事前学習による汎化可能な世界行動モデルの進化
大規模な一人称視点ビデオからロボット制御のための世界行動モデルを学習するフレームワークを提案し、実機ゼロショット評価で成功率を大幅に向上させた。
原題: ZimaBlue: Evolving Generalizable World Action Models through Scalable Video Pre-training / Xionghao Wu, Yijun Yang, Shiyang Zhou 他
日本語で読む → - 論文画像フォレンジック画像認識
APT: 完全再生成画像における改ざん位置特定のためのアンカー整列摂動
拡散モデルによる画像修復で画像全体が再生成される状況でも、埋め込んだ信号のずれから改ざん領域を高精度に特定する新しい手法を提案した。
原題: APT: Anchor-aligned Perturbations for Tamper Localization in Fully Regenerated Images / Suhyeon Ha, Woo Jae Kim, Joonsung Jeon 他
日本語で読む → - 論文画像フォレンジック画像認識
SegWave: ウェーブレット駆動による改ざん領域のセグメンテーション
画像改ざん検出のためのハイブリッドフレームワークで、空間的特徴と周波数領域の手がかりを組み合わせ、離散ウェーブレット変換と適応サブバンド注意機構を用いて改ざん領域を高精度に特定する。
原題: SegWave: Wavelet-Driven Segmentation of Tampered Regions / Siddhi Pravin Lipare, Vishesh Kumar, Akshay Agarwal
日本語で読む → - 論文VLAロボティクス
PAVE: 世界行動ポリシーのための予測的アライメントと価値誘導進化
視覚言語行動ポリシーに、複数時間スケールの遷移予測と価値ベースの条件付けを導入し、軌道の質を考慮した学習を可能にする手法を提案した。
原題: PAVE: Predictive Alignment and Value-Guided Evolution for World-Action Policies / Botong Zhao, Fang Yu, Tim 他
日本語で読む → - 論文流体力学physics.flu-dyn
小型クアッドローター下方における合流乱流ジェットの構造
ホバリング中の小型クアッドローターのダウンウォッシュをPIVで詳細に計測し、4つのロータージェットが合流して円形ジェットの自己相似形に近づくことを示した。
原題: The Structure of Merging Turbulent Jets Beneath a Small Quadrotor / Anoop Kiran, Nora Ayanian, Kenneth Breuer
日本語で読む → - 論文VLA/社会的相互作用自然言語
私たちが見抜ける嘘:身体的社会的相互作用におけるVLMエージェントによる言語・非言語連携欺瞞
3Dマルチモーダル環境『MineAmongUs』を構築し、VLMエージェントが言語と非言語行動を組み合わせて欺瞞を行う様子を分析。非言語チャネルが勝利に重要であることを示した。
原題: Lies We Can See: Joint Verbal and Non-Verbal Deception by VLM Agents in Embodied Social Interactions / Jaewoo Ahn, Junseo Kim, Hyunseo Kim 他
日本語で読む → - 論文ロボット運動学ロボティクス
一般的な3Rロボットの幾何学的解析と、直交ロボットのクラスが4つの逆運動学解を持つための必要十分条件
共形幾何代数に基づく手法を用いて、一般的な3Rロボットの逆運動学解析を行い、4つの逆運動学解を持つための条件を幾何学的に導出した。特に、直交ロボットのクラスに対して必要十分条件を提示している。
原題: Geometric analysis of generic 3R robots, and necessary and sufficient conditions for a class of orthogonal robots to have four IKS / Durgesh Haribhau Salunkhe, Abhilash Nayak
日本語で読む → - 論文マイクロロボット/ナビゲーションロボティクス
単平面透視を用いた無造影・自律ナビゲーションによる血管内マイクロロボットの制御
単平面X線透視のみを用いて、造影剤なしで血管内マイクロロボットを3次元自律ナビゲーションするデジタルツイン手法VISTAを提案し、ファントムと生体内で実証した。
原題: Contrast-Free Autonomous Navigation of Untethered Endovascular Microrobots Using Single-Plane Fluoroscopy / Husnu Halid Alabay, Tuan-Anh Le, Ping Wang 他
日本語で読む → - 論文ドローン設計ロボティクス
ティルトローター二重プロペラドローンの最適化モジュール設計と開発
固定翼と回転翼の利点を組み合わせたティルトローター二重プロペラドローンの設計を、構造・空力シミュレーションと飛行試験により最適化した。
原題: Optimized Modular Design and Development of a Tilt-Rotor Bicopter Drone / Saideep Verma, Nimisha Tatapudi, Akshay Arjun 他
日本語で読む → - 論文視覚ナビゲーションロボティクス
CanonNav: カメラ幾何からナビゲーション行動を分離するクロスプラットフォーム視覚ナビゲーション
クロスプラットフォームのデモから視覚ナビゲーションを学習する際、カメラ幾何の影響を分離し、安全性と局所進行の補助監督を導入するフレームワークCanonNavを提案。RGBのみでRGB-D法を上回る性能を達成。
原題: CanonNav: Disentangling Navigation Behavior from Camera Geometry in Cross-Platform Visual Navigation / Dong-Wook Kim, Ji-Hoon Hwang, E-In Son 他
日本語で読む → - 論文自動運転cs.SE
オープンソース自動運転システムの解析と、強化学習テストおよび大規模言語モデルを用いた学際的ハードウェアインザループ研究パラダイム
複数車両の実車実験、コード再利用、ソフトウェア・ハードウェア連携テストを統一的にレビュー可能な枠組みを提案し、Apollo-on-Hongqi EV環境で実証した。
原題: Open-Source Autonomous Driving System Analysis and Multi-Disciplinary Hardware-in-the-Loop Research Paradigm with Reinforcement-Learning Testing and Large Language Models / Dianjing Cheng, Yike Li, Lan Yang 他
日本語で読む → - 論文3D視覚的グラウンディング画像認識
SeqAlign3DVG: シーケンス整合ベンチマークとボクセル推論フレームワークによる3D視覚的グラウンディング
時間順序と観測整合性を備えた画像ベース3D視覚的グラウンディングの新しいベンチマークと、ボクセルメモリと段階的融合を用いた推論フレームワークを提案した。
原題: SeqAlign3DVG: A Sequence-Aligned Benchmark and Voxel Reasoning Framework for 3D Visual Grounding / Yi Zhang, Yi Wang, Yueting Wu 他
日本語で読む → - 論文ヒューマンマシンインターフェースロボティクス
データ中心型ニューロモーターインターフェースによる携帯型ヒューマンマシンインタラクション
筋電信号を利用した携帯型のジェスチャー認識インターフェースを開発し、データ中心のアプローチにより小型モデルで高精度な認識を実現した。
原題: Data-Centric Neuromotor Interfaces for Portable Human-Machine Interaction / Jiaxuan Li, Di Wu, Jianhua Liu 他
日本語で読む → - 論文オフロードナビゲーション/危険特定ロボティクス
GAFT: 地理的アンカーによる微調整を用いた稀な失敗からの危険特定
オフロード走行中の高重心化や閉じ込めなどの稀な失敗事例から危険構造を特定するため、視覚基盤モデルを幾何学由来の事前情報で微調整する手法GAFTを提案した。
原題: GAFT: Geo-Anchored Fine-Tuning for Hazard Identification from Rare Failures / Yanran Xu, Chuanhang Qiu, Yue Wang 他
日本語で読む → - 論文VLAロボティクス
CometVLA: 身体性データピラミッドの共学習による物理理解の獲得
ロボット操作タスクにおける物理常識の欠如を補うため、身体性に整合した物理VQAデータとベンチマークを構築し、VLAモデルを共学習させる手法を提案。実世界とシミュレーションで性能向上を確認した。
原題: CometVLA: Co-Training on an Embodied Data Pyramid towards Physical Understanding / Hanwen Wan, Dafeng Chi, Linbo Zhai 他
日本語で読む →