論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/9/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文ソフトロボティクス/アクチュエータロボティクス
1回の印刷で多様な動き:折り紙に着想を得た一体型ソフト多自由度アクチュエータ
折り紙構造と剛性の空間パターン化により、ソフト材料の柔軟性を保ちつつ正確な折り畳み動作を実現する、単一材料・単一印刷で作れるアクチュエータを提案。複数連結して多自由度システムを構成し、VR触覚デバイスや水中グリッパーなど3つの応用を示した。
原題: One Print, Many Moves: Monolithic Origami-inspired Folding Actuator for Composable Soft Multi-DoF Systems / Jaehyung Jang, Zhenish Zhakypov, Jasmin Elena Palmer 他
日本語で読む → - 論文移動physics.bio-ph
移動研究のための泥の強度の制御・変化・特性評価の重要性と方法
動物やロボットが遭遇する泥の降伏強度を制御・測定する方法を開発し、乾燥砂との違いを明らかにした。
原題: Importance and methods to control, vary, and characterize mud strength for studying locomotion / Divya Ramesh, Gargi Sadalgekar, Qiyuan Fu 他
日本語で読む → - 論文深度推定画像認識
単眼深度推定:進展と機会の包括的サーベイ
単眼画像からの深度推定の進化を、初期の学習ベース手法から基盤モデル時代まで体系的にレビューし、主要なデータセット、手法の分類、応用、今後の課題を整理したサーベイ論文。
原題: Monocular Depth Estimation from a Single Image: Progress and Opportunities / Muxin Liu, Xiaoyang Lyu, Yang-Tian Sun 他
日本語で読む → - 論文VLA/スキル学習機械学習
REFACTOR-VLA: 型付きモータープログラムの教師なしライブラリ学習
本論文は、ロボットの行動を再利用可能な抽象化(スキル)として組織化する新しいVLAモデルを提案し、長期的なタスクでの性能向上と解釈可能性の向上を目指す。
原題: REFACTOR-VLA: Unsupervised Library Learning of Typed Motor Programs / Riyaaz Shaik, Chandru Venkataraman
日本語で読む → - 論文ビデオ生成画像認識
MeRoPE: カメラ制御ビデオ生成のためのメトリック回転位置埋め込み
カメラ制御ビデオ生成において、実世界のメトリックカメラ軌道でスケール依存の失敗を起こさない、ノルム保存型の相対カメラエンコーディングMeRoPEを提案した。
原題: MeRoPE: Metric Rotary Position Embedding for Camera-Controlled Video Generation / Zhijian Qiao, Xinjiang Wang, Jiajie Chen 他
日本語で読む → - 論文自動運転ロボティクス
文脈を考慮したインテリジェント車両
本論文は、インテリジェント車両の次世代システムにおいて、状況要因(文脈)を一級の設計原理として扱い、ソフトウェアスタック全体で共有状態として活用することを提案し、関連研究を体系的にレビューして技術的課題を特定する。
原題: Context-Aware Intelligent Vehicles / Liangkai Liu, Shuyao Shi, Mingke Wang 他
日本語で読む → - 論文3次元再構成ロボティクス
対応点不要の多視点点群レジストレーションのための適応的デプスマップ誘導バンドル調整
対応点を必要としない多視点点群位置合わせ手法を提案。シーンを適応的な多層デプスマップで表現し、センサ姿勢とデプスマップを同時最適化する。
原題: Adaptive Depth-Map-Guided Bundle Adjustment for Correspondence-Free Multi-View Point Cloud Registration / Yiran Zhou, Yingyu Wang, Shoudong Huang 他
日本語で読む → - 論文音声対話ロボティクス
騒がしい公共空間における複数参加者とのヒューマンロボット対話
騒音の多い公共空間で、ロボットやアバターが複数人と会話するための音声強調システムを提案し、2025年大阪万博で実証した。
原題: Human-robot conversation with multiple participants in noisy public spaces / Divesh Lala, Yogeeswaran Muthukumaran, Vincent Fernandes 他
日本語で読む → - 論文VLAロボティクス
EmbodiedSkills: VLAエージェントの統合フレームワーク
VLAモデルを長期的タスクに適用するための、実行提案としてのスキル判断を検証する統合フレームワークを提案。
原題: EmbodiedSkills: A Unified Framework for Orchestrating, Training, and Deploying VLA Agents / Wei Wang, Wenqiao Zhang, Yutong Lin 他
日本語で読む → - 論文触覚ロボティクス
連続・閉ループ・双方向触覚インタラクションのためのウェアラブル空気圧デバイス
触覚センシングと触覚フィードバックを統合したウェアラブル空気圧デバイスを提案し、遠隔操作の性能向上と精神的負荷の低減を実証した。
原題: A Wearable Pneumatic Device for Continuous, Closed-Loop, Bidirectional Tactile Interaction / Cosima du Pasquier, Aliyah Smith, Serin Huber 他
日本語で読む → - 論文シミュレーション/ベンチマークロボティクス
AM-Bench: 空中マニピュレーションのポリシー学習のためのモジュール式シミュレーションスイートとベンチマーク
空中マニピュレーションのポリシー学習を評価するための、モジュール式シミュレーションスイートとベンチマークを提案した論文。
原題: AM-Bench: A Modular Simulation Suite and Benchmark for Aerial Manipulation Policy Learning / Yutong Wang, Dongjae Lee, Xiaofeng Guo 他
日本語で読む → - 論文検索/構造的類似性機械学習
検索されるがランクされない:数学からエージェント軌跡までの構造的検索における表層形式バイアス
埋め込みベースの検索が、表層の類似性ではなく構造的類似性を持つ項目を検索できるかを、数学問題とエージェント軌跡の2つの領域で評価し、表層形式バイアスが強いことを示した。
原題: Retrieved but not ranked: surface-form bias in structural retrieval, from mathematics to agent trajectories / Nabira Rashid, Manolis Kellis
日本語で読む → - 論文ヒューマノイド制御ロボティクス
ADAPT: 俊敏な拡散行動事前分布による堅牢で操縦可能なオンライン文章駆動ヒューマノイド制御
テキスト条件付きのヒューマノイド全身制御をエンドツーエンドで行うフレームワークを提案。拡散ベースの行動事前分布と残差強化学習を組み合わせ、言語コマンドに応じた多様な動作を直接実行しつつ、長期的な堅牢性とスムーズな切り替えを実現する。
原題: ADAPT: Agile Diffusion Action Priors for Robust and Steerable Online Text-Driven Humanoid Control / Yan Wu, Chenhao Li, Kaifeng Zhao 他
日本語で読む → - 論文3Dメモリ/動的環境/ナビゲーションロボティクス
HitMem: 動的環境のための階層的時間的3Dメモリとマルチモーダル文脈認識検索
動的環境で物体が移動した際のメモリと観測の矛盾を解決するため、階層的時間的3DメモリフレームワークHitMemを提案し、物体の再発見精度とタスク実行性能を向上させた。
原題: HitMem: Hierarchical Temporal 3D Memory with Multi-Modal Context-Aware Retrieval for Dynamic Environments / Ruijie Tang, Chenye Zou, Guoquan Wu 他
日本語で読む → - 論文画像レタッチ画像認識
目を描く:視覚的焦点強調のための意図駆動型画像レタッチエージェント
ユーザーの弱い意図(数回のクリックや粗いストローク)から視覚的焦点を推定し、拡散モデルを用いて自然な画像レタッチを行うMLLM駆動エージェント「EyeControl」を提案した。
原題: Dotting the Eye: An Intent-Driven Image Retouching Agent for Visual Focus Enhancement / Chujie Qin, Zilong Zhang, Zewei Chang 他
日本語で読む → - 論文群制御ロボティクス
エージェント間通信を必要としない分散群制御による自律ロボット橋梁構築
GPSや無線通信を使わず、分散群制御とマルチモデルセンシングで複数の無人水上艇が自己位置推定し、隊列を組んで目標地点へ移動し橋を架ける手法を提案・シミュレーションで実証した論文。
原題: Autonomous robotic bridging using distributed swarm control without inter-agent communication / Vishwaak C. Thamaraiselvan, Cody L. Lundberg, Michail Theofandis 他
日本語で読む → - 論文自動運転/意図認識ロボティクス
DNC-IMM: 運転コンテキスト情報に基づくニューラル校正による早期車線変更意図認識
従来のIMMフィルタにニューラルネットワークを組み合わせ、運転状況に応じて遷移確率と観測尤度を校正し、車線変更意図を早期に高精度で認識する手法を提案した。
原題: DNC-IMM: Early Lane-Change Intention Recognition via Neural Calibration Based on Driving Context Information / Woong-Chan Byun, Seung-Hyun Kong
日本語で読む → - 論文交通制御ロボティクス
可変速度制限制御への交通騒音排出モデルの統合
交通騒音を考慮した可変速度制限(VSL)制御フレームワークを提案し、騒音排出指標に基づいて速度制限を動的に調整することで、騒音を低減しつつ平均速度を維持することを示した。
原題: Integrating Traffic Noise Emission Modelling into Variable Speed Limit Control / Jiawen Meng, John Pravin Arockiasamy, Alexey Vinel
日本語で読む → - 論文オフロードナビゲーション/危険特定ロボティクス
GAFT: 地理的アンカーによる微調整を用いた稀な失敗からの危険特定
オフロード走行中の高重心化や閉じ込めなどの稀な失敗事例から危険構造を特定するため、視覚基盤モデルを幾何学由来の事前情報で微調整する手法GAFTを提案した。
原題: GAFT: Geo-Anchored Fine-Tuning for Hazard Identification from Rare Failures / Yanran Xu, Chuanhang Qiu, Yue Wang 他
日本語で読む → - 論文自動運転ベンチマーク画像認識
記憶による運転:NAVSIMスコアの再評価
エンドツーエンド自動運転モデルがカメラ入力の代わりに過去の記憶を用いてもNAVSIMで高いスコアを達成できることを示し、ベンチマークの評価指標に警鐘を鳴らす論文。
原題: Driving on Memory / Christian Löwens, Thorben Funke, Alexandru Paul Condurache
日本語で読む → - 論文VLAロボティクス
CometVLA: 身体性データピラミッドの共学習による物理理解の獲得
ロボット操作タスクにおける物理常識の欠如を補うため、身体性に整合した物理VQAデータとベンチマークを構築し、VLAモデルを共学習させる手法を提案。実世界とシミュレーションで性能向上を確認した。
原題: CometVLA: Co-Training on an Embodied Data Pyramid towards Physical Understanding / Hanwen Wan, Dafeng Chi, Linbo Zhai 他
日本語で読む → - 論文マニピュレーションロボティクス
SUN: 言語に基づく制御から学習、実機への永続的プログラム
モデルベース制御と学習ポリシーを橋渡しするため、幾何・接触関係を一度定義してMPCコストや報酬、遷移ガードなどにコンパイルする型付き実行可能プログラム「SUN」を導入し、大規模言語ビジョンモデルで自動合成するシステムKuafuを提案。デモなしで高成功率を達成した。
原題: SUN: Persistent Programs For Language-Grounded Control-to-Learning-to-Real Policies / Weiqi Wang, Zhi Li, Yudong Lei 他
日本語で読む → - 論文安全制御制御
時空間変換:メモリ拡張制御バリア関数
制御バリア関数の構造的限界を解決するため、時間フィルタリングを安全制約に組み込む時空間変換を導入し、高周波ノイズを抑えつつ安全性を保証する手法を提案した。
原題: The Space-Time Transform: Memory-Augmented Control Barrier Functions / Avinash Malik
日本語で読む → - 論文自動運転画像認識
CoLT-Drive:運転アフォーダンス予測のための反事実的ロングテールベンチマークと知識保持適応
運転アフォーダンス予測の性能を評価する反事実的ロングテールベンチマークCoLT-Driveを構築し、知識を保持しながら適応するKPAフレームワークを提案した。
原題: CoLT-Drive: Counterfactual Long-Tail Benchmarking and Knowledge-Preserving Adaptation for Driving Affordance Prediction / Zhengxu Tang, Guofeng Cui, Ziyu Gong 他
日本語で読む → - 論文データセットロボティクス
DARP: 多視点ロボット知覚のための校正済み双腕RGB-D-IRデータセット
自己遮蔽や表面の不完全な可視性を解決するため、双腕ロボットに搭載したRGB-D-IRセンサで多視点データを収集するデータセットを構築し、幾何学的整合性を評価した。
原題: DARP: A Calibrated Dual-Arm RGB-D-IR Dataset for Multi-View Robotic Perception / Manish Kansana, Mohammed Yusuf Mujawar, Sudip Mittal 他
日本語で読む → - 論文シーン構築画像認識
Lucida: 合成可能な実世界からシミュレーションへのシーン構築のための解析・生成・配置
実室内シーンを編集可能なオブジェクト資産として復元するパイプラインを提案し、各ステップが実際の観測で確実に得られる情報のみを消費するよう再設計。VLMポリシーによるGUI操作でオブジェクト配置を閉ループで行う。
原題: Lucida: Parse, Generate, and Place for Composable Real-to-Sim Scene Modeling / Minghan Qin, Yuang Wang, Xiuyu Yang 他
日本語で読む → - 論文アクチュエータ設計ロボティクス
ヒューマノイド足首向けデュアルカム・並列弾性アクチュエータ:共有ガススプリングによるトルク補償
ヒューマノイドの足首関節のトルク容量とエネルギー効率を向上させるため、2自由度の並列弾性アクチュエータを提案し、共有ガススプリングとカスタムカムでピッチ・ロール両方向のトルク補償を実現した。
原題: A Dual-Cam Parallel Elastic Actuator with Shared Gas-Spring Compensation for Humanoid Ankles / Jingcheng Jiang, Yifang Zhang, Nikos G. Tsagarakis
日本語で読む → - 論文強化学習/探索戦略ロボティクス
CIG-RL: 不確実な環境下での発生源推定のための好奇心駆動型情報誘導強化学習
ガス発生源の特性を推定する問題に対し、好奇心による探索と不確実性適応型報酬を組み合わせた強化学習手法を提案し、高ノイズ環境でのロバスト性を実証した。
原題: CIG-RL: Curiosity-Driven Information-Guided Reinforcement Learning for Source Term Estimation in Uncertain Environments / Junhee Lee, Seunghwan Kim, Hongro Jang 他
日本語で読む → - 論文画像フォレンジック画像認識
APT: 完全再生成画像における改ざん位置特定のためのアンカー整列摂動
拡散モデルによる画像修復で画像全体が再生成される状況でも、埋め込んだ信号のずれから改ざん領域を高精度に特定する新しい手法を提案した。
原題: APT: Anchor-aligned Perturbations for Tamper Localization in Fully Regenerated Images / Suhyeon Ha, Woo Jae Kim, Joonsung Jeon 他
日本語で読む → - 論文SLAM画像認識
失敗かドリフトか?合成および実世界の劣化下での単眼SLAMの評価
単眼SLAMの堅牢性を、合成劣化と実世界の悪条件下で比較評価し、学習ベースのトラッカーが破滅的な失敗をドリフトに置き換えることや、劣化の忠実度によって性能順位が変わることを示した。
原題: Failure or Drift? Evaluating Monocular SLAM under Synthetic and Real-World Corruptions / Abhay Skaria Thomas, Shashank Agnihotri, Margret Keuper
日本語で読む →