論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/6/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文群制御ロボティクス
ロボットセル型倉庫システムにおける動的マルチエージェント集荷・配送
倉庫内のロボットによる集荷・配送において、注文の途中でSKUが追加される動的な状況を扱う問題を初めて定式化し、イベント駆動型のオンライン再計画アルゴリズムを2つ提案した。
原題: Dynamic Multi-Agent Pickup and Delivery in Robotic Cellular Warehousing Systems / Cheng Ren, Ming Li, Xinping Guan 他
日本語で読む → - 論文VLAロボティクス
ThinkingVLA: ロボット操作のための視覚と言語の推論を交互に行う手法
ロボット操作タスクにおいて、視覚と言語の推論を交互に行う統一アーキテクチャを提案し、長期的な操作タスクでの性能を向上させた。
原題: ThinkingVLA: Interleaved Vision and Language Reasoning for Robotic Manipulation / Tianyi Lu, Hui Zhang, Zijie Diao 他
日本語で読む → - 論文歩行ロボティクス
最小限の近接センシングによる不連続地形での歩行学習
四足ロボットの足に低コストの赤外線近接センサを埋め込み、接地前の情報を活用して不連続地形(隙間や飛び石)の歩行を強化学習で実現。シミュレーションから実機への転移も高精度で、従来の視覚システムに比べ低遅延・低消費電力で頑健性を向上させる。
原題: Learning Locomotion on Discrete Terrain via Minimal Proximity Sensing / Jiale Fan, Connor Flynn, Tianao Xu 他
日本語で読む → - 論文オフライン強化学習機械学習
価値スティッチングによる地平線適応型オフライン方策学習
固定長の価値バックアップを再帰的で地平線適応的な価値合成に置き換え、将来の状態と地平線長に条件付けられた補助価値関数とスティッチング方策を用いて、オフライン強化学習の性能を向上させる手法VASTを提案した。
原題: Horizon Adaptive Offline Policy Learning via Value Stitching / Kexin Zheng, Xianyuan Zhan, Xintao Yan
日本語で読む → - 論文VLAロボティクス
平坦性が視覚言語行動モデルの指示追従を維持する
視覚言語行動モデルの微調整時に平坦性を保つ最適化を適用し、指示無視の失敗を大幅に改善した。
原題: Flatness Preserves Instruction Following in Vision-Language-Action Models / Haochen Zhang, Yonatan Bisk
日本語で読む → - 論文触覚/表現学習ロボティクス
TacGen: 触覚は物理世界表現に不可欠な次元である -- スケーラブルな視覚-触覚アライメントと生成による触覚データ不足への対処
触覚データ不足を解決するため、視覚と触覚のコントラスト学習と潜在空間での視覚から触覚への生成モデルを組み合わせ、RGB画像から触覚表現を合成してデータを拡張する手法を提案した。
原題: TacGen: Touch Is a Necessary Dimension of Physical-World Representation -- Addressing Tactile Data Scarcity with Scalable Vision-to-Touch Alignment and Generation / Wanghao Ye, Aarosh Das, Sihan Chen 他
日本語で読む → - 論文イベントカメラシミュレーション画像認識
TIDES: 変形可能な再構成による時間微分イベントシミュレーション
動的ガウシアンスプラッティングを用いた連続時間イベントカメラシミュレータを提案し、フレーム差分ではなくシーンから直接輝度変化を導出することで高精度なイベント生成を実現した。
原題: TIDES: Time-Derivative Event Simulation via Deformable Reconstruction / Christopher Thirgood, Dipon Kumar Ghosh, Simon Hadfield
日本語で読む → - 論文グリッパー/手内操作ロボティクス
ベルトフィンガー:器用な手内操作のための低コストなソフトベルト駆動グリッパー
平行ジョーのグリッパーに、翻訳・ピッチ・ロールの3自由度を追加する二重ソフトベルト式指モジュールを提案し、低コストで器用な手内操作を実現した。
原題: Belt-Finger: An Affordable Soft Belt-Driven Gripper for Dexterous In-Hand Manipulation / Boya Zhang, Andreas Zell, Georg Martius
日本語で読む → - 論文変形物操作/sim2realロボティクス
SimWeaver: 変形物操作のためのゼロショットRGBシミュレーションから実世界への転移
変形物操作のためのRGBシミュレーションから実世界への転移を、実世界での微調整なしで実現する手法を提案。シミュレーション上のデモンストレーションのみで訓練したVLAポリシーが、5つの多様な変形物タスクで高い成功率を達成した。
原題: SimWeaver: Zero-Shot RGB Sim-to-Real for Deformable Manipulation / Wenkang Hu, Haoran Wang, Yitong Li 他
日本語で読む → - 論文VLAロボティクス
ReSiReg: 言語条件付きロボットタスクにおける空間的に一貫したセマンティクスの実現
視覚言語モデルの埋め込みはノイズが多く空間的に一貫性がない問題を解決するため、空間的に一貫した中間表現を用いて特徴を再構成する手法ReSiRegを提案した。
原題: ReSiReg: Towards Spatially Consistent Semantics in Language-Conditioned Robotic Tasks / Simon Schwaiger, David Seyser, Alessandro Scherl 他
日本語で読む → - 論文ナビゲーションロボティクス
CBF-CLFに基づくマルチゴールナビゲーションのための競合認識スイッチング
CBF-CLF-QP制御における安全制約と目標追従制約の競合を検出し、目標を切り替えることでデッドロックや遅延を減らす手法を提案した。
原題: Conflict-Aware Switching for CBF-CLF-Based Multi-Goal Navigation / Rohan Walia, Kevin Leahy
日本語で読む → - 論文エージェントアーキテクチャ探索ロボティクス
具現化エージェントアーキテクチャ設計の自動化
具現化エージェントのアーキテクチャ設計を自動化する手法を提案し、視覚言語ナビゲーションや操作タスクで有効性を検証した。
原題: Automating the Design of Embodied Agent Architectures / Jian Zhou, Sihao Lin, Jin Li 他
日本語で読む → - 論文記憶/エピソード記憶ロボティクス
記憶に値するもの:驚きでゲートされたロボットのエピソード記憶
ロボットの長期記憶を選択的に保持するため、ベイズ的驚きをゲート機構として用いる手法を提案。V-JEPA-2の潜在空間で驚きを計算し、4Dシーングラフ空間記憶と組み合わせることで、ロボットの質問応答性能を向上させた。
原題: Worth Remembering: Surprise-Gated Robot Episodic Memory / Nicolas Gorlo, Derek K. Wise, Alberto Speranzon 他
日本語で読む → - 論文VLA画像認識
WAM4D: 空間レジスタトークンによる高速4Dワールドアクションモデル
ロボットの行動予測と未来観測を同時に行うワールドアクションモデルにおいて、軽量な空間レジスタトークンを用いて事前学習済みの幾何学的特徴を因果的なビデオ・アクショントランスフォーマーに転送し、高コストな幾何学的デコードを避けつつ4D空間整合性を向上させる手法を提案した。
原題: WAM4D: Fast 4D World Action Model via Spatial Register Tokens / Ying Li, Xiaobao Wei, Jiajun Cao 他
日本語で読む → - 論文操作学習/転移学習ロボティクス
Human2Any: 制約を考慮した構成的プランニングによる人間からロボットへの転移
人間の動画から物体間の相互作用の事前知識を学習し、ロボットの制約を考慮したプランニングと組み合わせることで、実ロボットのデモデータなしに多様なロボットへ操作スキルを転移するフレームワークを提案。
原題: Human2Any: Human-to-Robot Transfer via Constraint-Aware Compositional Planning / Shuo Cheng, Chuye Zhang, Alfred Cueva 他
日本語で読む → - 論文VLA/異機種間転移ロボティクス
Cloak: エンドエフェクタをVLAからマスクすることで実現するゼロショット異機種間操作
手首カメラ画像からエンドエフェクタをマスクする訓練手法Cloakを提案し、単一グリッパのデータのみで訓練したVLAが、未見の異なるロボット構成へゼロショットで転移できることを示した。
原題: Cloak: Zero-Shot Cross-Embodiment Manipulation by Masking the End-Effector from the VLA / Michael Piseno, Guy Tevet, C. Karen Liu
日本語で読む → - 論文マニピュレーションロボティクス
MoDex: 連続多物体器用把持のための拡散ポリシー
単一の器用な手で複数の物体を順次把持する問題に対し、把持に参加する指を指定する対向空間条件を用いた拡散ポリシーを提案し、模倣学習と強化学習の2段階訓練でシミュレーションと実機の成功率を向上させた。
原題: MoDex: A Diffusion Policy for Sequential Multi-Object Dexterous Grasping / Haofei Lu, Hongjia Liu, Yifei Dong 他
日本語で読む → - 論文インスタンス分割画像認識
マスク条件付き境界学習による少数ショット工業部品インスタンス分割
テクスチャが乏しい工業部品に対して、境界を教師信号とする数ショットのインスタンス分割フレームワークを提案。基盤モデルの特徴量とSDFヘッドを用いて境界を推定し、マスク再構成でセグメンテーションを実現する。
原題: Boundary-by-Mask: Few-Shot Instance Segmentation with Mask-Conditioned Boundary Learning for Texture-Poor Industrial Parts / Yutaka Yoshinaga, Naoya Chiba, Koichi Hashimoto
日本語で読む → - 論文動作生成ロボティクス
周波数認識フローマッチングによる連続かつ一貫したロボット動作生成
離散的な動作チャンクに依存せず、周波数領域でフローマッチングを行うことで、異なる制御周波数や時間的不整合に頑健な連続動作を生成する手法を提案した。
原題: Frequency-Aware Flow Matching for Continuous and Consistent Robotic Action Generation / Jianing Guo, Fangzheng Chen, Zihao Mao 他
日本語で読む → - 論文サーベイロボティクス
ワールドアクションモデル:サーベイ
予測と行動を統合するワールドアクションモデル(WAM)の定義と分類を整理し、既存手法を生成対象と設計要素の2軸で分析したサーベイ論文。
原題: World Action Models: A Survey / Qiuhong Shen, Shihua Zhang, Yue Liao 他
日本語で読む → - 論文マッピング画像認識
GaussLite: リアルタイムロボットマッピングのためのオンラインタスク条件付き3Dガウススプラッティング
タスク記述に基づいて3Dガウススプラッティングの表現密度を調整し、関連領域のみを高精細に最適化するリアルタイムマッピングシステムを提案。
原題: GaussLite: Online Task-Conditioned 3D Gaussian Splatting for Real-Time Robotic Mapping / Annika Thomas, Mason Peterson, Jonathan P. How
日本語で読む → - 論文経路計画ロボティクス
DIFF-IPPO: 拡散モデルに基づくオープンボキャブラリ信念マップを用いた情報経路計画
拡散モデルを用いて、非ガウス型の信念マップ上で情報利得を最大化する大域軌道を生成する経路計画手法を提案。シミュレーションの捜索救助シナリオで有効性を検証した。
原題: DIFF-IPPO: Diffusion-Based Informative Path Planning with Open-Vocabulary Belief Maps / Sausar Karaf, Oleg Sautenkov, Mikhail Martynov 他
日本語で読む → - 論文把持機構ロボティクス
反転シェルに基づく受動的万能把持機構
弾性変形可能な双安定シェルの反転を利用した、受動的でモノリシックな把持機構を提案。物体に接触するとシェルが反転し、アームが物体を包み込んで把持する。
原題: A passive universal grasping mechanism based on an everting shell / Mythra V. S. Balakuntala, Safvan Palathingal, G. K. Ananthasuresh
日本語で読む → - 論文VLAロボティクス
TTT-VLA: テスト時潜在プロンプト最適化による視覚言語行動モデルの適応
視覚言語行動モデル(VLA)のテスト時分布シフトに対処するため、環境からの相互作用データを用いて潜在プロンプトのみを最適化するテスト時訓練フレームワークを提案した。
原題: TTT-VLA: Test-Time Latent Prompt Optimization for Vision-Language-Action Models / Wenbo Zhang, Jianxiong Li, Shuai Yang 他
日本語で読む → - 論文模倣学習ロボティクス
歪みに頑健な自律ケーブル配線のためのロボット模倣学習
画像の歪みが発生するケーブル配線作業において、画像品質評価と信頼度に基づく学習機構を導入し、歪んだ観測下でも高性能を維持するロボット模倣学習フレームワークを提案した。
原題: Distortion-Resilient Robotic Imitation Learning for Autonomous Cable Routing / Hao Wang, Fu-Zhao Ou, Shiqi Wang 他
日本語で読む → - 論文SLAMロボティクス
LXD-SLAM: 5種類のセンサから最大32通りの組み合わせを構成可能なLiDAR+X高密度SLAM
3D LiDARを中心に、カメラ・IMU・車輪エンコーダ・GNSSをプラグアンドプレイで統合できる多センサ融合SLAMフレームワークを提案し、高精度な位置推定と高密度マッピングを実現した。
原題: LXD-SLAM: LiDAR+X Dense SLAM with $\sum_{i=0}^{5}C_5^i$ Configurable Sensor Combinations / Zhong Wang, Lin Zhang, Linfei Li 他
日本語で読む → - 論文AR-HRCロボティクス
fARfetch: 大規模で視覚的に多様な環境におけるVLM駆動ARコンテンツ適応による共同配置型AR-HRCの実現
屋外などの大規模で視覚的に多様な環境でのAR-HRCを改善するため、セマンティック環境マッピング、文脈認識型ワールドインミニチュア表現、VLMによるARビュー管理を統合したシステムを提案し、実環境でのユーザスタディで有効性を検証した。
原題: fARfetch: Enabling Collocated AR-HRC in Large Visually Diverse Environments with VLM-Driven AR Content Adaptation / Christian Fronk, Hanting Ye, David Hunt 他
日本語で読む → - 論文姿勢推定画像認識
MF-UAVPose6D: 固定翼UAVのためのモデルフリー単眼6自由度姿勢推定フレームワーク
CADモデルやキーポイント事前情報を必要とせず、単一のRGB画像とカメラ内部パラメータのみから固定翼UAVの6自由度姿勢を推定するフレームワークを提案した。
原題: MF-UAVPose6D: A Model-Free Monocular 6-DoF Pose Estimation Framework for Fixed-Wing UAVs / Juanqin Liu, Leonardo Plotegher, Eloy Roura 他
日本語で読む → - 論文VLA/汎化ロボティクス
APT: 行動エキスパートの事前学習による視覚-言語-行動ポリシーの指示汎化の改善
視覚-言語-行動モデルにおいて、言語データの不均衡が原因で未見の指示への汎化が悪い問題を、行動エキスパートを事前学習する二段階手法APTで解決した。
原題: APT: Action Expert Pretraining Improves Instruction Generalization of Vision-Language-Action Policies / Kechun Xu, Zhenjie Zhu, Anzhe Chen 他
日本語で読む → - 論文四足歩行ロボティクス
無限の動きを解き放つ:生成ビデオ事前学習による表現豊かな四足歩行のスケーリング
動物を介さずに、LLMとビデオ拡散モデルで四足ロボットの多様な動きを生成し、実機で追従させるパイプラインUni-Moを提案した。
原題: Unleashing Infinite Motion: Scaling Expressive Quadrupedal Motion via Generative Video Priors / Youzhi Liu, Li Gao, Yifei Qian 他
日本語で読む →