論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/3/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文HRIロボティクス
POIROT: 多人数殺人ミステリーゲームにおける直接的な触覚インタラクションとデジタル媒介インタラクション、および態度調整の調査
ロボットゲームマスターが手がかりを直接触覚提示するかデジタル画面で提示するかがユーザー体験に与える影響を、ロボットに対する否定的態度(NARS)の高低で分けて実験し、高NARSユーザーでは触覚提示が没入感を下げることを見出した。
原題: POIROT: Investigating Direct Tangible vs. Digitally Mediated Interaction and Attitude Moderation in Multi-party Murder Mystery Games / Wen Chen, Rongxi Chen, Shankai Chen 他
日本語で読む → - 論文歩行ロボティクス
散らかった空間を移動する:VRによる3Dシーン認識型ヒューマノイド歩行のデータ収集とベンチマークのスケーリング
VRを使って散らかった3D環境での人間の全身運動を収集し、ヒューマノイドロボットに再ターゲットするフレームワークを提案。145のシーンで348の軌道からなるデータセットを構築し、歩行性能を評価するベンチマークを導入した。
原題: Moving Through Clutter: Scaling Data Collection and Benchmarking for 3D Scene-Aware Humanoid Locomotion via Virtual Reality / Beichen Wang, Yuanjie Lu, Linji Wang 他
日本語で読む → - 論文群制御機械学習
凍らず、衝突せず:密集群集におけるニューラルナビゲーションの安全動作範囲の拡張
密集群集でのナビゲーションにおいて、学習ベース手法は密度変化に弱く、解析的手法は凍結しがちな問題を、密度不変な観測エンコーディングと密度適応型報酬設計を用いた強化学習で解決し、ゼロショット密度汎化を実現した。
原題: Don't Freeze, Don't Crash: Extending the Safe Operating Range of Neural Navigation in Dense Crowds / Jiefu Zhang, Yang Xu, Vaneet Aggarwal
日本語で読む → - 論文環境生成画像認識
MANSION: 長期的タスクのための多階層言語から3Dシーン生成
建物全体の多階層3D環境を言語指示から生成するフレームワークを提案し、長期的なロボットタスクの評価基盤を提供する。
原題: MANSION: Multi-floor lANguage-to-3D Scene generatIOn for loNg-horizon tasks / Lirong Che, Shuo Wen, Shan Huang 他
日本語で読む → - 論文VLA/エッジ・クラウド協調推論cs.DC
RAPID: 多様なVLAモデルのための冗長性認識・互換性最適なエッジ・クラウド分割推論
VLAモデルの推論コスト削減のため、冗長性を考慮し互換性を最適化したエッジ・クラウド分割推論フレームワークRAPIDを提案し、最大1.73倍の高速化を実現した。
原題: RAPID: Redundancy-Aware and Compatibility-Optimal Edge-Cloud Partitioned Inference for Diverse VLA Models / Zihao Zheng, Sicheng Tian, Hangyu Cao 他
日本語で読む → - 論文群制御ロボティクス
軽量3D LiDARを用いたUAV追跡:適応拡張カルマンフィルタによるアプローチ
小型UAV向けに、軽量な3D LiDARと適応拡張カルマンフィルタを用いて、スパースでノイズの多い点群から他機を頑健に追跡する手法を提案した。実機実験で標準的なカルマンフィルタより高い追跡性能を示した。
原題: Lightweight 3D LiDAR-Based UAV Tracking: An Adaptive Extended Kalman Filtering Approach / Nivand Khosravi, Meysam Basiri, Rodrigo Ventura
日本語で読む → - 論文触覚HCI
熱空気圧ピクセル:高速・局所・堅牢・低電圧な触覚フィードバック
電気パルスで内部空気を加熱膨張させ、薄型で高速・低電圧駆動の局所的な触覚提示を実現する熱空気圧ピクセルを提案し、その特性と知覚効果を評価した。
原題: Thermopneumatic Pixels: Fast, Localized, Robust, Low-Voltage Touch Feedback / Max Linnander, Yon Visell
日本語で読む → - 論文VLAロボティクス
最適化としての生成的制御:適応的で堅牢なロボット制御のための時間無条件フローマッチング
行動生成を軌道積分ではなく反復最適化として扱う時間無条件フレームワークGeCOを提案し、状態の難易度に応じて計算量を適応させ、OOD検出も可能にした。
原題: Generative Control as Optimization: Time Unconditional Flow Matching for Adaptive and Robust Robotic Control / Zunzhe Zhang, Runhan Huang, Yicheng Liu 他
日本語で読む → - 論文オドメトリロボティクス
SE(3)-LIO: SE(3)多様体上の同時分布ポーズによる滑らかなIMU伝播を用いた高精度・高ロバストなLiDAR-慣性オドメトリ
本論文では、IMU伝播をSE(3)多様体上で行い、回転変化を並進に適切に反映させるとともに、予測ポーズ間の相関を考慮した不確かさを運動補償に組み込むことで、LiDAR-慣性オドメトリの精度とロバスト性を向上させる手法を提案している。
原題: SE(3)-LIO: Smooth IMU Propagation With Jointly Distributed Poses on SE(3) Manifold for Accurate and Robust LiDAR-Inertial Odometry / Gunhee Shin, Seungjae Lee, Jei Kong 他
日本語で読む → - 論文VLA/ロバスト性/メモリロボティクス
RoboHarness:メモリ拡張型ポリシーハーネスによる視覚言語行動モデルの文脈内適応ロバスト性向上
凍結したVLAモデルを微調整なしでロバスト化するため、デュアルメモリRAGとマルチモーダルLLMによる帰属駆動オーケストレータ、MCP介入を備えたオンラインパイプラインと、オフラインのメモリ統合を提案し、平均成功率を56.6%向上させた。
原題: RoboHarness: A Memory-Augmented Policy Harness for Vision-Language-Action Model Robustness via In-Context Adaptation / Zhuoran Li, Zhiyang Li, Kaijun Zhou 他
日本語で読む → - 論文マニピュレーションロボティクス
RoboPCA: 人間のデモンストレーションからの姿勢中心のアフォーダンス学習によるロボット操作
ロボット操作のための、指示に応じた接触領域と接触姿勢を同時に予測する姿勢中心のアフォーダンス予測フレームワークを提案し、人間のデモからデータを自動収集するパイプラインも導入した。
原題: RoboPCA: Pose-centered Affordance Learning from Human Demonstrations for Robot Manipulation / Zhanqi Xiao, Ruiping Wang, Xilin Chen
日本語で読む → - 論文ナビゲーションロボティクス
ImagiNav: 生成的視覚予測と逆動力学によるスケーラブルな身体化ナビゲーション
ロボットのナビゲーションを、言語指示を視覚的なサブゴールに分解し、生成ビデオモデルで未来の軌道を想像し、逆動力学モデルで軌道を抽出するというモジュール方式で実現。ロボットデータなしでゼロショット転移を達成する。
原題: ImagiNav: Scalable Embodied Navigation via Generative Visual Prediction and Inverse Dynamics / Jie Chen, Yuxin Cai, Yizhuo Wang 他
日本語で読む → - 論文マニピュレーションロボティクス
ATG-MoE: 混合エキスパートを用いた自己回帰軌道生成による組立スキル学習
RGB-D観測、自然言語指示、ロボットの自己受容感覚を入力とし、混合エキスパートアーキテクチャを用いた自己回帰軌道生成により、単一モデルで複数の組立スキルを学習する手法を提案した。
原題: ATG-MoE: Autoregressive trajectory generation with mixture-of-experts for assembly skill learning / Weihang Huang, Chaoran Zhang, Xiaoxin Deng 他
日本語で読む → - 論文触覚/近接センサロボティクス
3Dプリント全身触覚・近接センサによる設計、マッピング、接触予測
3Dプリントで作れる全身用人工皮膚を開発し、触覚と近接センサを統合して接触を事前に予測する手法を提案。ロボットの全身に装着可能で、最大18cmの検出範囲を実現し、周囲空間の知覚マッピングとオンラインでの接触予測を実証した。
原題: Design, Mapping, and Contact Anticipation with 3D-printed Whole-Body Tactile and Proximity Sensors / Carson Kohlbrenner, Anna Soukhovei, Caleb Escobedo 他
日本語で読む → - 論文VLAロボティクス
ROI駆動フォビエーション注意による視覚-言語-行動システムの統一エゴセントリック表現
エンドエフェクタの姿勢を前方運動学で外部カメラに投影し、手中心の関心領域(ROI)を切り出すことで、手首カメラなしに高解像度の局所情報と全体文脈を両立するデータ表現を提案した。
原題: ROI-Driven Foveated Attention for Unified Egocentric Representations in Vision-Language-Action Systems / Xinhai Sun, Xiang Shi, Menglin Zou 他
日本語で読む → - 論文世界モデルロボティクス
持続可能なロボット世界モデル:強化学習によるマルチステップ展開の安定化
ロボットの世界モデルが自己回帰的に展開すると誤差が蓄積して劣化する問題に対し、強化学習を用いてモデル自身の展開上で訓練し、長期的な予測の忠実度を向上させた。
原題: Persistent Robot World Models: Stabilizing Multi-Step Rollouts via Reinforcement Learning / Jai Bardhan, Patrik Drozdik, Josef Sivic 他
日本語で読む → - 論文模倣学習/行動転移ロボティクス
OCRA: 3Dと触覚の事前知識を用いた物体中心学習による人間からロボットへの行動転移
人間のデモ動画からロボットの操作行動を学習する物体中心フレームワークOCRAを提案。3D点群と触覚情報を統合し、拡散ポリシーでロバストな操作を実現する。
原題: OCRA: Object-Centric Learning with 3D and Tactile Priors for Human-to-Robot Action Transfer / Kuanning Wang, Ke Fan, Yuqian Fu 他
日本語で読む → - 論文VLA/能動的知覚/操作ロボティクス
SaPaVe: ロボットの視覚言語行動モデルにおける能動的知覚と操作の実現
能動的知覚と操作を統合するエンドツーエンドフレームワークSaPaVeを提案し、カメラと操作の行動を分離しつつ協調学習することで、動的視点下でのロバストな能動的操作を実現した。
原題: SaPaVe: Towards Active Perception and Manipulation in Vision-Language-Action Models for Robotics / Mengzhen Liu, Enshen Zhou, Cheng Chi 他
日本語で読む → - 論文テレオペレーションロボティクス
KUKAloha: 建設用ロボットアームのための汎用・低コスト・共有制御型テレオペレーションフレームワーク
建設用ロボットアーム向けに、人間の直感的な操作と自律認識を組み合わせた低コストな共有制御テレオペレーションフレームワークを提案し、KUKAアームで実装・評価した。
原題: KUKAloha: A General, Low-Cost, and Shared-Control based Teleoperation Framework for Construction Robot Arm / Yifan Xu, Qizhang Shen, Vineet Kamat 他
日本語で読む → - 論文状態推定ロボティクス
H-RINS: スムージングとマッピングによる階層的密結合レーダー慣性状態推定
レーダーとIMUを階層的な因子グラフで密結合し、高速なオドメトリ推定とループ閉じ込めによるバイアス補正を組み合わせてドリフトを抑える手法を提案した。
原題: H-RINS: Hierarchical Tightly-coupled Radar-Inertial State Estimation via Smoothing and Mapping / Ali Alridha Abdulkarim, Mikhail Litvinov, Dzmitry Tsetserukou
日本語で読む → - 論文歩行ロボティクス
データ駆動型物理埋め込みダイナミクスと予測制御・強化学習による四足歩行
ラグランジュニューラルネットワークを強化学習とモデル予測制御に統合し、四足歩行の物理的に整合したダイナミクス学習と効率的な実時間計画を実現した。
原題: Data-Driven Physics Embedded Dynamics with Predictive Control and Reinforcement Learning for Quadrupeds / Prakrut Kotecha, Aditya Shirwatkar, Shishir Kolathaya
日本語で読む → - 論文軌道計画制御
不確実性下での多目的軌道評価のためのリスク対応ルールブック
環境との不確実な相互作用を考慮し、階層的優先順位や非比較可能性を含む複数の要求・目的を体系的に扱うリスク対応の軌道評価形式を提案し、自動運転の例で説明可能性の向上を示した。
原題: Risk-Aware Rulebooks for Multi-Objective Trajectory Evaluation under Uncertainty / Tichakorn Wongpiromsarn
日本語で読む → - 論文マニピュレーションロボティクス
TransDex: 透明物体の巧みな操作のための点群再構成による視触覚ポリシーの事前学習
透明物体操作時の自己遮蔽や深度ノイズに対処するため、Transformerベースの自己教師あり点群再構成で事前学習した3D視触覚融合ポリシーを提案し、実機実験で既存手法を上回る性能を示した。
原題: TransDex: Pre-training Visuo-Tactile Policy with Point Cloud Reconstruction for Dexterous Manipulation of Transparent Objects / Fengguan Li, Yifan Ma, Chen Qian 他
日本語で読む → - 論文VLA画像認識
HiMemVLN:階層的記憶システムによるオープンソースゼロショット視覚言語ナビゲーションの信頼性向上
オープンソースLLMを用いた視覚言語ナビゲーションにおける「ナビゲーション健忘」問題を分析し、階層的記憶システムを導入することで性能を約2倍に改善した研究。
原題: HiMemVLN: Enhancing Reliability of Open-Source Zero-Shot Vision-and-Language Navigation with Hierarchical Memory System / Kailin Lyu, Kangyi Wu, Pengna Li 他
日本語で読む → - 論文VLAロボティクス
AR-VLA: 視覚言語行動モデルのための真の自己回帰型アクションエキスパート
観測ごとに時間的文脈をリセットする従来のVLAや拡散ポリシーと異なり、長期記憶で履歴を保持し連続的な因果系列として行動を生成する自己回帰型アクションエキスパートを提案。再アンカリング機構で非同期な視覚・言語・行動を同期させ、滑らかで文脈認識型の行動生成を実現した。
原題: AR-VLA: True Autoregressive Action Expert for Vision-Language-Action Models / Yutong Hu, Jan-Nico Zaech, Nikolay Nikolov 他
日本語で読む → - 論文アフォーダンス推論画像認識
arg-VU: ロボット手術の視覚理解のための物理認識3D幾何によるアフォーダンス推論
3Dガウシアンスプラッティングと拡張位置ベースダイナミクスを組み合わせ、変形する手術組織の物理的に整合したアフォーダンス推論を実現するフレームワークを提案。
原題: arg-VU: Affordance Reasoning with Physics-Aware 3D Geometry for Visual Understanding in Robotic Surgery / Nan Xiao, Yunxin Fan, Farong Wang 他
日本語で読む → - 論文VLAロボティクス
世界行動モデルはVLAより汎化するのか?ロバスト性の比較研究
VLAと世界行動モデル(WAM)をLIBERO-PlusやRoboTwin 2.0-Plusで視覚・言語の摂動下に比較し、WAMの高いロバスト性を示した研究。
原題: Do World Action Models Generalize Better than VLAs? A Robustness Study / Zhanguang Zhang, Zhiyuan Li, Behnam Rahmati 他
日本語で読む → - 論文VLAロボティクス
HapticVLA: 推論時触覚センシング不要のVision-Language-Actionモデルによる接触リッチマニピュレーション
触覚をオフラインで学習し、推論時には触覚センサなしで接触を伴う器用な操作を実現するVLAモデルを提案。実世界実験で86.7%の成功率を達成。
原題: HapticVLA: Contact-Rich Manipulation via Vision-Language-Action Model without Inference-Time Tactile Sensing / Konstantin Gubernatorov, Mikhail Sannikov, Ilya Mikhalchuk 他
日本語で読む → - 論文イベントカメラ/運動予測画像認識
E-TIDE: イベント列からの高速で構造を保つ運動予測
イベントカメラのデータから将来のイベント表現を予測する軽量なエンドツーエンドモデルを提案し、大規模事前学習なしで競争力のある性能を実現した。
原題: E-TIDE: Fast, Structure-Preserving Motion Forecasting from Event Sequences / Biswadeep Sen, Benoit R. Cottereau, Nicolas Cuperlier 他
日本語で読む → - 論文歩行ロボティクス
RoboForge: 物理最適化されたテキスト誘導型ヒューマノイド全身歩行
テキストから生成した人間らしい動作をヒューマノイドロボットで物理的に実行可能にするため、物理的妥当性を最適化する双方向結合フレームワークを提案した。
原題: RoboForge: Physically Optimized Text-guided Whole-Body Locomotion for Humanoids / Xichen Yuan, Zhe Li, Bofan Lyu 他
日本語で読む →