論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/5/3 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文世界モデル画像認識
Embody4D: 身体化された4D世界モデリングのための汎用データエンジン
単眼ロボット映像を任意の視点からの新規ビュー映像に変換するビデオ間世界モデルを提案し、データ不足を合成パイプラインで補い、幾何学的安定性と操作領域の忠実度を高める手法を導入した。
原題: Embody4D: A Generalist Data Engine for Embodied 4D World Modeling / Peiyan Tu, Hanxin Zhu, Jingwen Sun 他
日本語で読む → - 論文群制御機械学習
分散データセンター向けのエネルギー管理と連携AIGCワークロードスケジューリング:拡散モデル支援型報酬整形アプローチ
AIGCサービス提供者がデータセンターのエネルギーコストを削減しつつ高品質なコンテンツ生成を保証するため、エネルギー管理とワークロードスケジューリングを統合する枠組みを提案し、報酬のスパース性を拡散モデルによる報酬整形で解決する。
原題: Joint Energy Management and Coordinated AIGC Workload Scheduling for Distributed Data Centers: A Diffusion-Aided Reward Shaping Approach / Yang Fu, Peng Qin, Liming Chen 他
日本語で読む → - 論文行動セグメンテーション画像認識
IMPACT-Scribe: 境界スケッチとクエリ計画による対話型時間行動セグメンテーション
手動修正を活用して将来の協調を改善する、手続き動画の高密度ラベリングのための対話型フレームワークを提案。
原題: IMPACT-Scribe: Interactive Temporal Action Segmentation with Boundary Scribbles and Query Planning / Qian Yin, Di Wen, Kunyu Peng 他
日本語で読む → - 論文セキュリティ機械学習
TRAP: ワールドモデル計画のためのテール認識ランキング攻撃
ワールドモデルの想像軌道のランキング構造を標的としたバックドア攻撃フレームワークTRAPを提案し、計画結果を乗っ取る。
原題: TRAP: Tail-aware Ranking Attack for World-Model Planning / Siyuan Duan, Ke Zhang, Xizhao Luo
日本語で読む → - 論文ナビゲーション画像認識
ゼロショット具現化ナビゲーションと推論のためのマルチスケールガウス言語マップ
環境の幾何構造と意味構造を捉えるマルチスケールのガウス言語マップを提案し、大規模モデルと統合してゼロショットでナビゲーションと推論を行う。
原題: Multi-Scale Gaussian-Language Map for Zero-shot Embodied Navigation and Reasoning / Sixian Zhang, Yiyao Wang, Xinhang Song 他
日本語で読む → - 論文ナビゲーション画像認識
TrajRAG: 幾何学的・意味的経験の検索によるゼロショット物体ナビゲーション
過去のナビゲーション軌跡をトポロジカル極座標表現で構造化し、階層的チャンクで検索可能にすることで、大規模モデルの推論を強化するゼロショット物体ナビゲーション手法を提案。
原題: TrajRAG: Retrieving Geometric-Semantic Experience for Zero-Shot Object Navigation / Yiyao Wang, Sixian Zhang, Keming Zhang 他
日本語で読む → - 論文ビデオ推論画像認識
知覚的ショートカットを超えて:軽量MLLMの汎化ビデオ推論のための因果的着想に基づくデバイアス最適化
軽量マルチモーダル言語モデルにおける強化学習がデータバイアスによる知覚的ショートカットに依存する問題を因果分析で明らかにし、バイアスモデルと反発的目標を用いた2段階デバイアス手法VideoThinkerを提案した。
原題: Beyond Perceptual Shortcuts: Causal-Inspired Debiasing Optimization for Generalizable Video Reasoning in Lightweight MLLMs / Jingze Wu, Quan Zhang, Hongfei Suo 他
日本語で読む → - 論文制御制御
滑らかな回避制約を備えた点群NMPC
非線形モデル予測制御を用いて、滑らかな点群距離指標と制御バリア関数により複雑な環境での目標追跡と障害物回避を実現する手法を提案した。
原題: Point-to-Cloud NMPC with Smooth Avoidance Constraints / Brener G. Ferreira, Vinicius M. Gonçalves, Marcelo A. Santos 他
日本語で読む → - 論文制御ロボティクス
バリア・リアプノフ制約を備えた適応的人工時間遅延制御:オイラー・ラグランジュロボット向け
状態依存の不確かさと時間変化する状態制約を同時に扱うため、人工時間遅延推定とバリア・リアプノフ関数を組み合わせた適応制御フレームワークを提案し、5自由度ロボットアームで実証した。
原題: Adaptive Artificial Time-Delay Control with Barrier Lyapunov Constraints for Euler-Lagrange Robots / Saksham Gupta, Rishabh Dev Yadav, Sarthak Mishra 他
日本語で読む → - 論文遠隔操作ロボティクス
コンプライアント6自由度ポーズ・力覚センシングによる双方向遠隔操作
低コストのコンプライアント6自由度ポーズ・力覚センシングエンドエフェクタを両側に搭載し、ハードウェア非依存のミドルウェア上で双方向遠隔操作を実現した。遅延やパケット損失下でも安定性を維持し、接触時の仮想剛性を追従する。
原題: Bilateral Teleoperation with Compliant 6-DOF Pose-and-Force Sensing / Yue Feng, Weicheng Huang, I-Ming Chen
日本語で読む → - 論文進化ロボティクスロボティクス
ECo-MoE: 身体条件付き混合エキスパートによるロボットの進化可能性の向上
ロボットの設計(遺伝子型)と制御(神経モジュール)を同時最適化する新しい枠組みを提案。個別ポリシー学習や単一の万能コントローラではなく、身体構造に応じてエキスパートを切り替える混合モデルで、進化的探索と学習を効率化する。
原題: ECo-MoE: Embodiment-Conditioned Mixture of Experts Increases the Evolvability of Robots / Yibin Wang, Muhan Li, Zihan Guo 他
日本語で読む → - 論文自動運転/交通行動ロボティクス
自動運転車と人間運転車に対する割り込み許容ギャップの差異:Waymoオープンモーションデータセットからの証拠
Waymoの実世界高速道路データを用いて、人間ドライバーが自動運転車の前では人間運転車の前よりも短い車間距離で割り込む傾向があることを統計的に示した論文。
原題: Cut-In Gap Acceptance Toward Autonomous vs. Human-Driven Vehicles: Evidence from the Waymo Open Motion Dataset / Abdulaziz Alhuraish, Yuhang Wang, Hao Zhou
日本語で読む → - 論文世界モデル機械学習
UWM-JEPA: 信念空間で想像する予測的世界モデル
部分観測環境向けに、密度行列潜在変数とユニタリ予測器を持つJEPA世界モデルを提案し、隠れ状態の不確実性を保持したままロールアウトできることを示した。
原題: UWM-JEPA: Predictive World Models That Imagine in Belief Space / Santosh Kumar Radha, Oktay Goktas
日本語で読む → - 論文強化学習/制御ロボティクス
強化学習によるクアッドローターの適応型アウターループ制御
クアッドローターの飛行制御に強化学習を適用し、外乱を推定する残差ダイナミクス予測器と実機転送のための校正機構を導入して、動的擾乱下でも高精度な軌道追従を実現した。
原題: Adaptive Outer-Loop Control of Quadrotors via Reinforcement Learning / Vishnu Saj, Sushil Vemuri, Dileep Kalathil 他
日本語で読む → - 論文模倣学習/変形物体操作ロボティクス
位相条件付き模倣学習と自律的失敗回復による堅牢な変形物体操作
変形物体操作のための、位相条件付きで力覚を考慮したフレームワークを提案。閉ループ階層アーキテクチャにより、視覚的に類似した観測での状態エイリアシングを解消し、実行失敗からの自律回復を実現する。
原題: Phase-Conditioned Imitation Learning with Autonomous Failure Recovery for Robust Deformable Object Manipulation / Dayuan Chen, Kai Tang, Yukuan Zhang 他
日本語で読む → - 論文位置推定ロボティクス
合成LiDARセンシングと記述子空間検索によるオフライン・オンライン階層型3Dグローバル再位置推定
大規模空間での3D再位置推定を高速化するため、オフラインで地図から候補位置と記述子を生成し、オンラインでは検索と点群レジストレーションで精密な位置を推定する階層型フレームワークを提案した。
原題: Offline-Online Hierarchical 3D Global Relocalization With Synthetic LiDAR Sensing and Descriptor-Space Retrieval / Jiahua Ren, Kai Shen, Muhua Zhang 他
日本語で読む → - 論文マニピュレーションロボティクス
MonoDuo: 1本のロボットアームで両腕ポリシーを学習する
単腕ロボットのデモと人間の協調動作から、両腕ロボットの操作ポリシーを学習するフレームワークを提案。合成デモにより未見の両腕ロボット構成へのゼロショット転移を実現した。
原題: MonoDuo: Using One Robot Arm to Learn Bimanual Policies / Sandeep Bajamahal, Lawrence Yunliang Chen, Toru Lin 他
日本語で読む → - 論文VLAロボティクス
RoVLA: ロバストな視覚言語行動モデルのための多重整合性制約
視覚言語行動モデルのロバスト性を高めるため、指示意味・軌道進化・観測摂動の3つの変換に対する整合性制約を導入したRoVLAを提案。
原題: RoVLA: Multi-Consistency Constraints for Robust Vision-Language-Action Models / Jingzhou Luo, Yifan Wen, Yongjie Bai 他
日本語で読む → - 論文教育/ロボティクスHCI
RoboBlockly Studio: 対話型ブロックプログラミングとロボットフィードバックによる計算的思考の育成
ブロックプログラミング、対話型AIチューター、実体ロボットを統合したシステムを設計・評価し、高校生の計算的思考学習を支援する。
原題: RoboBlockly Studio: Conversational Block Programming with Embodied Robot Feedback for Computational Thinking / Leyi Li, Chenyu Du, Jiafei Sun 他
日本語で読む → - 論文世界モデル画像認識
ハイブリッド身体性タスクにおける長期的進化のためのワールド・エゴモデリング
本論文は、長期的なハイブリッド身体性タスク(ナビゲーションと操作の組み合わせ)において、世界と自己の進化を分離してモデル化する新しいパラダイム「ワールド・エゴモデリング」を提案し、その実装としてWEMモデルとベンチマークHTEWorldを構築した。
原題: World-Ego Modeling for Long-Horizon Evolution in Hybrid Embodied Tasks / Zuyao Lin, Jianhui Zhang, Peidong Jia 他
日本語で読む → - 論文マニピュレーションロボティクス
OHP-RL: ロボット操作の強化学習におけるオンライン人間選好をガイドとして活用
人間の介入を選好情報として捉え、状態依存のゲートで適応的に学習を導く強化学習フレームワークを提案し、実機ロボットの接触を伴う操作タスクで有効性を示した。
原題: OHP-RL: Online Human Preference as Guidance in Reinforcement Learning for Robot Manipulation / Yunyang Mo, Jian Li, Qiwei Wu 他
日本語で読む → - 論文VLAロボティクス
ECHO: 視覚言語行動モデルのための連続階層メモリ
長期的な操作タスクにおけるVLAモデルの性能を向上させるため、経験を階層的に整理する連続メモリフレームワークECHOを提案。双曲オートエンコーダでメモリを木構造に組織化し、効率的な検索と合成を実現。
原題: ECHO: Continuous Hierarchical Memory for Vision-Language-Action Models / Yanbin Hu, Jin Cui, Jiayi Lu 他
日本語で読む → - 論文VLA/推論時計算ロボティクス
ドリフトはサンプリング誤差:長期的ロボット計画のためのSNRを考慮したパワー分布
VLAモデルにおける指示ドリフトをサンプリング誤差として捉え、推論時にパワー分布とSNRに基づく適応的MCMC探索を導入するCAPSを提案し、長期的タスクの成功率を向上させた。
原題: Drift is a Sampling Error: SNR-Aware Power Distributions for Long-Horizon Robotic Planning / Kewei Chen, Yayu Long, Mingsheng Shang
日本語で読む → - 論文自動運転/制御ロボティクス
連続時間残差学習による車両のロバスト経路追従:ICODE-MPPIアプローチ
モデル予測経路積分(MPPI)制御の性能を向上させるため、未モデル化の残差ダイナミクスを学習・補償するICODE-MPPIフレームワークを提案。高忠実度シミュレーションで横追従誤差を最大69%削減し、制御チャタリングも抑制した。
原題: Robust Path Tracking for Vehicles via Continuous-Time Residual Learning: An ICODE-MPPI Approach / Shugen Song, Wenjie Mei, Chengyan Zhao
日本語で読む → - 論文マニピュレーションロボティクス
ステレオポリシー:ステレオ知覚によるロボット操作ポリシーの改善
ステレオ画像ペアを直接利用して3次元幾何推論を強化する視覚運動ポリシー学習フレームワークを提案し、シミュレーションと実ロボットの操作タスクで性能を向上させた。
原題: StereoPolicy: Improving Robotic Manipulation Policies via Stereo Perception / Evans Han, Yunfan Jiang, Yingke Wang 他
日本語で読む → - 論文医療ロボティクスロボティクス
解剖学的ランドマーク誘導による深層強化学習を用いた自律的胃内ナビゲーション
カプセル内視鏡の胃内ナビゲーションを、解剖学的ランドマークを利用した深層強化学習で自律化し、シミュレーションと実環境で高い被覆率と短時間化を達成した。
原題: Anatomical Landmark-Guided Deep Reinforcement Learning for Autonomous Gastric Navigation / Haoxuan Wu, Sishen Yuan, Haitao Gao 他
日本語で読む → - 論文VLAロボティクス
Premover: 指示が完了する前から行動を開始する高速ビジョン・言語・行動制御
ユーザーが指示を入力している待ち時間を利用して事前計算を行う軽量モジュールをVLAポリシーに追加し、成功率を保ちながら応答時間を短縮する手法を提案した。
原題: Premover: Fast Vision-Language-Action Control by Acting Before Instructions Are Complete / Joonha Park, Jiseung Jeong, Taesik Gong
日本語で読む → - 論文自動運転/3D知覚画像認識
STELLAR: 自動運転向け3D知覚大規模モデルのスケーリング
自動運転の3D知覚モデルを大規模化し、LiDAR・レーダー・カメラ・地図情報を統合して5000万データで学習し、Waymoデータセットで最高性能を達成した研究。
原題: STELLAR: Scaling 3D Perception Large Models for Autonomous Driving / Yingwei Li, Xin Huang, Yang Liu 他
日本語で読む → - 論文マニピュレーションロボティクス
OA-WAM: 物体アドレス可能な世界行動モデルによるロバストなロボット操作
物体ごとのスロット表現とアドレス機構を導入した世界行動モデルを提案し、物体の同一性と文脈を分離することで、シーン変化に対して頑健な操作を実現した。
原題: OA-WAM: Object-Addressable World Action Model for Robust Robot Manipulation / Yushan Liu, Peibo Sun, Shoujie Li 他
日本語で読む → - 論文SLAMロボティクス
SLAMのための証明付き多面体不確実性定量化
3D-3DランドマークベースSLAMに対して、真の姿勢とランドマークを確実に含む多面体不確実性セットを生成するアルゴリズムを提案。理論的保証と実用性を両立し、共形予測で測定不確実性を較正する。
原題: Provably Guaranteed Polytopic Uncertainty Quantification for SLAM / Guangyang Zeng, Yulong Gao, Yuan Shen 他
日本語で読む →