論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/9/2 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文動画理解画像認識
ShallowStream: 浅い層で索引し、深い層で答えるストリーミング動画理解
動画ストリーミング理解の計算コストを削減するため、MLLMの浅い層でフレームの索引を構築し、質問時には浅い層の注意スコアで関連フレームを選択して深い層で回答するフレームワークを提案した。
原題: ShallowStream: Index Shallow then Answer Deep for Streaming Video Understanding / Jitai Hao, Ke Yang, Qiang Huang 他
日本語で読む → - 論文世界モデル機械学習
AGI迷路予測データセット:トランスフォーマーによる世界ダイナミクス学習のためのコンパクトなベンチマーク
手続き的に生成されたグリッドワールドを用いて、トランスフォーマーの世界モデル能力を評価するための軽量ベンチマークを提案し、空間メモリを持つアーキテクチャが有効であることを示した。
原題: AGI Maze Prediction Datasets: A Compact Benchmark for Learning World Dynamics with Transformers / Alexey Potapov
日本語で読む → - 論文キャリブレーションロボティクス
接触拘束に基づく人型ロボット下肢関節オフセット校正
外部計測装置を使わず、内蔵エンコーダと骨盤IMUのみで、静的両足接地時の接触拘束を利用して下肢関節オフセットを校正する手法を提案。シミュレーションと実機で精度向上を確認した。
原題: Contact-Constrained Lower-Limb Joint-Offset Calibration for Humanoid Robots / Kaixiang Lu, Haiyu Lan, Chunxiao Qiao 他
日本語で読む → - 論文VLAロボティクス
どのモダリティが重要かを感知する:ロバストなVLAポリシーのための証拠ゲート正則化
VLAポリシーが複数センサー入力の融合時に生じる「モダリティ絡み合い」問題を解決するため、センサーごとのタスク関連性に基づいて正則化を適応的に適用するEvidence-Gated Regularization (EGR)を提案した。シミュレーションと実ロボットで成功率を大幅に向上させた。
原題: Sensing Which Modality Matters: Evidence-Gated Regularization for Robust VLA Policies / Yue Yang, Diego Romeres, Chiori Hori 他
日本語で読む → - 論文ソフトロボティクスロボティクス
空気圧ソフトロボットによる効果的な物理リザーバ計算に向けて
空気圧ソフトアームを用いた物理リザーバ計算において、ポーチの接続トポロジー、剛性、センサ数が曲げ角度推定に与える影響を実験的に評価し、設計指針を導出した。
原題: Towards Effective Physical Reservoir Computing with a Pneumatic Soft Robot / Jeevan Hebbal Manjunath, Jun Wang, Suyi Li 他
日本語で読む → - 論文マニピュレーションロボティクス
リアルタイム動力学に基づくトルクサンプリングMPPIによるコンプライアントで力認識のマニピュレーション
MPPIベースのタスク空間制御フレームワークを提案し、剛体動力学をリアルタイムMPCで解き、安全制約を課すことで、非構造環境での正確な運動・力制御とコンプライアントな物理的相互作用を実現した。GPU並列化を活用したトルクサンプリング方式により、166Hz以上の更新レートを達成し、7自由度マニピュレータで実証した。
原題: Real-Time Dynamics-Based Torque-Sampling MPPI for Compliant and Force Aware Manipulation / Euncheol Im, Taehyun Kim, Yonghwan Oh 他
日本語で読む → - 論文モーションリターゲティングロボティクス
学習された点群対応によるヒューマノイドの統合モーションリターゲティング
人手による対応付けを必要とせず、点群の密な対応を学習することで、多様なモーションソースやロボット形態に対して統一的にモーションリターゲティングを行うフレームワークを提案した。
原題: Unified Motion Retargeting for Humanoids with Learned Point Cloud Correspondence / Hanyang Cao, Yuetong Fang, Taesoo Kwon 他
日本語で読む → - 論文3D再構成画像認識
MV-dVRK: 空間的外科知覚のための多視点ベンチマーク
外科手術用の多視点3D再構成を評価する初のex-vivoデータセットを構築し、視点数増加に伴う手法の性能比較を行った。
原題: MV-dVRK: A Multi-Viewpoint Benchmark for Spatial Surgical Perception / Guido Caccianiga, Sergey Prokudin, Yutong Chen 他
日本語で読む → - 論文LiDARセマンティックセグメンテーションロボティクス
実世界展開に向けた頑健なLiDARセマンティックセグメンテーション:粗いラベル、悪条件下、ドメインシフトでの評価
LiDARセマンティックセグメンテーションの実展開性を、粗いラベル、8種類の劣化、ドメイン汎化の3軸で評価するプロトコルを提案し、既存手法の性能と限界を明らかにした。
原題: Toward Robust LiDAR Semantic Segmentation for Real-World Deployment: Evaluation under Coarse Labels, Adverse Conditions, and Domain Shifts / Samir Abou Haidar, Alexandre Chariot, Mehdi Darouich 他
日本語で読む → - 論文データエンジン/操作学習画像認識
RoboTok: 人間のデモンストレーション検索と器用な操作学習のためのインターネット規模データエンジン
クエリ動画から関連する人間の操作デモをウェブ動画から検索し、器用なロボットポリシーの訓練に利用するデータエンジンを提案。3D手の軌跡に基づく潜在動作空間を学習し、視点や外観の変化に頑健な検索を実現。
原題: RoboTok: An Internet-Scale Data Engine for Human Demonstration Retrieval and Dexterous Manipulation Learning / Howard Qian, Yiting Chen, Yunfei Xie 他
日本語で読む → - 論文解釈可能性自然言語
知っているのに聞かれた時だけ言う:LLM内部診断とMinerva-7Bの分裂的認知
言語モデルの内部表現を解析・操作する「LLM内部診断」を提案し、Minerva-7Bがリスクを内部で区別しながら行動には反映しないこと、誤った前提に従いつつ内部には真実を保持することを示した。
原題: Knowing, and Saying It Only When Asked: LLM Endognostics and the Schizognosis of Minerva-7B / Fabrizio Davide, Francesco Collova
日本語で読む → - 論文歩行ロボティクス
FOCUS: 堅牢な人型プロプリオセプティブオドメトリのための足部観測信頼度
二値の接触判定に頼らず、シミュレーションから学習した連続的な足部FK信頼度をEKFに統合し、人型ロボットのオドメトリ精度を向上させる手法を提案した。
原題: FOCUS: Foot Observation Confidence for Robust Humanoid Proprioceptive Odometry / Kaixin Feng, Angsong Li, Shaopeng Zhang 他
日本語で読む → - 論文3Dプリンティングcs.GR
WildFab: 実世界モデルからの多軸3Dプリンティング
実世界の複雑な3Dモデル(ソリッドとシェルの組み合わせや非多様体構造を含む)を直接処理し、多軸3Dプリンティングのための空間ツールパスと衝突回避動作を計算するフレームワークを提案。ニューラル符号なし距離場と正則化一般化巻き数場を組み合わせたハイブリッド表現を用いる。
原題: WildFab: Multi-Axis 3D Printing from Models in the Wild / Jiasheng Qu, Zhikai Shen, Chenyu Xu 他
日本語で読む → - 論文VLA/解釈可能性ロボティクス
視覚・言語・行動モデルの潜在クラスタ解析
VLAモデルの内部表現を層ごとに解析し、行動デコーダの潜在空間をクラスタリングして解釈可能な概念を抽出するフレームワークを提案した。
原題: Latent Cluster Analysis for Vision-Language-Action Models / Theodor Wulff, Sergio Lanza, Tamara Bila 他
日本語で読む → - 論文状態推定ロボティクス
より良い想像上のロールアウトはより良いロボット制御を意味するか?フィードバック下でのワールドモデル評価の統制研究
ロボットの状態推定器の評価指標として、オープンループの予測精度よりもクローズドループの追従性能との相関が重要であることを示し、リプレイ誤差がロールアウト誤差よりも優れた指標であることを実験的に明らかにした。
原題: Do Better Imagined Rollouts Mean Better Robot Control? A Controlled Study of World-Model Evaluation Under Feedback / Dharini Raghavan, Amritpal Singh
日本語で読む → - 論文VLA/転移学習ロボティクス
ZETA: テーブルトップ操作におけるゼロショット・クロスエンボディメントVLA転移の統制研究
異なるロボット形態へのゼロショット転移を体系的に評価するため、厳密な定義と統制ベンチマークを導入し、状態表現・事前学習の多様性・補助学習・対象形態の露出の影響を分析した。
原題: ZETA: A Controlled Study of Zero-Shot Cross-Embodiment VLA Transfer for Tabletop Manipulation / Mi Yan, Wenhao Zhang, Zhiqi Zhang 他
日本語で読む → - 論文VLAロボティクス
ShieldVLA: 視覚言語行動モデルのための実行可能性を考慮した安全アライメント
視覚言語行動モデルに対し、ハミルトン・ヤコビ到達可能性に基づく安全クリティックを学習させ、安全領域内での報酬最大化と危険時の回復を分離するファインチューニング手法を提案。安全性コストを平均57%削減し、タスク成功率も向上させた。
原題: ShieldVLA: Feasibility-Aware Safety Alignment for Vision-Language-Action Models / Manan Tayal, Akshay Nambi
日本語で読む → - 論文セグメンテーション/エッジAI/宇宙ロボティクスロボティクス
資源制約のある宇宙ロボティクス向けハードウェア高速化インスタンスセグメンテーションと重要度解析
月面探査ロボット向けに、量子化キャリブレーション手法AVISとDPU上のYOLOベースセグメンテーションモデルを導入し、低照度・計算資源制約・放射線故障下でのリアルタイム推論を実現。ソフトウェアレベルの重要度解析で故障影響を推定し、精度損失の69.8%回復と消費電力5.7Wを達成した。
原題: Hardware-Accelerated Instance Segmentation for Resource-Constrained Space Robotics with Criticality Analysis / Siddhant Shete, Hilmi Dogu Kücüker, Udo Frese 他
日本語で読む → - 論文LLMエージェントAI
SkillGLoW: 手続き的ファミリーのスキル統合による長期的タスクストリーム上の自己改善エージェント
LLMエージェントが長期的なタスク群で自己改善する際、タスク間で共有される解決手順を「手続き的ファミリー」として集約・圧縮し、タスク固有の詳細は再生成するスキル管理手法SkillGLoWを提案した。
原題: SkillGLoW: Procedural-Family Skill Consolidation for Self-Improving Agents on Long-Horizon Task Streams / Ao Yan, Xin Zhang, Jiawei Du 他
日本語で読む → - 論文ポーズ推定ロボティクス
独自の経路を辿る:外れ値ロバストなポーズ登録に適用する高速認証器
凸緩和の退化により従来の認証が困難な問題に対し、候補解から中央経路に近い領域を探索して効率的に最適性を認証する手法CP-Certを提案し、ポーズ登録とデータ対応に適用して高速化を実証した。
原題: Following a Unique Path: A Fast Certifier Applied to Outlier-Robust Pose Registration / Connor Holmes, Abhishek Goudar, Timothy D. Barfoot
日本語で読む → - 論文マニピュレーションロボティクス
結果ボトルネックによる操作十分表現の学習
行動条件付き結果ボトルネックを用いて、操作に十分な確率的表現を学習し、把持選択や適応に応用した研究。
原題: Learning Manipulation-Sufficient Representations via Outcome Bottlenecks / Md Selim Sarowar, Sungho Kim
日本語で読む → - 論文制御ロボティクス
グローバル・ローカル可観測量を用いたKoopman演算子による多セグメント柔軟ロボットアームのリアルタイム形状制御
多セグメント柔軟ロボットアームの形状制御を、Koopman演算子に基づくモデル予測制御とグローバル・ローカル可観測量の組み合わせで実現し、最大10セグメントの数値実験と3・5セグメントの物理実験でリアルタイム性能とロバスト性を示した。
原題: Real-Time Shape Control of Multi-Segment Soft Robotic Arms Using Koopman Operators with Global and Local Observables / Jiahe Wang, Eron Ristich, Sultan Haidar Ali 他
日本語で読む → - 論文義足/アクチュエーションロボティクス
準直接駆動アクチュエーションを備えた軽量・低背型パワード膝義足の設計と検証
準直接駆動(QDD)アクチュエータを用いた軽量(2.6kg)で低背(24.5cm)のパワード膝義足を設計・試作し、ベンチテストと切断者3名の歩行・起立着席試験で生体模倣的な動作と高いトルク性能を実証した。
原題: Design and Validation of a Lightweight, Low-Profile Powered Knee Prosthesis with Quasi-Direct Drive Actuation / Ross J. Cortino, Ryan Posh, Emily G. Keller 他
日本語で読む → - 論文宇宙機/世界モデルロボティクス
GPU加速宇宙機ランデブー・近傍運用のための世界モデル
宇宙機のランデブー・ドッキング運用に世界モデルを初適用し、GPU並列シミュレーション環境とトランスフォーマー型世界モデルを構築、強化学習より高効率な計画性能を示した。
原題: GPU-Accelerated Astrodynamics World Models for Spacecraft Rendezvous and Proximity Operations / Duncan Eddy, Isaac R. Ward, Grace Ra Kim 他
日本語で読む → - 論文安全性機械学習
SEAL: 共有エキスパートの整合によるMixture-of-Expertsのグローバル安全性強化
MoEモデルの安全性を強化するため、常時活性化される共有エキスパートに着目し、ルータ非依存の防御手法SEALを提案した。
原題: SEAL: Reinforcing Global Safety in Mixture-of-Experts through Shared Expert ALignment / Qingyu Meng, Yiwei Zha, Jiahuan Pei 他
日本語で読む → - 論文画像フォレンジック画像認識
テキスト中心画像フォレンジックのための証拠誘導型検出・位置特定・説明システム
テキスト改ざん画像の真偽判定、改ざん領域の特定、証拠に基づく説明を統合したシステムを提案し、ACM Multimedia 2026のチャレンジで2位を獲得した。
原題: Evidence-Guided Detection, Localization and Explanation for Text-Centric Image Forensics / Peifeng Liu, Bin Li, Qingsong Zhang 他
日本語で読む → - 論文VLAロボティクス
静かなる妨害:LLM搭載ロボットシステムに対する内部状態トリガーバックドア攻撃
LLMで制御されるロボットに、外部刺激ではなくロボット自身の過去の行動履歴をトリガーとする隠れたバックドアを埋め込めることを示し、通常時は性能を保ちつつ特定条件下で停止や衝突を引き起こせることを実験で明らかにした。
原題: Silent Sabotage: Internal State Triggered Backdoor Attacks on LLM-Powered Robotic Systems / Doniyorkhon Obidov, Shivayogi Akki, Tan Chen 他
日本語で読む → - 論文世界モデル機械学習
JEPA型世界モデルのためのスペクトルターゲット物理潜在構造化
潜在世界モデルにおいて、表現崩壊は防げても物理的特性を捉えられない「物理表現の怠惰」という新たな失敗モードを特定し、フーリエ補助ヘッドによる訓練時補助で潜在空間を物理的に構造化し、計画性能を向上させる手法を提案した。
原題: Spectral-Target Physical Latent Structuring for JEPA-Style World Models / Penghao Zhu, Salvatore Penachio, Kaustav Mukherjee 他
日本語で読む → - 論文セキュリティ/防御画像認識
小さなパッチを超えて:多様なバックドアトリガーのブラックボックス検出と浄化
ブラックボックスモデルに対して、推論時に異常な挙動を引き起こす画像領域を特定し、その領域のみを浄化することでバックドア攻撃を防御する手法TRIMを提案した。
原題: Beyond Small Patches: Black-Box Detection and Purification of Diverse Backdoor Triggers / Ahmed Abdelnaby, Mohamed Elmahallawy
日本語で読む → - 論文VLA画像認識
SimpleMemVLA: 視覚言語行動モデルのためのシンプルかつ効果的なネイティブビデオメモリ
専用メモリモジュールを使わず、過去の観察をタイムスタンプ付きビデオとしてそのままバックボーンに渡すことで、長時間の操作タスクで高い性能を達成するVLAを提案した。
原題: SimpleMemVLA: A Simple but Effective Native-Video Memory for Vision-Language-Action Models / Cheng Yin, Wang Xu, Junpeng Yang 他
日本語で読む →