論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/8/23 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文触覚ロボティクス
触覚基盤モデルの可能性
言語や視覚の基盤モデルの成功を踏まえ、触覚分野でも汎用的な基盤モデル(HFM)の構築を提案し、その課題と展望を論じた論文。
原題: The Potential of Haptic Foundation Models / Jianquan Wang, Haiwei Dong, Abdulmotaleb El Saddik
日本語で読む → - 論文UAV認識画像認識
メトリック3DフュージョンによるオープンボキャブラリUAV認識の時間的意味安定性の理解
UAVのオープンボキャブラリセグメンテーションの時間的不安定性を、3Dフュージョンで関連付けたボクセル評価フレームワークを用いて分析し、観測の持続性が意味的一貫性評価に重要であることを示した。
原題: Understanding Temporal Semantic Stability in Open-Vocabulary UAV Perception through Metric 3D Fusion / Saurbh Singh Jamwal
日本語で読む → - 論文気象予測機械学習
ラグランジュ大気JEPAフレームワークにおけるクロス変数転移:ラベルなし嵐の追跡
南アジアのモンスーン降水予測において、降水データを使わずに連続的な大気プロキシ(OLRなど)で事前学習した表現を転移し、降水予測精度を向上させる手法を提案した。
原題: Tracing the Unlabeled Storm: Cross-Variable Transfer in a Lagrangian Atmospheric JEPA Framework / K M Anirudh, S Sandeep, Hariprasad Kodamana
日本語で読む → - 論文VLA/蒸留AI
WAM-OPD: ワールドアクションモデルのためのオンポリシー蒸留
ビデオ生成とロボット動作生成を統合したワールドアクションモデル(WAM)の蒸留後性能低下を、オンポリシー蒸留で修復する手法を提案。学生モデルが環境で行動し、教師モデルがその履歴に基づいてビデオと動作のターゲットを提供することで、タスク成功率が大幅に向上した。
原題: WAM-OPD: On-Policy Distillation for World Action Models / Liuhaichen Yang, Zhuang Jiang, Chenchao Sheng 他
日本語で読む → - 論文移動操作ロボティクス
TONAV: 関節物体の四足移動操作のためのタスク指向ナビゲーションと動作速度チャンク学習
四足ロボットによる関節物体の移動操作を統合するフレームワークを提案。タスク指向ナビゲーションと動作速度チャンク学習を組み合わせ、ナビゲーションと操作のギャップを解消し、安定した連続接触操作を実現した。
原題: TONAV: Task-Oriented Navigation and Action-Velocity Chunk Learning for Articulated Object Quadrupedal Mobile Manipulation / Haoran Lin, Mingyu Yang, Pengfei Qi 他
日本語で読む → - 論文ナビゲーションAI
潜在世界モデルによる結果予測とナビゲーションポリシーの強化
ロボットナビゲーションのための潜在世界モデルを提案し、観測の再構成ではなく潜在特徴の適合性を予測することで、未ラベルのビデオからポリシー学習を可能にし、世界モデル内での強化学習により実世界性能を向上させた。
原題: Predicting Consequences and Reinforcing Navigation Policies with Latent World Models / Zengmao Wang, Wei Gao, Shuhan Shen
日本語で読む → - 論文sim2realロボティクス
実2シミュレーション動力学推定と強化学習によるトルク制御ロボットのSim2Real転送の強化
トルク制御ロボットアームのシミュレーションから実機へのポリシー転送を改善するため、実機の軌跡データから動力学パラメータを同定し、遺伝的アルゴリズムとドメインランダム化を組み合わせたReal2Sim2Realパイプラインを提案した。7自由度のFranka Emika Pandaロボットで検証し、追従精度とロバスト性が向上した。
原題: Enhancing Sim2Real Transfer for Torque-Controlled Robots through Real2Sim Dynamics Estimation and Reinforcement Learning / Davide Bargellini, Alex Pasquali, Andrea Govoni 他
日本語で読む → - 論文VLA/両腕操作ロボティクス
驚くほど単純なモダリティマスキングによる堅牢な両腕視覚言語行動モデル
両腕ロボット操作のための視覚言語行動モデルの堅牢性を、トレーニング中にモダリティチャネルをランダムにマスクするだけのシンプルな手法で向上させた。
原題: Robust Bimanual Vision-Language-Action Models via Embarrassingly Simple Modality Masking / Dongzhou Cheng, Ziang Li, Yixiao Zhou 他
日本語で読む → - 論文模倣学習ロボティクス
WorldToken: ロボット模倣学習のための時間優先シーケンスモデリング
ロボットポリシーにおいて、各タイムステップの多視点画像やプロプリオセプションなどの観測を1つのワールドトークンに融合し、時間方向にTransformerでモデル化する新しい手法を提案。RoboCasaタスクで高い成功率を達成し、データ量やモデルサイズの影響を分析した。
原題: WorldToken: Time-First Sequence Modeling for Robotic Imitation Learning / Chunkai Yang, Andong Yang, Chao Gao
日本語で読む → - 論文群制御AI
AUDITA: 自律マルチエージェントシステムにおける有害事象の認証付き監査と因果帰属
複数のAIエージェントが協調して動くシステムで事故が起きた際、責任の所在を公平に判定する監査手法を提案。改ざん防止の記録と段階的な因果帰属エンジンを組み合わせ、単一の犯人を特定する従来手法より正確に責任を割り当てる。
原題: AUDITA: certified auditing and causal attribution of adverse outcomes in autonomous multi-agent systems / Zhixu Du, Yiran Chen
日本語で読む → - 論文分子基盤モデル機械学習
Mol-JEPA: 分子のためのマルチモーダル統合予測アーキテクチャ
分子構造や細胞表現型など複数のデータモダリティを潜在空間で予測することで、化学的に無効な拡張やモダリティ崩壊などの問題を解決する分子基盤モデルを提案した。
原題: Mol-JEPA: A multimodal Joint Embedding Predictive Architecture for Molecules / Florian Rottach, Sebastian Schieferdecker, William Rudman 他
日本語で読む → - 論文模倣学習機械学習
ワールドモデルポリシー学習と模倣ワールドアクションモデルの能力分離について
観察デモから学習する際、将来予測を介したワールドアクションモデルと直接行動クローニングの制御能力を理論的に比較し、両者が同じ外部ポリシークラスと理想的な模倣目標を持つことを示した。
原題: On the Capability Separation Between World-Model Policy Learning and Imitated World-Action Models / Yang Yu
日本語で読む → - 論文運動計画ロボティクス
GCS-Bridging: 凸集合の非連結性を回復するグラフ・オブ・凸集合運動計画
凸集合のグラフ(GCS)に基づく運動計画で、開始・目標領域が異なる連結成分にある場合に、衝突回避経路と凸領域の膨張で連結性を回復する手法を提案。シミュレーションで99.8%の成功率、実機でも有効性を確認。
原題: GCS-Bridging: Restoring Connectivity of Disconnected Convex Sets for Graph-of-Convex-Sets Motion Planning / Xiaokai Zhou, Baoshi Cao, Yang Liu 他
日本語で読む → - 論文VLAロボティクス
Ludi 0.1: 社会的知能を持つロボットのためのエージェントシステム
ロボットが曖昧な指示を理解し、文脈を保持し、意図の変化に応じて行動を修正しながら人間と協調するための、対話・推論・記憶・ナビゲーション・操作を統合したエージェントシステムを提案した。
原題: Ludi${}_{\scriptscriptstyle 0.1}$: An Agentic System for Socially Intelligent Robots / Wooseong Chung, William Cong, Jakub Dworakowski 他
日本語で読む → - 論文HCI/共在コラボレーションAI
代わりに言ってくれませんか?共在ディスカッションにおける代理発言
共在ディスカッションで発言しにくい意見を、仮想プロキシを通じて代弁するMRシステム「SecondVoice」を提案し、テキストボードと比較して代理発言が会話に参加しやすいことを示した。
原題: Can You Say This for Me? Speaking Up by Proxy in Co-Located Discussion / Yue Shen, Rehema Abulikemu, Ryan P. McMahan 他
日本語で読む → - 論文群制御AI
GenCoord: プライベート情報下でのスキルパスコミットメント
エージェント間で非対称な情報を持つ協調タスクにおいて、タスクの結果を実行可能なスキルパスコミットメントに変換する手法を提案。ローカルモデルが計画と要求を生成し、フィードバックで修正することで、情報ギャップを解消し、通信量を削減する。
原題: GenCoord: Skill-Path Commitments under Private Information / Peng He, Junning Zhu, Haohan Yuan 他
日本語で読む → - 論文VLA/強化学習ロボティクス
CounterAlign: 視覚言語行動モデルのための反事実的監督
専門家のデモンストレーションのみから、指示を入れ替えることで反事実的なデータを合成し、オフライン強化学習の報酬モデルを学習する手法を提案。ロボット操作の堅牢性を向上させる。
原題: CounterAlign: Counterfactual Supervision for Vision-Language-Action Models / Haru Kondoh, Kei Ota, Asako Kanezaki 他
日本語で読む → - 論文物理推論機械学習
物理推論のためのモデリングと実行の分離
物理問題を解く際に、計算前に物理モデルを明示的に構築するフレームワークを提案し、二段階の学習戦略でモデルの推論性能を向上させた。
原題: Decoupled Physical Modeling and Execution for Physics Reasoning / Ye Zhang, Xuehang Guo, Rui Pan 他
日本語で読む → - 論文接触リッチ操作ロボティクス
建設現場におけるゼロショット学習による接触リッチなロボット操作:拡散ポリシー誘導型適応制御
シミュレーションで学習した拡散ポリシーと適応制御を組み合わせ、建設現場の接触を伴う組立作業をゼロショットで実現するフレームワークを提案した。
原題: Contact-Rich Robotic Manipulation in Construction via Zero-Shot Learning: A Diffusion Policy-Guided Adaptive Control / Roman Ibrahimov, Salma Mozaffari, Arash Adel
日本語で読む → - 論文内視鏡ロボティクスロボティクス
EndoNav:言語誘導ロボット内視鏡検査のための意味論から幾何学への接地
外科医の音声コマンドを患者固有の解剖学的シーン表現に基づく視点目標に変換し、内視鏡の自律的な可視化動作を実現するフレームワークを提案した。
原題: EndoNav: Semantic-to-Geometric Grounding for Language-Guided Robotic Endoscopic Examination / Jecia Z. Y. Mao, Hisashi Ishida, Kathryn Jung 他
日本語で読む → - 論文画像編集画像認識
SpatialDiff: 暗黙的な空間モデリングによる3D認識オブジェクト移動
複雑なシーンでのオブジェクト移動を正確に行うため、3D空間構造を暗黙的にモデル化し、グローバルな空間監視で編集操作による位置変化を認識する手法を提案した。
原題: SpatialDiff: 3D-Aware Object Movement via Implicit Spatial Modeling / Zheng Liu, Zijian He, Huiguo He 他
日本語で読む → - 論文安全性評価AI
GuardianBench:身体化AIにおける潜在的な文脈リスクのための同一シーン指示対比ベンチマーク
同一シーンで指示だけを変えた安全/不安全の対比ペアからなるベンチマークを構築し、VLMが指示に鈍感で安全判断を誤ることを示し、軽量な事後学習手法で改善を実証した。
原題: GuardianBench: A Same-Scene Instruction-Contrastive Benchmark for Latent Contextual Risk in Embodied AI / Zhesheng Zhang, Jiahao Lu, Wei Liu 他
日本語で読む → - 論文メモリ/エージェントAI
ECHO: 認知に着想を得た監査可能なメモリプレーンによる長期的エージェント
長期的なタスクを扱うエージェント向けに、エピソード記憶や再固定化などの認知機能に着想を得た監査可能なメモリアーキテクチャ「ECHO」を提案し、検索性能を評価した。
原題: ECHO: A Cognitively Inspired, Auditable Memory Plane for Long-Horizon Agents / Yu Qian, Hong Miao, Boyang Guo 他
日本語で読む → - 論文HRIロボティクス
文脈認識に基づく人間支援ロボットシステムの設計
人間の活動を文脈に応じて認識し、行動ツリーで動的な支援行動を定義するロボットシステムの設計を提案した論文。
原題: Design of a Human-Assistance Robot System with Contextual Action Recognition / Amanuel Ergogo, Teresa Zielińska
日本語で読む → - 論文センサ統合ロボティクス
羽ばたき昆虫サイズ航空ロボットのためのアクチュエータと付属肢における昆虫様分散型固有受容
昆虫サイズの羽ばたき飛行ロボットに、駆動アクチュエータとピッチヒンジに組み込む薄膜圧電ポリマーセンサを開発し、ストローク角とピッチ角を正確に計測できることを示した。衝突検出や非同期羽ばたきなどの応用も実証した。
原題: Towards insect-like distributed proprioception in actuators and appendages for flapping-wing insect-scale aerial robots / Alexander Hedrick, Arvind Gupta, Kaushik Jayaram
日本語で読む → - 論文ソーシャルロボットロボティクス
認知症の見当識障害検出と介護者支援介入のための在宅ソーシャルロボット設計に関するステークホルダー洞察
認知症患者の見当識障害を検出し、介護者を支援する在宅ソーシャルロボットの設計要件を、介護者や専門家へのインタビューから導き出した研究。
原題: Stakeholder Insights for Designing In-Home Social Robots for Dementia Disorientation Detection and Caregiver-Aware Intervention / Emmanuel Akinrintoyo, Nicole Salomons
日本語で読む → - 論文ドローン輸送ロボティクス
視覚誘導型モーフィングクアッドコプターによる狭路通過を伴う多形状ペイロード輸送
ペイロードの形状や通路幅に応じてアームを伸縮できるモーフィング機構を備えたクアッドコプターを提案し、視覚と力覚フィードバックを用いて箱・円筒・球の異なる形状の物体を狭い通路を通って輸送するシミュレーション評価を行った。
原題: Vision-Guided Morphing Quadcopter for Multi-Geometry Payload Transport through Narrow Passages / Aashish Sahu, Shriram Hari, R. Prasanth Kumar
日本語で読む → - 論文継続学習ロボティクス
CIDER: 身体化強化学習のための継続的対話蒸留
実世界の継続的強化学習において、過去のポリシーを教師として凍結し、蒸留による保持とタスク学習を交互に行うことで、破滅的忘却を防ぎながら新しいスキルを獲得するフレームワークを提案した。
原題: CIDER: Continual Interactive Distillation for Embodied Reinforcement Learning / Houlin Li, Minghui Xu, Guo Xu 他
日本語で読む → - 論文強化学習自然言語
EDGE: エージェント強化学習における誘導探索のための経験蒸留
強化学習で得た経験を一時的な学習支援として使い、徐々にパラメータに内化させるフレームワークEDGEを提案。推論時の外部依存をなくし、複数タスクで性能を向上させた。
原題: EDGE: Experience-Distillation for Guided Exploration in Agentic Reinforcement Learning / Can Xie, Yuyi Zhou, Wen Yang 他
日本語で読む → - 論文操作ロボティクス
ロボット操作のための未来潜在状態からの行動推論
ビデオ生成を介さず、未来の潜在状態からロボットの行動を直接推論する新しい世界行動モデルを提案し、計算コストを削減しつつ長期的な操作タスクで有効性を示した。
原題: Inferring Action from Future Latent State for Robotic Manipulation / Fenghao Lei, Zhixiong Huang, Long Yang 他
日本語で読む →