論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/6/11 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文ソフトウェア操作エージェントcs.SE
ComAct: COMをアクションとして捉える新パラダイムによるプロフェッショナルソフトウェア操作の再定義
GUI操作やAPIに頼らず、WindowsのCOMを統一的な実行抽象として用い、プロフェッショナルソフトウェア操作を決定論的なプログラム合成として扱う新パラダイムを提案。産業用CAD操作のベンチマークComCADBenchを導入し、自己修正エージェントComActorが高い性能を示した。
原題: ComAct: Reframing Professional Software Manipulation via COM-as-Action Paradigm / Jiaxin Ai, Tao Hu, Xuemeng Yang 他
日本語で読む → - 論文マニピュレーションロボティクス
Mana: 関節ツールの巧みな操作
関節を持つツールの器用な操作を、アニメーション問題として捉え直したシミュレーションから実機への転移フレームワークを提案。
原題: Mana: Dexterous Manipulation of Articulated Tools / Zhao-Heng Yin, Guanya Shi, Pieter Abbeel 他
日本語で読む → - 論文3D占有予測画像認識
VISA: VLMによる3D占有ワールドモデルのインスタンス意味監査
3D占有予測の精度向上のため、VLMを用いて物体インスタンスの意味を監査し、その情報を学習時に蒸留する手法を提案。推論時はVLM不要で、閉集合のmIoUを改善した。
原題: VISA: VLM-Guided Instance Semantic Auditing for 3D Occupancy World Models / Ruiqi Xian, Yuehan Xian, Jing Liang 他
日本語で読む → - 論文空間推論画像認識
SpatialClaw:エージェント的空間推論のためのアクションインターフェース再考
視覚言語モデルによる空間推論を強化するため、コードをアクションインターフェースとして用いる訓練不要のフレームワークSpatialClawを提案。状態を持つPythonカーネル上で柔軟に知覚・幾何プリミティブを組み合わせ、中間結果に応じて分析を適応させる。
原題: SpatialClaw: Rethinking Action Interface for Agentic Spatial Reasoning / Seokju Cho, Ryo Hachiuma, Abhishek Badki 他
日本語で読む → - 論文VLA画像認識
RepWAM: 表現型ビジュアル・アクショントークナイザによるワールドアクションモデリング
再構成ではなく意味的な視覚・行動の潜在空間を用いたワールドアクションモデルを提案し、実ロボット操作とシミュレーションで有効性を示した。
原題: RepWAM: World Action Modeling with Representation Visual-Action Tokenizers / Junke Wang, Qihang Zhang, Shuai Yang 他
日本語で読む → - 論文VLA/セキュリティロボティクス
軌道レベルでのリダイレクション攻撃:視覚言語行動モデルに対する
視覚言語行動(VLA)モデルに対して、指示文をわずかに変更するだけで、意図したタスクに見せかけつつ最終的な物理的結果を攻撃者が指定した目標に変える「軌道レベル」の脆弱性を発見し、その攻撃を自動生成する手法を提案した。
原題: Trajectory-Level Redirection Attacks on Vision-Language-Action Models / Gokul Puthumanaillam, Vardhan Dongre, Pranay Thangeda 他
日本語で読む → - 論文顔認識攻撃画像認識
Adv-TGD: 顔認識なりすまし攻撃のための敵対的テキスト誘導拡散モデル
顔認識システムを欺くために、テキストプロンプトで条件付けした拡散モデルを用いて、ターゲットの人物に似せた自然な顔画像を生成する敵対的攻撃フレームワークを提案した。
原題: Adv-TGD: Adversarial Text-Guided Diffusion for Face Recognition Impersonation Attacks / Omid Ahmadieh, Nima Karimian
日本語で読む → - 論文VLA/操作機械学習
μVLA:VLAモデルにおける部分観測操作のためのリカレントメモリ
VLAモデルに小さな学習可能なメモリトークンを追加し、時間ステップ間で自己注意により更新することで、部分観測下での操作性能を向上させる手法を提案した。
原題: $μ$VLA: On Recurrent Memory for Partially Observable Manipulation in VLA Models / Egor Cherepanov, Nikita Kachaev, Daniil Zelezetsky 他
日本語で読む → - 論文位置推定画像認識
SG2Loc: 3Dシーングラフを用いた逐次視覚位置推定
3Dシーングラフを環境表現に用いた軽量な逐次視覚位置推定手法を提案。パーティクルフィルタとセマンティック特徴マッチングにより、大規模な画像データベースや点群を必要とせずに位置推定を実現する。
原題: SG2Loc: Sequential Visual Localization on 3D Scene Graphs / Nicole Damblon, Olga Vysotska, Federico Tombari 他
日本語で読む → - 論文シミュレーション/USVロボティクス
海洋ロボティクスUnityシミュレータにおける無人水上艇の操縦性評価のためのトレーサブル仮想海上公試
オープンソースのMARUSシミュレータに、無人水上艇の旋回試験とジグザグ試験を自動実行・データ生成する標準化された仮想海上公試フレームワークを導入し、IMO/ITTC準拠の操縦指標抽出とシステム同定用データ生成を可能にした。
原題: Traceable Virtual Sea Trials in the Marine Robotics Unity Simulator for Manoeuvring Assessment of Unmanned Surface Vehicles / Paria Rezayan
日本語で読む → - 論文セキュリティ/敵対的攻撃cs.CR
機械学習ベースのネットワーク侵入検知システムにおけるカテゴリ別ロバスト性評価
ネットワーク侵入検知システムに使われるMLモデル(CNN、LSTM、ランダムフォレスト)を敵対的攻撃(FGSM、PGD)で評価し、ランダムフォレストが攻撃に脆弱である一方、CNNが比較的頑健であることを示した。
原題: Categorical Robustness Assessment for Machine Learning based Network Intrusion Detection Systems / Mayank Raj, Nathaniel D. Bastian, Lance Fiondella 他
日本語で読む → - 論文柔軟構造の動力学制御
回転ハブ上のポストバックリング超柔軟倒立振子の動力学と状態依存多重平衡
超柔軟な倒立振子のポストバックリング動力学を解析し、ハブ角度に応じて平衡点が変化する現象を数理モデルと実験で示した論文。
原題: On the Dynamics and State Dependent Multiple Equilibria of a Post-Buckled Ultra-Flexible Inverted Pendulum on a Rotating Hub / Prasanna S Gandhi, Dhruvi Joshi, Vivek Natarajan 他
日本語で読む → - 論文ベンチマーク構築ロボティクス
具現化ベンチマーク構築の知的自動化:パイプライン、身体性、シミュレータ、そして動向
具現化知能のベンチマーク構築を5段階のパイプラインとして整理し、各段階での手動から自動化・基盤モデル支援・エージェント型クローズドループへの移行を分析したサーベイ論文。自動化はコスト削減ではなく、検証や監査などへのコストシフトをもたらすと結論づけている。
原題: Intelligent Automation for Embodied Benchmark Construction: Pipelines, Embodiments, Simulators, and Trends / Jinshan Lai, Jianwei Hu, Baoyang Jiang 他
日本語で読む → - 論文ベンチマーク構築AI
Embodied-BenchClaw:身体化空間知能ベンチマーク構築のための自律型マルチエージェントシステム
ユーザーの評価意図から自動でベンチマークを生成・更新する自律エージェントシステムを提案し、屋内・屋外の空間推論やロボット操作など多様なベンチマークを構築して有効性を検証した。
原題: Embodied-BenchClaw: An Autonomous Multi-Agent System for Embodied Spatial Intelligence Benchmark Construction / Baoyang Jiang, Fengchun Zhang, Leyuan Wang 他
日本語で読む → - 論文強化学習ロボティクス
UniIntervene: 実世界強化学習の効率化のためのエージェント介入
人間参加型強化学習における介入コストを削減するため、非生産的な探索を検知し自律的に回復行動を生成するエージェント介入モデルUniInterveneを提案した。
原題: UniIntervene: Agentic Intervention for Efficient Real-World Reinforcement Learning / Haoyuan Deng, Yitong Gao, Yudong Lin 他
日本語で読む → - 論文VLA/プランニングロボティクス
DIRECT: 身体化プランナーにおけるテスト時計算の割り当てはいつ、どこで行うべきか?
VLMを高レベルプランナーとして使う際、テスト時計算を増やすと性能が上がるが、コストも増える。シーン文脈に基づいて計算をルーティングするDIRECTを提案し、成功率とコストのトレードオフを改善した。
原題: DIRECT: When and Where Should You Allocate Test-Time Compute in Embodied Planners? / Jadelynn Dao, Milan Ganai, Yasmina Abukhadra 他
日本語で読む → - 論文強化学習ロボティクス
対比的相互作用による物体操作のゼロからの学習
強化学習における対比学習が操作タスクで苦戦する原因を分析し、相互作用を考慮したリサンプリング手法(IWR)を提案して、シミュレーションと実機のエアホッケーで性能を向上させた。
原題: Learning Object Manipulation from Scratch via Contrastive Interaction / Tongle Shen, Caleb Chuck, Fan Feng 他
日本語で読む → - 論文行動予測画像認識
FactCheck: マルチエージェント協調による実現可能性を考慮した長期行動予測
本論文では、ビデオから将来の行動系列を予測する際に、物理的な実現可能性を検証する閉ループ機構を備えたマルチエージェントフレームワークFactCheckを提案し、既存手法より高い精度を達成した。
原題: FactCheck: Feasibility-aware Long-term Action Anticipation with Multi-agent Collaboration / Rui Cao, Jiannong Cao, Bo Yuan 他
日本語で読む → - 論文VLAロボティクス
DAM-VLA: 非同期マルチモーダル視覚言語行動モデル
各モダリティをセンサー固有のレートで処理する非同期VLAモデルを提案し、接触の多い実世界操作タスクで成功率を大幅に向上させた。
原題: DAM-VLA: Decoupled Asynchronous Multimodal Vision Language Action model / Pankhuri Vanjani, Zhuoyue Li, Jakub Suliga 他
日本語で読む → - 論文ベンチマーク/知覚画像認識
自然環境におけるロボット知覚のためのクロスモーダルベンチマーク
自然環境でのロボット知覚の限界を明らかにするため、大規模な自然環境での場所認識とメートル深度推定のための新しいクロスモーダルベンチマークWildCrossを紹介し、その結果を分析した。
原題: Cross-Modal Benchmarking for Robotic Perception in Natural Environments / David Hall, Joshua Knights, Mark Cox 他
日本語で読む → - 論文模倣学習機械学習
フーリエ特徴量による高精度模倣学習ポリシーの実現
点群をフーリエ空間に写像して高周波特徴を直接利用できるようにし、模倣学習による高精度なロボット操作を実現した。
原題: Fourier Features Let Agents Learn High Precision Policies with Imitation Learning / Balázs Gyenes, Emiliyan Gospodinov, Jan Frieling 他
日本語で読む → - 論文模倣学習/ロボット技能獲得ロボティクス
LUCID: 非構造化人間ビデオからの身体非依存意図モデル学習による拡張可能な器用なロボット技能獲得
インターネット規模の非構造化人間ビデオからタスク意図を学習し、並列シミュレーションでロボット制御を学習する2段階フレームワークを提案。意図モデルは身体非依存で、異なるロボット形態に適用可能。
原題: LUCID: Learning Embodiment-Agnostic Intent Models from Unstructured Human Videos for Scalable Dexterous Robot Skill Acquisition / Harsh Gupta, Guanya Shi, Wenzhen Yuan
日本語で読む → - 論文システム機械学習
M*: マルチモーダルモデルのためのモジュール式で拡張可能なサービスシステム
複合AIモデルを効率的にサービスするための普遍的なシステムM*を提案し、データフローグラフ表現とウォークグラフ抽象化により、多様なモデル構成を柔軟に扱い、既存システムより低遅延・高スループットを達成した。
原題: M*: A Modular, Extensible, Serving System for Multimodal Models / Atindra Jha, Naomi Sagan, Keisuke Kamahori 他
日本語で読む → - 論文拡散モデル防御画像認識
VOID: 潜在拡散モデルにおける不正な模倣を打ち破る
潜在拡散モデルによる個人の不正な模倣を防ぐため、モデルの確率的挙動を操作して画像の意味構造を破壊する防御フレームワークVOIDを提案した。
原題: VOID: Defeating Unauthorized Mimicry in Latent Diffusion Models / Chunlin Qiu, Ang Li, Tianxiao Huang 他
日本語で読む → - 論文VLA画像認識
予測を行動に変える:世界行動モデルにおける表現整合の再利用
世界行動モデル(WAM)の行動デコーダがタスク関連領域に注目せず、表現の不一致が行動精度を損なう問題を診断し、基盤ビジュアルエンコーダの意味表現と中間特徴を整合させるAGRAを提案。実機操作タスクで性能と汎化を向上させた。
原題: Making Foresight Actionable: Repurposing Representation Alignment in World Action Models / Lu Qiu, Yizhuo Li, Yi Chen 他
日本語で読む → - 論文触覚AI
TouchThinker:大規模データと行動認識表現による触覚常識推論のオープンワールドへの拡張
触覚常識推論をオープンワールドに拡張するため、大規模データセットと行動認識表現を備えた触覚言語フレームワークTouchThinkerを提案した。
原題: TouchThinker: Scaling Tactile Commonsense Reasoning to the Open World with Large-scale Data and Action-aware Representation / Kailin Lyu, Di Wu, Pengwei Zhang 他
日本語で読む → - 論文VLA/言語指示最適化ロボティクス
VLAに何を言うべきかを学ぶ:ほぼ無害なビジョン言語行動モデルの操縦
VLAモデルへの言語指示を自動で探索・改善し、性能向上を予測するヘッドを学習して、有害な介入を防ぎつつタスク成功率を高めるフレームワークを提案した。
原題: Learning What to Say to Your VLA: Mostly Harmless Vision Language Action Model Steering / Hyun Joe Jeong, Gokul Swamy, Andrea Bajcsy
日本語で読む → - 論文HCI/UXリサーチHCI
AI支援フォーカスグループの設計:役割×モダリティのプレイブック
フォーカスグループにおける生成AIの活用方法を、AIの役割(ツール、共同司会、司会)とモダリティ(テキスト、音声、身体性)のマトリクスで整理したプレイブックを提案する論文。
原題: Designing AI-Supported Focus Groups: A Role x Modality Playbook / Zhiqing Wang, Steven Dow
日本語で読む → - 論文器用な把持生成ロボティクス
EquiDexFlow: 接触に基づくSE(3)等変な器用な把持生成フロー
物体点群から手首姿勢、関節角、指先接触、法線、接触力を同時に予測するSE(3)等変フローマッチングモデルを提案し、摩擦円錐内の力と物体表面の接触を構造的に保証して物理的に安定な把持を生成する。
原題: EquiDexFlow: Contact-Grounded SE(3)-Equivariant Dexterous Grasp Generative Flows / Clinton Enwerem, John S. Baras, Calin Belta
日本語で読む → - 論文水中ロボティクス/活動認識ロボティクス
水中マルチヒューマン・ロボット協調のための意味認識型ダイバー活動認識フレームワーク
水中環境での人間とロボットの協調を目指し、ダイバーの活動を分類するトランスフォーマーベースのフレームワークDAR-Netを提案。ピクセルレベルのシーン監視と時間的推論を組み合わせ、新規のUDAデータセットも公開した。
原題: Semantically-Aware Diver Activity Recognition Framework for Effective Underwater Multi-Human-Robot Collaboration / Sadman Sakib Enan, Junaed Sattar
日本語で読む →