論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2025/11/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文VLAロボティクス
ROSBag MCPサーバ:LLMによるロボットデータ解析で実現するエージェント型身体性AI
ROS/ROS 2のbagデータを自然言語で解析・可視化・処理できるMCPサーバを提案し、8種のLLM/VLMのツール呼び出し性能を比較評価した。
原題: ROSBag MCP Server: Analyzing Robot Data with LLMs for Agentic Embodied AI Applications / Lei Fu, Sahar Salimpour, Leonardo Militano 他
日本語で読む → - 論文VLAロボティクス
SlotVLA: ロボットマニピュレーションにおける物体関係表現のモデリング
物体中心・物体関係表現を用いたスロットアテンション型VLAフレームワークを提案し、物体注釈付きベンチマークLIBERO+を構築した。
原題: SlotVLA: Towards Modeling of Object-Relation Representations in Robotic Manipulation / Taisei Hanyu, Nhat Chung, Huy Le 他
日本語で読む → - 論文VLA機械学習
行動クローニング方策に対するデータセット汚染攻撃
行動クローニングの方策がクリーンラベルバックドア攻撃に脆弱であることを初めて示し、汚染率やトリガー強度による影響と、エントロピーに基づく新たなテスト時トリガー攻撃を提案した。
原題: Dataset Poisoning Attacks on Behavioral Cloning Policies / Akansha Kalra, Soumil Datta, Ethan Gilmore 他
日本語で読む → - 論文VLAロボティクス
SRPO: VLAモデルのための自己参照方策最適化
VLAモデルの強化学習において、成功軌道を自己参照として失敗軌道に進捗報酬を付与し、報酬の疎さを解消する手法を提案。LIBEROで99.2%の成功率を達成。
原題: SRPO: Self-Referential Policy Optimization for Vision-Language-Action Models / Senyu Fei, Siyin Wang, Li Ji 他
日本語で読む → - 論文VLA画像認識
観察から行動へ:産業環境におけるVLA事前学習のための潜在行動ベースのプリミティブセグメンテーション
産業用の連続動画から人間の作業を教師なしで行動プリミティブに分割し、VLAモデルの事前学習に使える構造化データを自動生成するフレームワークを提案した。
原題: From Observation to Action: Latent Action-based Primitive Segmentation for VLA Pre-training in Industrial Settings / Jiajie Zhang, Sören Schwertfeger, Alexander Kleiner
日本語で読む → - 論文VLA機械学習
AVA-VLA: 能動的視覚注意による視覚言語行動モデルの改善
VLAモデルを部分観測マルコフ決定過程として再定式化し、履歴を反映した再帰状態と能動的視覚注意で行動生成を改善する手法を提案。LIBEROやCALVINで最高性能を達成し、実機双腕タスクにも転移。
原題: AVA-VLA: Improving Vision-Language-Action models with Active Visual Attention / Lei Xiao, Jifeng Li, Juntao Gao 他
日本語で読む → - 論文VLAロボティクス
成功を超えて:混合品質データからのジャストインタイム介入による優雅なロボットマニピュレーションの洗練
人間のデモの混合品質に起因するVLAモデルの実行品質のばらつきを改善するため、暗黙のタスク制約を評価するElegance Criticを学習し、推論時に必要な瞬間だけ介入するJITI機構を提案した。
原題: Beyond Success: Refining Elegant Robot Manipulation from Mixed-Quality Data via Just-in-Time Intervention / Yanbo Mao, Jianlong Fu, Ruoxuan Zhang 他
日本語で読む → - 論文VLAロボティクス
MiMo-Embodied: クロス身体性基盤モデル技術報告
自動運転と身体性AIを統合した初のクロス身体性基盤モデルを開発し、両分野で最先端性能を達成した。
原題: MiMo-Embodied: X-Embodied Foundation Model Technical Report / Xiaoshuai Hao, Lei Zhou, Zhijian Huang 他
日本語で読む → - 論文VLAロボティクス
SIL: 言語条件付き人間-エージェント共適応のための共生インタラクティブ学習
人間とエージェントが共有潜在タスク空間で双方向に信念を更新し合い、能動的な確認や提案を行う共生インタラクティブ学習フレームワークを提案。実世界・シミュレーションタスクで90.4%の完了率を達成。
原題: SIL: Symbiotic Interactive Learning for Language-Conditioned Human-Agent Co-Adaptation / Linus Nwankwo, Bjoern Ellensohn, Christian Rauch 他
日本語で読む → - 論文VLAロボティクス
視覚言語行動モデルのための身体性転移学習
事前学習済みVLAモデルをマルチロボットに効率的に転移するET-VLAを提案し、合成継続事前学習とEmbodied Graph-of-Thoughtで二腕ロボットの協調タスク性能を向上させた。
原題: Embodiment Transfer Learning for Vision-Language-Action Models / Chengmeng Li, Yaxin Peng
日本語で読む → - 論文VLAロボティクス
TraceGen: 3Dトレース空間での世界モデリングによる異なる身体性の動画からの学習
人間や他ロボットの動画を3Dトレース空間に変換し、少ない実機動画で新タスクを学習できる世界モデルTraceGenを提案。
原題: TraceGen: World Modeling in 3D Trace Space Enables Learning from Cross-Embodiment Videos / Seungjae Lee, Yoonkyo Jung, Inkook Chun 他
日本語で読む → - 論文VLAロボティクス
進化し続けるスキル知識を持つ視覚言語行動モデル
VLAモデルにパラメータを増やさずに継続的模倣学習を導入し、知識誘導型エキスパートルーティングでタスク特化を実現するフレームワークStellar VLAを提案。
原題: Continually Evolving Skill Knowledge in Vision Language Action Model / Yuxuan Wu, Guangming Wang, Zhiheng Yang 他
日本語で読む → - 論文VLAロボティクス
METIS: 多源自己中心データによる統合型巧みな視覚-言語-行動モデルの事前学習
人間とロボットの自己中心視点データを統合した大規模データセットEgoAtlasと動作表現を用いて、巧みな操作のための視覚-言語-行動モデルを事前学習し、実世界タスクでの成功率と汎化性能を向上させた。
原題: METIS: Multi-Source Egocentric Training for Integrated Dexterous Vision-Language-Action Model / Yankai Fu, Ning Chen, Junkai Zhao 他
日本語で読む → - 論文VLAロボティクス
Audio-VLA: 接触音知覚を視覚-言語-行動モデルに統合したロボットマニピュレーション
接触音を入力に加えたマルチモーダルVLAモデルを提案し、視覚のみの制約を克服。シミュレーションに衝突音生成を追加し、動的プロセス評価指標TCRを導入して実験的に有効性を示した。
原題: Audio-VLA: Adding Contact Audio Perception to Vision-Language-Action Model for Robotic Manipulation / Xiangyi Wei, Haotian Zhang, Xinyi Cao 他
日本語で読む → - 論文VLAロボティクス
大規模言語モデルと3Dビジョンによる知的ロボット知覚と自律性
LLMと3Dビジョンを統合し、ロボットが自然言語と空間理解を通じて複雑な環境を知覚・推論・操作するための最新手法、応用、課題を包括的にレビューした論文。
原題: Large Language Models and 3D Vision for Intelligent Robotic Perception and Autonomy / Vinit Mehta, Charu Sharma, Karthick Thiyagarajan
日本語で読む → - 論文VLAロボティクス
AerialMind:UAVシナリオにおける参照マルチオブジェクト追跡に向けて
UAV(ドローン)映像で自然言語指示に基づくマルチオブジェクト追跡を行うための大規模ベンチマークAerialMindと、半自動ラベリング手法COALA、追跡手法HawkEyeTrackを提案した論文。
原題: AerialMind: Towards Referring Multi-Object Tracking in UAV Scenarios / Chenglizhao Chen, Shaofeng Liang, Runwei Guan 他
日本語で読む → - 論文VLA画像認識
BOP-ASK:視覚言語モデルのための物体インタラクション推論
6D物体姿勢データを活用し、把持姿勢や経路計画などの細かい空間推論を問う15万枚・3300万QAペアの大規模データセットBOP-ASKを構築し、VLMの物体インタラクション理解を評価・訓練する。
原題: BOP-ASK: Object-Interaction Reasoning for Vision-Language Models / Vineet Bhat, Sungsu Kim, Valts Blukis 他
日本語で読む → - 論文VLAロボティクス
Evo-1: 意味的整合性を保つ軽量Vision-Language-Actionモデル
ロボットデータでの事前学習なしに、VLMの知覚表現を保ちながら軽量・高性能を実現したVLAモデルを提案。
原題: Evo-1: Lightweight Vision-Language-Action Model with Preserved Semantic Alignment / Tao Lin, Yilei Zhong, Yuxin Du 他
日本語で読む → - 論文VLAロボティクス
予言による行動方策の強化学習
ロボット世界モデル「Prophet」を大規模データで事前学習し、新環境へ少数適応させてシミュレータとし、FlowScaleでVLA方策を強化学習する手法を提案。
原題: Reinforcing Action Policies by Prophesying / Jiahui Zhang, Ze Huang, Chun Gu 他
日本語で読む → - 論文VLAロボティクス
ファントムの脅威:VLAモデルの物理センサー攻撃に対する堅牢性の探究と強化
VLAモデルに対する物理センサー攻撃を初めて体系的に研究し、カメラとマイクへの8種類の攻撃をシミュレート・実機検証する枠組みを提案。敵対的訓練による防御手法も開発した。
原題: Phantom Menace: Exploring and Enhancing the Robustness of VLA Models Against Physical Sensor Attacks / Xuancun Lu, Jiaxiang Chen, Shilin Xiao 他
日本語で読む → - 論文VLAロボティクス
Progress-Think: 視覚言語ナビゲーションのための意味的進捗推論
視覚観測から指示文の進捗を意味的に推論し、ナビゲーション方策を導く三段階フレームワークを提案。R2R-CEとRxR-CEで最高性能を達成。
原題: Progress-Think: Semantic Progress Reasoning for Vision-Language Navigation / Shuo Wang, Yucheng Wang, Guoxin Lian 他
日本語で読む → - 論文VLA画像認識
DualVLA: 推論と行動の部分的デカップリングによる汎用身体性エージェントの構築
ロボット実演で訓練したVLAモデルにマルチモーダル推論を追加すると行動性能が劣化する「行動退化」を解決するため、二層データ選別と二重教師適応蒸留を提案し、推論能力を保ちつつ行動精度を向上させた。
原題: DualVLA: Building a Generalizable Embodied Agent via Partial Decoupling of Reasoning and Action / Zhen Fang, Zhuoyang Liu, Jiaming Liu 他
日本語で読む → - 論文VLAcs.CR
身体性AIのショーシャンク・リデンプション:間接的環境ジェイルブレイクの理解とベンチマーク
環境に注入された間接的なプロンプト(壁の悪意ある指示など)で身体性AIをジェイルブレイクする新攻撃IEJを提案し、自動攻撃生成・ベンチマーク生成フレームワークとベンチマークを構築した。
原題: The Shawshank Redemption of Embodied AI: Understanding and Benchmarking Indirect Environmental Jailbreaks / Chunyang Li, Zifeng Kang, Junwei Zhang 他
日本語で読む → - 論文VLA機械学習
π*0.6:経験から学ぶVLA
実世界での経験と人間の修正を活用した強化学習手法RECAPにより、洗濯物畳みや箱組み立て、エスプレッソ抽出などのタスクを高成功率で実行できる汎用VLAモデルπ*0.6を開発した。
原題: $\pi^{*}_{0.6}$: a VLA That Learns From Experience / Physical Intelligence, Ali Amin, Raichelle Aniceto 他
日本語で読む → - 論文VLAロボティクス
ViPRA: 動画予測によるロボット行動生成
ラベルなし動画から将来の視覚観測と潜在行動を予測するモデルを事前学習し、少数の実演で連続ロボット制御を微調整するフレームワークを提案。
原題: ViPRA: Video Prediction for Robot Actions / Sandeep Routray, Hengkai Pan, Unnat Jain 他
日本語で読む → - 論文VLA画像認識
MAPS: モジュール別近接スケジューリングによる視覚言語表現の保持と視覚言語行動モデルの汎化向上
VLAモデルのファインチューニング時に、モジュールごとに事前学習VLMへの近接制約を段階的に緩めるスケジューリングを導入し、追加パラメータなしで分布内外の性能を最大30%向上させた。
原題: MAPS: Preserving Vision-Language Representations via Module-Wise Proximity Scheduling for Better Vision-Language-Action Generalization / Chengyue Huang, Mellon M. Zhang, Robert Azarcon 他
日本語で読む → - 論文VLA機械学習
π_RL: フローベース視覚言語行動モデルのオンライン強化学習ファインチューニング
フローマッチングに基づく大規模VLAモデルに強化学習を適用するため、Flow-NoiseとFlow-SDEの2手法を提案し、分布内外で性能を向上させた。
原題: $π_\texttt{RL}$: Online RL Fine-tuning for Flow-based Vision-Language-Action Models / Kang Chen, Zhihao Liu, Tonghe Zhang 他
日本語で読む → - 論文VLA機械学習
大規模マルチモーダルモデルによるタスク指向自律通信:設計手法と実装課題
LLM/LMMを活用したタスク指向自律通信の概要を示し、交通制御・ロボットスケジューリング・環境認識チャネル推定の3事例で従来手法を上回る性能を実証した。
原題: Large Multimodal Models-Empowered Task-Oriented Autonomous Communications: Design Methodology and Implementation Challenges / Hyun Jong Yang, Hyunsoo Kim, Hyeonho Noh 他
日本語で読む → - 論文VLA機械学習
自己対戦ファインチューニングによるエージェントRLのための世界モデル内在化
LLMエージェントに状態表現と遷移モデルからなる内部世界モデルを自己対戦SFTで学習させ、方策最適化前に未来状態をシミュレートすることでOOD環境でのRL性能を大幅に向上させる手法SPAを提案。
原題: Internalizing World Models via Self-Play Finetuning for Agentic RL / Shiqi Chen, Tongyao Zhu, Zian Wang 他
日本語で読む → - 論文VLA画像認識
Vision-Language-Actionモデルに対するモデル非依存の敵対的攻撃と防御
VLAモデルにカメラ視野内に置ける敵対的パッチを生成するモデル非依存攻撃EDPAを提案し、視覚エンコーダの敵対的ファインチューニングによる防御法も示した。
原題: Model-agnostic Adversarial Attack and Defense for Vision-Language-Action Models / Haochuan Xu, Yun Sing Koh, Shuhuai Huang 他
日本語で読む →