論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/8/17 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文ガス源位置推定ロボティクス
物理依存性に基づく逐次推論による深層確率的屋内ガス源位置推定
移動ロボットのスパースでノイズの多い測定からガス源の位置を推定する深層確率フレームワークを提案。風と濃度場の物理的依存性を逐次条件付き推論に組み込み、精度と効率を向上させた。
原題: Deep Probabilistic Indoor Gas Source Localization via Physical Dependency-Guided Sequential Inference / Seunghwan Kim, Hyungjin Kim, Junhee Lee 他
日本語で読む → - 論文VLAロボティクス
NebulaVLA: ロボット操作のためのガイドアクションを備えた二周波数視覚言語行動モデル
高レベルの意味推論と低レベルのアクション制御を分離した非同期二周波数アーキテクチャを提案し、異種ロボット間のギャップを埋める統一表現と滑らかな動作を実現するガイドアクションアルゴリズムを導入した。
原題: NebulaVLA: A Dual-Frequency Vision-Language-Action Model With Guide Action for Robotic Manipulation / Cong Zhao, Shuai Tian, Xu Zhang 他
日本語で読む → - 論文評価フレームワークAI
DeepInsight II: ベンチマークからロボットへの一つのトレース
物理AIスタックの評価を統一的に行うフレームワークを拡張し、ナビゲーションと操作のベンチマーク再現、全身制御のシミュレーションから実機への一貫した評価、そしてシステム間のハンドオフラベルと修復可能性の検証を行った。
原題: DeepInsight II: One Trace from Benchmark to Robot / Siyi Li, Yuchen Kang, Wuliang Wang 他
日本語で読む → - 論文身体性ロボティクスロボティクス
身体化パーセプトロン表現に基づく神経・筋肉ネットワークの共設計
身体をニューラルネットワークとして捉える理論的枠組み「Embodied Perceptron」を提案し、筋骨格ロボットの制御器と筋肉配置を同時最適化することで、単一ニューロン制御でも安定性と学習効率が向上することを示した。
原題: Co-design of Neural and Muscle Network based on Embodied Perceptron Representation / Siyuan Tao, Yoichi Masuda, Hiroyuki Nabae 他
日本語で読む → - 論文世界モデル/3Dシーン理解画像認識
GaussianDWM++: 言語基盤の3Dガウス駆動世界モデルによる統一的なシーン理解・編集・マルチモーダル生成
3Dガウス表現に視覚言語特徴を蒸留し、シーン理解・言語推論・4D編集・マルチモーダル生成を単一フレームワークで統合した駆動世界モデルを提案した。
原題: GaussianDWM++: Language-Grounded 3D Gaussian Driving World Model for Unified Scene Understanding, Editing, and Multi-Modal Generation / Tianchen Deng, Xuefeng Chen, Shuang Wu 他
日本語で読む → - 論文強化学習/ヒューマノイドロボティクス
RoboStriker: 自律型ヒューマノイドボクシングのための潜在空間戦略ゲーム
ヒューマノイドボクシングを2プレイヤーの潜在空間ゼロサムマルコフゲームとして定式化し、戦略的探索と物理的実現性の矛盾を解決する階層的フレームワークを提案した。
原題: RoboStriker: Latent-Space Strategic Games for Autonomous Humanoid Boxing / Kangning Yin, Kaige Liu, Zhe Cao 他
日本語で読む → - 論文自動運転/データセット分析ロボティクス
シナリオ特性化:軌跡データセット全体の安全性評価のためのモジュール型ツールキット
運転シナリオの軌跡データセットを自動的に分析・特性化するオープンソースのフレームワークを提案し、データセットに依存しないモジュール構成で安全性評価を可能にする。
原題: ScenarioCharacterization: A Modular Toolkit for Characterizing Safety across Trajectory Datasets / Ingrid Navarro, Yutong Duan, Jonathan Francis 他
日本語で読む → - 論文VLAAI
HaReCAP: 習慣的行動に基づく再帰的大規模言語モデルエージェントの接地
長期的な身体性タスクにおいて、LLMエージェントの葉ノードでの行動接地の冗長性を減らすため、成功軌跡から頻出の葉決定を抽出してオフラインでルール化し、実行時に安全な場合のみLLM呼び出しをスキップするHaReCAPを提案した。
原題: HaReCAP: Habitual-action Grounding for Recursive Large Language Model Agents / Shen Liu, Zhenguo Xu, Shaopu Wang 他
日本語で読む → - 論文VLAロボティクス
τ0-VLA: 世界モデル誘導のテスト時計算を備えた階層型ロボット基盤モデル
長期的なロボット操作タスクを、高レベル方策がサブタスク生成時にテスト時計算を追加で行える階層型VLAモデルを提案し、実データで性能向上を実証した。
原題: $τ_0$-VLA: a Hierarchical Robot Foundation Model with World-Model-Guided Test-Time Computation / Xiaowei Cai, Yunuo Cai, Bingao Chen 他
日本語で読む → - 論文VLA/エッジ推論/エネルギー効率AI
EcoVLA: リアルタイム制約下での視覚言語行動モデルのためのエネルギー効率的なデバイス・エッジ協調推論
VLAモデルの推論コストを削減するため、デバイスとエッジサーバー間で協調推論を行い、リアルタイム制約を満たしつつシステム全体のエネルギー効率を最大化する適応型フレームワークEcoVLAを提案した。
原題: EcoVLA: Energy-Efficient Device-Edge Co-Inference for Vision-Language-Action Models under Real-Time Constraints / Ao Zhou, Bo Dai, Le Yu 他
日本語で読む → - 論文模倣学習ロボティクス
ロボティクスにおけるオープンループ実行の再考:リアクティブで高性能なポリシーへ
模倣学習で使われるオープンループ実行の利点を再検証し、長いコンテキストを持つポリシーではクローズドループの方が優れることを示した。
原題: Revisiting Open-Loop Execution in Robotics: Toward Reactive, Higher-Performing Policies / Michael Zeng, Abhinav Agarwal, Ajay Bati 他
日本語で読む → - 論文模倣学習/遅延補償ロボティクス
RAPAC-DP: 遅延実行下での拡散ポリシーに対する応答整合型保留アクション補償
クラウド推論の遅延による制御性能低下を補うため、実行予定のアクション列を条件入力として活用する補償機構を拡散・フローベースのポリシーに組み込んだ。遅延が無視できる場合は元のポリシーと完全に一致し、遅延デモなしで訓練可能。
原題: RAPAC-DP: Response-Aligned Pending-Action Compensation for Diffusion Policies under Delayed Execution / Tao Wang, Wei Wang, Jianhui Wang 他
日本語で読む → - 論文マニピュレーションロボティクス
接触モードは層である:離散連続計画における幾何構造の利点
接触を伴う操作計画を、接触モードを配置空間の層として捉え、層上の測地線を辿る計画として解く手法を提案。シミュレーション上の2つのタスクで事前情報なしに高速に解を求めた。
原題: Contact Modes Are Strata: What Geometric Structure Buys in Discrete-Continuous Planning / Phone Thiha Kyaw, Jonathan Kelly
日本語で読む → - 論文群制御cs.MA
WONDER: マルチエージェントUAVカバレッジ最適化のための無線ワールドモデルに基づく交渉フレームワーク
災害後の無線カバレッジ復旧のため、UAV群の協調動作を最適化するフレームワークを提案。局所観測と群全体のカバレッジのギャップを、JEPAベースの無線ワールドモデルと多ラウンド交渉で埋める。
原題: WONDER: A Radio World Model-based Negotiation Framework for Multi-Agent UAV Coverage Optimization / Jiahao Huang, Rongpeng Li, Zhifeng Zhao 他
日本語で読む → - 論文ソーシャルロボット制御ロボティクス
MistyPilot: マルチエージェントLLMスキルオーケストレーションによるソーシャルロボット制御の実現
自然言語の指示からソーシャルロボットを制御するためのマルチエージェントLLMフレームワークを提案し、センサー連動の物理的動作と対話的な社会的動作を統合的に実行する。
原題: MistyPilot: Enabling Social-Robot Control through Multi-Agent LLM Skill Orchestration / Xiao Wang, Lu Dong, Ifeoma Nwogu 他
日本語で読む → - 論文ビデオ推論画像認識
視覚的思考の内面化:能動的なビデオ推論のための内部化視覚思考
ビデオ推論において、推論時に中間画像を生成するVisual CoTの代わりに、訓練時に未来フレームの潜在表現を予測するInternalized Visual Thinkingを提案し、推論時のオーバーヘッドを削減しつつ性能を維持・向上させた。
原題: Beyond Visual CoT: Internalized Visual Thinking for Proactive Video Reasoning / Xiaoyu Zhu, Xinke Deng, Suresh Taddewadikar 他
日本語で読む → - 論文VLA画像認識
GLaQ: 視覚的証拠への潜在クエリ接地によるマルチモーダル推論
マルチモーダル大規模言語モデルの推論において、連続的な潜在状態の代わりに、元の視覚トークンに接地された固定数のクエリを用いることで、細かい視覚情報を効果的に保持・再利用する手法を提案した。
原題: GLaQ: Grounding Latent Queries in Visual Evidence for Multimodal Reasoning / Zesheng Yang, Lingling Zhang, Xinyu Zhang 他
日本語で読む → - 論文強化学習ロボティクス
時間論理に基づく普遍的なタスク表現による強化学習
LTL式からタスクの意味を抽出する新しい表現アーキテクチャを提案し、任意の強化学習アルゴリズムに統合可能な普遍的なタスク表現フレームワークLOTUSを導入した。双模倣距離による理論的保証で、学習効率と汎化性能を大幅に向上させる。
原題: Temporal Logic Guided Universal Task Representations for Reinforcement Learning / Hao Zhang, Zhangli Zhou, Zhen Kan
日本語で読む → - 論文群制御ロボティクス
グループ化オークション・コンセンサスアルゴリズムによるマルチロボットシステムの分散タスク割り当て
分散型マルチロボットタスク割り当てにおいて、空間的に近いタスクをグループ化して入札する新しいアルゴリズムGACAを提案し、従来のCBBAより最適性を大幅に向上させた。
原題: Grouping Auction-Consensus Algorithm for Decentralized Task Allocation in Multi-Robot Systems / Jose Rodriguez, Sven Koenig, Wenjie Dong 他
日本語で読む → - 論文LiDARレジストレーションロボティクス
誰のフレームで縮退するのか?LiDARレジストレーションにおける縮退検出の等変性条件
LiDARレジストレーションの縮退検出ラベルが座標系に依存することを示し、フレーム不変な一般化固有値基準を提案した論文。
原題: Degenerate in Whose Frame? An Equivariance Condition for Degeneracy Detection in LiDAR Registration / Yujie Zhang, Chunlei Zhao, Yuzong Lin 他
日本語で読む → - 論文VLA/触覚/操作ロボティクス
ViTaR: 基盤VLA操作のための視触覚残差適応
接触を伴う操作タスクで、凍結したVLAモデルに触覚情報に基づく小さな残差補正を加える手法を提案し、既存の触覚ベースラインを上回る成功率を達成した。
原題: ViTaR: Visuo-Tactile Residual Adaptation for Foundation VLA Manipulation / Yi Wang, Renjun Wu, Jinyan Liu 他
日本語で読む → - 論文活動認識機械学習
TransfHAR: オンデマンド活動認識のための自己教師あり手首表現学習
手首のIMUデータを用いた自己教師あり事前学習により、未学習の細かい活動を少数のデモから認識できるフレームワークを提案し、実時間スマートウォッチアプリとして実装・評価した。
原題: TransfHAR: Self-Supervised Wrist Representations for On-Demand Activity Recognition / Aidan Bradshaw, Riku Arakawa, Xin Liu 他
日本語で読む → - 論文マニピュレーションロボティクス
視覚誘導による4自由度アームでの机上ペン操作
低コストの4自由度アームで、固定カメラとYOLOによる物体検出・姿勢推定を用いて、手首回転なしにペンの色分け整列を実現した論文。
原題: Tabletop Pen Manipulation With a Vision-Guided 4-DoF Arm / Anirudh Rangarajan, Bibit Bianchini
日本語で読む → - 論文介入学習/強化学習ロボティクス
GAINS: 強化学習における不整合な人間介入信号の活用
人間の介入信号の遅延や不整合性を扱うため、分布強化学習と悲観的探索を用いた介入ベースのロボット操作学習フレームワークを提案し、シミュレーションと実機で高い成功率を達成した。
原題: GAINS: Leveraging Inconsistent Human Intervention Signals in Reinforcement Learning / Xinyi Zhang, Yinuo Zhao, Pei Ren 他
日本語で読む → - 論文ビデオ理解画像認識
CrossView: 視覚言語モデルはカメラをまたいで推論できるか?
複数カメラ映像の質問応答ベンチマークCrossViewを新たに導入し、既存の視覚言語モデルが複数視点の統合推論に苦戦することを示した。
原題: CrossView: Can Vision-Language Models Reason Across Cameras? / Sahil Shah, S P Sharan, Harsh Goel 他
日本語で読む → - 論文外観検査画像認識
衣料生産のためのAI外観検査
縫製ラインの品質管理を自動化するため、CNNを用いたAI外観検査システムを開発・検証した。黒色生地で学習し、異なる色の生地で性能を評価した。
原題: AI Visual Inspection for Garment Production / Ray Wai Man Kong, Ding Ning, Theodore Ho Tin Kong
日本語で読む → - 論文操作プランニングロボティクス
データ合成と統合プランニングによるマニュアル基盤の家電操作のスケーリング
家電のマニュアルから部品接地・長期プランニング・閉ループ回復データを自動生成するパイプラインMAGEと、それを用いた大規模データセットUseAppliance、およびエンドツーエンドモデルAppliancePlanを提案し、実ロボットで有効性を実証した。
原題: Scaling Manual-Grounded Appliance Manipulation with Data Synthesis and Unified Planning / Yuxing Long, Lei Kang, Ziyan Yu 他
日本語で読む → - 論文sim2realロボティクス
触覚シミュレーションを使わない触覚Sim2Real:ボトルネック潜在再構成による実現
触覚センサのシミュレーションを避け、シミュレータ内のオラクルセンサ(点群と指先力)で学習したポリシーを、実センサの潜在表現をオラクルに合わせることで実機に転移するフレームワークを提案。挿入や歯車噛み合わせで高成功率を達成。
原題: Tactile Sim2Real without Tactile Simulation via Bottlenecked Latent Reconstruction / Fan Yang, Youngsun Wi, Jinhao Yu 他
日本語で読む → - 論文ビデオ生成/編集画像認識
EditStream: 対話型ビデオ生成と編集のための統一オートリグレッシブフレームワーク
ビデオ生成と編集を単一のDiTベースモデルで統合し、高速な数ステップのオートリグレッシブモデルに変換するフレームワークを提案。テキストからビデオ、画像からビデオ、編集伝播など多様なタスクをサポートし、対話的なクリエイティブワークフローを実現する。
原題: EditStream: A Unified Autoregressive Framework for Interactive Video Generation and Editing / Yuqian Zhou, Zhenghong Zhou, Zongze Wu 他
日本語で読む → - 論文触覚ロボティクス
ロボットのための視覚ベース触覚知能:センシング、学習、身体化された操作
視覚ベース触覚センサ(VBTS)のハードウェア、学習手法、シミュレーション、データセットを統合したレビュー論文。接触による変形を画像化するVBTSのパイプライン全体を俯瞰し、今後の課題と方向性を示す。
原題: Vision-Based Tactile Intelligence for Robotics: Sensing, Learning, and Embodied Manipulation / Peng Zhou, Jun Hu, Sihan Chen 他
日本語で読む →