論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/5/1 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文VLAロボティクス
予測に基づくサブゴール生成による長期タスク解決のためのAnticipation-VLA
長期にわたるロボットタスクを解決するため、タスクの進行に応じて適応的にサブゴールを生成する予測モデルを導入し、階層型VLAモデルを提案した。
原題: Anticipation-VLA: Solving Long-Horizon Embodied Tasks via Anticipation-based Subgoal Generation / Zhilong Zhang, Wenyu Luo, Haonan Wang 他
日本語で読む → - 論文群集シミュレーションロボティクス
データ駆動アプローチによる群集移動における衝突回避行動のシミュレーション
群集シミュレーションの精度向上のため、衝突ペナルティを損失関数に組み込んだGANベースのモデルCPGANを提案し、双方向流での衝突率低減とレーン形成の再現を実現した。
原題: Simulation of collision avoidance behavior in crowd movement by data-driven approach / Xuanwen Liang, Eric Wai Ming Lee
日本語で読む → - 論文形式手法AI
ReasonSTL: ツール拡張とプロセス報酬学習による自然言語と信号時相論理の橋渡し
自然言語で表された要件を信号時相論理(STL)式に変換するフレームワークReasonSTLを提案し、ローカルなオープンソース言語モデルを用いて、推論の分解、決定的ツール呼び出し、構造化式構築を行い、プロセス報酬学習で訓練する。
原題: ReasonSTL: Bridging Natural Language and Signal Temporal Logic via Tool-Augmented Process-Rewarded Learning / Bowen Ye, Zhijian Li, Junyue Huang 他
日本語で読む → - 論文自動運転/VLA/強化学習ロボティクス
MAPLE: 潜在マルチエージェントプレイによるエンドツーエンド自動運転
VLAモデルを閉ループで訓練するため、潜在空間でマルチエージェントのロールアウトを行い、強化学習で安全・進捗・多様性を最適化するフレームワークを提案。外部シミュレータ不要でスケーラブルな閉ループ訓練を実現し、Bench2DriveでSOTAを達成。
原題: MAPLE: Latent Multi-Agent Play for End-to-End Autonomous Driving / Rajeev Yasarla, Deepti Hegde, Hsin-Pai Cheng 他
日本語で読む → - 論文ナビゲーション支援ロボティクス
CANINE: 視覚障害者へのロボット盲導犬を用いた対話的ナビゲーションのコーチング
視覚障害者がロボット盲導犬と協調してナビゲーションするスキルを、個別適応的な音声フィードバックで自動コーチングするシステムを提案し、実験で学習効率と最終性能の向上を実証した。
原題: CANINE: Coaching Visually Impaired Users for Interactive Navigation with a Robot Guide Dog / Cunjun Yu, Zishuo Wang, Anxing Xiao 他
日本語で読む → - 論文VLAロボティクス
適応を資産へ変える:オンライン視覚言語ナビゲーションのためのクロスドメインブリッジング
非定常な環境変化に直面する視覚言語ナビゲーションエージェントのオンライン適応において、適応を一時的な更新ではなく資産の蓄積と合成として捉える新しいTTAフレームワークIDEAを提案し、忘却や負の転移を防ぎつつ、学習不要の適応を実現する。
原題: Turning Adaptation into Assets: Cross-Domain Bridging for Online Vision-Language Navigation / Zixuan Hu, Xuantuo Huang, Yancheng Li 他
日本語で読む → - 論文ナビゲーションロボティクス
CLUE: 統一セマンティックマップによる適応的優先コンテキスト手がかりを用いたゼロショット物体目標ナビゲーション
ゼロショット物体目標ナビゲーションにおいて、LLMを用いて物体と部屋の関連性を推定し、部屋と物体のコンテキスト手がかりを適応的に重み付けして探索するフレームワークを提案。シミュレーションと実世界で成功率と経路効率を向上させた。
原題: CLUE: Adaptively Prioritized Contextual Cues by Leveraging a Unified Semantic Map for Effective Zero-Shot Object-Goal Navigation / Taeyun Kim, Alvin Jinsung Choi, Dasol Hong 他
日本語で読む → - 論文遠隔操作/強化学習ロボティクス
確率的遅延下でのロボット遠隔操作のための残差強化学習
確率的通信遅延による信号不連続性に対処するため、LSTMによる状態推定と残差強化学習を組み合わせたハイブリッド制御フレームワークを提案し、遅延下でも安定した遠隔操作を実現した。
原題: Residual Reinforcement Learning for Robot Teleoperation under Stochastic Delays / Kaize Deng, Zewen Yang
日本語で読む → - 論文3Dシーン理解画像認識
DGSG-Mind: 長期シーン理解とグラウンディングのための動的3Dガウシアンシーングラフ
動的な3Dシーン表現にオープンボキャブラリの意味情報を統合し、インスタンス認識型の3Dガウシアン動的シーングラフと推論エージェントを構築した。
原題: DGSG-Mind: Dynamic 3D Gaussian Scene Graphs for Long-Term Scene Understanding and Grounding / Luzhou Ge, Xiangyu Zhu, Jinyan Liu 他
日本語で読む → - 論文群制御ロボティクス
学習型入札方式を用いたマルチロボットシステム向けオークション合意アルゴリズム
マルチロボットのタスク割り当てにおいて、CBBAの手動設計された入札関数を強化学習で学習したニューラル入札ポリシーに置き換え、分散実行を保ちつつ解の質を向上させる手法を提案した。
原題: Auction-Consensus Algorithm with Learned Bidding Scheme for Multi-Robot Systems / Jose Rodriguez, Constantine Tarawneh, Sven Koenig 他
日本語で読む → - 論文VLAロボティクス
Pelican-Unify 1.0: 理解・推論・想像・行動を統合した身体化基盤モデル
単一のVLMと統一未来生成器を用いて、理解・推論・想像・行動を一つのモデルで統合的に学習・実行する身体化基盤モデルを提案し、各能力のベンチマークで高い性能を達成した。
原題: Pelican-Unify 1.0: A Unified Embodied Intelligence Model for Understanding, Reasoning, Imagination and Action / Yi Zhang, Yinda Chen, Che Liu 他
日本語で読む → - 論文テレプレゼンスロボットHCI
在宅のK-12生徒4名を対象としたテレプレゼンスロボットの複数週間にわたる教室展開:利点、課題、および推奨事項
在宅のK-12生徒がテレプレゼンスロボットを使って教室に参加した複数週間の実践を4件のケーススタディとして分析し、利点と課題を明らかにした。
原題: Multi-Week, In-Class Deployments of Telepresence Robots With Four Homebound K-12 Students: Benefits, Challenges, and Recommendations / Matthew Rueben, Rhianna Lee, Thomas R. Groechel 他
日本語で読む → - 論文マニピュレーションロボティクス
MVB-Grasp: 拡散ベース把持の最小体積ボックスフィルタリングによる正面操作の実現
正面からの把持が難しい低コストロボットアーム向けに、拡散ベースの把持生成に最小体積境界ボックス(MVBB)の幾何学的先験を注入し、成功率を大幅に向上させる新しい把持スタックを提案した。
原題: MVB-Grasp: Minimum-Volume-Box Filtering of Diffusion-based Grasps for Frontal Manipulation / Bibek Poudel, Abdul Basit, Muhammad Shafique
日本語で読む → - 論文人型ロボット制御画像認識
MIND: テキスト駆動の物理ベース人型ロボット制御のためのマルチスケール意図拡散
テキスト指示から物理ベースの人型ロボットを制御する新しいエンドツーエンド拡散フレームワークを提案し、行動意図を意味的橋渡しとして用いることで、テキストと低レベル行動のギャップを解消する。
原題: MIND: Multi-Scale Intent Diffusion for Text-Driven Physics-Based Humanoid Control / Bin Li, Ruichi Zhang, Han Liang 他
日本語で読む → - 論文人型ロボット制御cs.GR
SCRIPT: 言語駆動の物理ベース人型ロボット制御のための多段階学習によるスケーラブル拡散ポリシー
自然言語指示で物理ベースの人型ロボットを制御するための、多段階学習フレームワークを備えた拡散ポリシーを提案。行動・状態・テキストを統合するトランスフォーマーと強化学習による後段学習で、指示追従性と動作品質を向上させた。
原題: SCRIPT: Scalable Diffusion Policy with Multi-stage Training for Language-driven Physics-based Humanoid Control / Jingyan Zhang, Han Liang, Ruichi Zhang 他
日本語で読む → - 論文強化学習機械学習
マインドドリーマー:潜在多様体への能動的因果介入による想像力の解放
モデルベース強化学習において、観測状態からではなく生成的初期状態から想像を開始することで、歴史的束縛を打破し、探索と報酬最適化の非対称性を解消する新しいフレームワークを提案した。
原題: Mind Dreamer: Untethering Imagination via Active Causal Intervention on Latent Manifolds / Shaojun Xu, Xiaoling Zhou, Yihan Lin 他
日本語で読む → - 論文マニピュレーションロボティクス
ForceFlow: 接触駆動フローマッチングによる感覚と行動の学習
接触を伴う操作タスクのための力覚対応リアクティブフレームワークを提案。非対称マルチモーダル融合と視覚から力へのハンドオーバー機構により、力と運動の深い結合を実現し、実世界6タスクで成功率を37%向上させた。
原題: ForceFlow: Learning to Feel and Act via Contact-Driven Flow Matching / Shuoheng Zhang, Yifu Yuan, Hongyao Tang 他
日本語で読む → - 論文アフォーダンス接地ロボティクス
アフォーダンスエージェントハーネス:検証ゲートによるスキルオーケストレーション
オープンワールドでのアフォーダンス接地を改善するため、検証ゲート付きのクローズドループランタイムを提案し、適応的なスキル選択とエビデンス蓄積により精度とコストのトレードオフを向上させた。
原題: Affordance Agent Harness: Verification-Gated Skill Orchestration / Haojian Huang, Jiahao Shi, Yinchuan Li 他
日本語で読む → - 論文世界モデル画像認識
残差潜在アクションによる視覚特徴ベース世界モデルの学習
視覚特徴ベースの世界モデルにおいて、DINO残差から学習可能な新しい潜在アクション表現(RLA)を導入し、フローマッチングで予測することで、既存手法より高速かつ高精度な未来予測を実現した。さらに、ロボット学習への応用として、アクションなし動画からの行動学習や、オフライン動画のみで学習する視覚RLフレームワークを開発した。
原題: Learning Visual Feature-Based World Models via Residual Latent Action / Xinyu Zhang, Zhengtong Xu, Yutian Tao 他
日本語で読む → - 論文視線推定画像認識
Gaze4HRI: 人間ロボット相互作用のための視線推定ニューラルネットワークのゼロショットベンチマーク
人間ロボット相互作用における視線推定の頑健性を評価する大規模データセットとベンチマークを提案し、既存手法が特定条件下で失敗することを明らかにした。
原題: Gaze4HRI: Zero-shot Benchmarking Gaze Estimation Neural-Networks for Human-Robot Interaction / Berk Sezer, Ali Görkem Küçük, Erol Şahin 他
日本語で読む → - 論文ソフトロボティクスロボティクス
トポロジー最適化による空気圧ソフトアクチュエータの設計と実験的検証
非線形トポロジー最適化を用いて空気圧駆動のソフトアクチュエータを3D設計し、造形・実験で性能を検証した論文。
原題: Topology-Optimized Pneumatic Soft Actuator: Design and Experimental Validation / Sumit Mehta, Konstantinos Poulios
日本語で読む → - 論文VLAロボティクス
GuidedVLA: プラグアンドプレイの行動注意特化によるタスク関連因子の指定
VLAモデルの行動デコーダを機能部品として捉え、個々の注意ヘッドに明示的な補助信号でタスク関連因子(物体接地、空間幾何、時間的スキル論理)を学習させるフレームワークを提案し、シミュレーションと実機で汎化性能を向上させた。
原題: GuidedVLA: Specifying Task-Relevant Factors via Plug-and-Play Action Attention Specialization / Xiaosong Jia, Bowen Yang, Zuhao Ge 他
日本語で読む → - 論文HRI/感情表現ロボティクス
低自由度ロボットにおける感情表現:Reachy Miniを用いた知覚評価
低自由度で非人間的な表現しかできないロボットReachy Miniの感情表現を、オンライン実験で100人がどう知覚するかを調べた論文。正確な感情認識は限定的だが、覚醒度や感情価などの感情の大まかな意味は伝わり、社会的評価にも影響することが示された。
原題: Emotional Expression in Low-Degrees-of-Freedom Robots: Assessing Perception with Reachy Mini / Amit Rogel, Elmira Yadollahi, Guy Laban
日本語で読む → - 論文ドローン/視覚誘導ロボティクス
木のどこにとまるか:木をつかむドローンのための視覚誘導
木にとまるドローンが、枝の太さや傾き、曲がり具合を画像処理で評価し、最適な着地点を選ぶ方法を提案した論文。
原題: Where to Perch in a Tree: Vision-Guidance for Tree-Grasping Drones / Alex Dunnett, Leonie Bottomley, Mirko Kovac 他
日本語で読む → - 論文自動運転ロボティクス
HiDrive: 高レベル自動運転のためのクローズドループベンチマーク
既存の自動運転ベンチマークの飽和に対し、希少な物体や高度な判断能力を評価する新しいクローズドループベンチマークHiDriveを提案した。
原題: HiDrive: A Closed-Loop Benchmark for High-Level Autonomous Driving / Zhongyu Xia, Guanyu Zhu, Guo Tang 他
日本語で読む → - 論文自動運転/動作計画ロボティクス
MORPH-U: 高不確実環境下でのV2X対応自動運転のための多目的レジリエント動作計画とシミュレーション評価
V2X通信の遅延や欠落、偽情報などの不確実性に頑健な自動運転の動作計画手法を提案し、CARLAシミュレーションで有効性を検証した。
原題: MORPH-U: Multi-Objective Resilient Motion Planning for V2X-Enabled Autonomous Driving in High-Uncertainty Environments via Simulation / Shih-Yu Lai
日本語で読む → - 論文強化学習ロボティクス
E²DT:経験認識サンプリングによる効率的かつ効果的なロボット操作のためのディシジョン・トランスフォーマー
ロボット操作の強化学習において、ディシジョン・トランスフォーマーの性能を向上させるため、経験の質と多様性を考慮したサンプリング手法を提案した論文。
原題: E$^2$DT: Efficient and Effective Decision Transformer with Experience-Aware Sampling for Robotic Manipulation / Kaiyan Zhao, Borong Zhang, Yiming Wang 他
日本語で読む → - 論文空中マニピュレーションロボティクス
垂直農業における非接触受粉を目指した知覚駆動型花ターゲティング用空中マニピュレータ
垂直農業環境で花を検出・位置特定し、空中マニピュレータで精密に接近するロボットプラットフォームを提案し、シミュレーションと実機実験でその有効性を検証した。
原題: An Aerial Manipulator for Perception-Driven Flower Targeting Toward Contactless Pollination in Vertical Farming / Chenzhe Jin, Zhuohang Wu, Yifan Cai 他
日本語で読む → - 論文POMDP計画AI
連続POMDP計画におけるMCTSの有限時間解析
部分観測マルコフ決定過程(POMDP)におけるモンテカルロ木探索(MCTS)の有限時間解析を提供し、離散・連続観測空間での確率的集中境界を導出。連続空間ではボロノイ分割による適応的パーティショニングを導入したVoro-POMCPOWを提案し、理論的保証と競争力のある性能を示した。
原題: Finite-Time Analysis of MCTS in Continuous POMDP Planning / Da Kong, Vadim Indelman
日本語で読む → - 論文自動運転/評価ベンチマーク画像認識
あなたの運転ワールドモデルは万能選手か?
運転ワールドモデルの性能を画質から閉ループ運転まで多面的に評価する統一ベンチマークWorldLensを提案し、既存モデルが全軸で優れないことを示した。
原題: Is Your Driving World Model an All-Around Player? / Lingdong Kong, Ao Liang, Tianyi Yan 他
日本語で読む →