論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/9/5 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文タスク計画ロボティクス
脳に着想を得たゼロショットロボットタスク推論と実行のための階層的フレームワーク
オープンな言語指示に従うロボットのための、脳の役割分担に着想を得たゼロショット階層的フレームワークを提案し、視覚認識、言語接地、コストベースの計画、実行検証を統合して、長期的なタスク分解と物理的検証を実現した。
原題: A Brain-inspired Hierarchical Framework for Zero-Shot Robot Task Reasoning and Execution / Guangming Wang, Pengfei Ye, Qizhen Ying 他
日本語で読む → - 論文操作学習/クロスエンボディ転移ロボティクス
A4A: 人間のデモからの行動指向4Dアフォーダンスのクロスエンボディ転移
人間のデモから行動指向の4Dアフォーダンス(相互作用点の将来軌跡)を学習し、ロボットポリシーの事前学習に利用することで、多様なVLAポリシーの操作性能を向上させる手法を提案した。
原題: A4A: Cross-Embodiment Transfer of Action-Oriented 4D Affordances from Human Demonstrations / Yifan Han, Litao Liu, Yuqi Gu 他
日本語で読む → - 論文操作ロボティクス
人間が避ける行動からどう学ぶか?介入認識型ワールドモデルと実世界RLによる器用な操作
人間の介入を単なる修正ではなく、将来のリスク予測信号として活用する安全重視のRLフレームワークWHIRLを提案し、多指ロボットハンドでの複雑な把持・操作タスクで成功率向上と介入削減を実証した。
原題: How to Learn from What a Human Would Avoid? Intervention-Aware World Models with Real-World RL for Dexterous Manipulation / Jiaju Yin, Zhenhui Zhang, Lixin Xu 他
日本語で読む → - 論文エゴセントリックビジョン/手とカメラの軌跡推定画像認識
MINT: スケーラブルなエゴセントリックパイプライン監視によるワールド空間カメラ・手の動き推定の統合モデル
エゴセントリックRGB映像からカメラと両手のワールド空間軌跡を直接推定する初の基盤モデルMINTを提案し、大規模な疑似ラベル生成パイプラインで事前学習して高精度化した。
原題: MINT: A Unified Model for World-Space Camera and Hand Motion Estimation from Scalable Egocentric Pipeline Supervision / Zijie Zhu, Weiren Cai, Yizhou Wang 他
日本語で読む → - 論文群制御ロボティクス
私の好みで詰めて:パーソナライズ自動梱包のための三者間ヒューマンロボット協調
居住者の好みを反映した自動梱包を実現するため、人間専門家と音声エージェントの仲介を比較し、音声エージェントが専門家と同等の成果を2/3のカテゴリで達成できることを示した。
原題: Pack It My Way: Triadic Human-Robot Collaboration for Personalized Autonomous Packing / Sandeep Chowdary Kotapati, Yanxin Gao, Tsung-Chi Lin
日本語で読む → - 論文3D再構成画像認識
HiSfM: 足場アンカー型階層再構成によるStructure-from-Motionの曖昧性解消
繰り返し構造や対称構造による視覚的曖昧性に強い、階層的な粗密SfMフレームワークを提案。局所コミュニティと検証済みスケルトンを用いて安定な足場を構築し、残りの画像を効率的に吸収することで、曖昧性による失敗を防ぎつつ計算コストを削減する。
原題: HiSfM: Disambiguating Structure-from-Motion via Scaffold-Anchored Hierarchical Reconstruction / Ziding Zhao, Hainan Cui, Peilin Tao 他
日本語で読む → - 論文ヒューマノイド/HRIロボティクス
マルチモーダルな人とロボットのインタラクションのためのヒューマノイドロボットプロトタイプの開発
人とロボットのインタラクション研究用に、12自由度の双腕と表情表示可能な頭部を持つヒューマノイドロボットを開発し、ジェスチャ認識・物体検出・音声コマンド処理の3つのAIモジュールを統合して検証した。
原題: Development of a Humanoid Robot Prototype for Multimodal Human-Robot Interaction / Thang Tran Viet, Thanh Nguyen Canh, Huy Uong Gia 他
日本語で読む → - 論文VLA画像認識
時間を考慮した支援ナビゲーション
視覚と言語のエージェントが、ユーザーへの応答タイミングを計画できるかを検証し、複雑な屋外環境での支援ナビゲーション用の大規模ベンチマークを導入。既存のMLLMの限界を明らかにし、指示の理由を予測する単純な改良で性能が向上することを示した。
原題: Time-Aware Assistive Navigation / Masaki Kuribayashi, Zhongkai Shangguan, Eshed Ohn-Bar
日本語で読む → - 論文VLAロボティクス
GE-Act 2.0: ロボット操作のためのワールドアクションモデルの事前学習とスケーリング
操作データのみで生成・行動コンポーネントをゼロから学習するワールドアクションモデルを提案し、大規模データでの事前学習とスケーリングの効果を検証した。
原題: GE-Act 2.0: Pretraining and Scaling a World-Action Model for Robotic Manipulation / AgiBot Research Team, Renhang Liu, Wenzhi Zhao 他
日本語で読む → - 論文VLAロボティクス
長期的視覚言語行動操作のための神経記号的推論
長期的な操作タスクを遂行するために、学習されたVLA制御と明示的なタスクグラフおよびマルチモーダル手続き記憶を組み合わせた神経記号的枠組みを提案する。
原題: Towards Neuro-Symbolic Procedural Reasoning for Long-Horizon Vision-Language-Action Manipulation / Vivek Chavan, Yahuan Shi, Oliver Heimann 他
日本語で読む → - 論文探索ロボティクス
情報誘導型安全強化学習による小型無人航空機を用いた自律ガス発生源探索
乱流環境下でのガス発生源探索を、情報量指標と強化学習を組み合わせた枠組みで解決し、シミュレーションで高い成功率を達成した。
原題: Information-Guided Safe Reinforcement Learning for Autonomous Gas Source Localization using sUAS / Sachin Giri, Thomas Zhao, Matthew Huynh 他
日本語で読む → - 論文3Dビジョン言語モデル画像認識
3Dビジョン言語モデルの概要
3Dデータとテキスト・画像を結びつける3Dビジョン言語モデル(3D VLM)の基礎から最新の応用までを概説したチュートリアル論文。
原題: An overview of 3D Vision-Language Models / Márcus Lobo, Vitor Matias, Afonso Paiva 他
日本語で読む → - 論文3Dシーングラフロボティクス
フィールドロボティクスのためのオープンセット3Dシーングラフ:屋外ケーススタディ
屋外ロボット向けの3Dシーングラフ(3DSG)を、オープンセットの視覚言語モデルと組み合わせて5つのデータセットで評価し、セマンティック埋め込みの外れ値やナビゲーション性能などの課題を明らかにした。
原題: Open-Set 3D Scene Graphs for Field Robotics: An Outdoor Case Study / Chad R. Samuelson, Gabriel R. Slade, Joshua G. Mangelson
日本語で読む → - 論文3D再構成画像認識
WorldSculpt: 接地動画からの構成的3D世界生成
数百の物体が密集したシーンを、個々の物体メッシュの集合として構成的に3D再構成する手法を提案。単一物体の生成事前分布を多視点観測に適応させ、シーン全体の学習なしで複雑なシーンを生成できることを示した。
原題: WorldSculpt: Generating Compositional Worlds from Grounded Videos / Muyao Niu, Jixuan He, Ruihan Yu 他
日本語で読む → - 論文SLAM/オドメトリロボティクス
FIRE-LIVWO: 故障耐性ミリ波レーダー強化による堅牢なLiDAR-慣性-視覚-車輪オドメトリ
地下炭鉱のような過酷な環境でのSLAMの堅牢性を高めるため、4Dミリ波レーダー、LiDAR、視覚、車輪オドメトリを統合し、故障検出と適応的融合戦略によりモダリティを動的に切り替えるオドメトリフレームワークを提案した。
原題: FIRE-LIVWO: Robust LiDAR-Inertial-Visual-Wheel Odometry via Failure-Immune mmWave Radar Enhancement / Kun Hu, Menggang Li, Kaidi Wu 他
日本語で読む → - 論文VLAロボティクス
一言で変わる行動:言語条件付き身体化推論の実ロボットベンチマーク
タスクが変わらない場合は行動を維持し、タスクが変わった場合のみ行動を正しく更新する能力を評価する、実ロボット向けの新しいベンチマークを提案した。
原題: One Word, Different Action: A Real-Robot Benchmark for Language-Conditioned Embodied Reasoning / Yiwei Liu, Luwei Yang, Shunbo Lei
日本語で読む → - 論文VLA/ベンチマークロボティクス
RoboSPA: VLAモデルは単純なシーンと短期的なタスクを超えられるか?
VLAモデルの空間的・手続き的複雑さに対する推論能力を診断する大規模ロボット操作ベンチマークRoboSPAを提案し、既存モデルの限界を明らかにした。
原題: RoboSPA: Can VLA Models Go Beyond Simple Scenes and Short-Horizon Tasks? / Zhenxuan Fan, Bo Zhang, Yutong Lin 他
日本語で読む → - 論文VLM報酬モデルロボティクス
同じ軌道、矛盾する報酬(ROBORMBENCH):視覚言語報酬モデルにおける言い換えの脆弱性
視覚言語モデルをロボット学習の報酬関数として使う際、意味的に等価な指示の言い換えで報酬が大きく変わり、成功と失敗が反転することもあることを示し、その脆弱性を測るベンチマークROBORMBENCHを構築した。
原題: Same Trajectory, Contradictory Rewards (ROBORMBENCH): Paraphrase Fragility in Vision Language Reward Models / Wonje Jeung, Sangyeon Yoon, Hyesoo Hong 他
日本語で読む → - 論文群制御ロボティクス
局所学習を不安定化させないロボットポリシー精錬のためのスキーマ拘束型言語モデル
異種ロボット群の分散ナビゲーションにおいて、LLMによるポリシー生成をラウンド単位に限定し、UCBバンディットとDouble DQNで局所制御を安定化させる手法を提案・評価した。
原題: A Schema Bounded Language Model for Refining Robot Policies Without Destabilizing Local Learning / Chongwen Dong, Mithun Paul Saint-Germain, Pinjari Asif 他
日本語で読む → - 論文画像生成画像認識
LensStyle:光学美学を学習し、制御可能なスタイライズドレンズ効果レンダリングを実現
レンズの美学(絞り形状、周辺減光、回折など)を明示的にモデル化し、連続・離散制御を統合した統一フレームワークで、多様なボケ効果やスターバーストなどのスタイライズドレンズ効果を生成する手法を提案した。
原題: LensStyle: Learning the Optical Aesthetics for Controllable Stylized Lens Effect Rendering / Yachuan Huang, Liwen Xiao, Liao Shen 他
日本語で読む → - 論文医用画像分割画像認識
心血管カテーテル血管造影における多クラス分割のための二部構成マルチラテラル分岐ネットワーク
カテーテル画像の多クラス分割を高速かつ高精度に行うため、エンコーダに横方向分岐、デコーダに複数ヘッドを持つ二部構成のMLBNetを提案し、ファントムや動物モデルのデータで有効性を検証した。
原題: Dual-Part Multi-Lateral Branched Network for Multi-Class Segmentation in Cardiovascular Catheterization Angiograms / Olatunji Omisore, Ahmed Elazab, Ali Shahidinejad 他
日本語で読む → - 論文ナビゲーションロボティクス
NavArena: 3Dガウススプラッティング再構成からの目標指向ナビゲーションベンチマークの自動構築
固定された3DGS再構成を、到達可能性や衝突判定、意味的目標を備えたナビゲーションベンチマークへ自動変換するフレームワークを提案し、2,000以上のシーンで2,220万の専門家軌道を生成して評価する。
原題: NavArena: Automated Construction of Goal-Oriented Navigation Benchmarks from 3D Gaussian Splatting Reconstructions / Junhui Wang, Wei Yang, Xinyao Li 他
日本語で読む → - 論文模倣学習ロボティクス
何が重要か、いつ重要か?視運動模倣ポリシーにおける条件付き視覚グラウンディングの診断と改善
視運動模倣ポリシーが、視覚的に類似した物体や容器が導入されると失敗する問題を、条件付き視覚グラウンディングとして分析し、注意正則化や外観ベースの視覚プロンプティングなどの介入でロバスト性を改善した。
原題: What Matters, When? Diagnosing and Improving Conditional Visual Grounding in Visuomotor Imitation Policies / Vivek Chavan, Pengtao Xie, Yahuan Shi 他
日本語で読む → - 論文最適制御制御
ルールブックを用いたリスク認識型最適制御
複数の要件を優先度とリスク評価で扱う安全制御問題に対し、リスク認識型ルールブックを定義し、辞書式最適化と枝刈りアルゴリズムで最適性ギャップを保証する手法を提案した。
原題: Risk-Aware Optimal Control with Rulebooks / Tichakorn Wongpiromsarn
日本語で読む → - 論文マニピュレーションロボティクス
意図を考慮したロボットから人への両手受け渡しのための時間的触覚符号化とコンプライアンス制御
ロボットから人への物体受け渡しにおいて、視覚だけでは受け取り意図を判別できない問題に対し、VLAモデルに時間的触覚フィードバックとコンプライアンス制御を組み合わせ、安全で快適な受け渡しを実現する手法を提案・評価した。
原題: Temporal Tactile Encoding and Compliance for Intent-Aware Robot-to-Human Bimanual Handover / Pasquale Marra, Stefano Berti, Gabriele Mario Caddeo 他
日本語で読む → - 論文協調自動運転ロボティクス
CoLMIN: LLMに基づく協調自動運転のためのマルチ決定経路交渉
複数車両の協調自動運転において、LLMの推論能力を活用し、複数の運転意図を生成・評価する交渉フレームワークCoLMINを提案。浅い反射と深い反射を組み合わせて、複雑な交通シナリオでの安定した合意形成を実現する。
原題: CoLMIN: LLM-based Multi-Decision Path Negotiation for Cooperative Autonomous Driving / Zhe Huang, Zhaoxin Fan, Shuo Wang 他
日本語で読む → - 論文マニピュレーションロボティクス
ロボットハンド操作における形態と駆動方式の帰納的バイアス
ロボットハンドの形態と駆動方式が操作性能に与える影響を、タスクヤコビアンと駆動行列の条件数を用いて解析し、強化学習実験で検証した論文。
原題: Morphology and actuation as inductive biases in robotic hand manipulation / Zalán Tari, Eszter Birtalan, Péter Polcz 他
日本語で読む → - 論文ハンド/ベンチマークロボティクス
多指ロボットハンドの巧緻性ベンチマーク:レビューと展望
多指ロボットハンドの巧緻性を評価するためのベンチマーク手法を体系的にレビューし、3段階のベンチマークフレームワークを提案する論文。
原題: Benchmarking Dexterity of Multifingered Robot Hands: A Review and Perspective / Anthony Shilati, Anunth Ramaswami, Luke Batteas 他
日本語で読む → - 論文マニピュレーションロボティクス
物理カーネル:暗所マニピュレーションのための構造化視覚潜在表現
短時間の照明下での書き込みで視覚潜在z0を符号化し、その後は画素入力なしで方策と開ループ動力学が接触の多いスキルを実行できることを示した研究。
原題: Physical Kernel: Structured Visual Latents for Dark Manipulation / Jinting Hang, Hong Li, Zhenhui Cai 他
日本語で読む → - 論文認知アーキテクチャロボティクス
自律ロボットのためのイベント依存認知処理と学習による連続的認知カバレッジ
自律ロボットが遭遇するすべてのイベントに、状態や文脈に応じた認知処理を割り当て、学習により自動化・改善する連続的認知カバレッジの枠組みを提案した。
原題: Continuous Cognitive Coverage for Autonomous Robots via Event-Dependent Cognitive Treatment and Learning / Hong Su
日本語で読む →