論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/6/18 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文マルチモーダル/誤情報検出自然言語
NepOOC-M: ネパール語-英語バイリンガルベンチマークとOOC検出のためのマルチモーダルアーキテクチャ比較分析
ネパール語を主とする初の公開OOC誤情報ベンチマークNepOOCを構築し、5つのマルチモーダルモデルとテキスト/画像のみのベースラインを比較。現段階ではテキストのみのモデルが最良で、画像のみは偶然レベルに留まることを示した。
原題: NepOOC-M: Bilingual Nepali-English Benchmark and Comparative Analysis of Multimodal Architectures for OOC Detection / Sanjeev Khatiwada
日本語で読む → - 論文音声評価eess.AS
音響・韻律摂動による音声品質評価における人間とモデルの乖離の調査
音声品質評価モデルが音響劣化には追従するが、韻律誤差や話者特性の変化に対する感度が人間と異なることを、制御された摂動実験で明らかにした論文。
原題: Investigating Human-Model Discrepancies in Speech Quality Assessment via Acoustic and Prosodic Perturbations / Masato Takagi, Masaya Kawamura, Reo Shimizu 他
日本語で読む → - 論文手術ロボティクス/世界モデル画像認識
SurgVista: 手術における長期的世界モデリングと物理的に妥当な器具-組織ダイナミクス
手術映像の世界モデルを提案し、器具と組織の相互作用の整合性と長期的な予測の安定性を向上させる手法を開発した。
原題: SurgVista: Long-Horizon Surgical World Modeling with Plausible Instrument-Tissue Dynamics / Wentao Pan, Wuyang Li, Shengyuan Liu 他
日本語で読む → - 論文ナビゲーション画像認識
見て到達する:視野内UAVの精密視覚言語ナビゲーション
UAVの視覚言語ナビゲーションにおいて、目標が視野に入った後の精密な到達能力に焦点を当てた新しいタスクと、動的3D方向手がかりを用いたウェイポイント予測フレームワークを提案した。
原題: See-and-Reach: Precise Vision-Language Navigation for UAVs within the Field of View / Fanfu Xue, En Yu, Yantian Shen 他
日本語で読む → - 論文VLA画像認識
EventVLA: イベント駆動型視覚証拠メモリによる長期的視覚言語行動ポリシー
長期的なロボット操作タスクで、視覚情報が隠れたり見えなくなったりする問題に対処するため、重要な視覚イベントを予測して記憶する新しいフレームワークEventVLAを提案した。シミュレーションと実機タスクで既存手法より成功率が大幅に向上した。
原題: EventVLA: Event-Driven Visual Evidence Memory for Long-Horizon Vision-Language-Action Policies / Ganlin Yang, Zhangzheng Tu, Yuqiang Yang 他
日本語で読む → - 論文ナビゲーションロボティクス
自律ナビゲーションにおける注視誘導型能動知覚のための高速な人間の注意予測
液体ニューラルネットワークとMobileNetV3を用いた軽量な視線走査予測モデルGazeLNNを提案し、計算コストを99.4%削減しつつ最先端の精度を達成。さらに強化学習で訓練したカメラ制御ポリシーに統合し、実機ドローンでの自律ナビゲーションを実証した。
原題: Fast Human Attention Prediction for Fixation-guided Active Perception in Autonomous Navigation / Fatma Youssef Mohammed, Grzegorz Malczyk, Kostas Alexis
日本語で読む → - 論文4Dセグメンテーション画像認識
シーン手がかりからの内在的4Dガウスセグメンテーション
動的4Dガウススプラッティング表現から、外部マスクや学習済み特徴量を使わずに、ガウスプリミティブ間の疎な親和性グラフを構築し、Leidenコミュニティ検出でオブジェクトをセグメンテーションする手法を提案。
原題: Intrinsic 4D Gaussian Segmentation from Scene Cues / Hasan Yazar, Mohamed Rayan Barhdadi, Erchin Serpedin 他
日本語で読む → - 論文器用操作/データ生成ロボティクス
私の真似をして:日常の人間ビデオからの器用な操作データ
単眼RGBの人間ビデオから手と物体のインタラクションを再構築し、多指ロボットハンドの実行可能な操作軌道へとリターゲティングするアルゴリズムを提案した。
原題: Do as I Do: Dexterous Manipulation Data from Everyday Human Videos / Bhawna Paliwal, Haritheja Etukuru, William Liang 他
日本語で読む → - 論文世界モデル機械学習
二重チャネル接地型世界モデリング(DCGWM):異種外部接地と内向きのみの勾配流による目的干渉崩壊の構造的防止
JEPAベースの世界モデルにおいて、物理的ダイナミクスと社会的行動ダイナミクスの2つの異なる外部信号を共有潜在空間で学習すると、一方のチャネルが他方の表現部分空間を崩壊させる「目的干渉崩壊」が起こることを特定し、これを構造的に防ぐため、潜在空間を物理・行動の2つの部分空間に分割し、内向きのみの勾配流を持つDCGWMを提案した。
原題: Dual-Channel Grounded World Modeling (DCGWM): Structural Prevention of Objective Interference Collapse via Heterogeneous External Grounding with Inward-Only Gradient Flow / Akshay Hazare
日本語で読む → - 論文デジタルツイン/関節物体/URDF画像認識
RGB-DシーケンスからのURDF合成:微分可能な関節推定とエネルギー整合検証によるアプローチ
短いRGB-Dシーケンスから関節物体のデジタルツインを構築するパイプラインを提案。部品形状・関節トポロジー・関節パラメータを同時推定し、エネルギー保存則を検証して物理シミュレータでのドリフトを低減する。
原題: URDF Synthesis from RGB-D Sequences via Differentiable Joint Inference and Energy-Consistent Verification / Xinze Zhang
日本語で読む → - 論文3Dシーン理解画像認識
OneCanvas: パノラマ再投影による3Dシーン理解
複数視点のパッチ特徴を単一のパノラマキャンバスに再投影し、3D位置埋め込みを加えることで、既存のVLMを大幅に変更せずに3D空間推論を実現する手法を提案した。
原題: OneCanvas: 3D Scene Understanding via Panoramic Reprojection / Bartłomiej Baranowski, Dave Zhenyu Chen, Matthias Nießner
日本語で読む → - 論文セキュリティcs.CR
ライフサイクルを考慮した動的解析による安全なMLモデル実行の実現
MLモデルの実行をライフサイクルフェーズに分け、各フェーズでのホストシステムとの相互作用を監視する動的解析手法を提案し、既存の静的スキャンでは検出できない攻撃を高い精度で検出した。
原題: Lifecycle-Aware Dynamic Analysis for Secure ML Model Execution / Gabriele Digregorio, Marco Di Gennaro, Francesco Pastore 他
日本語で読む → - 論文具現化エージェント/長期記憶/ベンチマークAI
WorldLines: 長期的な状態を持つ具現化エージェントのベンチマークとモデリング
長期的な家庭支援のためのベンチマークWorldLinesを構築し、記憶と計画の課題を評価するフレームワークObsMemを提案した。
原題: WorldLines: Benchmarking and Modeling Long-Horizon Stateful Embodied Agents / Yehang Zhang, Jianchong Su, Haojian Huang 他
日本語で読む → - 論文自動運転/テストベッドロボティクス
自動運転車のための複合現実テストベッド
物理ロボットと高忠実度シミュレーションを統合した、自動運転車のハードウェアインザループテストベッドを提案し、安全性が保証された制御フレームワークを実証した。
原題: A Mixed-Reality Testbed for Autonomous Vehicles / H. M. Sabbir Ahmad, Ehsan Sabouni, Emrullah Celik 他
日本語で読む → - 論文VLA評価機械学習
VLAは基本を知っているか?視覚言語行動モデルにおける常識・世界知識の保持を測る
VLAモデルがロボットデータで微調整後も常識や世界知識を保持しているかを、行動で回答する新しい評価プロトコルAct2Answerを導入して検証した。
原題: Does VLA Even Know the Basics? Measuring Commonsense and World Knowledge Retention in Vision-Language-Action Models / Nikita Kachaev, Andrey Moskalenko, Matvey Skripkin 他
日本語で読む → - 論文画像編集画像認識
BindEdit: 注意漏れを抑えた高精度な複数物体画像編集
複数物体を含む画像編集で生じる注意漏れ(トークンと領域の対応ずれや、編集対象外の物体の注意が支配的になる問題)を特定し、拡散過程内で注意制約を課すことで、物体の混ざりや重複を防ぎ、高精度な編集を実現する手法を提案した。
原題: BindEdit: Taming Attention Leakage for Precise Multi-Object Image Editing / Chaewon Park, Soyoon Lee, Naeun Lee 他
日本語で読む → - 論文SLAMロボティクス
センサ構成が重要:四足ロボットにおけるマルチモーダルSLAMの系統的評価
四足ロボットの過酷な運動下でのSLAM性能に対するセンサ構成(カメラ種別、シャッター方式、IMU性能)の影響を、ANYmal Dのデータセットを用いて系統的に評価した論文。
原題: Sensor Configuration Matters: A Systematic Evaluation of Multimodal SLAM on Quadruped Robots / Roberto Corlito, Fabian Schmidt, Nils Seibert 他
日本語で読む → - 論文教育AIcs.CY
ELEVATE:スケーラブルで包括的な教育のための人間中心設計のGenAI仮想チューター
教育用GenAIチューターの新しいフレームワークELEVATEを提案。ローカル実行型の3Dアバターと教師向けガバナンス層を統合し、低コストで多感覚的な教育を実現する。
原題: ELEVATE: Designing Human-Centered GenAI Virtual Tutors for Scalable and Inclusive Education / Lorenzo Stacchio, Michele Giordano, Daniele Berardini 他
日本語で読む → - 論文動作予測画像認識
MolmoMotion: 言語指示による3D点軌跡予測
言語指示に基づいて物体上の3D点の将来軌跡を予測するモデルと、大規模データセット・ベンチマークを構築した論文。
原題: MolmoMotion: Forecasting Point Trajectories in 3D with Language Instruction / Jianing Zhang, Chenhao Zheng, Yajun Yang 他
日本語で読む → - 論文セマンティックセグメンテーション画像認識
ICRA 2026 GOOSE 2D細粒度セマンティックセグメンテーションチャレンジ技術報告:フィールドロボティクスにおける堅牢な屋外シーン理解のためのDINOv3活用
GOOSE 2Dセマンティックセグメンテーションチャレンジで1位を獲得した手法を報告。DINOv3バックボーンとMask2Formerデコーダを組み合わせ、テスト時拡張とアンサンブルで精度を向上させた。
原題: Technical Report for ICRA 2026 GOOSE 2D Fine-Grained Semantic Segmentation Challenge: Leveraging DINOv3 for Robust Outdoor Scene Understanding in Field Robotics / Jaeil Park, Hyobin Choi, Sangjin Lee 他
日本語で読む → - 論文評価指標画像認識
AUCが誤解を招くとき:ドメインシフト下でのディープフェイク検出器の分極化を考慮した評価
ディープフェイク検出器の汎化性能を評価する際、従来のAUCはデータソース混合やアーティファクト多様性を反映しないため、新指標Cross-AUCを提案し、ドメインシフト下での頑健性をより現実的に評価する。
原題: When AUC Misleads: Polarization-Aware Evaluation of Deepfake Detectors under Domain Shift / Dat Nguyen, Cosmin Radoi, Romain Hermary 他
日本語で読む → - 論文遠隔操作ロボティクス
オクルージョンを透過する:ロボット遠隔操作のための決定論的アーム運動学補正
単一RGB-Dカメラによるマーカーレスモーションキャプチャで自己遮蔽により劣化する関節深度推定を、一定の腕長の幾何学的制約(ピタゴラスの定理)を用いて決定論的に補正する手法を提案し、実機遠隔操作で有効性を示した。
原題: Seeing Through Occlusion: Deterministic Arm Kinematic Correction for Robot Teleoperation / Thomas M. Kwok, Nicholas Koenig, Yue Hu
日本語で読む → - 論文戦略的分類機械学習
戦略的特徴選択
戦略的操作を考慮した特徴選択とリッジ正則化の相互作用を研究し、個々の特徴の操作可能性だけに基づく除外は最適でないことを示し、特徴セットと正則化レベルを共同で選択する実用的アルゴリズムを提案した。
原題: Strategic Feature Selection / Jivat Neet Kaur, Pratik Patil, Divya Shanmugam 他
日本語で読む → - 論文探索/理論機械学習
文脈内学習は内発的好奇心を支えられるか?
大規模系列モデルの文脈内学習能力を利用して、勾配更新なしで学習進捗を推定し、探索ポリシーを訓練できるかを理論的に検証した論文。一般的なマルコフ決定過程では不可能だが、能動学習などの非時間的設定では可能であることを証明した。
原題: Can In-Context Learning Support Intrinsic Curiosity? / Eric Elmoznino, Sangnie Bhardwaj, Johannes von Oswald 他
日本語で読む → - 論文触覚センシング画像認識
接触式フリンジ投影プロフィロメトリによる反射・透明物体の高解像度3次元表面計測
GelSightセンサの欠点を克服するため、フリンジ投影法を用いた接触式3次元計測手法を提案し、高精度な表面形状計測を実現した。
原題: Contact-Based Fringe Projection Profilometry for High-Resolution 3-D Surface Measurement of Reflective and Transparent Objects / Ingu Yeo, Hyung-Gun Chi, Jae-Sang Hyun
日本語で読む → - 論文シミュレーション環境構築ロボティクス
GASE: ガウススプラッティングに基づく身体化シミュレーション環境再構築の自動化システム
パノラマカメラアレイを用いて環境を高速スキャンし、高品質な前景抽出とインペインティングを経て、物理シミュレータにそのまま使える高忠実度シーンを自動構築するシステムを提案した。実ロボット実験で、実データのみで訓練したポリシーとの性能差が10%未満であることを示した。
原題: GASE: Gaussian Splatting-Based Automated System for Reconstructing Embodied-Simulation Environments / Jiawei Zhang, Yiming Yan, Chao Liang 他
日本語で読む → - 論文操作ロボティクス
グアバ:身体的操作のための効果的で普遍的なハーネス
言語モデルを外部モジュールと組み合わせるハーネスフレームワーク「Guava」を提案し、反復的な知覚-推論-行動ループ、意味的アクション抽象化、マルチモーダル観測が重要であることを示した。シミュレーションで収集した少数の軌道から4Bモデルへの蒸留を行い、実世界でも高い性能と汎化を達成した。
原題: Guava: An Effective and Universal Harness for Embodied Manipulation / Haowen Liu, Xirui Li, Shaoxiong Yao 他
日本語で読む → - 論文データ生成ロボティクス
AnnotateAnything: ロボット操作のための3Dアセット自動アノテーション
受動的な3Dアセットに、物体の意味・相互作用・物理的制約を考慮した操作ラベル(把持、接触、関節動作など)を自動付与するフレームワークを提案し、シミュレーションデータ収集の効率とタスク成功率を向上させた。
原題: AnnotateAnything: Automatic Annotation of 3D Assets for Robot Manipulation / Haoran Lu, Mutian Shen, Shuyang Yu 他
日本語で読む → - 論文シミュレーション基盤ロボティクス
MagicSim: 実行可能な身体化インタラクションのための統合基盤
シミュレーションを制御・スキル・計画を結ぶ実行基盤として捉え、YAML定義から多様な実行可能な世界を構築し、コマンドをロボット動作に変換する統一パイプラインを提供する。
原題: MagicSim: A Unified Infrastructure for Executable Embodied Interaction / Haoran Lu, Songling Liu, Yue Chen 他
日本語で読む → - 論文3D再構成画像認識
MoonSplat: Sim(3)大域最適化を備えた単眼オンラインガウシアンスプラッティング
単眼画像列からのオンライン3D再構成において、カメラ姿勢の大域最適化とボクセル化3Dガウシアンのループ閉じ込みを統合し、色残差学習で高速化・高品質化を実現した。
原題: MoonSplat: Monocular Online Gaussian Splatting with Sim(3) Global Optimization / Guo Pu, Yixuan Han, Haofeng Li 他
日本語で読む →