論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/6/10 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文生理計測画像認識
照明変化に頑健なロボット用カメラ心拍計測
ロボット搭載カメラでの心拍計測を照明変化に頑健にするため、空間時間トランスフォーマーと照明オーグメンテーションを組み合わせた新しい推定手法を提案した。
原題: Illumination-Robust Camera-Based Heart-Rate Estimation for Physiological Sensing in Robots / Zhi Wei Xu, Torbjörn E. M. Nordling
日本語で読む → - 論文模倣学習ロボティクス
アンビエント拡散ポリシー:ロボティクスにおける準最適データからの模倣学習
準最適なロボットデータから有益な特徴のみを抽出するため、ノイズ依存のデータ使用法を導入した拡散ポリシー手法を提案し、複数タスクで有効性を実証した。
原題: Ambient Diffusion Policy: Imitation Learning from Suboptimal Data in Robotics / Adam Wei, Nicholas Pfaff, Thomas Cohn 他
日本語で読む → - 論文触覚/VLA/sim2realロボティクス
TacCoRL: シミュレーションによる触覚フィードバックのVLAへの統合
視覚と言語と行動の事前知識を持つVLAモデルに触覚フィードバックを注入し、シミュレーションと実機の共学習と強化学習で接触を要するタスクの成功率を向上させるフレームワークを提案した。
原題: TacCoRL: Integrating Tactile Feedback into VLA via Simulation / Siyu Ma, Yuqi Liang, Chang Yu 他
日本語で読む → - 論文強化学習機械学習
PAWS: アドバンテージ重み付きセグメントを用いた選好学習
人間の軌道比較から報酬を学習する選好ベース強化学習において、訓練と推論の不一致による分布シフトを分析し、セグメントレベルのアドバンテージ関数を直接用いた政策更新手法PAWSを提案した。ロボット操作・移動タスクで既存手法を上回る性能を示した。
原題: PAWS: Preference Learning with Advantage-Weighted Segments / Aleksandar Taranovic, Onur Celik, Niklas Freymuth 他
日本語で読む → - 論文VLA画像認識
ワールドモデルの自己蒸留:汎用タスク解決のためのワールドモデル学習
事前学習済みビデオ生成モデルを、自己蒸留と強化学習を組み合わせて、タスク実行能力を持つワールドモデルへと変換する手法を提案。
原題: World Model Self-Distillation: Training World Models to Solve General Tasks / Sebastian Stapf, Pablo Acuaviva Huertos, Aram Davtyan 他
日本語で読む → - 論文音楽生成cs.SD
PianoKontext: 無表情なコンテキストからの表現豊かな演奏レンダリング
クラシックピアノの楽譜から表現豊かな演奏音声を生成するフローマッチングモデルを提案し、潜在空間でのDTWにより可変長の演奏を生成する。
原題: PianoKontext: Expressive Performance Rendering from Deadpan Context / Dmitrii Gavrilev
日本語で読む → - 論文知識表現/オントロジーロボティクス
意味抽出:LLMガイドによるURDFからのロボットオントロジー自動構築
URDFファイルからロボットの意味的抽象化を自動生成するパイプラインを提案。LLMを用いて既存オントロジーの概念に基づき意味関係を推論し、多数決と検証で信頼性を高める。
原題: Extracting Semantics: LLM-Guided Automatic Population of Robot Ontology from URDF / Bastien Dussard, Guillaume Sarthou
日本語で読む → - 論文世界モデルstat.ML
ガウス性を超えた識別可能性:シンボリック世界モデルとほぼ無限の時間的一貫性
統計的世界モデルの時間的一貫性の限界がガウス過程に起因することを示し、物理に基づくシンボリックアーキテクチャ(PGSA)が非ガウス系でも正確な線形識別可能性とほぼ無限の時間的一貫性を達成することを証明した論文。
原題: Identifiability Without Gaussianity: Symbolic World Models and Near-Infinite Temporal Consistency / Seth Dobrin, Łukasz Chmiel
日本語で読む → - 論文3D生成/解釈可能性画像認識
3D-CBM: 生成的3Dモデリングにおける概念ベース解釈可能性のためのフレームワーク
3D生成モデルに概念ボトルネックモデルを組み込み、点群やメッシュなどの幾何学入力を人間が定義した概念にマッピングすることで、解釈可能性とテスト時の介入を可能にするフレームワークを提案した。
原題: 3D-CBM: A Framework for Concept-Based Interpretability in Generative 3D Modeling / Ahmad Al-Kabbany
日本語で読む → - 論文拡散ポリシー/強化学習/モデルベース機械学習
MODIP: 拡散ポリシーのための効率的なモデルベース最適化
拡散ポリシーを強化学習で直接微調整する代わりに、ワールドモデルとモデル予測制御で高品質な軌道を生成し、それを教師信号として行動クローニング的に微調整するフレームワークを提案した。
原題: MODIP: Efficient Model-Based Optimization for Diffusion Policies / Zakariae El Asri, Philippe Gratias-Quiquandon, Nicolas Thome 他
日本語で読む → - 論文模倣学習/操作ロボティクス
器用なポイントポリシー:人間のデモから学習するポイントベースの器用な手のポリシー
人間のビデオから直接、器用な操作ポリシーを学習するフレームワークを提案。3Dキーポイント表現で人間とロボットの身体性のギャップを埋め、ロボットデモなしで実ロボットタスクを高い成功率で達成。
原題: Dexterous Point Policy: Learning Point-based Dexterous Hand Policies from Human Demonstrations / Beomjun Kim, Seong Hyeon Park, Seunghoon Sim 他
日本語で読む → - 論文3D再構成/操作軌道合成画像認識
ManiSplat: 単眼ビデオからの操作軌道合成 - 分離型3Dガウシアンスプラッティングによるアプローチ
ロボットの単眼ビデオから、ロボット・物体・背景を分離した3Dガウシアン表現を構築し、操作タスクの軌道を合成するフレームワークを提案した。
原題: ManiSplat: Manipulation Trajectory Synthesis from Monocular Video via Decoupled 3D Gaussian Splatting / Wenhao Hu, Haonan Zhou, Liu Liu 他
日本語で読む → - 論文VLA/階層制御ロボティクス
ロボットポリシー編成における重要要素:階層型VLAエージェントの体系的研究
階層型VLAシステムの設計原則を体系的に研究し、プランナーとコントローラの選択や接続方法などが性能に与える影響を分析。導出した原則に基づくシステムが、フラットなVLAや素朴な階層構造より優れることをシミュレーションと実機で示した。
原題: What Matters in Orchestrating Robot Policies: A Systematic Study of Hierarchical VLA Agents / Jiaheng Hu, Mohit Shridhar, Caden Lu 他
日本語で読む → - 論文VLA画像認識
ScoutVLA:オープンワールド具現化質問応答のためのデュアルエキスパートVLAモデルによるUAV中心の能動知覚
UAVが環境を能動的に知覚して質問に答える空中具現化質問応答(EQA)において、証拠探索に必要な微細な視点調整を可能にするベンチマークFG-EQAと、ミツバチのダンスに着想を得たデュアルエキスパート型VLAモデルScoutVLAを提案した。
原題: ScoutVLA: UAV-Centric Active Perception via a Dual-Expert VLA Model for Open-World Embodied Question Answering / Wenhao Lu, Zhengqiu Zhu, Xiaofeng Wang 他
日本語で読む → - 論文6Dポーズ推定/農業ロボティクス画像認識
シミュレーションから実世界へ:ロボットイチゴ収穫のための実地6Dポーズデータセットとベースライン
実際の農場で収集した初のイチゴ6Dポーズ実データセットを提供し、シミュレーションとのギャップを定量化してベースライン性能を示した論文。
原題: From Simulation to the Real-World: An In-Field 6D Pose Dataset and Baseline for Robotic Strawberry Harvesting / Woojung Son, Won Suk Lee, Zijing Huang 他
日本語で読む → - 論文データセット画像認識
一人称視点での手検出のためのマルチモーダルRGB・イベントデータセット
イベントカメラとRGBカメラを組み合わせた手検出用の合成データセットを構築し、既存のマルチモーダル検出アルゴリズムで性能を実証した。
原題: A Multimodal RGB and Events Dataset for Hand Detection in First-Person View / Bharghav Kota, Yulia Sandamirskaya
日本語で読む → - 論文強化学習機械学習
封印監査における符号付き圧縮進捗はグッドハート耐性を持つ
本論文は、世界モデルの圧縮進捗を報酬とする内在的動機付けが、封印された監査損失の符号付き減少として定義されると、累積報酬が監査改善に一致し、偽の進捗を無限に押し上げられないことを証明した。
原題: Signed Compression Progress on a Sealed Audit is Goodhart-Resistant / Ayush Mittal, Dhruv Gupta
日本語で読む → - 論文ナビゲーションロボティクス
IMUのみの外乱除去とジャーク拡張モデルを活用した自律型農業ロボットの頑健なナビゲーション
GNSSやLiDARなどのセンサが途切れる環境でも、ジャーク拡張EKFと適応型ノイズ調整によりロバストな自己位置推定を実現する農業ロボット向けナビゲーション手法を提案した。
原題: Resilient Navigation for Autonomous Farm Robots by Leveraging Jerk-Augmented Models with IMU-Only Disturbance Rejection / Batu Candan, Mohammed Atallah, Simone Servadio 他
日本語で読む → - 論文視覚サンプリング画像認識
二重螺旋ビジョン(DH-V2):帯域制約下の知覚のための幾何学的ビジュアルサンプラー
画像を黄金比に基づく二重螺旋軌道でサンプリングし、1D信号に圧縮することで、帯域制約下でも幾何構造を保ちつつ高速な知覚を実現する手法を提案した。
原題: Double-Helix Vision (DH-V2): A Geometry-Based Visual Sampler for Bandwidth-Constrained Perception / Jinwen Wen
日本語で読む → - 論文制御制御
安定性保証を備えた非線形制御のためのL2有界構造化状態空間コントローラの自由パラメータ化
非線形システムの安定化制御において、L2ゲインを指定した線形時不変システムの新しい自由パラメータ化を提案し、それを用いた構造化状態空間モデル層(L2RU)により、制御器のパラメータに制約を課さずに閉ループ安定性を保証する。移動ロボットのフォーメーション制御で有効性を示した。
原題: Free Parametrization of L_2-Bounded Structured State-Space Controllers for Nonlinear Control with Stability Guarantees / Muhammad Zakwan, Leonardo Massai, Efe C. Balta 他
日本語で読む → - 論文軌道最適化ロボティクス
LieIPM: 剛体の直接軌道最適化のためのリー群内点法
剛体の軌道最適化をリー群上で直接行う構造を考慮したフレームワークを提案し、特異点を回避しつつ高速に収束する内点法を開発した。
原題: LieIPM: Lie Group Interior Point Method for Direct Trajectory Optimization of Rigid Bodies / Sangli Teng, Ruiqi Zhang, Tzu-Yuan Lin 他
日本語で読む → - 論文マニピュレーションロボティクス
IMPACT: 力強いロボット操作のための内部モデル予測制御の学習
力強い操作タスクをタスク計画と内部モデル予測制御に分離するフレームワークを提案し、シミュレーションと実世界で成功率と汎化性を向上させた。
原題: IMPACT: Learning Internal-Model Predictive Control for Forceful Robotic Manipulation / Jiawei Gao, Chaoqi Liu, Peilin Wu 他
日本語で読む → - 論文VLAロボティクス
視覚-行動ロボットデータの再ラベリングによるタスク堅牢性向上
大規模視覚言語モデルを用いて既存のロボットデータセットを拡張し、追加データ収集なしで指示追従性能と汎化性を向上させるフレームワークTREADを提案した。
原題: Task Robustness via Re-Labelling Vision-Action Robot Data / Artur Kuramshin, Özgür Aslan, Cyrus Neary 他
日本語で読む → - 論文最適制御ロボティクス
リーマン幾何に基づく逆最適制御のための勾配法バイレベル最適化
逆最適制御を最適解の多様体上の最適化問題として再定式化し、観測軌道を多様体に投影するリーマン逆最適制御法を提案。実データで計算時間を約4分の1に削減しつつ精度を維持した。
原題: Gradient based Bilevel for Inverse Optimal Control, a Riemannian approach / Ahmed-Manaf Dahmani, Vincent Bonnet, David Daney 他
日本語で読む → - 論文器用手/表現学習ロボティクス
UniDexTok: 実データからの統合器用手トークナイザ
人間とロボットの手の状態を共通の22自由度セマンティックインターフェースにマッピングし、再ターゲティング不要で異種の器用手を統一表現するトークナイザを提案。誤差をセンチメートルからサブミリメートルに大幅削減した。
原題: UniDexTok: A Unified Dexterous Hand Tokenizer from Real Data / Dong Fang, Youjun Wu, Yuanxin Zhong 他
日本語で読む → - 論文VLA自然言語
APIを超えて:物理的な道具使用におけるMLLMの限界を探る
物理的な道具使用を評価する初のベンチマークPhysTool-Benchを導入し、13の主要なMLLMが実世界のシーンで道具の認識と使用計画に苦戦することを示した。
原題: Beyond APIs: Probing the Limits of MLLMs in Physical Tool Use / Zhixin Ma, Yutong Zhou, Yongqi Li 他
日本語で読む → - 論文セキュリティ/拡散ポリシーロボティクス
テスト時敵対的乗っ取り:ロボット拡散ポリシーに対するリアルタイムハイジャックインターフェース
拡散ベースのロボットポリシーを攻撃者がリアルタイムに遠隔操作できるようにする手法TAKOを提案し、複数のタスクと環境で100%の成功率を達成した。
原題: Test-time Adversarial Takeover: A Real-time Hijacking Interface against Robotic Diffusion Policies / Zi Yin, Peilin Chai, Siyuan Huang 他
日本語で読む → - 論文ニューラルレンダリング画像認識
TRON: 3Dガウス再構成のためのニューラルレンダラをオーケストレーションする光線追跡
3Dガウス表現に光線追跡とニューラルレンダリングを組み合わせ、実シーンの再照明や動的物体操作、マテリアル編集を可能にするレンダリングフレームワークを提案。
原題: TRON: Tracing Rays to Orchestrate a Neural Renderer for 3D Gaussian Reconstructions / Or Perel, Hassan Abu Alhaija, Zian Wang 他
日本語で読む → - 論文VLA/操作画像認識
LIBERO-Occ: 視点想像によるシーン起因の遮蔽下での視覚言語行動モデルの評価と改善
遮蔽がある操作環境でVLAモデルの性能が低下する問題を調べ、遮蔽評価ベンチマークLIBERO-Occを導入し、補完視点を想像して行動予測に活用する手法VIMを提案した。
原題: LIBERO-Occ: Evaluating and Improving Vision-Language-Action Models under Scene-Induced Occlusion via Viewpoint Imagination / Taishan Li, Jiwen Zhang, Siyuan Wang 他
日本語で読む → - 論文世界モデル評価画像認識
WorldOlympiad:あなたの世界モデルはトライアスロンを生き残れるか?
ビデオベースの世界モデルを物理的忠実性、幾何学的整合性、相互作用の忠実性の3つの観点から評価するベンチマークWorldOlympiadを提案する。
原題: WorldOlympiad: Can Your World Model Survive a Triathlon? / Yuke Zhao, Wangbo Zhao, Weijie Wang 他
日本語で読む →