論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/6/4 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文モーション生成画像認識
KV-Control: 軌道制御テキスト・モーション生成のためのパラメータ効率的K/V注入
テキスト条件付き3Dモーション生成モデルに、軌道や関節の制約を注入するための軽量なアテンション側制御インターフェースを提案。事前学習済みモデルを凍結しつつ、自己アテンションに制御用のキー/バリューを注入することで、高精度な制御を実現する。
原題: KV-Control: Parameter-Efficient K/V Injection for Trajectory-Controlled Text-to-Motion / Tengjiao Sun, Pengcheng Fang, Xiaoyu Zhan 他
日本語で読む → - 論文強化学習機械学習
表現学習がマルチタスク深層強化学習のスケーラビリティを実現する
モデルベース制御ではなく表現学習がマルチタスクRLのスケーラビリティの鍵であると主張し、予測的表現学習と高容量価値関数を組み合わせたモデルフリーアルゴリズムMR.Qを提案・評価した。
原題: Representation Learning Enables Scalable Multitask Deep Reinforcement Learning / Johan Obando-Ceron, Lu Li, Scott Fujimoto 他
日本語で読む → - 論文歩行ロボティクス
LadderMan: 人型ロボットによる知覚的梯子登りの学習
人型ロボットが様々な梯子を頑健に登り、梯子上での操作も行える統一システムを提案。シミュレーションで学習したポリシーを実機にゼロショット転送し、多様な梯子形状での登攀と操作タスクを実現した。
原題: LadderMan: Learning Humanoid Perceptive Ladder Climbing / Siheng Zhao, Yuanhang Zhang, Ziqi Lu 他
日本語で読む → - 論文VLA画像認識
DRIFT: 視覚言語モデルの連続出力を解読するための残差フローアダプタ
DRIFTは、事前学習済みの視覚言語モデルを連続値出力タスクに適応させるフレームワークで、粗い予測を基にフローマッチングで残差を生成・改善します。視覚的グラウンディングやロボット制御で既存手法を上回る性能を示しました。
原題: DRIFT: A Residual Flow Adapter for Decoding Continuous Outputs in Vision-Language Models / Zhuoming Liu, Jinhong Lin, Kwan Man Cheng 他
日本語で読む → - 論文操作学習ロボティクス
日常の人間ビデオを用いたロボット操作ポリシーの共学習で重要な要素は何か?
ロボット操作ポリシーの共学習に日常の人間ビデオを用いる際、手のポーズの品質とネットワークの専門化が重要であることを示し、低ロボットデータ環境で成功率を29.7%向上させるレシピを提案した。
原題: What Matters When Cotraining Robot Manipulation Policies on Everyday Human Videos? / Richard Li, Aditya Prakash, Andrew Wen 他
日本語で読む → - 論文最適化機械学習
二重プレコンディショニング(DoPr):検証損失ではなくテスト時性能のための最適化
自己回帰生成やロボットポリシー学習など、予測を繰り返す展開時に誤差が蓄積する問題に対し、勾配と活性化の両方を前処理する新しい最適化手法DoPrを提案し、テスト時性能を向上させる。
原題: Double Preconditioning (DoPr): Optimization for Test-Time Performance, not Validation Loss / Thomas T. Zhang, Alok Shah, Yifei Zhang 他
日本語で読む → - 論文シーン生成画像認識
HomeWorld: フロアプランから家具付きまでを統合した、制御可能で高密度にインタラクティブな住宅全体シーン生成フレームワーク
住宅全体のシーン生成を、フロアプラン生成、家具レイアウト生成、小物体配置の階層的フレームワークに分解し、大規模データとLLM、画像生成、VLMリファイナーを用いて制御可能かつシミュレーション可能なシーンを生成する手法を提案した。
原題: HomeWorld: A Unified Floorplan-to-Furnished Framework for Generating Controllable, Densely Interactive Whole-Home Scenes / Wenbo Li, Xiaoliang Ju, Zipeng Qin 他
日本語で読む → - 論文点群処理ロボティクス
RadiusFPS: 球状ボクセル刈り込みによるCPU・GPU上の効率的な最遠点サンプリング
点群のダウンサンプリング手法である最遠点サンプリング(FPS)を高速化するため、球状ボクセル刈り込みと座標ごとのスキップテストを導入し、GPU実装で最大2.5倍の高速化を達成した。
原題: RadiusFPS: Efficient Farthest Point Sampling on CPUs and GPUs via Spherical Voxel Pruning / Ziyang Yu, Xiang Li, Qiong Chang 他
日本語で読む → - 論文全身制御ロボティクス
HANDOFF: 蒸留された相補的教師によるヒューマノイドのタスク空間全身制御
ヒューマノイドロボットのための直感的で汎用的なコマンド空間を提案し、複数の専門家を蒸留して統合した全身制御器を開発。実機で言語指示による多様なタスクを実証した。
原題: HANDOFF: Humanoid Agentic Task-Space Whole-Body Control via Distilled Complementary Teachers / Lizhi Yang, Junheng Li, Nehar Poddar 他
日本語で読む → - 論文スキル学習ロボティクス
VASO: 物理AIエージェントのための形式的検証可能な自己進化スキル
LLMが生成したロボットスキル契約を、モデル検査による形式的検証と反例に基づくテキスト勾配で自己進化させるフレームワークVASOを提案。未テスト条件下でも時間的安全性を満たすスキルを少数サンプルで獲得できる。
原題: VASO: Formally Verifiable Self-Evolving Skills for Physical AI Agents / Yunhao Yang, Neel P. Bhatt, Kevin Wang 他
日本語で読む → - 論文安全強化学習機械学習
説明可能な安全強化学習
シールドの決定を人間が解釈可能な形で説明するため、階層的な決定木を用いて安全リスクの分類と行動許可の理由を提示する手法を提案した。
原題: Explainably Safe Reinforcement Learning / Sabine Rieder, Stefan Pranger, Debraj Chakraborty 他
日本語で読む → - 論文動作理解/ベンチマーク画像認識
NextMotionQA: 視覚言語モデルによる人間動作理解のベンチマークと評価
人間の動作理解を評価するための新しいベンチマークNextMotionQAを導入し、複数のタスクと難易度レベルで12の視覚言語モデルを評価して、その能力の限界を明らかにした。
原題: NextMotionQA: Benchmarking and Judging Human Motion Understanding with Vision-Language Models / Yong Cao, Chuqiao Li, Xianghui Xie 他
日本語で読む → - 論文安全制御制御
高次システム向けモデルフリー制御バリア関数のアプローチ
制御バリア関数をモデルなしで高次非線形システムに拡張し、動的モデルや状態測定を必要とせずに安全制御を実現する手法を提案した。7自由度ロボットアームで実証した。
原題: A model-free approach to control barrier functions for higher-order systems / Lukas Lanza, Johannes Köhler, Dario Dennstädt 他
日本語で読む → - 論文画像編集画像認識
InstantRetouch: バイラテラル空間による効率的で忠実度の高い指示追従画像レタッチ
言語指示による画像レタッチを、拡散モデルの反復生成ではなくバイラテラルグリッド操作で実現し、忠実度と効率を両立した手法を提案。
原題: InstantRetouch: Efficient and High-Fidelity Instruction-Guided Image Retouching with Bilateral Space / Jiarui Wu, Yujin Wang, Ruikang Li 他
日本語で読む → - 論文画像操作検出画像認識
Impostor: 現実的なAIGC操作位置特定のためのエージェントキュレーション型ベンチマーク
生成画像編集の進歩に伴い、既存の画像操作検出・位置特定ベンチマークの限界を克服するため、100K枚の操作画像を含む新しいデータセットImpostorを構築し、閉ループエージェントフレームワークCraftAgentで多様で現実的な操作画像を自動生成した。また、局所位相モデリングと意味的フォレンジック一貫性学習を導入したPhaseAware-Netを提案し、既存手法を上回る性能を示した。
原題: Impostor: An Agent-Curated Benchmark for Realistic AIGC Manipulation Localization / Zhenliang Li, Yutao Hu, Qixiong Wang 他
日本語で読む → - 論文VLA画像認識
3DThinkVLA: 潜在3D事前知識を3D思考誘導共学習で視覚言語行動モデルに付与する
視覚言語行動(VLA)モデルに、3D幾何知覚と3D空間推論を分離して潜在空間に注入する共学習フレームワークを提案し、推論時の追加テキスト生成なしに暗黙的な3D空間推論を可能にする。
原題: 3DThinkVLA: Endowing Vision-Language-Action Models with Latent 3D Priors via 3D-Thinking-Guided Co-training / Jiaxin Shi, Xidong Zhang, Fucai Zhu 他
日本語で読む → - 論文マニピュレーションロボティクス
四元数関節を用いた新型ケーブル駆動冗長マニピュレータ構成とFABRIKおよび残差強化学習による制御
四元数関節を持つ4セグメント8関節のケーブル駆動冗長マニピュレータを提案し、FABRIKアルゴリズムと残差強化学習を用いて制御する手法を示した。提案構成は従来より広い作業空間を低コストで実現し、残差強化学習が位置・姿勢精度でFABRIKを3桁上回ることを実証した。
原題: A New Quaternion-Joint Cable-Driven Redundant Manipulator Configuration and its Control Through FABRIK and Residual Reinforcement Learning / Tanapath Pornthisan, Thanapat Kemthong, Thanyapisit Kangsathien 他
日本語で読む → - 論文安全強化学習ロボティクス
COP-Q: コレスキー順序射影による安全最優先ロボット制御強化学習
報酬と安全性のQ値の相関を考慮し、コレスキー分解で安全を優先しつつ報酬の過度な保守性を抑える新しい安全強化学習手法を提案した。ロボットの移動やナビゲーション実験で安全性とサンプル効率の向上を確認した。
原題: COP-Q: Safety-First Reinforcement Learning for Robot Control via Cholesky-Ordered Projection / Guopeng Li, Moritz A. Zanger, Matthijs T. J. Spaan 他
日本語で読む → - 論文VLA機械学習
Flash-WAM: モダリティ認識蒸留によるワールドアクションモデルの高速化
ビデオとロボット動作を同時生成するワールドアクションモデルを、モダリティごとに適切な蒸留手法を適用して単一ステップ推論に圧縮し、リアルタイム制御を可能にした。
原題: Flash-WAM: Modality-Aware Distillation for World Action Models / Arman Akbari, Ci Zhang, Arash Akbari 他
日本語で読む → - 論文操作画像認識
Dream.exe: ビデオ生成モデルは実行可能なロボット操作を夢見ることができるか?
ビデオ生成モデルが生成した操作映像を物理シミュレータで実行可能なロボット軌道に変換し、実行成功率で物理世界の理解度を評価するフレームワークDream.exeを提案した。
原題: Dream.exe: Can Video Generation Models Dream Executable Robot Manipulation? / Rui Zhao, Kaiming Yang, Jifeng Zhu 他
日本語で読む → - 論文フェイクニュース検出機械学習
KITE: テキスト・画像・知識グラフを統合する三モーダルトランスフォーマーによるフェイクニュース検出
テキスト、画像、外部知識(Wikidata)を同時に統合する三モーダルフレームワークKITEを提案し、クロスモーダル注意機構で各モダリティの関連性を捉えてフェイクニュースを高精度に検出する。
原題: KITE: A Tri-Modal Transformer Integrating Text, Images, and Knowledge Graphs for Fake News Detection / Kevin Patel, Shashi Bhushan Jha
日本語で読む → - 論文ナビゲーションロボティクス
3Dアイソビスト世界モデル:都市の見えない幾何学とその創発的な都市横断シグネチャを明らかにする
都市を移動するエージェントのために、建物の見た目ではなく移動可能な空間(ネガティブスペース)を3Dアイソビストとして予測する世界モデルを提案した。マンハッタンとパリで訓練した単一モデルが、都市横断的な空間特徴を創発的に獲得することを発見した。
原題: A 3D Isovist World Model -- Revealing a City's Unseen Geometry and Its Emergent Cross-City Signature / Xuhui Lin, Stephen Law, Nanjiang Chen 他
日本語で読む → - 論文強化学習機械学習
双対優位フィールド:オフライン目標条件付き強化学習のための方策抽出法
双対線形価値モデルから局所的な優位信号を抽出する方策抽出法を提案し、オフライン目標条件付き強化学習の性能を向上させた。
原題: Dual Advantage Fields / Alexey Zemtsov, Maxim Bobrin, Alexander Nikulin 他
日本語で読む → - 論文自律科学/プロトコルAI
LAP: 自律科学のためのエージェント-機器間プロトコル
自律科学実験において、AIエージェントと物理機器を接続する標準プロトコル「Lab Agent Protocol (LAP)」を提案し、機器カード、予約、安全フェンス、測定結果スキーマの4つの物理世界プリミティブを導入した。
原題: LAP: An Agent-to-Instrument Protocol for Autonomous Science / Linwu Zhu, Liqiang Gao, Yan Chen 他
日本語で読む → - 論文AI安全cs.CY
エージェントの安全性は行動特性ではなく認識論的特性である
AIシステムの安全性は現在の行動だけでなく、学習・適応・自己改善を通じて将来も修正可能性を保てるかという認識論的特性として捉えるべきだと論じ、その概念として「教示可能性」を導入する。
原題: Agentic Safety is an Epistemic Property, Not a Behavioral One / Charles L. Wang, Keir Dorchen, Peter Jin
日本語で読む → - 論文継続学習/VLAロボティクス
PHASER: 位相認識と意味的経験再生による視覚言語行動モデルの継続学習
視覚言語行動モデルの継続学習における破滅的忘却を防ぐため、操作軌道の位相(サブスキル)に注目した経験再生手法PHASERを提案。位相ごとのメモリ割り当てと忘却リスクに基づく動的優先付けで、LIBEROベンチマークで最大31%の成功率向上を達成した。
原題: PHASER: Phase-Aware and Semantic Experience Replay for Vision-Language-Action Models / Ziyang Chen, Shaoguang Wang, Weiyu Guo 他
日本語で読む → - 論文3D再構築画像認識
SimuScene: 単一画像からのシミュレーション対応の構成的3Dシーン再構築
単一画像から物理シミュレーションで安定した3Dシーンを再構築する手法を提案。物理エンジンを生成過程に組み込み、貫通や浮遊などの不安定性を修正信号として利用する。
原題: SimuScene: Simulation-Ready Compositional 3D Scene Reconstruction from a Single Image / Inhee Lee, Sangwon Baik, Sungjoo Kim 他
日本語で読む → - 論文VLAロボティクス
PointAction: 3D点群をロボット制御の普遍的な行動表現として用いる
ビデオ生成モデルを基盤に、将来のRGBフレームと動的3D点群を同時予測し、その点群の動きを行動デコーダでロボットの実行可能な行動に変換するフレームワークを提案。RGBのみの行動基盤の曖昧さを低減し、限られた行動教師データで異なるタスクやロボットへの転移を実現。
原題: PointAction: 3D Points as Universal Action Representations for Robot Control / Mutian Tong, Han Jiang, Qiao Feng 他
日本語で読む → - 論文安全性/行動予測画像認識
VLESA: 人間活動監視のための視覚言語身体化安全エージェント
一人称視点映像から人間の活動を監視し、危険な行動を予測してリアルタイムに安全介入を行うフレームワークを提案。意図に応じて安全性が変わる行動を扱うため、目標条件付き安全Qフィルタを導入した。
原題: VLESA: Vision-Language Embodied Safety Agent for Human Activity Monitoring / Hanjiang Hu, Yiyuan Pan, Jiaxing Li 他
日本語で読む → - 論文3D生成cs.GR
SymTRELLIS: 対称性を強制するボクセル潜在表現による3D生成
3D生成モデルに任意の点群対称性(回転・鏡映・多面体)を、再学習なしで強制する手法を提案。潜在空間での変換を線形演算子で近似し、ODEステップで速度を対称化する。
原題: SymTRELLIS: Symmetry-Enforced Voxel Latents for 3D Generation / Guangda Ji, Qimin Chen, Qinchan Li 他
日本語で読む →