論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/8/28 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文変形物体操作ロボティクス
ChainSplat: ねじ理論に着想を得た、多視点RGBビデオから変形可能な線状物体の動力学を学習する物理モデル
多視点RGBビデオのみから、ケーブルやロープなどの変形可能な線状物体の3D形状・外観・運動学・動力学を同時に学習するフレームワークを提案。物体を回転関節で連結された剛体リンクの開連鎖としてモデル化し、ガウススプラッティングと統合することで高精度な予測と制御を実現した。
原題: ChainSplat: A Physics-Inspired Screw-Theoretic Model for Learning Deformable Linear Object Dynamics from Multi-View RGB Videos / Seungyeon Kim, Noémie Jaquier
日本語で読む → - 論文ヒューマノイド/ジェスチャ生成ロボティクス
RoboGesture: 人間型ロボットのためのリアルタイム意味整合型共話ジェスチャ生成
人間型ロボットが音声に同期し意味的に適切なジェスチャをリアルタイム生成するフレームワークを提案。データセット構築、モデル設計、安全制御を統合し、実機で検証した。
原題: RoboGesture: Real-Time Semantic-aligned Co-Speech Gestures Generation for Humanoid Interaction / Zifan Wang, Ziang Ren, Pengyang Shi 他
日本語で読む → - 論文マニピュレーションロボティクス
FLARE: 視覚言語ロボット操作における自動修正と回復のための障害認識フレームワーク
視覚言語行動モデル(VLA)が実行中に起こす失敗(掴み損ね、落下、衝突など)を自動で修正・回復できるようにするフレームワークを提案。デモに摂動や橋渡しセグメントを注入して「リトライ」能力を、MLLMによる失敗分析で「リセット」スキルを獲得し、オンライン監視で切り替える。
原題: FLARE: A Failure-Aware Framework for Autonomous Correction and Recovery in Visual-Language Robotic Manipulation / Ganlong Zhao, Zijia Tang, Xingping Chen 他
日本語で読む → - 論文ワールドモデル機械学習
対照的ワールドモデル
ピクセル再構成を使わず、状態行動系列と将来観測の局所特徴間の相互情報量を最大化する対照学習目的で潜在ダイナミクスモデルを学習し、視覚的妨害に頑健なワールドモデルを実現した。
原題: Contrastive World Models / Bonnie Li
日本語で読む → - 論文オンライン学習ロボティクス
動的操作スキルのための高速オンロボット学習:ロボットジャグリング
実機上で数分以内に多様なジャグリングパターンを学習するオンライン学習フレームワークを提案。モデルが現実と乖離していても有用であることを活かし、現在の知識を基盤に安全に学習を進める手法。
原題: Rapid On-Robot Learning for Dynamic Manipulation Skills: Robot Juggling / Taeyoon Lee, Chunpeng Wang, Christopher G. Atkeson 他
日本語で読む → - 論文グリッパー/把持ロボティクス
能動表面駆動型再構成グリッパー:薄物の堅牢な把持と逐次操作
薄い物体(本など)を安定して把持・操作するために、能動表面と劣駆動コンプライアンスを統合した新しいグリッパーを提案し、複雑な制御なしで堅牢な把持を実現した。
原題: Active Surface-Driven Reconfigurable Gripper: Robust Grasping and Sequential Manipulation of Thin Objects / Ziyi Zheng, Keqi Zhu, Hao Wu 他
日本語で読む → - 論文VLAロボティクス
FlashVLA: 高速かつ非同期なVLA推論のためのストリーミング行動デコード
VLAモデルの推論遅延と非同期実行の不安定さを解決するため、ストリーミング行動バッファとチャンク単位の因果注意を用いたフレームワークを提案し、単一GPUで30Hz以上の制御周波数を実現した。
原題: FlashVLA: Streaming Action Decoding for Fast and Asynchronous VLA Inference / Zekai Li, Jiaming Tang, Zhijian Liu
日本語で読む → - 論文3D再構成画像認識
大規模再構成モデルを用いた人と物体のインタラクション再構成
単一画像から人と物体の3Dインタラクションを再構成するフレームワークMILOを提案。大規模再構成モデル(LRM)の幾何学的特性を活用し、従来法より高精度な再構成を実現。
原題: Reconstructing Humans and Objects in Interaction using Large Reconstruction Models / Agniv Chatterjee, Georgios Pavlakos
日本語で読む → - 論文シミュレーションロボティクス
浅海域の写実性を超えて:深海ロボティクスのための物理・センサ接地シミュレーション
深海環境での物理的・センサ的忠実度を高めるため、StonefishシミュレータにIMU/DVLドリフトや高次流体力学、圧力依存環境変動などを追加した。
原題: Beyond Shallow-Water Photorealism: Physically and Sensor-Grounded Simulation for Deep-Sea Robotics / Michele Grimaldi, Enrico Di Maria, Ignacio Carlucho 他
日本語で読む → - 論文タスク計画ロボティクス
身体化シーン再配置計画
エージェントが自己中心視覚とトップダウン目標レイアウトのみを用いて3Dシーン内の家具を目標配置に再配置する新しいタスクを提案し、ベンチマークとベースライン手法を提供した。
原題: Embodied Scene Rearrangement Planning / Canzhi Chen, Zan Wang, Siqi Zhu 他
日本語で読む → - 論文歩行ロボティクス
SOLO: 安定した全地形・長距離知覚ヒューマノイド歩行
長距離歩行で累積する知覚・制御誤差による不安定化を解決するため、地形再構成の鮮明化と時間的クレジット割り当てを改善した統合フレームワークを提案。シミュレーションと実機で高い成功率を達成した。
原題: SOLO: Stable Omni-terrain Long-Horizon Perceptive Humanoid Locomotion / Pihai Sun, Gang Han, Jingkai Sun 他
日本語で読む → - 論文群制御cs.MA
制約のある倉庫におけるマルチエージェント集配のための動的ヘイブン選択
狭い通路や行き止まりのワークステーションがある倉庫で、ロボットが他のロボットを妨げずに待機できる場所(ヘイブン)を動的に選択する手法を提案し、タスク完了時間を短縮する。
原題: Dynamic Haven Selection for Multi-Agent Pickup and Delivery in Constrained Warehouses / Taisei Hirayama, Kohei Yoshida, Hiroki Sakaji 他
日本語で読む → - 論文VLA/操作ロボティクス
GRAFT: 微細なロボット操作のための接地された効率的なオンライン強化学習適応
事前学習済みの視覚言語行動ポリシーをオンラインで適応させる際、タスクに重要な視覚的手がかりを学習するための枠組みを提案し、計算コストを削減しつつ成功率を向上させた。
原題: GRAFT: Grounded and Efficient Online Reinforcement Adaptation for Fine-Grained Robot Manipulation / Yibo Qiu, Haoliang Ye, Shu'ang Sun 他
日本語で読む → - 論文剛体運動補間ロボティクス
超マルチ双対四元数による剛体運動ジェットの任意次エルミート補間
剛体運動の高次微分情報(ジェット)を超マルチ双対四元数で表現し、任意次数のエルミート補間を実現する手法を提案した。
原題: Arbitrary-Order Hermite Interpolation of Rigid-Motion Jets via Hyper-Multidual Quaternions / Daniel Condurache
日本語で読む → - 論文自動運転/安全認証制御
運転軌道選択のためのバリア関数によるコンフォーマル安全クリアランス認証とCVaR
自動運転の軌道選択において、計画時間マージンと実際の安全クリアランスの乖離を統計的に補正し、CVaRとコンフォーマル校正を用いて安全認証を行う手法を提案した。
原題: Barrier Function Conformal Safety Clearance Certification with CVaR for Driving Trajectory Selection / Pei Yu Chang, Qadeer Ahmed
日本語で読む → - 論文VLAロボティクス
データスケーリングを超えて:視覚言語行動モデルのための表現中心の継続事前学習
ロボットデータの不足を補うため、多様なロボットデータでVLMバックボーンを継続事前学習し、下流タスクの性能を向上させるVLActを提案した。
原題: Beyond Data Scaling: Representation-Centric Continued Pre-training for Vision-Language-Action Models / Senqiao Yang, Chengyao Wang, Yuxin Chen 他
日本語で読む → - 論文3D物体検出画像認識
TADP: 単一ステージ3D物体検出のためのタスク認識変形予測
単一ステージ3D物体検出器において、タスクごとに特徴を変形させる新しい手法を提案し、KITTIデータセットで高い精度を達成した。
原題: TADP: Task-Aware Deformable Prediction for Single-Stage 3D Object Detection / Su Wang, Yaochen Li, Min Yang 他
日本語で読む → - 論文水中ロボット/位置推定ロボティクス
接触支援型ファクターグラフによる水中サンプリングのための位置推定
水中ロボットが海底サンプリングを行う際、視覚情報が乏しい環境でのドリフトを、マニピュレータの接触イベントを高信頼度の制約としてファクターグラフに統合することで低減する手法を提案した。
原題: Contact-Aided Factor-Graph Localization for Underwater Sampling / Michele Grimaldi, Yosaku Maeda, Hitoshi Kakami 他
日本語で読む → - 論文3Dシーン生成画像認識
SpatialCrafter: 生成3Dプロキシを用いた単一画像からのワールドモデリング
単一画像から探索可能な3Dシーンを生成する新しい2段階フレームワークを提案し、3Dプロキシ生成と外観精緻化を分離することで、従来のビデオ拡散モデルより高品質で3D整合性の高いシーン生成を実現した。
原題: SpatialCrafter: Single Image World Modeling with Generative 3D Proxies / Chuan Fang, Lingteng Qiu, Yixun Liang 他
日本語で読む → - 論文ナビゲーションロボティクス
RTNav: リアルタイムゼロショット物体ナビゲーションに向けて
未知環境での物体探索ナビゲーションにおいて、推論遅延を考慮したリアルタイム実行を可能にするアーキテクチャRTNavを提案し、従来手法より成功率を最大11%向上させた。
原題: RTNav: Towards Real-Time Zero-Shot Object Navigation / Easop Lee, Lingyu Zhang, Boyuan Chen
日本語で読む → - 論文布地シミュレーションロボティクス
MeshPriorDiT: 行動条件付き布地ダイナミクスのための階層的モデリング
布地の動き予測を、メッシュGNNによる構造化された事前分布と、拡散トランスフォーマーによる生成的な残差に分解する階層モデルを提案し、長距離の協調と局所的な変形を両立させて予測精度を大幅に向上させた。
原題: MeshPriorDiT: Hierarchical Modeling for Action-Conditioned Cloth Dynamics / Zihang Wang, Jianming Hu, Shang Su 他
日本語で読む → - 論文計画/最適化ロボティクス
CLIPPER: 反復型空間カバレッジ計画のための再生可能なショートリスト最適化
都市規模のマイクロモビリティ計画において、制約を満たしつつ高速に再計画できるCLIPPERを提案。候補プールと正確な利得計算を組み合わせ、フルグリーディとほぼ同等のカバレッジを維持しながら計算時間を大幅に削減する。
原題: CLIPPER: Replayable Shortlisted Optimization for Repeated Spatial Coverage Planning / Julian Teusch, Jörg Philipp Müller, Monika Sester
日本語で読む → - 論文VLA/操作ロボティクス
TemporalFlow-VLA: 物理的に基づいた実行履歴を学習する長期的ロボット操作
視覚言語行動モデルに物理的な時間的監督を導入し、多段階操作の実行履歴をコンパクトに学習する手法を提案。LIBEROやRoboTwinで高い成功率を達成し、長期的な操作で優位性を示した。
原題: TemporalFlow-VLA: Learning Physically Grounded Execution History for Long-Horizon Robot Manipulation / Jiarui Yang, Yehao Lu, Yuning Su 他
日本語で読む → - 論文群制御ロボティクス
バケツリレー方式:異種ロボットチームのための効率的で堅牢な局所負荷分散
異種ロボット群が1次元空間で協調輸送する際、局所的な衝突感知のみで負荷分散を実現するバケツリレー方式を提案し、トークンによる安定化で収束を保証した。
原題: Pass the Bucket: Efficient, Robust, Local Load Balancing for Teams of Heterogeneous Robots / Tobias Wallner, Dominik Krupke, Arne Schmidt 他
日本語で読む → - 論文ソフトロボティクス/制御ロボティクス
空気圧ソフトアクチュエータのタスク空間モデルベース制御
非最小座標の離散弾性ロッドモデルを用いて、空気圧ソフトアクチュエータのリアルタイムタスク空間制御を実現した。フィードフォワード逆モデルとPI制御、動的オブザーバを組み合わせ、複数の平面ソフトアクチュエータで高精度な軌道追従を実証した。
原題: Task-space model-based control of pneumatic soft actuators / Nithin S. Kumar, Joshua Gaston, D. Caleb Rucker 他
日本語で読む → - 論文通信cs.IT
GAN精緻化を伴う知識蒸留駆動型セマンティックNOMA:6Gロボティック車両ネットワーク向け
6Gロボティック車両ネットワーク向けに、知識蒸留とGANを用いたセマンティック通信NOMAフレームワークを提案し、干渉を抑えつつ高忠実度な画像伝送を実現した。
原題: Knowledge Distillation Driven Semantic NOMA with GAN Refinement for 6G Robotic Vehicle Networks / Qifei Wang, Zhen Gao, Li Qiao 他
日本語で読む → - 論文視覚表現学習画像認識
DINOcular: 自己教師あり視空間表現の学習
RGB-D観測から視覚と空間情報を同時に学習する自己教師ありフレームワークを提案し、3D認識性能を向上させつつセマンティック転移も維持する。
原題: DINOcular: Self-Supervised Visuospatial Representations / Farkhat Almukhamedov, Sami Azirar, Hermann Blum
日本語で読む → - 論文手順解析画像認識
VidParse: 熟練者のように自己中心的手順をオンライン解析する
ノイズの多い自己中心的な動画を、手と物体の相互作用に基づく特徴と手順グラフの制約を用いて、学習なしで正確な行動ステップに分割するフレームワークを提案した。
原題: VidParse: Online Parsing of Egocentric Procedures Like a Pro / Anubhav Gupta, Archit Kambhamettu, Vatsal Agarwal 他
日本語で読む → - 論文群制御ロボティクス
分散モデルベース拡散:有界遅延下での有限時間縮小性
複数エージェントの軌道最適化問題に対し、通信遅延があっても収束性を保証する分散型モデル予測制御手法を提案し、シミュレーションで性能向上を実証した。
原題: Distributed Model-Based Diffusion: Finite Horizon Contraction under Bounded Delay / Seth Golembeski, Keith L. Gibson, Alexander Gross 他
日本語で読む → - 論文VLAロボティクス
PHR-VLA: 視覚言語行動モデルのための計画地平推論
将来の観測から得た潜在ダイナミクスをVLAの内部表現に整列させる補助ヘッドを導入し、接触を伴う細かい操作タスクの成功率を向上させた。
原題: PHR-VLA: Planning Horizon Reasoning for Vision-Language-Action Models / Davood Soleymanzadeh, Kaidi Zhang, Zhiyuan Zhang 他
日本語で読む →