論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/8/17 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文マニピュレーションロボティクス
意味と密度を考慮したアクセシビリティ維持型マルチオブジェクト配置計画
家庭用ロボットが棚に複数の物体を順次配置する際、意味的な整理、空間の高密度利用、操作のしやすさを同時に考慮する計画手法SDPPを提案した。
原題: Semantic- and Density-Aware Planning for Accessibility-Preserving Multi-Object Placement / Benno Wingender, Nils Dengler, Nicolas Busch 他
日本語で読む → - 論文マニピュレーションロボティクス
BATONを落とすな:エージェント的サブタスク探索と遷移認識メモリによる長期的ロボット操作
長期的なロボット操作タスクを、VLAモデルを凍結しLLMエージェントがサブタスク単位で探索・記憶することで、コストを加算的にし、遷移条件を明示して失敗を単一ステージに帰属させる手法BATONを提案。
原題: Don't Drop the BATON: Long-Horizon Robot Manipulation via Agentic Subtask Exploration and Transition-aware Memory / Bingxin Xu, Yuzhang Shang, Emilio Ferrara
日本語で読む → - 論文評価ベンチマーク機械学習
CaliBench: ビデオ世界モデルの確率的ダイナミクスは物理的に較正されているか?
ビデオ世界モデルの生成結果が物理現象の不確実性を正しく再現しているかを評価するベンチマークCaliBenchを提案し、複数のモデルで較正のずれを検出した。
原題: CaliBench: Are the Stochastic Dynamics of Video World Models Physically Calibrated? / Jonathan Sadeghi, Jenny Seidenschwarz, Jesse Allardice 他
日本語で読む → - 論文ソフトロボティクスロボティクス
重力負荷下での大型高力ソフトロボットマニピュレータの設計最適化
ソフトロボットの腕の形状を最適化し、自重による座屈を防ぎつつブロッキング力を最大化する手法を提案。閉形式解を示し、実験で有効性を検証した。
原題: Design Optimization for Large High-Force Soft Robot Manipulators Under Gravitational Loads / Isara Cholaseuk, Penelope Llibre, Alexa Kyriacou 他
日本語で読む → - 論文地理参照/ポーズグラフ最適化ロボティクス
マーカー制約付きポーズグラフ補正によるGNSS非依存環境でのクロスプラットフォーム地理参照
GNSSが使えない環境で、カモフラージュ対応のマーカーを視覚アンカーとして用い、LiDARオドメトリとRTAB-Mapの再構成を共通座標系に地理参照するフレームワークを提案。マーカー制約付きポーズグラフ最適化によりドリフトを大幅に低減した。
原題: Marker-Constrained Pose-Graph Correction for Cross-Platform Georeferencing in GNSS-Denied Environments / Marco Giberna, Jose Luis Sanchez Lopez, Holger Voos
日本語で読む → - 論文ナビゲーションロボティクス
実世界動画からのスケーラブル学習による都市ナビゲーションのロングテール顕在化
ウェブ上の未編集な一人称視点動画からメトリック軌跡とナビゲーション意味情報を自動アノテーションし、視覚言語行動ポリシーを訓練して都市ナビゲーションのロングテールな稀なシナリオを体系的に明らかにする枠組みを提案した。
原題: Exposing the Long-tail in Embodied Urban Navigation via Scalable Learning from In-the-Wild Videos / Bingyi Xia, Han Bao, Zhewei Chen 他
日本語で読む → - 論文センサ融合ロボティクス
カルマンフィルタ情報融合におけるIMUパラメータ設定
アラン分散キャリブレーションに基づくIMUパラメータ設定法をカルマンフィルタ枠組みで検討し、連続時間フィルタのプロセス不確かさを定式化して、2つの典型的なセンサ融合システムで有効性を示した。
原題: The Setting of IMU Parameters in Kalman Filtering-based Information Fusion / Qiang Hu, Yanhua Zou, Shuaiyi Huo 他
日本語で読む → - 論文VLAロボティクス
教えて育てる:汎用ロボット学習のためのエージェント中心アーキテクチャ
この論文は、少数のデモから再利用可能なスキルブロックを学習し、新しいシーンでそれらを組み合わせてタスクを実行するエージェント中心のアーキテクチャ(TGL)を提案し、再学習の負担を軽減する。
原題: Teach and Grow: An Agent-Centered Architecture for General Robot Learning / Chang Nie, Zhe Liu, Hesheng Wang
日本語で読む → - 論文センサ融合ロボティクス
サイクロプス:色を夢見るカメラとしてのLiDAR
低照度や高ダイナミックレンジ環境で劣化するカメラの代わりに、照明に依存しないLiDAR強度をRGBビデオに変換するフレームワーク「Cyclops」を提案し、カメラなしで終日認識タスクを可能にする。
原題: Cyclops: LiDAR as a Camera That Dreams in Color / Wei Gao, Jian Shu, Mingle Zhao 他
日本語で読む → - 論文医療ロボティクスロボティクス
US-VLA: 腹部超音波検査のための視覚・言語・動作モデル
臨床的な意味目標を明示的に符号化し、リアルタイムの超音波フィードバックに基づいてプローブ操作を生成する超音波検査自動化のための視覚・言語・動作モデルを提案した。肝臓と腎臓の検査データセットを構築し、プローブ操作タスクでの有効性と汎化性を示した。
原題: US-VLA: An Ultrasound Vision-Language-Action Model for Embodied Abdomina / Cheng Zhang, Xingzheng Wu, Guihao Yan 他
日本語で読む → - 論文リハビリテーションロボティクスロボティクス
ロボット支援上肢タスク特異的トレーニングのための可変的な理学療法士-患者間相互作用の学習
この論文は、タスク特異的トレーニング中の理学療法士と患者の相互作用を学習し、新しいタスクバリエーションで療法士のトルクを再現するフレームワークを提案しています。少数のデモンストレーションからタスクパラメータ化ガウス混合モデルを用いて個人化された相互作用を学習し、評価では従来手法と同等以上の性能を示しました。
原題: Learning Varying Physical Therapist-Patient Interactions for Robot-mediated Upper Limb Task-Specific Training / Jia Quan Loh, Vincent Crocher, Marlena Klaic 他
日本語で読む → - 論文LLM評価ロボティクス
監視・警備ロボット向けアイデンティティ依存LLM出力のベンチマーキング
LLMが生成する監視・警備ロボットの設計記述が、人口統計学的アイデンティティのラベルによって読みやすさに系統的な差が出るかを評価した論文。
原題: Benchmarking Identity-Sensitive LLM Outputs for Surveillance and Security Robots / Nneka Hyman, Jasmine Khan, Raj Korpan
日本語で読む → - 論文VLA/操作ロボティクス
SparkVLA: 長期的操作のための適応アクションチャンクを備えた停止認識型階層VLA
階層型VLAシステムにおけるサブタスクの停止タイミングとアクションチャンク長の相互依存関係を単一のランキング問題として定式化し、統一候補セットから最適解を選択する新しい手法を提案した。
原題: SparkVLA: Stop-Aware Hierarchical VLA with Adaptive Action Chunking for Long-Horizon Manipulation / Xunyao Lei, Renjun Wu, Tianlin Huo 他
日本語で読む → - 論文群制御ロボティクス
プランナー条件付き拡散による協調マルチエージェント探索
複数のプランナーのデモから学習し、プランナーIDを条件として与えることで多様な軌道を生成できる拡散ポリシーを提案。局所的な再ランキングでエージェント間の重複を減らし、協調探索を実現した。
原題: Planner-Conditioned Diffusion for Coordinated Multi-Agent Exploration / Marcus Yu Siong Teo, Jeric Lew, Tanishq Duhan 他
日本語で読む → - 論文地理的定位画像認識
X$^2$Localizer: プログレッシブなクロスビュー動画地理的定位のためのクロス粒度アライメント
本論文は、地上視点の動画を対応する航空画像に位置づけるクロスビュー動画地理的定位(CVG)を、部分的な観測や動的な時間予算に対応できるプログレッシブな設定(PCVG)に拡張し、新しいフレームワークX$^2$Localizerを提案する。
原題: X$^2$Localizer: Cross-grained Alignment for Progressive Cross-view Video Geo-localization / Zichao Zeng, Weijia Fan, Yufan Chen 他
日本語で読む → - 論文マニピュレーションロボティクス
統一条件・行動モデリングによる高精度ワンステップ行動生成
条件と行動を共有トークン空間で統一的にモデリングするUCA-Flowを提案し、推論速度を大幅に向上させつつ成功率を9.3ポイント改善した。
原題: Unified Condition-Action Modeling for Accurate One-Step Action Generation / Xinyu Zhou, Zikun Cai, Kuangji Zuo 他
日本語で読む → - 論文移動操作/sim2realロボティクス
FetchMan: シミュレーション経験から学ぶ視覚的ヒューマノイド移動操作ポリシー
シミュレーションで合成デモをクローンするだけでは性能が頭打ちになることを発見し、強化学習とFlow-GRPOによる微調整を組み合わせたエンドツーエンドのsim-to-realパイプラインを構築。実機Unitree G1で未見シーンへのゼロショット到達・把持を73.3%の成功率で達成した。
原題: FetchMan: Learning Visual Humanoid Loco-Manipulation Policies from Simulated Experiences / Omar Rayyan, Zhi Li, Max Argus 他
日本語で読む → - 論文マニピュレーションロボティクス
VLCP: 視覚言語制御ポリシーによるロボット操作の閉ループコード再計画
凍結した視覚言語モデルを制御コード生成に用い、デモや微調整なしでロボット操作ポリシーを実現。エピソード内でコードを再計画することで失敗を修正し、成功率を大幅に向上させた。
原題: VLCP: Vision Language Control Policy Closed-Loop Code Replanning for Robot Manipulation / Dhia Naouali, Minghan Wu, Claudia Wong 他
日本語で読む → - 論文3D再構成ロボティクス
OccamView: フレーム予算制約下のアクティブ3Dガウス再構成のためのオブジェクト条件付き視点選択
限られたフレーム予算で3Dガウス再構成を行う際、物体の隠れ領域を考慮した視点選択手法を提案し、再構成の完全性を向上させた。
原題: OccamView: Object-Conditioned View Selection for Frame-Budgeted Active 3D Gaussian Reconstruction / Hongbo Gao, Wei Zhang, Zeyu Ni 他
日本語で読む → - 論文ナビゲーションロボティクス
DPNet: 視覚ベースUAVナビゲーションのための効率的な行き止まり予測と回避
RGB-D入力から行き止まりの相対距離と方位を予測する軽量ニューラルネットワークを提案し、軌道ライブラリを刈り込んでUAVが行き止まりを回避しながら滑らかに飛行できるようにした。実データでの追加学習なしで実世界に適用でき、50Hzでの高速再計画を実現する。
原題: DPNet: Efficient Dead-End Prediction and Avoidance for Vision-Based UAV Navigation / Ruibin Zhang, Lun Pan, Zelong Xia 他
日本語で読む → - 論文顔認識/解釈可能性画像認識
SCOUT: 顔認識テンプレートのオープンボキャブラリ編集のための意味概念発見
顔認識テンプレート内の意味概念を直接発見・操作するフレームワークを提案し、自然言語記述から潜在特徴の意味仮説を生成して安定性を検証することで、編集可能な意味方向を獲得する。
原題: SCOUT: Semantic Concept Discovery for Open-Vocabulary Editing of face Recognition Templates / Leon Todorov, Peter Rot, Peter Peer 他
日本語で読む → - 論文強化学習ロボティクス
時間論理に基づく普遍的なタスク表現による強化学習
LTL式からタスクの意味を抽出する新しい表現アーキテクチャを提案し、任意の強化学習アルゴリズムに統合可能な普遍的なタスク表現フレームワークLOTUSを導入した。双模倣距離による理論的保証で、学習効率と汎化性能を大幅に向上させる。
原題: Temporal Logic Guided Universal Task Representations for Reinforcement Learning / Hao Zhang, Zhangli Zhou, Zhen Kan
日本語で読む → - 論文群制御ロボティクス
グループ化オークション・コンセンサスアルゴリズムによるマルチロボットシステムの分散タスク割り当て
分散型マルチロボットタスク割り当てにおいて、空間的に近いタスクをグループ化して入札する新しいアルゴリズムGACAを提案し、従来のCBBAより最適性を大幅に向上させた。
原題: Grouping Auction-Consensus Algorithm for Decentralized Task Allocation in Multi-Robot Systems / Jose Rodriguez, Sven Koenig, Wenjie Dong 他
日本語で読む → - 論文マニピュレーションロボティクス
視覚誘導による4自由度アームでの机上ペン操作
低コストの4自由度アームで、固定カメラとYOLOによる物体検出・姿勢推定を用いて、手首回転なしにペンの色分け整列を実現した論文。
原題: Tabletop Pen Manipulation With a Vision-Guided 4-DoF Arm / Anirudh Rangarajan, Bibit Bianchini
日本語で読む → - 論文VLA/触覚/操作ロボティクス
ViTaR: 基盤VLA操作のための視触覚残差適応
接触を伴う操作タスクで、凍結したVLAモデルに触覚情報に基づく小さな残差補正を加える手法を提案し、既存の触覚ベースラインを上回る成功率を達成した。
原題: ViTaR: Visuo-Tactile Residual Adaptation for Foundation VLA Manipulation / Yi Wang, Renjun Wu, Jinyan Liu 他
日本語で読む → - 論文外観検査画像認識
衣料生産のためのAI外観検査
縫製ラインの品質管理を自動化するため、CNNを用いたAI外観検査システムを開発・検証した。黒色生地で学習し、異なる色の生地で性能を評価した。
原題: AI Visual Inspection for Garment Production / Ray Wai Man Kong, Ding Ning, Theodore Ho Tin Kong
日本語で読む → - 論文センサ/信頼性ロボティクス
物理的限界と不確実性モニタリングによる信頼性の高いピエゾ抵抗ひずみセンシング
ソフトなピエゾ抵抗ひずみセンサの信頼性を高めるため、物理情報を組み込んだ確率的逆モデルと、不確実性とひずみ・ひずみ速度の限界を融合したリスク指標を用いた3状態モニタを提案した。実験では高い適合度と異常検出率を達成した。
原題: Reliable Piezoresistive Strain Sensing Through Physical Limits and Uncertainty Monitoring / Carmen Ballester, Víctor Muñoz, Dorin Copaci 他
日本語で読む → - 論文マニピュレーションロボティクス
ディスクを回転させてより遠くへ:新しい再構成可能な腱駆動マニピュレータの設計とモデリング
腱駆動連続体マニピュレータの中間スペーサディスクを独立に回転させて腱経路を局所的に変更し、複雑な変形を実現する再構成可能な設計を提案し、静的モデルを構築して実験で検証した。
原題: Rotate Disks to Reach Farther: Design and Modeling of a Novel Reconfigurable Tendon Driven Manipulator / Sabyasachi Dash, Yangkun Liu, Will Hunter 他
日本語で読む → - 論文自動運転ロボティクス
すべての履歴が役立つわけではない:長期的なエンドツーエンド自動運転のための速度認識型選択的メモリ
自動運転の長期計画において、過去の自己予測状態が古くなったり現在の運動段階と矛盾したりする問題を解決するため、選択的メモリと運動段階学習を導入したStableDriveを提案し、衝突率やL2誤差を大幅に改善した。
原題: Not All History Helps: Velocity-Aware Selective Memory for Long-Horizon End-to-End Autonomous Driving / Yuchen Liu, Ziying Song, Shengkai Zhang 他
日本語で読む → - 論文VLAロボティクス
GigaBrain-0.7:三系統アーキテクチャによる創発的能力へのスケーリング
視覚言語行動モデルのスケーリングとアーキテクチャ改善により、多様なロボットへの汎化を大幅に向上させた基盤モデルを提案。
原題: GigaBrain-0.7: Scaling Embodied Foundation Models to Emergent Capabilities with a Three-System Architecture / GigaBrain Team, Angen Ye, Axiang Sun 他
日本語で読む →