論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/8/17 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文移動操作/sim2realロボティクス
FetchMan: シミュレーション経験から学ぶ視覚的ヒューマノイド移動操作ポリシー
シミュレーションで合成デモをクローンするだけでは性能が頭打ちになることを発見し、強化学習とFlow-GRPOによる微調整を組み合わせたエンドツーエンドのsim-to-realパイプラインを構築。実機Unitree G1で未見シーンへのゼロショット到達・把持を73.3%の成功率で達成した。
原題: FetchMan: Learning Visual Humanoid Loco-Manipulation Policies from Simulated Experiences / Omar Rayyan, Zhi Li, Max Argus 他
日本語で読む → - 論文強化学習機械学習
世界モデルを用いたQ学習
Q学習に世界モデルを組み合わせ、実データのみで学習しつつ想像上の軌道で探索を行うことで、サンプル効率と性能を向上させる手法を提案した。
原題: Q-Learning With World Models / Perry Dong, Yueru Jia, Chelsea Finn 他
日本語で読む → - 論文動作計画ロボティクス
FlexWorm: 吸着式多セグメント変形ロボットのためのプリミティブ拡張ハイブリッド接触・動作計画
多セグメントの吸着式ソフトロボットが複雑な3D表面を移動するための計画フレームワークを提案し、離散的な吸着切替と連続的な変形を扱い、学習ベースのプリミティブ検索で計画時間を短縮する。
原題: FlexWorm: Primitive-augmented Hybrid Contact-motion Planning for Suction-based Multi-segment Deformable Robots / Zili Tang, Tiecheng Guo, Qinyue Zhang 他
日本語で読む → - 論文操作計画ロボティクス
PDDL-ART: デモンストレーションからの自律的シンボリック抽象化による長期的ロボット操作のための視覚言語モデル
本論文は、単一の専門家デモと自然言語タスク記述からPDDLドメインと問題記述を自動生成するVLMベースのフレームワークPDDL-ARTを提案する。構文・意味・実行レベルの多段階補正パイプラインと、幾何・時間推論のためのツール使用を導入し、長期的操作タスクで有効性を示した。
原題: PDDL-ART: Autonomous Symbolic Abstraction From Demonstration For Long-Horizon Robotic Manipulation Using Vision-Language Models / Disha Kamale, Dmitry Berenson
日本語で読む → - 論文ハンド制御ロボティクス
H-PACハンド:劣駆動ロボットハンドの制御指向モデリングと腱弾性補償
腱駆動の劣駆動ハンドにおける腱伸びによる関節誤差を補償する制御手法を提案し、6アクチュエータ・15自由度のハンドで精度を大幅に改善した。
原題: H-PAC Hand: Control-Oriented Modeling and Tendon-Elasticity Compensation for an Underactuated Robotic Hand / Teng Yan, Jiongxu Chen, Teng Wang 他
日本語で読む → - 論文経路計画ロボティクス
DEMデータ統合によるUGV自律航法のための地形認識型ローカル経路計画
低解像度のDEMデータとリアルタイムLiDARセンサを統合し、グローバル経路とローカル適応を組み合わせたUGVの経路計画フレームワークを提案。シミュレーションで障害物回避率95%と平均斜面角度の低減を達成した。
原題: Terrain-Aware Local Path Planning with Global DEM Data Integration for Autonomous UGV Navigation / Devender Singh, Issah Nazif Suleiman, Paul Mitten 他
日本語で読む → - 論文侵入検知cs.CR
車両パワートレインCANバスシステム向けデジタルツイン型侵入検知
CANバスのペイロード改ざん攻撃を検知するため、デジタルツインで車両の物理関係を学習し、予測と実測の残差から攻撃を検出する手法を提案した。実データで評価し、従来手法より高い検出率を達成した。
原題: Digital Twin-Based Intrusion Detection for Vehicle Powertrain CAN Bus Systems / Araf Rahman, M Sabbir Salek, Mashrur Chowdhury
日本語で読む → - 論文マニピュレーションロボティクス
VLCP: 視覚言語制御ポリシーによるロボット操作の閉ループコード再計画
凍結した視覚言語モデルを制御コード生成に用い、デモや微調整なしでロボット操作ポリシーを実現。エピソード内でコードを再計画することで失敗を修正し、成功率を大幅に向上させた。
原題: VLCP: Vision Language Control Policy Closed-Loop Code Replanning for Robot Manipulation / Dhia Naouali, Minghan Wu, Claudia Wong 他
日本語で読む → - 論文HDRイメージング画像認識
深度ガイドによる多視点露出ブラケティングを用いたHDRロボットビジョン
極端な照明条件下での単一ショットHDR撮像を実現するため、多視点カメラに異なる露出を割り当て、深度情報で融合する手法DMEBを提案し、ロボット用の大規模HDRデータセットも構築した。
原題: Depth-guided Multi-view Exposure Bracketing for HDR Robot Vision / Jinnyeong Kim, Juhyung Choi, Woohyeok Kim 他
日本語で読む → - 論文マニピュレーションロボティクス
視覚誘導による4自由度アームでの机上ペン操作
低コストの4自由度アームで、固定カメラとYOLOによる物体検出・姿勢推定を用いて、手首回転なしにペンの色分け整列を実現した論文。
原題: Tabletop Pen Manipulation With a Vision-Guided 4-DoF Arm / Anirudh Rangarajan, Bibit Bianchini
日本語で読む → - 論文マニピュレーションロボティクス
ロボ・ドーパミン2.0:ロボット操作のための履歴条件付き・OOD認識プロセス報酬モデリング
VLAモデルのロボット操作における報酬設計を改善するため、履歴とOOD(分布外)を考慮したプロセス報酬モデルを提案し、ペアワイズ予測インターフェースとSigned-Hopカリキュラムで学習精度を向上させた。
原題: Robo-Dopamine 2.0: History-Conditioned and OOD-Aware Process Reward Modeling for Robotic Manipulation / Yijie Xu, Haopeng Jin, Run Zhou 他
日本語で読む → - 論文外観検査画像認識
衣料生産のためのAI外観検査
縫製ラインの品質管理を自動化するため、CNNを用いたAI外観検査システムを開発・検証した。黒色生地で学習し、異なる色の生地で性能を評価した。
原題: AI Visual Inspection for Garment Production / Ray Wai Man Kong, Ding Ning, Theodore Ho Tin Kong
日本語で読む → - 論文マニピュレーションロボティクス
ディスクを回転させてより遠くへ:新しい再構成可能な腱駆動マニピュレータの設計とモデリング
腱駆動連続体マニピュレータの中間スペーサディスクを独立に回転させて腱経路を局所的に変更し、複雑な変形を実現する再構成可能な設計を提案し、静的モデルを構築して実験で検証した。
原題: Rotate Disks to Reach Farther: Design and Modeling of a Novel Reconfigurable Tendon Driven Manipulator / Sabyasachi Dash, Yangkun Liu, Will Hunter 他
日本語で読む → - 論文器用操作/事前学習ロボティクス
シミュレーションでの視覚的器用さの事前学習
VRヘッドセットを使い、人間がシミュレーション内で物体を操作して収集したデータで、多指ロボットハンドの操作ポリシーを事前学習する手法を提案。実機での微調整により、ゼロから学習するよりも高い性能を達成した。
原題: Pre-training Visual Dexterity in Simulation / Sarthak Kamat, Adam Rashid, Satvik Sharma 他
日本語で読む → - 論文自動運転ロボティクス
すべての履歴が役立つわけではない:長期的なエンドツーエンド自動運転のための速度認識型選択的メモリ
自動運転の長期計画において、過去の自己予測状態が古くなったり現在の運動段階と矛盾したりする問題を解決するため、選択的メモリと運動段階学習を導入したStableDriveを提案し、衝突率やL2誤差を大幅に改善した。
原題: Not All History Helps: Velocity-Aware Selective Memory for Long-Horizon End-to-End Autonomous Driving / Yuchen Liu, Ziying Song, Shengkai Zhang 他
日本語で読む → - 論文UAVプランニングロボティクス
エンドツーエンドUAVプランナーへの改良
単一深度画像から軌道を直接生成するYOPOプランナーに対し、二分割MINCOパラメータ化、ホモトピーアンカー、バリアペナルティ、ランキング損失などの改良を加え、安全性と飛行経路の質を向上させた。
原題: Some Modifications to Our End-to-End UAV Planner / Junjie Lu, Bailing Tian
日本語で読む → - 論文ポリシー学習ロボティクス
二つのアクションヘッドを一致させる:フローマッチングポリシーのための協調メカニズムと実行時崩壊証明
フローマッチングポリシーにおいて、関節空間とエンドエフェクタ空間の二つのデコード結果の残差を実行時信号として用いる際、マルチモーダルタスクでの誤警報を避けるための協調メカニズムを研究し、理論的な証明と実験的評価を行った。
原題: Making two action heads agree: coordination mechanisms and a runtime collapse certificate for flow-matching policies / Jinhui Sun, Wei Zhou, Bowen Yang 他
日本語で読む → - 論文sim2realロボティクス
触覚シミュレーションを使わない触覚Sim2Real:ボトルネック潜在再構成による実現
触覚センサのシミュレーションを避け、シミュレータ内のオラクルセンサ(点群と指先力)で学習したポリシーを、実センサの潜在表現をオラクルに合わせることで実機に転移するフレームワークを提案。挿入や歯車噛み合わせで高成功率を達成。
原題: Tactile Sim2Real without Tactile Simulation via Bottlenecked Latent Reconstruction / Fan Yang, Youngsun Wi, Jinhao Yu 他
日本語で読む → - 論文LiDARレジストレーションロボティクス
誰のフレームで縮退するのか?LiDARレジストレーションにおける縮退検出の等変性条件
LiDARレジストレーションの縮退検出ラベルが座標系に依存することを示し、フレーム不変な一般化固有値基準を提案した論文。
原題: Degenerate in Whose Frame? An Equivariance Condition for Degeneracy Detection in LiDAR Registration / Yujie Zhang, Chunlei Zhao, Yuzong Lin 他
日本語で読む → - 論文VLA/セキュリティcs.CR
ビットフリップ攻撃による視覚言語行動モデルの脆弱性:行動デコードアーキテクチャが攻撃耐性を左右する
量子化された視覚言語行動(VLA)モデルに対する初のビットフリップ攻撃を提案し、少数のフリップで閉ループ成功率を0%にできることを示した。攻撃に必要なフリップ数は行動ヘッドの種類に依存し、直接回帰やトークンポリシーでは1〜5回、フローマッチングでは100〜300回必要である。
原題: Bit-Flip Attacks on Vision-Language-Action Models: Action-Decoding Architecture Shapes the Vulnerability / Yudong Gao, Linghan Chen, Wenhan Wu 他
日本語で読む → - 論文ビデオ理解画像認識
CrossView: 視覚言語モデルはカメラをまたいで推論できるか?
複数カメラ映像の質問応答ベンチマークCrossViewを新たに導入し、既存の視覚言語モデルが複数視点の統合推論に苦戦することを示した。
原題: CrossView: Can Vision-Language Models Reason Across Cameras? / Sahil Shah, S P Sharan, Harsh Goel 他
日本語で読む → - 論文操作プランニングロボティクス
データ合成と統合プランニングによるマニュアル基盤の家電操作のスケーリング
家電のマニュアルから部品接地・長期プランニング・閉ループ回復データを自動生成するパイプラインMAGEと、それを用いた大規模データセットUseAppliance、およびエンドツーエンドモデルAppliancePlanを提案し、実ロボットで有効性を実証した。
原題: Scaling Manual-Grounded Appliance Manipulation with Data Synthesis and Unified Planning / Yuxing Long, Lei Kang, Ziyan Yu 他
日本語で読む → - 論文マニピュレーションロボティクス
ReForce: 力覚を考慮した器用な操作のためのリターゲティング学習
人間のデモからロボットの操作へ変換する際、運動学的なリターゲティングに加えて力の情報を考慮し、接触を再現する手法を提案。シミュレーションと実機で力追従誤差を低減し、多指接触を強化した。
原題: ReForce: Learning Force-aware Retargeting for Dexterous Manipulation / Yuhang Wu, Lingqi Zeng, Changwei Jing 他
日本語で読む → - 論文VLA/推論最適化ロボティクス
投機的推論と検証による効率的なVLA推論のためのアルゴリズム・アーキテクチャ協調設計
ロボット環境の能動/非能動状態に応じて投機的予測と選択的検証を切り替えることで、VLAモデルの推論効率と行動長を改善する協調設計フレームワークを提案した。
原題: Algorithm-Architecture Co-Design for Efficient VLA Inference via Speculative Inference and Verification / Chunyu Qi, Zhuoran Song, Jian Weng 他
日本語で読む → - 論文触覚ロボティクス
ロボットのための視覚ベース触覚知能:センシング、学習、身体化された操作
視覚ベース触覚センサ(VBTS)のハードウェア、学習手法、シミュレーション、データセットを統合したレビュー論文。接触による変形を画像化するVBTSのパイプライン全体を俯瞰し、今後の課題と方向性を示す。
原題: Vision-Based Tactile Intelligence for Robotics: Sensing, Learning, and Embodied Manipulation / Peng Zhou, Jun Hu, Sihan Chen 他
日本語で読む → - 論文介入学習/強化学習ロボティクス
GAINS: 強化学習における不整合な人間介入信号の活用
人間の介入信号の遅延や不整合性を扱うため、分布強化学習と悲観的探索を用いた介入ベースのロボット操作学習フレームワークを提案し、シミュレーションと実機で高い成功率を達成した。
原題: GAINS: Leveraging Inconsistent Human Intervention Signals in Reinforcement Learning / Xinyi Zhang, Yinuo Zhao, Pei Ren 他
日本語で読む → - 論文VLAロボティクス
GigaBrain-0.7:三系統アーキテクチャによる創発的能力へのスケーリング
視覚言語行動モデルのスケーリングとアーキテクチャ改善により、多様なロボットへの汎化を大幅に向上させた基盤モデルを提案。
原題: GigaBrain-0.7: Scaling Embodied Foundation Models to Emergent Capabilities with a Three-System Architecture / GigaBrain Team, Angen Ye, Axiang Sun 他
日本語で読む → - 論文VLA画像認識
AlloEgo-VLM: 視覚言語モデルにおける全中心・自己中心参照枠の曖昧性解消
視覚言語モデルが空間関係を記述する際に参照枠(全中心的・自己中心的)の曖昧さを解消するためのデータセットとフレームワークを構築し、ロボットの物体探索タスクでの実用性を検証した。
原題: AlloEgo-VLM: Disambiguating Allocentric and Egocentric Reference Frames in Vision-Language Models / Kuan-Lin Chen, Tzu-Ti Wei, Chao-Chi Liao 他
日本語で読む → - 論文物体検出画像認識
MITE-Net: 組み込みエッジSAR向けSWaP最適化4Kビデオ微小ターゲット認識
UAVなどのエッジデバイス向けに、SWaP制約下で4K映像から微小なターゲットをリアルタイムに認識するための軽量カスケードアーキテクチャMITE-Netを提案し、専用データセットとエッジデバイスでのベンチマークを提供した。
原題: MITE-Net: SWaP-Optimized 4K Video Tiny Target Perception for Embodied Edge SAR / Mingshuo Xu, Mu Hua, Jigen Peng 他
日本語で読む → - 論文ビデオ生成/編集画像認識
EditStream: 対話型ビデオ生成と編集のための統一オートリグレッシブフレームワーク
ビデオ生成と編集を単一のDiTベースモデルで統合し、高速な数ステップのオートリグレッシブモデルに変換するフレームワークを提案。テキストからビデオ、画像からビデオ、編集伝播など多様なタスクをサポートし、対話的なクリエイティブワークフローを実現する。
原題: EditStream: A Unified Autoregressive Framework for Interactive Video Generation and Editing / Yuqian Zhou, Zhenghong Zhou, Zongze Wu 他
日本語で読む →