論文
フィジカルAI関連の最新論文を、日本語のひとことで。原題は英語です。
最新論文: 2026/8/16 / arXivを3時間ごとに自動収集
📖 UMIデバイス・カタログ(日本語版)UMI式データ収集デバイスと主要データセットを日本語で俯瞰 →- 論文VLA画像認識
AlloEgo-VLM: 視覚言語モデルにおける全中心・自己中心参照枠の曖昧性解消
視覚言語モデルが空間関係を記述する際に参照枠(全中心的・自己中心的)の曖昧さを解消するためのデータセットとフレームワークを構築し、ロボットの物体探索タスクでの実用性を検証した。
原題: AlloEgo-VLM: Disambiguating Allocentric and Egocentric Reference Frames in Vision-Language Models / Kuan-Lin Chen, Tzu-Ti Wei, Chao-Chi Liao 他
日本語で読む → - 論文VLA/セキュリティcs.CR
ビットフリップ攻撃による視覚言語行動モデルの脆弱性:行動デコードアーキテクチャが攻撃耐性を左右する
量子化された視覚言語行動(VLA)モデルに対する初のビットフリップ攻撃を提案し、少数のフリップで閉ループ成功率を0%にできることを示した。攻撃に必要なフリップ数は行動ヘッドの種類に依存し、直接回帰やトークンポリシーでは1〜5回、フローマッチングでは100〜300回必要である。
原題: Bit-Flip Attacks on Vision-Language-Action Models: Action-Decoding Architecture Shapes the Vulnerability / Yudong Gao, Linghan Chen, Wenhan Wu 他
日本語で読む → - 論文ビデオ生成/編集画像認識
EditStream: 対話型ビデオ生成と編集のための統一オートリグレッシブフレームワーク
ビデオ生成と編集を単一のDiTベースモデルで統合し、高速な数ステップのオートリグレッシブモデルに変換するフレームワークを提案。テキストからビデオ、画像からビデオ、編集伝播など多様なタスクをサポートし、対話的なクリエイティブワークフローを実現する。
原題: EditStream: A Unified Autoregressive Framework for Interactive Video Generation and Editing / Yuqian Zhou, Zhenghong Zhou, Zongze Wu 他
日本語で読む → - 論文外観検査画像認識
衣料生産のためのAI外観検査
縫製ラインの品質管理を自動化するため、CNNを用いたAI外観検査システムを開発・検証した。黒色生地で学習し、異なる色の生地で性能を評価した。
原題: AI Visual Inspection for Garment Production / Ray Wai Man Kong, Ding Ning, Theodore Ho Tin Kong
日本語で読む → - 論文マニピュレーションロボティクス
視覚誘導による4自由度アームでの机上ペン操作
低コストの4自由度アームで、固定カメラとYOLOによる物体検出・姿勢推定を用いて、手首回転なしにペンの色分け整列を実現した論文。
原題: Tabletop Pen Manipulation With a Vision-Guided 4-DoF Arm / Anirudh Rangarajan, Bibit Bianchini
日本語で読む → - 論文再構成可能ロボットロボティクス
着脱式ワイヤ駆動:アクチュエータ共有による再構成可能ロボットアーキテクチャ
重く高価なアクチュエータを共通ベースに集約し、ワイヤ経路を物理的に切断・再接続できる「ワイヤ着脱ユニット」により、複数の形態(剛体アーム、連続体アーム、グリッパ)を単一のアクチュエータセットで駆動する再構成可能ロボットシステムを提案・実証した。
原題: Detachable Wire Drive : Reconfigurable Robot Architecture with Shared Actuators / Takahiro Hattori, Kento Kawaharazuka, Kei Okada
日本語で読む → - 論文介入学習/強化学習ロボティクス
GAINS: 強化学習における不整合な人間介入信号の活用
人間の介入信号の遅延や不整合性を扱うため、分布強化学習と悲観的探索を用いた介入ベースのロボット操作学習フレームワークを提案し、シミュレーションと実機で高い成功率を達成した。
原題: GAINS: Leveraging Inconsistent Human Intervention Signals in Reinforcement Learning / Xinyi Zhang, Yinuo Zhao, Pei Ren 他
日本語で読む → - 論文ビデオ理解画像認識
CrossView: 視覚言語モデルはカメラをまたいで推論できるか?
複数カメラ映像の質問応答ベンチマークCrossViewを新たに導入し、既存の視覚言語モデルが複数視点の統合推論に苦戦することを示した。
原題: CrossView: Can Vision-Language Models Reason Across Cameras? / Sahil Shah, S P Sharan, Harsh Goel 他
日本語で読む → - 論文VLA/推論最適化ロボティクス
投機的推論と検証による効率的なVLA推論のためのアルゴリズム・アーキテクチャ協調設計
ロボット環境の能動/非能動状態に応じて投機的予測と選択的検証を切り替えることで、VLAモデルの推論効率と行動長を改善する協調設計フレームワークを提案した。
原題: Algorithm-Architecture Co-Design for Efficient VLA Inference via Speculative Inference and Verification / Chunyu Qi, Zhuoran Song, Jian Weng 他
日本語で読む → - 論文触覚ロボティクス
ロボットのための視覚ベース触覚知能:センシング、学習、身体化された操作
視覚ベース触覚センサ(VBTS)のハードウェア、学習手法、シミュレーション、データセットを統合したレビュー論文。接触による変形を画像化するVBTSのパイプライン全体を俯瞰し、今後の課題と方向性を示す。
原題: Vision-Based Tactile Intelligence for Robotics: Sensing, Learning, and Embodied Manipulation / Peng Zhou, Jun Hu, Sihan Chen 他
日本語で読む → - 論文自動運転ロボティクス
すべての履歴が役立つわけではない:長期的なエンドツーエンド自動運転のための速度認識型選択的メモリ
自動運転の長期計画において、過去の自己予測状態が古くなったり現在の運動段階と矛盾したりする問題を解決するため、選択的メモリと運動段階学習を導入したStableDriveを提案し、衝突率やL2誤差を大幅に改善した。
原題: Not All History Helps: Velocity-Aware Selective Memory for Long-Horizon End-to-End Autonomous Driving / Yuchen Liu, Ziying Song, Shengkai Zhang 他
日本語で読む → - 論文VLAロボティクス
GigaBrain-0.7:三系統アーキテクチャによる創発的能力へのスケーリング
視覚言語行動モデルのスケーリングとアーキテクチャ改善により、多様なロボットへの汎化を大幅に向上させた基盤モデルを提案。
原題: GigaBrain-0.7: Scaling Embodied Foundation Models to Emergent Capabilities with a Three-System Architecture / GigaBrain Team, Angen Ye, Axiang Sun 他
日本語で読む → - 論文マニピュレーションロボティクス
ロボ・ドーパミン2.0:ロボット操作のための履歴条件付き・OOD認識プロセス報酬モデリング
VLAモデルのロボット操作における報酬設計を改善するため、履歴とOOD(分布外)を考慮したプロセス報酬モデルを提案し、ペアワイズ予測インターフェースとSigned-Hopカリキュラムで学習精度を向上させた。
原題: Robo-Dopamine 2.0: History-Conditioned and OOD-Aware Process Reward Modeling for Robotic Manipulation / Yijie Xu, Haopeng Jin, Run Zhou 他
日本語で読む → - 論文センサ/信頼性ロボティクス
物理的限界と不確実性モニタリングによる信頼性の高いピエゾ抵抗ひずみセンシング
ソフトなピエゾ抵抗ひずみセンサの信頼性を高めるため、物理情報を組み込んだ確率的逆モデルと、不確実性とひずみ・ひずみ速度の限界を融合したリスク指標を用いた3状態モニタを提案した。実験では高い適合度と異常検出率を達成した。
原題: Reliable Piezoresistive Strain Sensing Through Physical Limits and Uncertainty Monitoring / Carmen Ballester, Víctor Muñoz, Dorin Copaci 他
日本語で読む → - 論文活動認識機械学習
TransfHAR: オンデマンド活動認識のための自己教師あり手首表現学習
手首のIMUデータを用いた自己教師あり事前学習により、未学習の細かい活動を少数のデモから認識できるフレームワークを提案し、実時間スマートウォッチアプリとして実装・評価した。
原題: TransfHAR: Self-Supervised Wrist Representations for On-Demand Activity Recognition / Aidan Bradshaw, Riku Arakawa, Xin Liu 他
日本語で読む → - 論文VLA/強化学習ロボティクス
StructRL: フローベースVLAのための構造化アクション空間探索
フローベースの視覚言語行動モデル(VLA)のオンライン強化学習において、ノイズをアクション空間に直接注入する構造化探索手法StructRLを提案し、シミュレーションと実世界タスクで性能を向上させた。
原題: StructRL: Structured Action-Space Exploration for Flow-Based VLAs / Jiarui Yang, Bin Zhu, Jingjing Chen 他
日本語で読む → - 論文遠隔操作/意図推論ロボティクス
GUIDER: 実ロボットデータを用いた遠隔操作における目標非依存の人間意図推論の評価
本論文は、ロボットアームの遠隔操作中に人間の意図を確率的に推論するフレームワークGUIDERを実データで評価し、全シナリオで正しい把持候補を推定できたことを示した。
原題: GUIDER: Evaluating Goal-Free Human Intent Inference for Teleoperated Manipulation on Real-Robot Data / Nicholas Kenny, Cesar Alan Contreras, Basile Ouedraogo 他
日本語で読む → - 論文VLAロボティクス
VTInstructor: 連続環境におけるナビゲーション指示生成のための視覚的軌跡プロンプティング
連続環境でのRGB映像からナビゲーション指示を生成する初のフレームワークを提案し、軌跡の幾何学を視覚的プロンプトに変換して指示生成の精度を大幅に向上させた。
原題: VTInstructor: Visual Trajectory Prompting for Navigation Instruction Generation in Continuous Environments / Haolin Yang, Yuxing Long, Zihan Yang 他
日本語で読む → - 論文VLM/ベンチマーク/エッジ推論cs.DC
洪水対応のためのエッジ推論セグメンテーションのベンチマーク
洪水対応のためのVLM推論セグメンテーションのベンチマークを提案し、実世界のシーンと応答関連ターゲットからなるデータセットを構築。エッジデバイスでの精度、遅延、エネルギー、通信のトレードオフを評価した。
原題: FloodReasonBench: Benchmarking VLM Reasoning Segmentation for Embodied Flood Response at the Edge / Rajat Bhattacharjya, Yoomee Jung, Minwoo Kim 他
日本語で読む → - 論文ビデオワールドモデルAI
SCOPE: ビデオワールドモデルのためのスコア分離型エージェント最適化
推論時に凍結されたビデオワールドモデルを監査可能な形で適応させるフレームワークSCOPEを提案し、Physics-IQベンチマークで性能向上を実証した。
原題: SCOPE: Score-Isolated Agentic Optimization for Video World Models / Yuhua Jiang, Jiaming Wang, Qingbin Liu 他
日本語で読む → - 論文VLA/ベンチマーク画像認識
NumerosityVLM: 視覚言語モデルにおける数量表現の解釈のための認知に着想を得たベンチマーク
視覚言語モデルの数量知覚能力を評価するため、物体の大きさや配置などの視覚的要因を独立に操作した合成画像ベンチマークを構築し、モデル性能の要因分析と層別プロービングを行った。
原題: NumerosityVLM: A Cognitively Inspired Benchmark for Interpreting Numerosity Representations in Vision-Language Models / Yiming Fu, Fangjun Li, Xiujin Liu 他
日本語で読む → - 論文UAVナビゲーションロボティクス
形状適合領域による閉鎖・劣化環境での飛行
UAVが洞窟や崩落構造物などの閉鎖環境で安全に飛行するため、知覚誤差を吸収する非凸の進入禁止領域を符号付き距離場に基づいて生成する手法を提案。実データで凸型ベースラインより多くの自由空間を確保しつつ、同等の保証付きカバレッジを達成。
原題: SCORE: Shape-Conforming Regions for Flight in Enclosed, Degraded Environments / Eric Minwoo Kim, Jong-Kook Kim
日本語で読む → - 論文動作計画ロボティクス
凸集合グラフのニューラル予測による混合離散連続動作計画の高速化
動作計画を凸集合グラフ(GCS)で定式化し、高コストな凸緩和をグラフ注意ネットワークによる候補経路予測と軽量ランキングで置き換え、早期探索終了で高速化する手法を提案。3Dクアッドロータや7自由度マニピュレータ、平面押し操作で最大2桁の高速化を達成。
原題: Accelerating Mixed Discrete-Continuous Motion Planning via Neural Graphs of Convex Sets / Ananya Trivedi, Sarvesh Prajapati, Mohamed Khalid M Jaffar 他
日本語で読む → - 論文セグメンテーション画像認識
SOS!:モデルフリーセグメンテーションのための合理化されたオブジェクト条件付きトランスフォーマー
3Dモデルを必要とせず、参照画像1枚だけで未知物体を正確にセグメンテーションする新しい手法を提案。オブジェクト条件付きトランスフォーマーにより、マスク生成と対象特定を単一のフィードフォワードで統合し、効率と精度を両立した。
原題: SOS! : A Streamlined Object-Conditional Transformer for Model-free Segmentation / Jiaqi Hu, Junwen Huang, Hongli Xu 他
日本語で読む → - 論文強化学習ロボティクス
Max-Q選択的模倣による人間参加型オンラインロボット学習
人間の介入を活用したオンライン強化学習において、介入軌道を直接評価するMC Q-chunk批判と、現在のポリシーとバッファサンプルのうち高いQ値を持つ方を模倣するmax-Q選択的模倣を組み合わせ、介入学習と自己改善を自動的に切り替える手法を提案した。実機のUSB挿入タスクで99%の成功率を30分で達成した。
原題: Max-Q Selective Imitation for Human-in-the-Loop Online Robot Learning / Zihang Wang, Yishan Wang
日本語で読む → - 論文触覚画像認識
EgoTac: 自己中心視覚からの実環境触覚予測
自己中心視覚映像から触覚情報を予測するモデルEgoTacを提案し、570万以上の画像-触覚ペアで学習して高精度な触覚予測を実現した。
原題: EgoTac: In-the-wild Tactile Prediction from Egocentric Vision / Wenkang Zhang, Chengbo Yuan, Zicheng Zhang 他
日本語で読む → - 論文制御理論制御
非対称アクチュエータ制約を有する厳密フィードバック非線形システムのための許容性保存制御
アクチュエータの非対称制約や出力制約、レート制限を考慮した安全制御フレームワークを提案し、動的実現により制約を直接組み込むことで、代数クリッピングや飽和補償を不要にした。
原題: Admissibility-Preserving Control for Strict-Feedback Nonlinear Systems with Asymmetric Actuator Constraints / Saurabh Kumar, Shashi Ranjan Kumar, Abhinav Sinha
日本語で読む → - 論文SLAMロボティクス
MotionGS-SLAM: イベント変調ガウススプラッティングによるモーションブラー耐性SLAM
モーションブラーを除去するのではなく、ブラー生成過程をレンダリングパイプラインに組み込むことで、イベントカメラの時間分解能を活用し、高運動条件下でも高精度な軌跡推定と地図構築を実現するSLAMシステムを提案した。
原題: MotionGS-SLAM: Event-Modulated Gaussian Splatting for Motion-Blur Robust SLAM / Zhiqiang Hu, Shouren Huang, Masatoshi Ishikawa
日本語で読む → - 論文ロボット学習ロボティクス
ロボットポリシー訓練における凍結視覚エンコーダのNPUオフロード
ロボットポリシー訓練時に凍結した視覚エンコーダの計算を低消費電力のNPUにオフロードし、GPUの消費エネルギーを削減する手法を提案・評価した。
原題: NPU Offloading of a Frozen Visual Encoder for Robot Policy Training / Hyojun Yun, Seungjae Won, Hyungpil Moon
日本語で読む → - 論文SLAMロボティクス
HP2-SLAM: 適応型ハイブリッドICPによる堅牢で効率的なLiDAR SLAM
平面性を考慮した適応閾値で点対平面と点対点の残差を動的に切り替えるハイブリッドICPを提案し、構造化・退化環境の両方で安定したLiDAR SLAMを実現した。
原題: HP2-SLAM: Adaptive Hybrid ICP for Robust and Efficient LiDAR SLAM / Nam Tran, Thu Tran, Hieu Phan 他
日本語で読む →