Lei Zhu
収録論文 22本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- UniTexture: 視覚言語行動モデルに対するクロスタスク普遍敵対的テクスチャ敵対的攻撃2026/8/13
単一のテクスチャ付き3Dオブジェクトを用いて、複数のタスクにわたってVLAモデルの行動予測を敵対的に逸脱させる普遍的な攻撃手法を提案した。
- ActFovea: 時空間的な視覚-行動整合性によるVLAポリシーの実行時保護VLA/安全制御2026/7/1
VLAポリシーを再学習せずに実行時の外乱を検出・緩和するプラグアンドプレイの保護フレームワークを提案。視覚と行動の整合性を監視し、回復不能な場合は安全に失敗させる。
- ドリフト対応ポストトレーニング量子化による効率的な視覚言語行動モデルVLA/量子化2026/4/1
視覚言語行動モデル(VLA)の量子化時に生じる時間的誤差蓄積による動作ドリフトを解決するため、ドリフト対応PTQ(DA-PTQ)を提案。クロススペース表現補償と動作駆動混合精度割り当てにより、低ビットでも高精度な制御を実現。
- キーフレーム連鎖による非マルコフ的長期間ロボット操作マニピュレーション2026/3/1
長期的な依存関係を持つ操作タスク向けに、過去の重要なフレームを自動選択・連鎖させてVLAモデルに組み込むフレームワークを提案し、シミュレーションで有効性を示した。
- 自己修正VLA:スパースな世界想像によるオンライン行動洗練VLA2026/2/1
VLAモデルに将来予測ヘッドを追加し、予測したスパースな未来状態に基づいて報酬を再形成することで、オンラインで行動を自己修正する手法を提案。シミュレーションと実機で成功率と効率が向上。
- MOTIF: 少数ショットでの異なる身体間転送のための行動モチーフ学習VLA2026/2/1
異なるロボット身体間での少数ショット転送を可能にするため、身体に依存しない時空間パターン(行動モチーフ)をベクトル量子化で抽出し、フローマッチング方策を導く軽量予測器を設計した手法。
- AC^2-VLA: 行動文脈を考慮した適応的計算による効率的なロボットマニピュレーションVLA2026/1/1
VLAモデルの推論における時間・空間・深さ方向の冗長性に着目し、行動文脈に基づいて計算を適応的に再利用・削減するフレームワークを提案。密なモデルと同等の成功率を保ちつつ最大1.79倍の高速化とFLOPs29.4%削減を実現した。
- 低電力組み込みシステム向けの効率的な特徴アライメントと共分散最適化によるリアルタイム車線検出自動運転/車線検出2026/1/1
車線特徴の分布を正解ラベルに近づける共分散分布最適化モジュールを提案し、計算量を増やさずに組み込み向け車線検出モデルの精度を向上させた。
- セグメンテーションを超えて:ロボット手術におけるSAM 3のセグメンテーション・3D知覚・再構成のベンチマーク評価医療画像/セグメンテーション2025/12/1
ロボット支援手術を対象に、SAM 3のゼロショットセグメンテーションとSAM 3Dの深度再構成をEndoVisやSCAREDなどのベンチマークで評価し、空間プロンプトでは改善が見られる一方、言語プロンプトや動的手術シーンには課題が残ることを示した。
- ワールドモデルへの第一歩:ロボットマニピュレーションに関するサーベイマニピュレーション2025/11/1
ロボットマニピュレーションにおけるワールドモデルの役割を整理し、知覚・予測・制御の観点から中核能力と課題を分析したサーベイ。
- ActDistill: 効率的な視覚-言語-行動モデルのための汎用的な行動誘導自己蒸留VLA2025/11/1
既存のVLAモデルの行動予測能力を軽量な生徒モデルに転移させる蒸留フレームワークを提案し、計算量を50%以上削減しつつ同等以上の性能を実現した。
- BLM₁:デジタルと物理を横断する汎用大規模モデルVLA2025/10/1
デジタル空間と物理空間、異なるタスクやロボット身体をまたいで動作する統合型マルチモーダル基盤モデルBLM₁を提案し、2段階学習で身体性知識と制御を両立させた。
- 遮蔽物の多い環境でのロボットナビゲーションのための遮蔽認識型一貫モデル予測制御ナビゲーション2025/3/1
遮蔽された障害物の将来位置をリスク領域として考慮し、複数の軌道候補を生成して安全性と運動の一貫性を両立するモデル予測制御手法を提案し、実機実験で有効性を示した。
- 汎用身体性エージェントのための視覚言語事前学習における順序性と連続性の証明可能な学習VLA2025/2/1
人間の行動動画から視覚言語表現を事前学習する際に、目標到達に基づく時間対比学習ではなく、フレーム間の意味的差異とブラウン橋制約を用いて順序性と連続性を学習するAcTOLを提案し、模倣学習実験で操縦タスクの性能と指示スタイルへの頑健性を向上させた。
- CALMM-Drive: 大規模マルチモーダルモデルによる信頼度を考慮した自動運転自動運転2024/12/1
大規模マルチモーダルモデルと拡散モデルを組み合わせ、信頼度に基づく候補選択で自動運転の意思決定と軌道計画を統合したフレームワークを提案。
- MCGMapper: 平面マーカーとカメラ群を用いた軽量インクリメンタルSfMと視覚的自己位置推定SLAM/自己位置推定2024/5/1
平面マーカーと既知の外部パラメータを持つ複数カメラを使い、PnPとバンドル調整でマーカーマップを逐次構築する軽量SfMフレームワークを提案し、テクスチャの少ない屋内・産業環境での地図構築の精度と速度を向上させた。
- DragTraffic: 自動運転のための対話的で制御可能な交通シーン生成シーン生成2024/4/1
画像生成のDragGANに着想を得て、条件付き拡散モデルにより非専門家でも多様でリアルな交通シナリオを対話的に生成・制御できるフレームワークを提案した。
- 混合交通を操る:横方向制御と階層型強化学習による交通流の振り付け群制御2024/3/1
ロボット車と人間運転車が混在する交差点で、ロボット車の縦横制御を階層型強化学習で行い、平均待ち時間を最大54%削減する手法を提案した。
- 星形ロードマップと動的システム変調による未知の混雑環境でのロボットナビゲーションナビゲーション2024/3/1
センサデータから星形の自由空間表現とロードマップを逐次構築し、動的システム変調に基づく反応型制御で未知の混雑環境を安全かつ効率的に移動する手法を提案した。
- Learning to Control and Coordinate Mixed Traffic Through Robot Vehicles at Complex and Unsignalized Intersections2023/1/1
- Submap-based Pose-graph Visual SLAM: A Robust Visual Exploration and Localization System2018/7/1
- Kinematics analysis and three-dimensional simulation of the rehabilitation lower extremity exoskeleton robot2014/1/1