Yanyong Zhang
収録論文 43本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- DriftingVLA: 次元別時間ドリフトによるネイティブ一段階視覚言語行動生成VLA2026/8/30
フローベースのVLAモデルの多段階推論による遅延を解消するため、分布ドリフト目的関数を用いてノイズから行動チャンクへの直接マッピングを学習する一段階VLAモデルを提案した。行動次元ごとに時間的ドリフトを適用することで、制御性能を保ちつつ3.36倍の高速化を実現した。
- RoMAN-Flow: ロボット操作におけるオフライン強化学習のための自己回帰正規化フローの制御オフライン強化学習2026/8/20
自己回帰正規化フローを用いたオフライン強化学習フレームワークを提案し、サンプリング不要の尤度目的と一段階蒸留により推論遅延を削減しつつ、ロボット操作の性能を維持する。
- LabDex: 実験室における器用な操作のための階層的ベンチマークマニピュレーション2026/8/19
化学実験室での器用な操作を評価するための大規模な実世界データセットとベンチマークを導入し、原子スキル、合成タスク、長期実験の階層的タスク分類を提供する。
- ReTouch: オンライン更新型触覚予測による接触豊富な器用操作の実現触覚/操作2026/8/1
触覚予測を実行時のフィードバックでオンライン更新するVLAモデルReTouchを提案し、接触を伴う器用操作の成功率を大幅に向上させた。
- CAC-VLA: 視覚言語行動モデルのための文脈ゲート型行動条件付けVLA2026/7/1
VLAモデル内に軽量な潜在行動インターフェースを導入し、文脈ゲートで行動エキスパートへの影響を調整することで、ロボット操作の成功率を向上させた。
- GEAR-VLA: 汎用ロボット操作のための幾何認識行動表現の学習VLA/操作2026/6/7
VLAモデルの実世界での汎化を改善するため、幾何認識型の行動表現を学習するGEAR-VLAを提案。粗密行動学習、3D特徴の整合、エンボディメント正準化により、未見物体や異なるロボットへの汎化を実現した。
- Labimus: 化学実験室における人型器用操作のためのシミュレーションとベンチマークシミュレーション/ベンチマーク2026/6/1
有機化学実験室での人型ロボットによる精密な器用操作を評価する初のベンチマークを提案し、実世界の作業台を再現したシミュレーション環境と精密さを考慮した評価プロトコルを導入した。
- Trans2Occ: 透明物体のボクセル占有推定と把持 - シミュレーションから実世界へマニピュレーション2026/6/1
単一RGB画像から透明物体のボクセル占有を直接予測し、シミュレーションで大規模学習したモデルを実ロボットに微調整なしで適用して把持を実現する枠組みを提案した。
- DynaHMRC: 大規模言語モデルによる動的タスクのための分散型異種マルチロボット協調群制御2026/6/1
各ロボットが役割認識を持つLLMエージェントとして動作する分散型フレームワークを提案し、動的タスクにおける異種マルチロボット協調のスケーラビリティと適応性を向上させた。
- OpenGo: リアルタイムスキル切り替えを備えたOpenClawベースのロボット犬ロボット犬/スキル切り替え2026/4/1
OpenClawを搭載したロボット犬が、タスクや指示に応じてスキルをリアルタイムに切り替えられるシステムを提案。スキルライブラリ、ディスパッチャー、自己学習フレームワークを備え、Unitree Go2で実証した。
- ドリフトベース方策最適化:オンラインロボット制御のためのネイティブ一段階方策学習ロボット制御2026/4/1
多段階生成方策の推論コストを削減するため、固定点ドリフト目的で訓練時に反復精錬を内部化した一段階生成方策(DBP)と、そのオンラインRLフレームワーク(DBPO)を提案した。
- Open-H-Embodiment:医療ロボティクスにおける基盤モデルを可能にする大規模データセット医療ロボティクス/データセット/基盤モデル2026/4/1
医療ロボットの自律化を妨げるデータ不足を解決するため、複数のロボットプラットフォームにわたる大規模な医療ロボットビデオと運動学データセットを公開し、基盤モデルの開発を実証した。
- 3D空間事前知識を用いた手術ロボット操作学習手術ロボティクス2026/3/1
内視鏡画像から3D空間情報を直接抽出するエンドツーエンドの視覚運動ポリシーを提案し、大規模3Dデータセットと空間特徴コネクタにより手術ロボットの空間認識能力を向上させた。
- FAVLA:接触の多いロボットマニピュレーションのための力適応型高速・低速VLAモデルVLA2026/2/1
低速なVLMによる計画と高速なアクションエキスパートを分離し、力覚フィードバックを適応的に活用することで、接触の多いマニピュレーションの反応性と成功率を向上させるVLAモデルを提案。
- DAGS-SLAM: 時空間運動確率と不確実性対応スケジューリングによる動的対応3DGS SLAMSLAM2026/2/1
各ガウシアンに時空間運動確率を持たせ、不確実性に応じてセマンティクスを必要な時だけ呼び出すことで、動的環境でもリアルタイムに高精度な3DGS-SLAMを実現した。
- ArtiBenchとArtiBrain:汎化可能な視覚言語による関節物体操作のベンチマークマニピュレーション2025/11/1
関節物体操作の汎化性能を評価する5段階ベンチマークArtiBenchと、VLM推論と拡散制御を組み合わせたモジュール型フレームワークArtiBrainを提案し、既存手法を上回る性能を示した。
- UrgenGo: 自動運転向けの緊急度を考慮した透過的GPUカーネル起動自動運転/GPUスケジューリング2025/9/1
アプリのソースコードやGPUドライバに手を加えず、カーネル起動を透過的に操作して緊急度の高いGPUタスクを優先するスケジューラを提案し、自動運転バスでの実証でデッドライン違反を61%削減した。
- VLMPlanner: 視覚言語モデルと運動計画の統合VLA2025/7/1
視覚言語モデル(VLM)を自動運転の運動計画に組み込み、生画像から得た文脈情報でリアルタイムプランナを誘導するハイブリッド手法を提案。シーン複雑度に応じて推論頻度を調整する機構も導入した。
- 大規模ガウシアンスプラッティングSLAMSLAM2025/5/1
ステレオカメラを用いて大規模屋外環境で動作する3DガウシアンスプラッティングベースのVisual SLAMを提案し、連続サブマップとループ検出によりメモリ制限下でも高品質な再構成を実現した。
- STDArm: 静的データ学習の視覚運動ポリシーを動的ロボットマニピュレーションへ転移マニピュレーション2025/4/1
静的環境で学習した視覚運動ポリシーを、移動ロボット上でもそのまま使えるよう、リアルタイムの行動補正・安定化・遅延推定を組み合わせて動的マニピュレーションを実現したシステム。
- CAFE-AD: 自動運転の軌道計画のためのクロスシナリオ適応的特徴強調自動運転/軌道計画2025/4/1
自動運転の軌道計画において、シナリオ間で適応的に特徴を強調・補間することで長尾分布や因果混同に対処し、nuPlanベンチマークで最先端手法を上回った研究。
- MT-PCR: モダリティ変換を活用した限られた重なりの大規模点群位置合わせ点群位置合わせ2025/3/1
3D点群をBEV画像に変換して2D画像のキーポイントマッチングで対応を推定し、逆変換で3D位置合わせを行う手法を提案。低重複の大規模シーンで高精度・高ロバスト性を実現。
- GraspCoT: 物理特性推論を統合した柔軟な言語指示による6自由度把持マニピュレーション2025/3/1
物理特性に着目したChain-of-Thought推論とマルチモーダルLLMを組み合わせ、多様な言語指示から6自由度把持姿勢を予測するフレームワークを提案し、新ベンチマークIntentGraspで有効性を示した。
- Map++: ユーザ参加型ビジュアルSLAMシステムに向けた効率的な地図拡張と共有SLAM2024/11/1
ユーザが協力して地図構築を行う参加型SLAMシステムMap++を提案し、軽量なプロトコルで通信量を約46%削減しつつ精度劣化を抑え、同時接続ユーザ数を約2倍に拡大できることを示した。
- CELLmap: 弾力的で軽量な球面マップ表現によるLiDAR SLAMの強化SLAM2024/9/1
大規模LiDAR SLAMの地図を、場所ごとの局所マップCELLに分割して保持する軽量な表現を提案し、双方向レジストレーションとループ閉じ込みで地図の一貫性を高めた。
- MHRC: 大規模言語モデルによる分散型マルチ異種ロボット協調VLA2024/9/1
大規模言語モデルを活用し、移動ロボット・マニピュレーションロボット・移動マニピュレーションロボットが分散協調して探索・運搬・整理タスクを遂行するフレームワークを提案。
- LDP: 効率的なロボットナビゲーションと衝突回避のための局所拡散プランナナビゲーション2024/7/1
多様なエージェントによるデータ生成と軽量なグローバル観測の統合により、複雑な実環境での局所ナビゲーションと衝突回避を実現する拡散モデルベースのプランナを提案する。
- 知覚が計画を助ける:二重エッジ構造による多段階レーンレベル統合自動運転計画2024/7/1
車線や交差点などの交通要素の知覚を計画に統合するフレームワークPHPを提案し、レーンの両エッジを活用して安全で効率的な自動運転計画を実現、Carlaベンチマークで運転スコアを27.20%改善した。
- 回転初期化と段階的洗練による汎用LiDARキャリブレーションキャリブレーション2024/5/1
複数LiDARの外部キャリブレーションを、事前知識不要の回転初期化と幾何・運動情報を統合した段階的最適化により、センサ非依存で高精度に行う手法を提案した。
- 道路沿いシーンにおけるレンダリング強化型自動画像-点群位置合わせ位置合わせ/キャリブレーション2024/4/1
事前点群からフォトリアルなグレースケール画像をレンダリングし、SAMで抽出した線特徴の再投影誤差を最小化することで、道路沿いカメラの外部パラメータを自動推定する手法を提案。
- MM-Gaussian: 3Dガウシアンによる非有界環境でのマルチモーダル融合ローカリゼーションと再構成SLAM2024/4/1
LiDARとカメラを融合し、3Dガウシアン表現を用いて屋外の非有界環境での自己位置推定と地図構築を高精度・高速に行うシステムを提案した。
- mmPlace: 低コスト単一チップミリ波レーダの中間周波数信号によるロバストな場所認識場所認識2024/3/1
低コストな単一チップミリ波レーダの中間周波数信号を距離方位ヒートマップに変換し、回転プラットフォームで視野を拡張することで、回転や横方向の変化に強い場所認識を実現した。
- CRPlace: カメラ・レーダー融合とBEV表現による場所認識場所認識2024/3/1
カメラとレーダーのBEV特徴を背景に注目して双方向クロスアテンションで融合し、場所認識のためのグローバル記述子を生成する手法を提案。nuScenesで有効性を示した。
- CalibFormer: A Transformer-based Automatic LiDAR-Camera Calibration Network2023/11/1
- EdgeCalib: Multi-Frame Weighted Edge Features for Automatic Targetless LiDAR-Camera Calibration2023/10/1
- OCC-VO: Dense Mapping via 3D Occupancy-Based Visual Odometry for Autonomous Driving2023/9/1
- USTC FLICAR: A Sensors Fusion Dataset of LiDAR-Inertial-Camera for Heavy-duty Autonomous Aerial Work Robots2023/4/1
- Deep Reinforcement Learning for Localizability-Enhanced Navigation in Dynamic Human Environments2023/3/1
- TrajMatch: Towards Automatic Spatio-temporal Calibration for Roadside LiDARs through Trajectory Matching2023/2/1
- MAROAM: Map-based Radar SLAM through Two-step Feature Selection2022/10/1
- PFilter: Building Persistent Maps through Feature Filtering for Fast and Accurate LiDAR-based SLAM2022/8/1
- Reinforcement Learning for Robot Navigation with Adaptive Forward Simulation Time (AFST) in a Semi-Markov Model2021/8/1
- DRQN-based 3D Obstacle Avoidance with a Limited Field of View2021/8/1