Qiang Zhang
University of Science and Technology of China
収録論文 58本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 予期せぬ路面外乱下での股関節外骨格支援歩行に向けた個人適応型動的バランス評価パラダイム外骨格/バランス制御2026/9/13
股関節外骨格の支援条件を個人ごとに最適化するため、7つの生体力学的指標を統合した複合バランスコストを提案し、階層ベイズモデルで最良条件を高確率で特定できることを3名の実験で示した。
- SOLO: 安定した全地形・長距離知覚ヒューマノイド歩行歩行2026/8/27
長距離歩行で累積する知覚・制御誤差による不安定化を解決するため、地形再構成の鮮明化と時間的クレジット割り当てを改善した統合フレームワークを提案。シミュレーションと実機で高い成功率を達成した。
- RoboStriker: 自律型ヒューマノイドボクシングのための潜在空間戦略ゲーム強化学習/ヒューマノイド2026/8/17
ヒューマノイドボクシングを2プレイヤーの潜在空間ゼロサムマルコフゲームとして定式化し、戦略的探索と物理的実現性の矛盾を解決する階層的フレームワークを提案した。
- GenHOI: タスク固有の訓練なしに生成ビデオを模倣する接触を考慮したヒューマノイドと物体のインタラクションヒューマノイド操作2026/6/1
生成ビデオを模倣することで、タスク固有の訓練や物理デモデータなしに、ヒューマノイドロボットが多様な物体操作タスクをゼロショットで実行できるフレームワークを提案した。
- FutureNav: 視覚言語ナビゲーションのための統合世界行動モデリングVLA/ナビゲーション2026/6/1
視覚と言語によるナビゲーション(VLN)タスクにおいて、世界状態の遷移と将来予測を明示的にモデル化する統合フレームワークを提案し、4B規模のバックボーンで複数のベンチマークで最先端性能を達成した。
- 知覚行動基盤モデル:人間の動作プリエントをロボット中心の地形に適応させるヒューマノイド制御2026/6/1
人間の動作データを基盤としたヒューマノイド制御モデルを、ロボットの周囲地形に適応させるフレームワークを提案。地形に合わせた参照動作を合成し、教師-学生学習で実ロボットに展開する。
- VAIC: 視覚誘導によるヒューマノイドの俊敏な物体インタラクション制御 - 分離コマンドを用いてヒューマノイド制御2026/6/1
ヒューマノイドロボットが、深度カメラと自己状態のみから、箱運びやスケートボードなどの多様な動的物体操作を単一のポリシーで実行できるようにする、教師-生徒蒸留に基づく制御フレームワークを提案した。
- OneVLA: 身体性タスクのための統一フレームワークVLA2026/6/1
ナビゲーションと操作を単一のフレームワークに統合したVLAモデルを提案し、タスク固有のアーキテクチャを不要にする統一アクションヘッドと多段階トレーニング戦略を導入。シミュレーションと実環境で最先端の性能を達成した。
- GeoSem-WAM: 幾何・意味を考慮した世界行動モデルVLA2026/6/1
将来のRGB予測に加えて、幾何と意味の予測を補助タスクとして導入し、ロボットの行動決定に有効な潜在表現を学習する世界モデルを提案した。
- MoSA: 運動制約付き応力適応による連続体力学の実機-シミュレーションギャップ緩和 - 残差異方性学習を通じて物理シミュレーション/ロボット操作2026/5/1
実世界の連続体の動力学を視覚観測から学習する際、等方性モデルを物理事前知識として使い、残差応力演算子を学習して軽度の異方性・不均一性を捉えることで、実機とシミュレーションのギャップをさらに縮小するフレームワークを提案した。
- AttenA+: ロボット基盤モデルにおける行動の不平等性の是正VLA2026/5/1
ロボットの軌道における速度の不均一性に着目し、速度に基づく行動注意機構で重要区間を強調して学習する、既存モデルに追加可能なフレームワークを提案した。
- ロボット操作のための効率的な視覚表現を学習する構造的潜在点視覚表現学習2026/5/1
3D認識と操作のための事前学習フレームワークを提案し、点群オートエンコーダの潜在空間に点単位の変分オートエンコーダを挿入して、暗黙的表現の表現力と明示的表現の構造的先行知識を組み合わせたハイブリッド表現「構造的潜在点」を学習する。
- RobotPan: 身体化知覚のための360度全方位ロボット視覚システム視覚システム2026/4/1
6台のカメラとLiDARを組み合わせ、ロボット周囲を360度カバーする視覚システムを構築し、リアルタイムレンダリング・再構成・ストリーミングを可能にする3Dガウシアン予測フレームワークを提案した。
- DRIFT: 拡散モデルによる軌道生成のためのルール推論軌道生成2026/3/1
移動ロボットの軌道生成において、滑らかさと終端精度のトレードオフを解決するため、GNNと時間注意機構を組み合わせた条件付き拡散モデルDRIFTを提案した。
- Heracles: 精密追従と生成的合成を橋渡しする汎用人型制御人型制御2026/3/1
人型ロボットの汎用制御において、厳密な参照追従と生成的な適応を統合する拡散モデルベースの中間層を提案し、外乱に対する頑健性と自然な回復動作を実現した。
- MeshMimic: 3Dシーン再構成による幾何学認識型ヒューマノイド動作学習ヒューマノイド/動作生成/sim2real2026/2/1
動画から3Dシーンと人間の動きを再構成し、地形との接触を保ったままヒューマノイドロボットの動作を学習させるフレームワークを提案。
- 物理情報を組み込んだ拡散Mamba Transformerによる実世界運転自動運転/軌道予測2026/2/1
拡散モデルにMambaと注意機構を組み込み、さらにポート・ハミルトン型ニューラルネットで物理制約を課すことで、自動運転の軌道予測精度と物理的妥当性を高めた研究。
- HAIC: ダイナミクス認識ワールドモデルによるヒューマノイドの俊敏な物体インタラクション制御マニピュレーション2026/2/1
固有受容感覚の履歴のみから物体の速度・加速度を予測し、動的占有マップを構築することで、スケートボードや台車の押し引きなど劣駆動物体との俊敏な全身インタラクションを実現したヒューマノイド制御フレームワーク。
- RoboStriker: 自律ヒューマノイドボクシングのための階層的意思決定ヒューマノイド制御2026/1/1
人間のモーションキャプチャからボクシングスキルを学習し、潜在空間での自己対戦強化学習により、シミュレーションと実機で競技可能なヒューマノイドボクシングを実現した。
- SwiftVLA:軽量VLAモデルのための時空間ダイナミクスを最小オーバーヘッドで解き放つVLA2025/12/1
軽量な視覚言語モデルに4D特徴を融合トークンとマスク再構成で組み込み、推論時には4D入力を不要にして高速・省メモリで高性能なVLAモデルを実現した。
- ポリシーを合成せよ!テスト時分布レベル合成による拡散・フローベースロボットポリシーの改善VLA2025/10/1
複数の事前学習済みロボットポリシーの分布スコアを凸結合しテスト時探索で合成する訓練不要手法GPCを提案し、単一ポリシーを超える性能を実現した。
- DPL: 実環境に即した深度合成とクロスアテンション地形再構成による深度のみの知覚型ヒューマノイド歩行歩行2025/10/1
ノイズの多い深度画像から地形を再構成するクロスアテンショントランスフォーマと、自己遮蔽を考慮したリアルな深度画像合成手法を組み合わせ、深度センサのみで多様な地形を歩行できるヒューマノイドの学習フレームワークを提案した。
- TopoNav: トポロジカルグラフを活用した高度な物体ナビゲーションナビゲーション2025/9/1
トポロジカルグラフを空間記憶として用いることで、長期的な物体ナビゲーションタスクにおける記憶管理と動的環境への対応を改善するフレームワークを提案。
- EgoDemoGen: ロボットマニピュレーションにおける視点汎化のための自己中心視点デモ生成マニピュレーション2025/9/1
自己中心視点が変化しても動作する模倣学習ポリシーのため、新視点での観測と行動のペアを生成するフレームワークを提案。軌道変換と条件付き動画生成を組み合わせ、シミュレーションと実機で成功率を大幅に改善した。
- PoseDiff: ロボット姿勢推定と動画から行動への制御を橋渡しする統合拡散モデルVLA2025/9/1
単一のRGB画像からロボットの3Dキーポイントや関節角度を推定し、さらに動画のキーフレームから長期行動列を生成する拡散モデルを提案。姿勢推定と逆動力学を一つの枠組みで統合した。
- LHM-Humanoid: 雑然とした環境での連続物体運搬のための長期的ヒューマンモーション制御マニピュレーション2025/8/1
物理シミュレーション上のヒューマノイドが、リセットなしで繰り返し物体を運ぶ長期的動作を実現するため、サイクル間の遷移を「回復可能性」として学習する手法を提案。
- LOVON: 脚式ロボットのためのオープン語彙物体ナビゲータナビゲーション2025/7/1
大規模言語モデルによる階層的タスク計画とオープン語彙の視覚検出を統合し、動的で非構造化環境での長距離物体ナビゲーションを実現するフレームワークを提案。
- UniTracker: ヒューマノイドロボットのための汎用全身運動トラッカー学習全身運動制御2025/7/1
3段階の学習フレームワークで、多様な人間の動きをヒューマノイドロボットが追従できる汎用全身運動トラッカーを実現し、実機でも高い性能を示した。
- ヒューマノイド占有:汎用マルチモーダル占有知覚システムの実現占有知覚2025/7/1
ヒューマノイドロボット向けに、マルチモーダル融合と時系列統合を用いた占有グリッド知覚システムを構築し、専用のパノラマ占有データセットを整備した。
- ArtVIP:ロボット学習のための視覚的リアリズム、モジュラー相互作用、物理的忠実性を備えた関節デジタルアセットsim2real2025/6/1
ロボット学習向けに、視覚的リアリズムと物理的忠実性を高めた関節物体のデジタルツインを多数収録したオープンソースデータセットArtVIPを構築し、模倣学習と強化学習で有効性を検証した。
- ロボットのための占有世界モデル世界モデル2025/5/1
屋内ロボット向けに、時空間受容野と自己回帰トランスフォーマーを組み合わせて3D占有シーンの進化を予測するRoboOccWorldを提案し、新しいベンチマークで有効性を示した。
- 全方位知覚:動的環境における脚式移動のための全方向衝突回避歩行2025/5/1
生のLiDAR点群を直接処理して3D空間認識と全方向衝突回避を実現する脚式ロボットのエンドツーエンド移動ポリシーを提案し、高忠実度LiDARシミュレータで訓練して実環境でも検証した。
- RoboOcc: ロボットのための幾何・意味シーン理解を強化する3D占有予測3D占有予測2025/4/1
3Dガウシアンの不透明度と幾何特性を活用したエンコーダで、ロボット周囲のシーンの細かい形状と意味を高精度に予測する手法を提案。
- HumanoidPano:ヒューマノイドロボットのための球面パノラマ-LiDARハイブリッドクロスモーダル知覚クロスモーダル知覚2025/3/1
パノラマ視覚とLiDARを球面ビジョントランスフォーマーで融合し、ヒューマノイドの自己遮蔽と狭視野を克服する360度BEV知覚フレームワークを提案。
- 蒸留PPO:ヒューマノイド知覚歩行のための新たな二段階強化学習フレームワーク歩行2025/3/1
完全観測MDPで教師方策を学習し、その知識で生徒方策を正則化・監督する二段階の知覚歩行フレームワークを提案した論文。
- Trinity: モジュール型ヒューマノイドロボットAIシステムヒューマノイド/VLA2025/3/1
強化学習・大規模言語モデル・視覚言語モデルを統合し、複雑な環境でヒューマノイドロボットを効率的に制御するAIシステムTrinityを提案した。
- EmbodiedVSR: 動的シーングラフ誘導による視覚空間タスクの連鎖推論VLA2025/3/1
動的シーングラフとChain-of-Thought推論を組み合わせ、微調整なしで身体性エージェントの空間推論を強化するフレームワークを提案し、新ベンチマークで有効性を示した。
- ES-Parkour: 生体模倣イベントカメラとスパイキングニューラルネットワークによる高度なロボットパルクール歩行2025/3/1
イベントカメラとスパイキングニューラルネットワーク(SNN)を組み合わせ、四足ロボットのパルクールを従来のANNベース手法より88.3%少ない消費電力で実現した研究。
- 推論時の分布レベル合成によるモダリティ合成可能な拡散ポリシーVLA2025/3/1
個別の視覚モダリティで事前学習済みの拡散ポリシーを追加学習なしに分布スコアのレベルで合成し、より表現力の高いポリシーを実現する手法を提案した。
- LiPS: 直並列構造を持つヒューマノイドロボットの大規模強化学習sim2real2025/3/1
閉ループの直並列機構をシミュレーションで直接モデル化することで、ヒューマノイドロボットの強化学習を大規模並列環境で訓練可能にする手法LiPSを提案する。
- MapNav: 注釈付きセマンティックマップによる視覚言語ナビゲーションの新たな記憶表現VLA2025/2/1
視覚言語ナビゲーションにおいて、過去の観測フレームの代わりに注釈付きセマンティックマップを構築・更新して用いることで、記憶と計算の負荷を抑えつつ最先端性能を達成した研究。
- RoboMIND:ロボットマニピュレーションのためのマルチエンボディメント知能規範データセットマニピュレーション2024/12/1
4種類のロボットによる10.7万件の模倣学習用デモンストレーション軌道と失敗例、デジタルツイン環境を提供する大規模データセットを構築し、VLAモデルの性能を評価した。
- E2H:非侵襲的脳波信号によるヒューマノイド全身制御フレームワークBCI/ヒューマノイド制御2024/10/1
非侵襲的な脳波(EEG)から動作キーワードを解読し、LLMによる動作生成と模倣制御ポリシーを組み合わせてヒューマノイドロボットを全身制御する2段階フレームワークを提案した。
- OPTIMA: 協調を考慮した自動運転車を実現するインテリジェントマルチエージェントシステム向け最適化ポリシーマルチエージェント強化学習2024/10/1
接続自動運転車の協調タスク向けに、環境との相互作用からのデータサンプリングとマルチエージェント強化学習を交互に行う分散学習フレームワークOPTIMAを提案し、安全性と効率性を両立させる。
- 多層階ゼロショット物体ナビゲーション方策ナビゲーション2024/9/1
MLLMを活用し、複数階にまたがる未知環境で対象物体を探索するゼロショット物体ナビゲーション方策を提案し、四足歩行ロボットで実環境検証も行った。
- Mambaポリシー:ハイブリッド選択的状態モデルによる効率的な3D拡散ポリシーマニピュレーション2024/9/1
拡散モデルベースの3Dマニピュレーションポリシーを、MambaとAttentionを組み合わせた軽量なXMambaブロックで置き換え、パラメータ数を80%以上削減しつつ性能を向上させた研究。
- 強化学習のためのクエリベース意味論的ガウシアンフィールドによるシーン表現シーン表現/強化学習2024/6/1
3Dガウシアンスプラッティングと階層的意味論エンコーディングを組み合わせ、強化学習エージェントのための効率的で意味情報を保持したシーン表現を学習する手法を提案。
- マルチモーダルトークンのプロンプトによるLLM活用型エンドツーエンド自動運転模倣学習の強化自動運転2024/4/1
視覚とLiDAR入力を学習可能なマルチモーダルトークンに統合し、LLMに運転モデルの誤り修正を補助させるハイブリッドなエンドツーエンド自動運転フレームワークを提案した。
- TriHelper: 動的支援によるゼロショット物体ナビゲーションナビゲーション2024/3/1
未知環境で特定物体へ向かうゼロショット物体ナビゲーションにおいて、衝突・探索・検出の課題を動的に支援する3つのヘルパーからなるフレームワークを提案し、HM3DとGibsonで既存手法を上回る性能を示した。
- Whole-body Humanoid Robot Locomotion with Human Reference2024/2/1
- Fully Spiking Neural Network for Legged Robots2023/10/1
- A Delay Compensation Framework Based on Eye-Movement for Teleoperated Ground Vehicles2023/9/1
- Prompt, Plan, Perform: LLM-based Humanoid Control via Quantized Imitation Learning2023/9/1
- UltraGlove: Hand Pose Estimation with Mems-Ultrasonic Sensors2023/6/1
- Relay Hindsight Experience Replay: Self-Guided Continual Reinforcement Learning for Sequential Object Manipulation Tasks with Sparse Rewards2022/8/1
- Dynamic Modeling of Hand-Object Interactions via Tactile Sensing2021/9/1
- Learning Cross-Domain Correspondence for Control with Dynamics Cycle-Consistency2020/12/1
- Testing the Safety of Self-driving Vehicles by Simulating Perception and Prediction2020/8/1