Zhiyuan Zhang
The Hong Kong University of Science and Technology (Guangzhou)
収録論文 35本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 動的ゲームにおける一般化ナッシュ均衡のための慣性補正ニュートン法と最適性検証マルチエージェント制御2026/9/25
動的ゲームの一般化ナッシュ均衡を求めるニュートン法に、解の最適性を検証する仕組みと慣性補正を導入し、マルチエージェント計画やミニチュアレースカー実験で有効性を示した。
- 制約付きポテンシャル外科手術を用いたゲーム理論制御ゲーム理論制御2026/9/25
制約付き一般和動的ゲームに対する高速な内点法ソルバーと、局所GNE解への収束確率を高める二次補正を提案し、数値ベンチマークとスケールカーレースで評価した。
- 力に敏感なマニピュレーションのためのカリキュラム:触覚反射制御による把持行動の形成触覚2026/9/22
触覚反射制御をデータ収集時の教師として用い、力に敏感な物体の把持を学習させる手法を提案し、その有効性を検証した。
- UniMo: 人間と動物のモーション生成を統合するフレームワークモーション生成2026/9/11
骨格の違いを点群表現に変換することで種を問わず統一的に扱えるモーション生成手法を提案し、人間と動物を合わせた大規模データセットUniML3Dも構築した。
- オンライン到達可能性を考慮したサンプリングベース動作計画動作計画2026/9/8
サンプリングベースのモデル予測制御に、オンラインで計算した到達可能集合の過大近似を用いて安全性を保証する手法を提案し、レースシミュレーションと実機で検証した。
- PHR-VLA: 視覚言語行動モデルのための計画地平推論VLA2026/8/27
将来の観測から得た潜在ダイナミクスをVLAの内部表現に整列させる補助ヘッドを導入し、接触を伴う細かい操作タスクの成功率を向上させた。
- 触覚を想像する:想像された触覚表現による触覚情報を活用した操作マニピュレーション2026/7/1
触覚センサーを使わずに、視覚と自己受容感覚から触覚観測を予測し、その予測信号で操作ポリシーを導くフレームワークTacImagを提案。シミュレーションと実世界のタスクで性能向上を確認した。
- 変換ロータリー位置埋め込み拡張拡散モデルによる制御可能なテクスチャタイリング画像生成2026/6/22
拡散トランスフォーマーを用いて、ユーザー指定のテクスチャをシーン画像に繰り返し配置する際に、周波数・向き・スケールを精密に制御しつつ、参照テクスチャの構造とシーンの照明・幾何を保つ新しいフレームワークを提案した。
- 接触豊富な操作における視覚-触覚世界モデルの重要要素:ContactWorld操作2026/6/1
接触を伴う操作タスクにおける視覚-触覚世界モデルの性能を、12種類のタスクで体系的に比較し、空間構造と時間連続性を持つ表現(特に点群と触覚力場)が計画性能を向上させることを示した。
- ReactSim-Bench: 自動運転における反応的行動ワールドモデルシミュレーションのベンチマーク自動運転/シミュレーション2026/6/1
自動運転シミュレーションのための行動ワールドモデルの反応能力を評価する新しいベンチマークを提案し、エージェントと自動運転車の制御を分離して、ログと異なる自動運転車の行動に対する反応を評価する。
- DREAM-Chunk: 潜在世界モデルによるリアクティブなアクションチャンキングVLA2026/6/1
アクションチャンキング方式のポリシーに軽量な潜在世界モデルを追加し、テスト時に複数の候補チャンクの未来を予測して最適なものを選択することで、確率的な環境下でのロバスト性を向上させる手法を提案した。
- Bench2Drive-Robust:展開時の摂動下でのクローズドループ自動運転のベンチマーク自動運転2026/5/1
実環境展開で生じるシステムレベルの摂動(カメラストリーム障害、自己位置推定誤差、計算遅延)がクローズドループのエンドツーエンド自動運転性能に与える影響を評価する、初のデバイス中心のロバストネスベンチマークを提案した。
- Bench2Drive-VL: 視覚言語モデルを用いたクローズドループ自動運転のベンチマーク自動運転2026/4/1
自動運転における視覚言語モデル(VLM)の評価を、従来のオープンループの静的QAではなく、クローズドループ環境で行うためのベンチマークを提案した論文。
- TacVLA: 接触認識型触覚融合による堅牢な視覚言語行動操作VLA/触覚/操作2026/3/1
視覚と言語に依存するVLAモデルに触覚を統合し、接触検出時のみ触覚トークンを活性化するゲーティング機構を導入して、細かい操作や視覚遮蔽下での性能を向上させた。
- EquiBim: 両腕操作のための対称性等変ポリシー学習両腕操作2026/3/1
両腕ロボットの対称性を活用し、観測と行動の間に両側等変性を課すポリシー学習フレームワークを提案。シミュレーションと実機で性能を検証した。
- 接触認識型タクタイル学習によるロボット分解作業触覚/分解作業2026/3/1
ロボット分解作業における触覚センシングの役割を、シミュレーションと実世界の両方で体系的に調査し、力場表現の触覚情報が視覚のみやRGB触覚画像よりも高い成功率を示すことを明らかにした。
- EquiForm: 3D点群からのノイズに頑健なSE(3)同変方策学習マニピュレーション2026/1/1
点群ノイズによる同変性の崩れを幾何デノイジングと同変コントラスト整合で補正し、ノイズに頑健なSE(3)同変マニピュレーション方策を学習する手法を提案。
- Gemini Robotics 1.5:高度な身体性推論・思考・動作転移で汎用ロボットの最前線を押し広げるVLA2025/10/1
異種ロボットデータから学ぶ動作転移機構と自然言語での多段階推論を組み合わせたVLAモデルと、身体性推論に特化したモデルを発表し、複雑な多段階タスクの実行と解釈性を向上させた。
- 晴天から雪天への教師なしLiDARオドメトリモデルの汎化LiDARオドメトリ/悪天候ロバスト性2025/9/1
雪などの悪天候下でのLiDARオドメトリの性能低下を解決するため、パッチ内の点の分散を評価するPSMと適応的な点重みを予測するPPWPを導入し、晴天データのみで学習して雪天や動的環境でも頑健に動作する教師なしモデルを提案した。
- 深層LiDARオドメトリのための効率的なアクティブ訓練LiDARオドメトリ2025/9/1
多様な環境に適応するLiDARオドメトリモデルを効率的に訓練するため、初期訓練セット選択とアクティブ増分選択を組み合わせたアクティブ訓練フレームワークを提案し、全データセットの52%のシーケンスで同等の性能を達成した。
- ロボット知覚のためのスーパーLiDAR強度LiDAR知覚2025/8/1
低コストLiDARの疎なスキャンデータから、非反復走査LiDARの特性を活かして高密度な強度画像を生成するフレームワークを提案し、ループ閉じ込めや車線検出などへの応用を示した。
- ControlVLA: 事前学習済み視覚言語行動モデルのための少数ショット物体中心適応VLA2025/6/1
ControlNet風のアーキテクチャで物体中心表現を導入し、10〜20回のデモンストレーションだけで多様な実世界操作タスクに適応できるフレームワークを提案。
- ExoGait-MS:マルチスケールグラフネットワークによる外骨格歩行認識のための周期ダイナミクス学習歩行認識2025/5/1
外骨格ロボットの個別化歩行制御に向け、関節協調を捉えるマルチスケールGCNと歩行の非線形周期ダイナミクス学習を組み合わせ、個人歩行を高精度に認識する手法を提案した。
- ManiFeel: 視触覚マニピュレーション方策学習のベンチマークと理解視触覚マニピュレーション2025/5/1
接触が多い・視覚的に難しい操作タスク向けに、視触覚方策学習を体系的に評価できる再現可能なシミュレーションベンチマークManiFeelを提案し、触覚が方策性能をどう高めるかを実験的に示した。
- 正準ポリシー:SE(3)同変ポリシーのための正準3D表現学習模倣学習2025/5/1
3D点群を正準表現にまとめることで、物体・配置・視点の変化に強いSE(3)同変な模倣学習ポリシーを実現した研究。
- RoboAct-CLIP: ロボティクス向け原子行動理解のための動画駆動型事前学習VLA2025/4/1
ロボット動画を原子行動単位で再注釈したデータセットと、CLIPを時間的に脱結合する微調整戦略により、ロボット操作に重要な時系列行動意味を学習する手法を提案。
- OSM誘導自律ナビゲーションのための方位場学習自律ナビゲーション2025/3/1
LiDARスキャンとOSM経路を統合し、ノイズや遮蔽に頑健な方位場(OrField)を学習して、OSM誘導の軌道計画を高精度化する二段階フレームワークを提案した。
- DriveTransformer:スケーラブルなエンドツーエンド自動運転のための統合トランスフォーマー自動運転2025/3/1
知覚・予測・計画を並列に統合し、スパース表現とストリーミング処理で累積誤差と計算負荷を抑えたエンドツーエンド自動運転フレームワークを提案。
- 3Dダイナミクスを考慮したマニピュレーション:操作ポリシーに3D先見性を与えるマニピュレーション2025/2/1
3D世界モデリングとポリシー学習を統合し、深度推定・未来RGB-D予測・3Dフロー予測の自己教師あり学習で操作ポリシーに3D先見性を持たせ、性能を向上させた。
- Bench2Drive-R: 生成モデルによる実世界データを反応型閉ループ自動運転ベンチマークへ変換自動運転2024/12/1
生成モデルを用いて実世界データから反応型の閉ループ自動運転評価ベンチマークを構築するフレームワークを提案。
- 残差降下微分動的ゲーム(RD3G):制約付き一般和ゲームのための高速ニュートン解法ゲーム理論/マルチエージェント制御2024/9/1
制約付きマルチエージェントゲーム制御問題に対して、局所ナッシュ均衡を求めるニュートン法ベースの高速解法を提案し、既存手法より計算効率が良いことを示した。
- Bench2Drive: 閉ループ自動運転のマルチ能力ベンチマークに向けて自動運転ベンチマーク2024/6/1
CARLA v2上で44の対話シナリオ・23の天候・12の町から収集した200万フレームのデータと閉ループ評価プロトコルを提供し、エンドツーエンド自動運転の多様な能力を公平に評価する初のベンチマークを提案した。
- GPT-4Vを用いた閉ループ型オープンボキャブラリ移動マニピュレーションVLA2024/4/1
GPT-4Vを活用し、未知環境での物体探索と操作を閉ループで行うロボットシステムを提案。実世界の8タスクで成功率を約35%向上させた。
- Risk-Aware Model Predictive Path Integral Control Using Conditional Value-at-Risk2022/9/1
- Trajectory Distribution Control for Model Predictive Path Integral Control using Covariance Steering2021/9/1