Fan Zhang
CUHK
収録論文 43本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- FutureWorlds: 代替未来からロボット世界モデルを学習する世界モデル2026/10/1
マルチモーダル離散自己回帰モデルと多様性ビーム探索、候補ごとの記憶保持、MemSPO最適化を組み合わせ、ロボットの行動条件付き未来予測を高精度化する枠組みを提案。
- TrackEverything: 3Dシーン表現の重複排除による長距離高密度トラッキング3Dトラッキング2026/9/24
動画を3Dシーンの持続的なトラックとして表現し、重複排除により1000フレーム超の動画でも全可視点を追跡可能にした3Dポイントトラッカー。
- MIRA: 身体性を備えたコンパニオン向けリアルタイム全二重ヒューマンロボットインタラクションヒューマンロボットインタラクション2026/9/21
ストリーミング音声から応答と身体動作を同時生成し、割り込み可能な動作をリアルタイムで実行する全二重対話フレームワークを提案し、ヒューマノイドロボットに実装した。
- PackLab: ロボットビンパッキングのためのMLLM開発・訓練・評価フレームワークマニピュレーション2026/9/20
物理シミュレータ・専用MLLM・ベンチマークを統合し、閉ループで物体選択と配置を予測するロボットビンパッキング用フレームワークを提案。従来のヒューリスティクスや強化学習、汎用MLLMを上回る性能を示した。
- RobotEQ-Video:世界状態タクソノミーを用いた社会的前向き知能の動画中心ベンチマーク社会的前向き知能/動画ベンチマーク2026/9/18
動画から人間の状態やニーズを推論し、社会的に適切な先回り支援を行う「社会的前向き知能」を評価するため、4階層の世界状態タクソノミーに基づく2K以上の動画ベンチマークを構築した。
- 信頼性の高い双腕手術サブタスク操作のための軌道発散ホライズン決定手術ロボティクス2026/8/1
手術用VLAモデルの固定長オープンループ動作による累積誤差を軽減するため、軌道発散に基づく適応的実行ホライズン決定手法を提案し、実機で検証した。
- 共形外乱境界を備えたロバストな動作空間制御による安全な冗長マニピュレーションマニピュレーション2026/7/1
冗長マニピュレータの動作空間制御において、拡張状態オブザーバと共形予測を組み合わせ、不確実性下でも安全かつ高精度な追従を実現するロバスト制御手法を提案した。
- Neural-ESO: 証明可能なロバスト学習ベース制御のための二経路アーキテクチャ制御2026/7/1
ニューラルネットワークによる予測経路と従来の拡張状態オブザーバによる補正経路を組み合わせた外乱抑制フレームワークを提案し、リプシッツ制約により閉ループ誤差の一様有界性を保証。クアッドローター着陸タスクで有効性を検証した。
- LabGuard: 実験室エージェントのための自然言語ルールを実行時ガードに変換する基盤安全性/実行時監視2026/6/30
実験室の安全ルールなどの自然言語を実行可能な仕様に変換し、実行時モニタとして適用する安全スイートLabGuardを提案。未見ルールへの汎化や不安全イベント削減効果を実証した。
- モデルはすでに知っている:視覚言語行動モデルのための注意誘導型安全フィルタ安全フィルタ2026/6/8
VLAモデルの注意ヘッドを利用して、各ステップで操作対象を特定し、残りを障害物として扱うCBFフィルタを構築。動的障害物を含む環境で安全性能を向上させた。
- InstantRetouch: バイラテラル空間による効率的で忠実度の高い指示追従画像レタッチ画像編集2026/6/3
言語指示による画像レタッチを、拡散モデルの反復生成ではなくバイラテラルグリッド操作で実現し、忠実度と効率を両立した手法を提案。
- ProbeAct: プローブ誘導による訓練不要の視覚言語行動モデル障害回復VLA/操作2026/6/1
視覚言語行動モデル(VLA)の失敗を検出・回復する訓練不要の介入フレームワークを提案。隠れ状態プローブと運動状態機械、制御障壁関数フィルタを組み合わせ、追加学習なしで成功率を向上させる。
- 物理ガイドによる非構造環境での任意測定経路に沿ったロボット放射線源位置推定放射線源位置推定2026/6/1
未知環境で測定経路に依存せず、物理情報機械学習モデルを用いて放射線源の位置を高精度に推定するロボット自動化フレームワークを提案。シミュレーションと実機実験で有効性を検証した。
- Koopmanグラフによるテザー宇宙システムのデータ駆動モデリングと制御宇宙システム/モデル予測制御2026/6/1
テザーや宇宙ネットのような柔軟構造を持つ宇宙システムの高次元・非線形な動力学を、Koopman作用素とグラフニューラルネットワークを統合したフレームワークで学習し、モデル予測制御を実現する。小型構成で学習したモデルが未学習の大型スケールへ転移可能であることを示した。
- RoboAlign-R1: ロボットビデオ世界モデルのための蒸留型マルチモーダル報酬アライメントビデオ世界モデル2026/5/1
ロボットビデオ世界モデルの訓練を、再構成損失などの低レベル目的ではなく、指示追従や操作成功などの意思決定に重要な能力に合わせるため、報酬アライメントと長期推論安定化を組み合わせたフレームワークを提案した。
- RobotEQ: 具身AIにおける受動的知能から能動的知能への移行具身AI/ベンチマーク2026/5/1
ロボットが明示的な指示なしに社会的規範を理解し遵守できるかを評価する、能動的知能のための最初のベンチマークRobotEQを提案した論文。
- RAE-NWM: 高密度視覚表現空間におけるナビゲーションワールドモデルナビゲーション2026/3/1
高密度なDINOv2特徴空間でナビゲーションの状態遷移をモデル化するワールドモデルを提案し、構造安定性と行動精度を向上させた。
- MERGE: 人間とロボットの相互作用におけるマルチアクターイベント推論とグラウンディングのための誘導型視覚言語モデルHRI/視覚言語モデル2026/3/1
動的な人間とロボットのグループ相互作用において、アクター、物体、イベントを状況に応じてグラウンディングするシステムMERGEを提案。軽量な知覚パイプラインでVLMを選択的に呼び出し、効率と推論能力を両立し、新規データセットで性能を向上させた。
- GeoLanG: 幾何学認識と統合RGB-Dマルチモーダル学習による言語誘導把持マニピュレーション2026/2/1
CLIPを基盤に視覚と言語を統合し、深度情報を幾何学的事前知識として活用することで、雑然とした環境でも言語指示に基づく把持を実現するエンドツーエンド手法を提案。
- iFANエコシステム:先進原子力シミュレーションと運用のための統合AI・デジタルツイン・サイバーフィジカルセキュリティ・ロボティクス環境デジタルツイン2026/1/1
原子力施設のデジタル変革に向け、AI・デジタルツイン・サイバーフィジカルセキュリティ・ロボティクスを統合した高忠実度仮想テストベッド「iFANエコシステム」を開発し、その応用シナリオを検討した。
- 音の世界モデルからロボットマニピュレーションを学習するマニピュレーション2025/12/1
将来の音観測を生成的に予測する潜在フローマッチングモデルを提案し、ロボット方策に統合することで、音の時間的変化を要するマニピュレーションタスクの性能を向上させた。
- 閉アーキテクチャロボットのための外乱対応安全運動制御の統合マニピュレーション2025/12/1
内部トルク制御が変更できない産業用マニピュレータに対し、外乱抑制とロバスト制御バリア関数を組み合わせた外付け制御を開発し、高精度追従と安全性を実現した。
- CUS-GS: マルチモーダルシーン表現のためのコンパクト統合構造化ガウシアンスプラッティングフレームワーク3Dシーン表現2025/11/1
複数の基盤モデルから得たマルチモーダル特徴をボクセルアンカー構造に統合し、外観・幾何・意味を一貫して表現する軽量な3Dガウシアンスプラッティング手法を提案。
- 計画としての時空間予測:生成的世界モデルを用いたモデルベース強化学習アプローチモデルベース強化学習2025/10/5
時空間予測をモデルベース強化学習の問題として捉え、生成的世界モデルとビーム探索による計画で非微分な評価指標を報酬として活用し、極端事象の捕捉精度を高める手法を提案した。
- Aria Gen 2 パイロットデータセット一人称視点データセット2025/10/1
最新のAria Gen 2グラスで収録した一人称視点多感覚オープンデータセットを段階的に公開し、日常活動における装着者・環境・相互作用の知覚性能を示す。
- 混合現実での人間のデモンストレーションから学習したリアルタイムなロボット感情表現の生成感情表現2025/8/1
混合現実空間で人間の表情や動きをロボットにマッピングし、フローマッチングで多様な感情表現をリアルタイム生成する枠組みを提案。
- Assistax: 支援ロボティクス向けマルチエージェント・ハードウェア加速強化学習ベンチマークマルチエージェント強化学習2025/7/1
JAXとMuJoCo-MJX上でGPU加速された支援ロボティクスタスク群を提供し、人間役のヒューマノイドエージェントとロボットをマルチエージェント強化学習で共訓練できるベンチマークを構築した。
- 未知外乱下での安定飛行のための微分可能物理情報適応Koopman制御制御/適応制御2025/6/1
名目物理モデルとKoopman演算子の学習を組み合わせ、外乱の時間発展を予測して先回り補償する適応制御フレームワークを提案し、未知外乱下での安定飛行を実現した。
- CARMA: 視覚言語モデルと物体・行動認識を組み合わせた人間-ロボット群集団インタラクションの状況認識状況認識2025/6/1
複数人とロボットの協調作業において、視覚言語モデルと物体・行動認識を統合し、行為者・物体・行動の三つ組を生成することで状況認識を実現するシステムを提案。
- 共創の振付:協調的なダンス即興におけるロボットアームの動きの設計と振付人間ロボット協調2025/5/1
ダンサーがロボットアームと即興で踊るワークショップを行い、1対1では流動的な動きと一体感が生まれ、3対1では注意が分散しロボットが背景化することを明らかにした。
- 条件付き拡散ポリシーの合成とガイド付きサンプリング模倣学習2025/3/1
模倣学習において、失敗した行動を避けるようにサンプリング分布を改良し、拡散モデルの分解により長期的な失敗回復を可能にする手法を提案。
- 非同期イベント慣性オドメトリのための連続時間ガウス過程事前最適化VIO/イベントカメラ2024/12/1
イベントカメラとIMUの非同期融合のため、時間ガウス過程に基づく連続時間プリインテグレーション手法GPOを提案し、高精度・高効率なオドメトリを実現した。
- 統一ガウス過程回帰による非同期イベント慣性オドメトリオドメトリ2024/12/1
イベントカメラとIMUの非同期データを統一ガウス過程回帰フレームワークで融合し、SE(3)軌道を推定する手法を提案した論文。
- HOT3D: 一人称マルチビュー動画による3D手・物体トラッキングデータセット一人称視点/3Dトラッキング2024/11/1
MetaのAIグラスとVRヘッドセットで撮影した一人称マルチビュー動画からなる大規模データセットを構築し、3D手追跡・物体姿勢推定・未知物体の3D復元で単一視点手法を大きく上回る性能を示した。
- AsynEIO: ガウス過程回帰を用いた非同期単眼イベント慣性オドメトリオドメトリ2024/11/1
イベントカメラと慣性センサの非同期データをガウス過程回帰の枠組みで統合し、高速移動や低照度環境での自己位置推定精度を向上させる手法を提案した。
- iFANnpp: ロボットと自律知能のための原子力発電所デジタルツインsim2real2024/10/1
原子力発電所全体をUnreal Engine 5でモデル化し、高忠実度の加圧水型原子炉シミュレータと統合したデジタルツインを構築。ロボットアルゴリズムの研究開発を支援する。
- 吊り下げペイロードを伴う飛行制御のためのニューラル予測器飛行制御2024/10/1
吊り下げペイロードによる力・トルクと残差ダイナミクスを学習ベースでモデル化し、第一原理モデルと組み合わせてMPCに統合することで、飛行制御の閉ループ性能を向上させた。
- フローマッチングを用いたアフォーダンスベースのロボットマニピュレーションマニピュレーション2024/9/1
視覚モデルにプロンプトチューニングを適用してアフォーダンスを予測し、フローマッチングでロボットの行動軌跡を学習する枠組みを提案。日常生活タスクの実世界データセットで評価した。
- DiM-Gesture: 適応的層正規化Mamba-2フレームワークによる音声連動ジェスチャー生成ジェスチャー生成2024/8/1
生の音声から個人に合わせた3D全身ジェスチャーを生成するため、Mambaベースの特徴抽出器とAdaLN Mamba-2拡散モデルを組み合わせたDiM-Gesturesを提案し、Transformerより高速・省メモリで高品質な生成を実現した。
- QUADFormer: クアッドロータUAVにおけるサイバー攻撃の学習ベース検出UAVセキュリティ2024/6/1
トランスフォーマーを用いてクアッドロータUAVへのサイバー攻撃を検出するフレームワークを提案し、実世界実験で従来手法を上回る検出性能を示した。
- MINER-RRT*: 3次元混雑環境における階層的で高速な軌道計画フレームワーク軌道計画2024/6/1
ニューラルネットでRRT*の探索を加速し、微分平坦性に基づく多段多項式軌道生成を組み合わせることで、3次元混雑環境で高速かつ高品質なドローン軌道計画を実現した。
- Data-Driven Optimal Control of Tethered Space Robot Deployment with Learning Based Koopman Operator2023/7/1
- Formal Verification of Robustness and Resilience of Learning-Enabled State Estimation Systems2020/10/1