Chi Zhang
Institute of Artificial Intelligence (TeleAI), China Telecom
収録論文 44本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 相互作用剛性に基づく動的運動プリミティブの基底配置による効率的なスキル転移スキル転移2026/10/1
ロボットのスキル学習において、相互作用剛性と軌道一貫性から段階的重要度を推定し、その重要度に応じて動的運動プリミティブの基底配置を適応的に再分配する手法を提案した。
- FutureDuet: 未来予測監督における観測アクセスの分離VLA2026/9/28
ロボットの行動生成において、メインカメラと手首カメラで異なる未来予測目標を与えることで、精密な操作タスクの成功率を向上させた研究。
- TourPhysics: 物理を世界モデルに導入し、単一画像からの探索と操作を実現世界モデル2026/9/4
単一画像と物理設定から初期化し、シミュレーションとビデオ生成を組み合わせて、長期的な物理的一貫性を保ちながら探索と操作を行うオンラインフレームワークを提案する。
- ロボット操作のための軌道レベル連続行動表現マニピュレーション2026/8/25
制御周波数に依存せず、固定時間間隔の行動軌跡を連続潜在トークンで表現する新しい行動表現フレームワークCATを提案し、LIBEROや実機の長期的操作タスクで既存手法より高い成功率を達成した。
- WNM-3D: 3Dシーン条件付けによるクローズドループVLNのための世界ナビゲーションモデルVLA/ナビゲーション2026/8/7
連続的な視覚言語ナビゲーション(VLN)のための生成的世界行動モデルを提案し、3Dシーン表現を条件として将来の視覚と行動を同時生成することで、クローズドループのナビゲーション性能を向上させた。
- InteracVid: ライブチャット動画から構築した実インタラクティブ音声視覚応答データセットデータセット2026/8/2
ライブ配信動画から、外部刺激に対する実際のインタラクティブな音声・視覚応答を抽出した大規模データセットを構築し、マルチモーダルAIの応答生成性能を向上させた。
- CineWeaver: トレーニング不要で参照制御可能なマルチショット長編映像生成による映画的ストーリーテリング映像生成2026/7/29
事前学習済みの動画拡散モデルを用いて、再学習なしで複数ショットからなる長編映像を生成する統一フレームワークを提案。位置エンコーディングとアテンション操作で時間的連続性を断ち、ショットごとの参照制御と長期記憶機構を導入した。
- 世界行動モデルから具現化された脳へ:オープンワールド物理知能へのロードマップVLA2026/7/1
本論文は、物理世界で推論・行動できる汎用AIの実現に向けて、世界行動モデル(WAM)の進化を概観し、モデル役割・標準化・システム構成の3つのギャップを整理した上で、具現化された脳を中心とした共進化ロードマップを提案している。
- EDAR: ロボット操作のための環境依存行動表現の学習マニピュレーション2026/7/1
ロボット操作において、行動トークンを実行可能な制御構造と環境条件付きの視覚的結果に基づいて表現する手法を提案し、長期的な操作タスクでのポリシー学習を改善した。
- 器用なロボット操作のための人間中心の転移可能な触覚事前学習触覚/操作2026/7/1
人間の触覚データを大規模に収集し、ロボット操作のための触覚事前学習手法を提案した論文。
- GN0: 視覚言語ナビゲーションにおける生成・評価・方策学習の統一的パラダイムに向けてナビゲーション2026/6/1
大規模データセットと高忠実度シミュレータを構築し、RL駆動のナビゲーション基盤モデルを提案して、視覚言語ナビゲーションの性能を向上させた。
- PhysOmni: 単一画像からの物理基盤マルチオブジェクトシーン生成とリアルタイムインタラクションシーン生成2026/5/19
単一画像から物理的に一貫性のある3Dシーンを再構成し、リアルタイムで操作可能なビデオを生成するトレーニング不要のフレームワークを提案。
- PRTS: 対比表現を用いたプリミティブ推論とタスク実行システムVLA2026/4/1
視覚言語行動モデルを、教師あり模倣学習ではなく目標条件付き強化学習として再構成し、言語指示を目標として扱うことで、物理的な到達可能性を評価する統一埋め込み空間を学習する基盤モデルを提案した。
- VTouch++: バイマニュアル操作のための視覚ベース触覚拡張を備えたマルチモーダルデータセットデータセット/触覚/バイマニュアル操作2026/4/1
両手操作の接触を伴うタスクを改善するため、視覚ベースの触覚センシングを用いた大規模マルチモーダルデータセットVTOUCHを構築し、その有効性を実験と実ロボット評価で示した。
- QuietWalk: 接地反力を考慮した多様な履物条件下での人型ロボット歩行のための物理情報強化学習歩行2026/4/1
物理情報強化学習を用いて、接地反力を推定し、歩行時の衝撃力を抑えることで、様々な履物条件下で静かで安定した人型ロボットの歩行を実現した。
- 対称性を考慮した異種グラフニューラルネットワークによるテンセグリティロボットの端部-地面接触推定状態推定2026/3/1
テンセグリティロボットの接触状態を、専用センサーを使わずIMUとケーブル長の履歴から推定する対称性考慮の異種グラフニューラルネットワークを提案し、接触支援InEKFと統合して姿勢推定精度を向上させた。
- ロバストで汎化可能なヒューマノイド動作追従ヒューマノイド制御2026/1/1
因果的時系列エンコーダとマルチヘッドクロスアテンションで動力学に応じて参照動作を集約し、転倒回復カリキュラムを組み合わせることで、少ないデータで汎化・ロバストなヒューマノイド全身制御を実現した。
- RoboSenseチャレンジ:あらゆる環境を認識し、どこへでも移動し、プラットフォームを超えて適応するロボット知覚ベンチマーク2026/1/1
ロボット知覚の堅牢性と適応性を競うRoboSense 2025チャレンジの報告で、5つのタスクのベンチマークと23の受賞解法から得られた知見をまとめた。
- Being-H0.5: 人間中心のロボット学習をスケールさせ、異なる身体間の汎化を実現VLA2026/1/1
人間の動作データを共通言語として扱い、35,000時間超・30種のロボット身体のデータで学習するVLA基盤モデルを提案し、異なる身体間での汎化性能を大幅に向上させた。
- UniTacHand:人間からロボットハンドへの触覚スキル転移のための統合時空間触覚表現触覚2025/12/1
触覚グローブで収集した人間の操作データを、MANOハンドモデルの2D表面上でロボットハンドの触覚情報と統合し、コントラスト学習で潜在空間を揃えることで、ゼロショットでの触覚ベース方策転移を実現した研究。
- テンセグリティロボットの移動のための形態認識グラフ強化学習歩行2025/10/1
テンセグリティロボットの物理トポロジーをグラフで表現し、GNNをSACに統合した強化学習フレームワークを提案。シミュレーションから実機への直接転移を実現した。
- 不確実性推定の統合による信頼性の高いLLMベースのロボットプランニングVLA2025/10/1
LLMによるロボットプランニングの不確実性を認識論的不確実性と内在的不確実性に分解し、さらにタスクの明確さと馴染み深さに細分して推定する手法CUREを提案し、キッチン操作と卓上整理の実験で実行結果との整合性が向上することを示した。
- SPOT: 障害物脅威モデリングによるセンシング拡張軌道計画経路計画2025/10/1
単一深度カメラ搭載UAVの動的障害物回避のため、ガウス過程による障害物信念マップと観測緊急度マップを統合し、10ms未満で観測を考慮した軌道計画を実現した手法。
- Align-Then-stEer:統一潜在ガイダンスによる視覚-言語-行動モデルの適応VLA2025/9/1
VLAモデルを下流タスクに適応させる際、事前学習との行動分布のずれを統一潜在空間でのアライメントと生成過程のガイダンスで解消し、少ないデータで効率的に微調整する手法を提案。
- 拡張現実で強化したロボット遠隔操作によるユーザーデモンストレーション収集遠隔操作2025/9/1
ARと点群レンダリングを組み合わせた遠隔操作システムを提案し、ABBの産業用・協働ロボットで実証。点群表示により作業精度が28%、SUSスコアが12%向上した。
- Astra:階層型マルチモーダル学習による汎用移動ロボットの実現移動ロボットナビゲーション2025/6/1
マルチモーダルLLMとマルチタスクネットワークを組み合わせた二重モデルアーキテクチャにより、多様な屋内環境で移動ロボットのナビゲーションを実現した。
- Skill-Nav: ウェイポイントインターフェースによる多様な四足歩行を統合したナビゲーション歩行2025/6/1
四足ロボットの歩行スキルをウェイポイントを介して階層的ナビゲーションに統合し、障害物を避けながら目標地点へ自律移動できるようにした研究。
- RoboRefer: ロボティクス向け視覚言語モデルにおける推論を伴う空間指示VLA2025/6/1
3D空間理解と多段階推論を可能にする視覚言語モデルRoboReferを提案し、大規模データセットRefSpatialとベンチマークRefSpatial-Benchを導入して、空間指示タスクで最先端性能を達成した。
- フローベース動画予測による汎用両腕基盤ポリシー両腕マニピュレーション2025/5/1
テキストからフロー、フローから動画への2段階ファインチューニングで動画予測を行い、軽量拡散ポリシーで両腕ロボットの行動を生成する基盤ポリシーを提案。
- 上半身と下半身の敵対的学習によるヒューマノイドの全身運動制御歩行2025/4/1
上半身と下半身のポリシーを敵対的に学習させ、歩行と動作模倣を両立する全身制御フレームワークALMIを提案し、実機ヒューマノイドで検証した。
- AgiBot World Colosseo:スケーラブルで知能的な身体性システムのための大規模マニピュレーションプラットフォームマニピュレーション2025/3/1
100万以上の軌道と217タスクを含む大規模ロボット操作データセットと、潜在行動表現を活用した汎用方策GO-1を提案し、データ規模の拡大に伴う性能向上と実世界での巧みな長期的タスクの成功率向上を示した。
- POEX:LLMベースロボットに対するポリシー実行可能なジェイルブレイク攻撃ロボットセキュリティ2024/12/1
LLMベースロボットへのジェイルブレイク攻撃の適用可能性を検討し、実行可能な有害ポリシーを生成する攻撃フレームワークPOEXを提案した。
- StreamMOTP: 3D多物体追跡と軌道予測を統合するストリーミングフレームワーク追跡・予測2024/6/1
自動運転における3D多物体追跡と軌道予測を、メモリバンクと相対時空間位置エンコーディング、デュアルストリーム予測器を用いてストリーミング形式で統合するフレームワークを提案し、nuScenesで有効性を示した。
- RoboDriveチャレンジ:あらゆる条件でいつでもどこでも走行する自動運転知覚2024/5/1
悪天候やセンサ故障など想定外の状況でも頑健に知覚できる自動運転技術を競う2024年RoboDriveチャレンジの報告で、BEV検出や地図セグメンテーションなど4タスクで140チームが参加した。
- FipTR: 自動運転における将来インスタンス予測のためのシンプルで効果的なTransformerフレームワーク自動運転/予測2024/4/1
BEV視点での将来インスタンス予測を、インスタンスクエリとフロー考慮型BEV予測器を用いたエンドツーエンドのTransformerで実現し、複雑な後処理を不要にした。
- SubjectDrive: 被写体制御による自動運転向け生成データのスケーリング自動運転/生成データ2024/3/1
被写体を制御できる生成モデルを開発し、多様な生成データを大量に作ることで自動運転の認識モデルの性能を継続的に向上させられることを示した。
- Solving the swing-up and balance task for the Acrobot and Pendubot with SAC2023/12/1
- I-PHYRE: Interactive Physical Reasoning2023/12/1
- ADriver-I: A General World Model for Autonomous Driving2023/11/1
- MacFormer: Map-Agent Coupled Transformer for Real-time and Robust Trajectory Prediction2023/8/1
- Learning the Pedestrian-Vehicle Interaction for Pedestrian Trajectory Prediction2022/2/1
- Congestion-aware Multi-agent Trajectory Prediction for Collision Avoidance2021/3/1
- Learning Safe Unlabeled Multi-Robot Planning with Motion Constraints2019/7/1
- Learning Unmanned Aerial Vehicle Control for Autonomous Target Following2017/9/1