Zixuan Chen
Nanjing University
収録論文 27本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 行動識別型ワールドモデルによる反事実モデル予測制御モデルベース制御/ワールドモデル2026/9/24
計画時に候補行動を区別できるよう、逆動力学と行動復元正則化を組み込んだワールドモデルAD-WMを提案し、MPCの成功率と実機ゼロショット転移を改善した。
- 群衆ロボットナビゲーションのための社会的選好学習ナビゲーション2026/7/1
オフライン強化学習を用いた群衆ロボットナビゲーションにおいて、詳細な報酬設計を不要にする社会的選好学習アルゴリズムを提案し、シミュレーションと実機で有効性を検証した。
- Wh0: 生成的世界モデルによるスケーラブルな自己中心視点の人間手操作データ生成VLA/データ生成2026/6/1
生成ビデオ世界モデルを用いて、ロボット学習に使える自己中心視点の人間手操作ビデオデータを大量生成し、実ロボットデータと組み合わせて器用な操作VLAモデルの性能を大幅に向上させる手法を提案した。
- Uni-LaViRA: 言語・視覚・ロボット行動の翻訳による統合具現化ナビゲーションナビゲーション2026/5/1
ナビゲーションの意思決定構造を言語と視覚の行動出力に分解し、事前学習済みMLLMを活用してゼロショットで4つのタスクと4種類のロボットに適用する統合エージェントアーキテクチャを提案した。
- V-Dreamer: ビデオ生成事前知識によるロボットシミュレーションと軌道合成の自動化シミュレーション/データ生成2026/3/1
自然言語の指示から、シミュレーション可能な3D環境と実行可能なロボット軌道を自動生成するフレームワークを提案。ビデオ生成モデルを動作の事前知識として活用し、シミュレーションから実世界への転移を実現した。
- RoTri-Diff: 空間的なロボット-物体三者間相互作用に基づく両腕操作のための拡散モデル両腕操作/拡散モデル/模倣学習2026/3/1
両腕と操作対象物の間の相対的な6D姿勢を符号化した三者間相互作用表現を導入し、階層的拡散過程で軌道生成する模倣学習フレームワークを提案。シミュレーションと実機で高い性能を実証した。
- MoMaStage: スキル状態グラフによる計画と閉ループ実行を統合した長期的屋内移動操作移動操作2026/3/1
屋内移動操作ロボット向けに、明示的なシーン地図を使わず、階層スキルライブラリとトポロジー認識スキル状態グラフでVLMの計画を制約し、閉ループ実行で堅牢性を高めるフレームワークを提案した。
- AdaClearGrasp: 密集環境でのロバストなゼロショット器用把持のための適応的クリアリング学習マニピュレーション2026/3/1
密集環境での器用な把持を実現するため、視覚言語モデルを用いて直接把持するか周囲をクリアするかを適応的に決定する閉ループ意思決定・実行フレームワークを提案した。
- ST-VLA: 汎用ロボット操作のための4D認識時空間理解の実現VLA/操作2026/3/1
ロボット操作のための階層型VLAフレームワークST-VLAを提案し、3D-4D表現で知覚と行動を橋渡し、大規模データセットST-Humanで訓練した。RLBenchと実世界で成功率を大幅に向上させた。
- INHerit-SG: 増分階層型セマンティックシーングラフとRAG型検索シーングラフ2026/2/1
ロボットナビゲーション向けに、3D環境を非同期の二重ストリームで階層的なセマンティックシーングラフとして構築し、LLMとトポロジーを組み合わせた検索で複雑な embodied クエリに応答するシステムを提案。
- ManiLong-Shot: 長期的操作のためのインタラクション認識ワンショット模倣学習模倣学習2025/12/1
物理的インタラクションイベントに基づいて長期的タスクをプリミティブに分解し、VLMやルールベースの推論でワンショット模倣学習を実現するフレームワークを提案。
- LISN: VLMベース制御器調整による言語指示型ソーシャルナビゲーションソーシャルナビゲーション2025/12/1
言語指示に従い社会的規範を守るソーシャルナビゲーションのベンチマークLISN-Benchを構築し、VLMがコストマップと制御パラメータを調整する階層型手法を提案した。
- AdaptPNP: 把持・非把持スキルを統合した適応的ロボットマニピュレーションマニピュレーション2025/11/1
VLMを用いて把持と非把持(押す・つつく等)の動作を組み合わせた計画を生成し、デジタルツインで予測しながら実環境でも適応的に再計画するマニピュレーション枠組みを提案した論文。
- RoboHiMan: 長期的マニピュレーションにおける構成的一般化のための階層的評価パラダイムマニピュレーション2025/10/1
長期的なマニピュレーションタスクにおけるスキル構成の一般化を評価するため、多様な摂動下での原子タスクと構成タスクのベンチマークHiMan-Benchと3つの評価パラダイムを提案し、代表的なモデル・アーキテクチャの能力ギャップを明らかにした。
- LaViRA: 連続環境におけるゼロショット視覚言語ナビゲーションのための言語・視覚・ロボット行動翻訳ナビゲーション2025/10/1
自然言語指示に基づき未学習の連続環境をナビゲートするゼロショット手法。行動を言語・視覚・ロボットの3階層に分解し、各段階で異なる規模のマルチモーダル大規模言語モデルを活用することで、汎化性能と実機制御の効率を両立した。
- GMT: ヒューマノイド全身制御のための汎用動作追従全身制御2025/6/1
多様な全身動作を実世界で追従できるよう、適応的サンプリングと動作Mixture-of-Expertsを組み合わせた単一の汎用方策を学習するフレームワークを提案。
- DeCo: 長期的3Dマニピュレーションにおけるゼロショット汎化のためのタスク分解とスキル合成マニピュレーション2025/5/1
模倣学習のデモを把持物体の相互作用に基づいて原子タスクに分解し、VLMで指示を解析してスキルを動的に組み合わせることで、未見の長期的3D操作タスクへのゼロショット汎化を実現するフレームワーク。
- TWIST: 遠隔操作による全身模倣システム全身遠隔操作2025/5/1
人間のモーションキャプチャを人型ロボットに再ターゲティングし、強化学習と行動クローニングを組み合わせた単一のニューラルネットワーク制御器で、全身の協調動作を実現する遠隔操作システムを開発した。
- G-DexGrasp: 部位認識型事前知識検索と生成支援による汎用性の高い巧みな把持合成マニピュレーション2025/3/1
未見の物体カテゴリや言語指示に対応するため、把持の事前知識(接触部位やアフォーダンス分布)を検索し、生成モデルと最適化を組み合わせて巧みな手の把持姿勢を合成する手法を提案。
- 実世界ヒューマノイドロボットのための起き上がり方策の学習歩行2025/2/1
二段階のカリキュラム学習により、人型ロボットが様々な地形で仰向け・うつ伏せから起き上がる制御器を獲得し、実機で実証した。
- RoboHorizon: 長期的ロボット操作のためのLLM支援マルチビューワールドモデルマニピュレーション2025/1/1
LLMで密な報酬を生成し、マルチビューMAEでキーフレームを検出するワールドモデルを構築し、長期的なロボット操作タスクの成功率を向上させた研究。
- Lipschitz制約付きポリシーによる滑らかなヒューマノイド歩行の学習歩行2024/10/1
方策にLipschitz制約を勾配ペナルティとして課すことで、低域通過フィルタや平滑化報酬を使わずに滑らかで頑健なヒューマノイド歩行制御を学習する手法を提案し、実機で検証した。
- 3D拡散ポリシーによる汎化可能なヒューマノイドマニピュレーションマニピュレーション2024/10/1
上半身テレオペで収集した単一場面のデータと機載計算のみで、25自由度ヒューマノイドが多様な実環境で自律マニピュレーションを実現するシステムを構築した。
- GravMAD: 接地された空間価値マップによる汎用3Dマニピュレーションのための行動拡散マニピュレーション2024/9/1
言語指示をサブゴールに分解し、基盤モデルと拡散方策を組み合わせて未知の3D操作タスクへの汎化を実現した手法。
- 脚式ロコマニピュレーションのための視覚的全身体制御ロコマニピュレーション2024/3/1
脚とアームを同時に制御する全身体制御を視覚入力のみで行う階層型フレームワークを提案し、シミュレーションで訓練して実機に転移、多様な物体の把持を実現した。
- Stylized Table Tennis Robots Skill Learning with Incomplete Human Demonstrations2023/9/1
- CasIL: Cognizing and Imitating Skills via a Dual Cognition-Action Architecture2023/9/1