Pan Zhou
Singapore Management University
収録論文 8本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- ドラッグ編集のための運動に基づく潜在再構成手法MoRe-Drag画像編集2026/9/29
ドラッグ操作による画像編集において、ピクセル空間のワーピングを運動の手がかりとして生成過程に注入し、領域ごとの潜在再構成と段階的適応条件付けで精度と自然さを両立させる手法を提案。
- D^3-MoE:スタイル制御可能なエンドツーエンド自動運転のための二重分離拡散Mixture-of-Experts自動運転2026/6/1
高分散な人間のデモデータで訓練されたエンドツーエンド自動運転モデルが陥る「スタイル平均化」問題を解決するため、行動軸と物理軸の二方向で軌道生成を分離する拡散MoEモデルを提案した。
- ツールによる拡張可能な身体性能力の実現身体性知能2026/5/1
身体性知能の能力をツールとして外部化し、推論時に動的に呼び出す手法を提案。標準プロトコルETPと100以上のツールを整備し、シミュレーションと実世界で性能向上を確認した。
- EmbodiedClaw: 身体性AI開発のための対話型ワークフロー実行身体性AI開発2026/4/1
身体性AI研究の開発工程を対話で自動化するエージェントを提案し、環境構築や評価などの作業を実行可能なスキル化して手作業を削減する。
- LIBERO-PRO:記憶を超えたVLAモデルの堅牢で公平な評価に向けてVLA2025/10/1
VLAモデル評価用ベンチマークLIBEROを拡張し、物体・初期状態・指示・環境を摂動させて評価したところ、標準評価で90%超の精度が汎化設定では0.0%に崩壊し、モデルがタスク理解ではなく訓練データの丸暗記に依存していることを明らかにした。
- 空間から行動へ:空間基盤事前分布に基づく視覚-言語-行動モデルVLA2025/10/1
RGB画像から空間基盤モデルで3D幾何事前分布を抽出し、行動ヘッドに注入することで、追加センサーなしにVLAモデルの空間推論能力を高めるFALCONを提案。
- エージェント型ロボット:身体性エージェントにおける視覚-言語-行動モデルのための脳に着想を得たフレームワークVLA2025/5/1
人間組織の標準作業手順に着想を得た「標準化行動手順(SAP)」で計画・実行・検証を連携させ、長期的なロボット操作を自己検証しながら遂行する脳模倣型フレームワークを提案。LIBEROベンチマークで平均成功率79.6%を達成。
- ConvoyLLM: LLMを用いた動的マルチレーン車群制御群制御2025/2/1
大規模言語モデルを活用し、動的な高速道路環境で複数車線の車群形成・合流・離脱・護衛編成切替をリアルタイムに判断する制御手法を提案し、SUMOシミュレーションで有効性を示した。