Zhiyuan Li
Aalto University
収録論文 16本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- クロススケルトン動作リターゲティングが非識別可能である理由:生成動作モデルの構造的限界動作生成/リターゲティング2026/9/29
異なる骨格間で動作を転送する生成モデルは、ソース動作を反映したのか典型的動作を生成したのか区別できない構造的曖昧性を持つことを示し、その検証指標SIFを提案した。
- 空間グラフティング:フローマッチングロボットポリシーのための3D特徴の接地VLA2026/9/28
凍結した3D再構成特徴をロボット相対のメートル幾何に結びつけ、クロスアテンションでフローマッチング行動エキスパートに注入する軽量モジュールを提案。複数のVLA/WAMや実機で汎用的に性能を向上させた。
- StageGuard: エージェント蒸留による長期的ロボットタスクの段階遷移学習VLA2026/9/17
大規模VLMの推論を蒸留した軽量モデルで、長期ロボットタスクにおけるサブタスク完了判定とスキル切替を高精度かつ低遅延で行うフレームワークを提案。
- ARC-Bench:凍結JEPA世界モデルにおける閉ループ再計画が破綻した行動ランキングを隠蔽する世界モデル/計画2026/8/12
凍結したJEPA潜在空間での距離に基づく行動選択が実際のコスト順序と一致するという仮定を監査し、公式チェックポイントで深刻なランキング逆転が生じることを示した。さらに、頻繁な再計画がこの欠陥を隠していることを明らかにした。
- RoboHarness: メモリ駆動による異種ロボットポリシーの統合オーケストレーションによる長期的計画長期計画/ポリシー統合2026/7/1
複数の異なるロボット制御システム(VLA、RL、TAMPなど)を再利用可能なスキルとして統合し、実行メモリとオンライン証拠を用いて能力境界を推定し、長期的タスクを能力に応じて分解・ルーティングするフレームワークを提案。ポリシー切り替え時の分布ミスマッチをメモリブリッジで緩和し、ゼロショット長期計画とOOD堅牢性を向上させた。
- LaWAM: 効率的なダイナミクス認識ロボットポリシーのための潜在世界行動モデルVLA2026/6/1
ロボットの行動がシーンをどう変えるかを予測する潜在空間の世界モデルを導入し、ピクセル単位の動画生成を避けつつ、高成功率と低遅延を実現した。
- 身体性ギャップを橋渡しする:分離型クロス身体性ビデオ編集ビデオ生成/身体性転移2026/5/1
人間のデモ動画からロボットの実行動画を生成する際、タスク情報と身体性情報を分離して表現し、拡散モデルを用いてロボット動画を合成する手法を提案した。
- オープンワールド環境におけるVLAの実際の動作VLA評価2026/4/1
本論文は、複雑な家事タスクのベンチマークであるBEHAVIOR1Kにおいて、視覚言語行動モデル(VLA)の評価方法が安全性や実際の性能を過大評価する可能性を指摘し、安全性違反を捉える新しい評価プロトコルを提案する。
- 世界行動モデルはVLAより汎化するのか?ロバスト性の比較研究VLA2026/3/1
VLAと世界行動モデル(WAM)をLIBERO-PlusやRoboTwin 2.0-Plusで視覚・言語の摂動下に比較し、WAMの高いロバスト性を示した研究。
- H-WM:階層型ワールドモデルによるロボットのタスク・動作計画タスク・動作計画2026/2/1
論理空間と視覚空間の状態遷移を統合的に予測する階層型ワールドモデルを提案し、長期的なロボットタスクの計画と実行を安定化させる。
- NICEシーン手術によるロボットマニピュレーションのロバスト性向上マニピュレーション2025/11/1
既存の実演データに画像生成とLLMで物体の置換・再スタイル化・除去を行い、追加データ収集なしで模倣学習のOODギャップを減らし、マニピュレーション成功率を平均11%向上させた。
- 気が散るロボット:視覚的 clutter がロボットマニピュレーションを損なう仕組みマニピュレーション2025/11/1
視覚的 clutter がロボットマニピュレーションに与える影響を心理物理学的指標で評価し、VLA モデルの性能低下や脆弱性を明らかにした。
- Self-CriTeach:自動ドメイン生成によるロボット計画改善のためのLLM自己教授・自己批評フレームワークロボット計画2025/9/1
LLMが記号計画ドメインを自動生成し、それを大規模なCoT教師データ生成と強化学習の報酬関数の両方に活用することで、ロボット計画性能を高める自己教授・自己批評手法を提案した。
- 継続学習による視覚言語ナビゲーションVLA2024/9/1
視覚言語ナビゲーション(VLN)エージェントが新しい環境を逐次学習しながら過去の知識を保持できるよう、脳の記憶リプレイに着想を得た二重ループシナリオリプレイ手法(Dual-SR)を提案した研究。
- Cog-GA: 大規模言語モデルによる連続環境での視覚言語ナビゲーション生成エージェントVLA2024/9/1
大規模言語モデルを基盤に、認知マップ構築・ウェイポイント予測・二チャネル場面記述・反省機構を組み合わせ、連続3D環境での視覚言語ナビゲーションを人間らしく効率的に行う生成エージェントを提案した。
- Exploiting Local Observations for Robust Robot Learning2023/9/1