Shijie Zhou
収録論文 6本 ・ フィジカルAI/ロボット学習
継続学習/セキュリティセキュリティ/攻撃VLA異常検知世界モデル/インタラクション合成
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- バックドア攻撃下での継続学習における浄化と選択的復元によるロバストな動的拡張継続学習/セキュリティ2026/9/6
各タスクに混入したバックドア攻撃サンプルに対処するため、浄化・選択的復元・ロバストな専門家選択を統合した動的拡張フレームワークを提案した。
- TempJail: 字幕スケジューリングによる大規模視覚言語モデルへの時間的ジェイルブレイク攻撃セキュリティ/攻撃2026/8/20
動画内の字幕の表示タイミングを最適化することで、大規模視覚言語モデルに有害な応答を引き起こすブラックボックス攻撃手法を提案した。
- SpatialStack: 3D VLM空間推論のための階層的幾何学-言語融合VLA2026/3/28
3D空間推論に弱い視覚言語モデルに対し、視覚・幾何・言語表現を階層的に融合するフレームワークを提案し、複数のベンチマークで最高性能を達成した。
- RC-NF: ロボット条件付き正規化フローによるロボット操作のリアルタイム異常検知異常検知2026/3/1
VLAモデルによるロボット操作中に、ロボットと物体の状態がタスクに沿っているかを監視し、異常をリアルタイム検知するモデルRC-NFを提案。正規化フローを用いて教師なし学習し、異常スコアを確率密度から算出する。
- 訓練不要の注意再調整によるVLAモデルの言語基盤の回復VLA2026/3/1
VLAモデルが視覚情報に偏り、指示と矛盾する動作を実行する「言語的盲目」現象を明らかにし、推論時に注意を再調整して指示の影響を回復する手法IGARを提案した。
- 自己中心視点の世界モデルによる写実的な手と物体のインタラクション合成世界モデル/インタラクション合成2026/3/1
ユーザーの行動のみから物理的に妥当な自己中心視点の手と物体のインタラクション動画を生成する世界モデルを提案し、3D推定から得た物理的知識を埋め込むことで将来の物体軌跡を使わずに高品質な合成を実現した。