Jie Wu
Tsinghua University
収録論文 7本 ・ フィジカルAI/ロボット学習
VLAVLA/操作4D時空間推論セキュリティマルチエージェントシステム位置推定
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- FutureDuet: 未来予測監督における観測アクセスの分離VLA2026/9/28
ロボットの行動生成において、メインカメラと手首カメラで異なる未来予測目標を与えることで、精密な操作タスクの成功率を向上させた研究。
- ChainVLA: 統一実行状態による長期的操作のためのビジョン・言語・行動クエリの連鎖VLA/操作2026/8/3
長期的な操作タスクにおいて、過去の行動の結果と現在の動作を連鎖させる新しいVLAポリシーを提案。進行状況コンテキストとモーションテールを統合し、高い成功率を達成。
- DynTrace: 4D時空間推論のための動的物体証跡追跡4D時空間推論2026/7/14
MLLMの4D時空間推論を強化するため、トレーニング不要のフレームワークDynTraceを提案。動的軌跡可視化と動的トレーストークンで物体の動きを連続追跡し、カメラ運動と物体運動を分離する。
- LVLM搭載ロボットシステムに対する過剰思考誘発型スローダウン攻撃セキュリティ2026/7/1
ロボットに搭載された大規模視覚言語モデル(LVLM)の過剰思考(長い推論)を悪意あるシーンテキストで誘発し、意思決定を遅延させる攻撃手法を提案・検証した論文。
- 単一エージェントの整合を超えて:マルチエージェントシステムにおけるコンテキスト断片化違反の防止マルチエージェントシステム2026/4/24
個々のエージェントの行動は安全に見えるが、組織ポリシーに違反する「コンテキスト断片化違反」を特定し、分散型ゼロトラスト執行アーキテクチャ「Distributed Sentinel」を提案する。
- RoboStream: 視覚言語モデルに時空間推論と記憶を統合したロボット操作フレームワークVLA2026/3/1
視覚言語モデルに時空間融合トークンと因果時空間グラフを導入し、長期ロボット操作における幾何学的定位と行動による状態変化の記憶を訓練なしで実現する。
- 2D前方監視ソナーのPnP問題に対する凸かつ大域的な解法位置推定2025/4/1
2D前方監視ソナー(FLS)の姿勢推定のためのPnP問題を、正射影近似による点-直線3D位置合わせとして定式化し、双対性に基づく最適ソルバーで大域最適解を求める手法を提案した。