Zhiwen Fan
Texas A&M University
収録論文 16本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- ENCORE: 少数の実演から操作戦略を発見するエージェントマニピュレーション2026/9/29
少数の実演を証拠として与え、コーディングエージェントが知覚・行動APIに対するポリシープログラムを書いて反復改善し、言語指示だけでは不明な操作戦略を発見する手法。
- 巧みな触覚ワールドモデル触覚2026/9/28
手袋型触覚センサと映像を組み合わせ、一人称視点の操作を予測する映像拡散トランスフォーマーベースのワールドモデルを提案。触覚情報により手の動きの過小評価を23%から9%に低減し、手領域の知覚誤差を7.4%改善した。
- 距離場とCBFへの意味的リスクの埋め込みによるオンラインモノキュラー安全制御安全制御2026/6/1
単眼カメラ映像から意味的リスクを距離場に埋め込み、CBFベースの安全ナビゲーションをオンラインで実現するフレームワークを提案した。
- 行動アンクローニング:推論時ステアリングなしでモードリダイレクションをポリシー重みに蒸留する手法模倣学習/ポリシー編集2026/6/1
デモデータに含まれる望ましくない行動モードを抑制するため、一時的なモード分類器からのリダイレクション信号をポリシー重みに蒸留し、推論時オーバーヘッドなしで安全な行動を実現する手法MoREを提案した。
- 物理基盤のマルチエージェントダイナミクスベンチマーク:ワールドモデルにおけるワールドモデル2026/6/1
ワールドモデルの生成するマルチエージェント衝突シナリオの物理的妥当性を評価するフレームワークCrashTwinを提案し、既存モデルが視覚品質は高いが物理法則に反する挙動を示すことを明らかにした。
- EgoTL: 長時間タスクのための自己中心視点シンクアラウド連鎖VLA2026/4/10
自己中心視点のデータに、発話と行動のタイムスタンプ付き思考連鎖とメートルスケールの空間情報を付与するパイプラインを構築し、VLMやワールドモデルの評価・微調整を行う。
- FF3R: 非拘束視点からのフィードフォワード特徴3D再構成3D再構成2026/4/10
カメラ位置や深度、セマンティックラベルを必要とせず、RGBと特徴マップのレンダリング監視のみで幾何学的・意味的推論を統合するアノテーションフリーのフィードフォワード3D再構成フレームワークを提案した。
- 幾何学的有用性スコアリングによるTransformerベース単眼SLAMの高速化SLAM2026/4/1
単眼SLAMの計算冗長性を減らすため、フレームのマッピング価値を事前に予測する軽量なゲーティングネットワークLeanGateを提案し、90%以上の冗長フレームをスキップして85%以上の計算削減と5倍のスループット向上を実現した。
- SpatialStack: 3D VLM空間推論のための階層的幾何学-言語融合VLA2026/3/28
3D空間推論に弱い視覚言語モデルに対し、視覚・幾何・言語表現を階層的に融合するフレームワークを提案し、複数のベンチマークで最高性能を達成した。
- 自己中心視点の世界モデルによる写実的な手と物体のインタラクション合成世界モデル/インタラクション合成2026/3/1
ユーザーの行動のみから物理的に妥当な自己中心視点の手と物体のインタラクション動画を生成する世界モデルを提案し、3D推定から得た物理的知識を埋め込むことで将来の物体軌跡を使わずに高品質な合成を実現した。
- NavTrust: 実世界環境における信頼性を評価する身体性ナビゲーションのベンチマークナビゲーション2026/3/1
RGB・深度・指示の現実的な劣化を体系的に与え、7つの最先端ナビゲーション手法の性能低下を明らかにし、4つの緩和策を評価した統一ベンチマークを提案。
- 反実仮想失敗合成による実行可能な操作リカバリの学習マニピュレーション2026/3/1
実世界の成功デモから生成モデルで反実仮想的な失敗ロールアウトを合成し、失敗診断と回復軌道を予測するフレームワークを提案。実機実験で補正精度を大幅に向上させた。
- LAD-VF: LLM自動微分による形式手法フィードバックを用いたファインチューニング不要のロボットプランニングVLA2025/9/1
形式検証のフィードバックをプロンプト改善に活用し、モデルの再学習なしでLLMのロボット計画の安全性・仕様遵守を高めるフレームワークを提案。
- 自動運転のための生成AI:フロンティアと機会自動運転2025/5/1
生成AI(VAE・GAN・拡散モデル・LLM)を自動運転スタック全体にどう応用するかを体系的に整理したサーベイ。データ生成からEnd-to-End運転、デジタルツイン、評価・安全・規制まで課題と研究方向をまとめる。
- STAMP: スケーラブルでタスク・モデル非依存な協調知覚協調知覚2025/1/1
異なるモデルを持つ複数エージェントのBEV特徴を軽量なアダプタで共通表現に変換し、効率的に共有・融合する協調知覚フレームワークを提案。
- MM3DGS SLAM:視覚・深度・慣性計測を用いたマルチモーダル3DガウシアンスプラッティングSLAMSLAM2024/4/1
3Dガウシアンスプラッティングと視覚・深度・慣性計測を統合し、未姿勢カメラ画像から高精度なSLAMを実現する手法を提案。追跡精度が3倍、描画品質が5%向上し、リアルタイムで高解像度3Dマップを生成できる。