Wentong Li
収録論文 9本 ・ フィジカルAI/ロボット学習
VLA動画フォレンジックナビゲーションマルチモーダル事前学習自動運転/占有予測意味的シーン補完セマンティックシーン補完
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- EmbodiedSkills: VLAエージェントの統合フレームワークVLA2026/9/1
VLAモデルを長期的タスクに適用するための、実行提案としてのスキル判断を検証する統合フレームワークを提案。
- 長尺動画における改ざんセグメントの説明可能なフォレンジック解析動画フォレンジック2026/6/1
未編集の長尺動画に埋め込まれたAI生成セグメントを検出・位置特定し、その理由を説明する新しいタスクとベンチマーク、ベースライン手法を提案した論文。
- DecoVLN: 観察・推論・修正を分離した視覚言語ナビゲーションVLA2026/3/1
長期的な指示に従う視覚言語ナビゲーションの性能を高めるため、記憶構築の最適化と誤差補正のための微調整戦略を導入したフレームワークを提案した。
- AgentVLN:エージェント型視覚言語ナビゲーションに向けてナビゲーション2026/3/1
視覚言語ナビゲーション(VLN)のための新しいフレームワークAgentVLNを提案。VLMを高次推論に用い、3Dトポロジカルウェイポイントを画像平面に投影して視覚プロンプトを生成し、自己補正と能動探索で長期的なナビゲーション誤差を抑制する。
- 空間知能の構築:自律システムのためのマルチモーダル事前学習ロードマップマルチモーダル事前学習2025/12/1
自動運転車やドローンなどの自律システムに向けて、カメラやLiDARなどのマルチモーダルセンサーデータを活用した事前学習技術を整理し、統一的な分類と今後の課題・ロードマップを提示したサーベイ論文。
- ReliOcc: 不確実性学習による信頼性の高い意味的占有予測自動運転/占有予測2024/9/1
カメラベースの意味的占有予測の信頼性を評価し、不確実性を組み込んだプラグアンドプレイ手法ReliOccで予測の信頼性を向上させた研究。
- スクリブル注釈によるラベル効率的な意味的シーン補完意味的シーン補完2024/5/1
スパースなスクリブル注釈と密な幾何ラベルを組み合わせた新しいベンチマークScribbleSCを構築し、Scribble2Sceneという手法で完全教師ありに匹敵する性能を少ないラベルで実現した。
- すべてのボクセルは平等ではない:自己蒸留を用いた難易度認識型セマンティックシーン補完セマンティックシーン補完2024/4/1
3D空間のボクセルごとに難易度を考慮し、学習が難しい領域を重点的に学習する自己蒸留ベースのセマンティックシーン補完手法を提案。
- LiDAR2Map: In Defense of LiDAR-Based Semantic Map Construction Using Online Camera Distillation2023/4/1