Yiheng Li
Shanghai Jiao Tong University
収録論文 7本 ・ フィジカルAI/ロボット学習
VLAマルチモーダル検出行動認識BEV知覚/マルチタスク
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- ActSafeGuard:フローマッチング方策のための微分可能で訓練整合型の制約強制VLA2026/9/10
フローマッチングベースの方策に微分可能な安全層を組み込み、学習段階から硬い物理制約を満たす行動を生成させる手法を提案。複数タスクで100%のステップ安全性を保ちつつ成功率も維持・向上させた。
- 証拠に基づく法医学的推論によるマルチモーダルメディア改ざんの検出と位置特定マルチモーダル検出2026/8/8
画像とテキストのクロスモーダル改ざんを検出し、その根拠となる証拠の位置を特定する新しいフレームワークを提案。推論の透明性を高め、証拠と結論の整合性を強制する手法を導入した。
- GeoAlign: セマンティクスを超えた状態誘導による空間的位置合わせをVLAモデルに導入VLA2026/6/1
VLAモデルにロボットの状態情報を利用した幾何学的特徴の位置合わせ機構を導入し、操作タスクの成功率を向上させた。
- DADP: ドメイン適応拡散ポリシーVLA2026/2/1
拡散ポリシーにドメイン表現を組み込み、未知の遷移力学にゼロショット適応する制御手法を提案。
- 3D人間ポーズで基盤視覚モデルを接地させたロバスト行動認識行動認識2025/11/1
V-JEPA 2の予測的世界ダイナミクスとCoMotionの遮蔽に強い3D人間ポーズを融合し、物理空間に接地した行動認識モデルを提案。高遮蔽シーンで既存手法を上回る。
- QuadBEV: Bird's-Eye-View表現による効率的な4タスク知覚フレームワークBEV知覚/マルチタスク2024/10/1
Bird's-Eye-View表現を共有バックボーンで活用し、3D物体検出・車線検出・マップセグメンテーション・占有予測の4タスクを効率的に同時実行する組込み向け知覚フレームワークを提案。
- WOMD-Reasoning: 運転シーンにおけるインタラクション推論のための大規模データセットVLA2024/7/1
実世界の運転シーンにおける交通ルールに基づくインタラクションを記述・推論する300万件のQ&Aデータセットを構築し、それを用いた運転動作言語モデルMotion-LLaVAを提案した。