Quan Zhang
収録論文 8本 ・ フィジカルAI/ロボット学習
マルチモーダル/偽造検出偽造検出時間的偽造検出ビデオ推論医療ロボティクスマニピュレーションソフトロボティクスデジタルツイン
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- EVAS: 音声-視覚シナジーと誘導境界較正による効率的なマルチモーダル時間的偽造位置特定マルチモーダル/偽造検出2026/7/5
長尺動画中の疎な偽造区間を正確に特定するため、多段階の音声-視覚相互作用と境界較正戦略を備えたエンドツーエンドのマルチモーダルフレームワークを提案した。
- UniSkip-Mamba: 周波数認識型状態空間モデルによる音声・視覚の時間的偽造位置特定偽造検出2026/7/5
音声・視覚の時間的偽造位置特定(AV-TFL)において、偽造の識別に有効な低・中周波数帯域に注目し、高周波ノイズを除去する周波数認識型の状態空間モデルUniSkip-Mambaを提案した。
- MG-RWKV: 時間的偽造位置特定のための多粒度文脈認識RWKV時間的偽造検出2026/7/1
RWKVの状態進化を利用し、O(T)計算量で全シーケンス処理を実現する多粒度フレームワークを提案。双方向RWKV、多粒度MoE、粒度間一貫性により、偽造セグメントの正確な特定を実現した。
- 知覚的ショートカットを超えて:軽量MLLMの汎化ビデオ推論のための因果的着想に基づくデバイアス最適化ビデオ推論2026/5/2
軽量マルチモーダル言語モデルにおける強化学習がデータバイアスによる知覚的ショートカットに依存する問題を因果分析で明らかにし、バイアスモデルと反発的目標を用いた2段階デバイアス手法VideoThinkerを提案した。
- 脳心血管インターベンションロボットの姿勢状態知覚医療ロボティクス2025/6/1
追加センサやマーカーなしに、視覚情報のみで血管内のインターベンションロボットの姿勢を高精度に認識する手法を提案した論文。
- 逆運動学計画と制御における統合階層的意思決定マニピュレーション2024/12/1
階層的意思決定と全身逆運動学計画・制御を統合する非線形計画法を提案し、L0ノルムを活用して効率的かつ汎用的に複雑な問題を解く。
- デジタルツインに基づくソフトロボットグリッパの把持制御への新手法ソフトロボティクス2024/10/1
ソフトグリッパのデジタルツインを構築し、カメラ画像から駆動圧力をリアルタイムに決定して把持動作を制御する手法を提案した。
- 知的ロボット製造における産業用ロボット向けの簡便で新しいデジタルツインフレームワークの開発デジタルツイン2024/10/1
産業用ロボットのデジタルツインを、Unity 3DとWebベースプラットフォームで実装し、17msの高効率通信とリアルタイム制御を実現した。