Ke Zhang
収録論文 10本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- EVAS: 音声-視覚シナジーと誘導境界較正による効率的なマルチモーダル時間的偽造位置特定マルチモーダル/偽造検出2026/7/5
長尺動画中の疎な偽造区間を正確に特定するため、多段階の音声-視覚相互作用と境界較正戦略を備えたエンドツーエンドのマルチモーダルフレームワークを提案した。
- UniSkip-Mamba: 周波数認識型状態空間モデルによる音声・視覚の時間的偽造位置特定偽造検出2026/7/5
音声・視覚の時間的偽造位置特定(AV-TFL)において、偽造の識別に有効な低・中周波数帯域に注目し、高周波ノイズを除去する周波数認識型の状態空間モデルUniSkip-Mambaを提案した。
- MG-RWKV: 時間的偽造位置特定のための多粒度文脈認識RWKV時間的偽造検出2026/7/1
RWKVの状態進化を利用し、O(T)計算量で全シーケンス処理を実現する多粒度フレームワークを提案。双方向RWKV、多粒度MoE、粒度間一貫性により、偽造セグメントの正確な特定を実現した。
- 自己教師あり単眼ビデオ深度推定のための3D一貫性最適化深度推定2026/6/14
ビデオフレームを独立に扱う従来法の問題を解決するため、深度推定を多視点3D再構成問題として捉え、3D一貫性最適化フレームワークを導入した。画像レベルのフォトメトリックレンダリング、ワールド座標の幾何学的整合、多スケール時間勾配一貫性の3つの制約でフレームを統一的に最適化し、自己教師あり学習とゼロショット臨床環境で最先端の精度を達成した。
- TRAP: ワールドモデル計画のためのテール認識ランキング攻撃セキュリティ2026/5/3
ワールドモデルの想像軌道のランキング構造を標的としたバックドア攻撃フレームワークTRAPを提案し、計画結果を乗っ取る。
- DexFormer: 履歴条件付きTransformerによるクロスエンボディメント器用マニピュレーションマニピュレーション2026/2/1
履歴観測を条件とするTransformerベースの単一ポリシーで、異なる多自由度ハンドの形態や動力学をオンラインで推定し、ゼロショットで多様なハンドに適応する器用マニピュレーションを実現した。
- 超音波ガイドによるロボット採血とラットのサブミリ血管におけるin vivo研究医療ロボティクス2025/4/1
超音波画像ガイド付きの6自由度ロボットアームと3自由度エンドエフェクタで採血を行い、ラット尾静脈(直径約0.7mm)で95%の初回成功率を達成した。
- CDKFormer: 長尾軌道予測のための文脈的逸脱知識ベースTransformer軌道予測2025/3/1
長尾軌道予測の課題に対し、個別運動と群集相互作用から逸脱特徴を抽出し、注意機構と二重クエリデコーダでマルチモーダル予測を行うTransformerモデルを提案した。
- Drama: Mambaを活用したモデルベース強化学習のサンプル効率とパラメータ効率モデルベース強化学習2024/10/1
Mambaをベースにした状態空間モデルで世界モデルを構築し、Atari100kで競争力のある性能を700万パラメータで達成した研究。
- TorchDriveEnv: 反応的でリアルかつ多様なNPCを備えた自動運転のための強化学習ベンチマーク自動運転/強化学習ベンチマーク2024/5/1
Pythonで実装された軽量な自動運転向け強化学習ベンチマークで、反応的でリアルかつ多様なNPC行動シミュレーションと統合し、学習車両の挙動評価を可能にする。