Jiaming Zhang
収録論文 61本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- キャッシュ対応Conv3D変換による組込みワールドモデルデコーダの高速化効率化2026/9/25
生成的世界モデルのエッジ実行を高速化するため、因果的Conv3Dをバッチ化空間Conv2Dに変換するキャッシュ対応のランタイム最適化を提案し、Jetson上でVAEデコードを約7倍高速化した。
- 日常動画から関節物体を再構成し操作を再現する実-to-シミュレーション手法sim2real2026/9/16
単眼RGB動画から、ドアや引き出しなどの関節物体のリンク分割・関節推定・3D再構成を行い、手の動きと合わせてシミュレーション上で操作を再現するフレームワークを提案。
- S3-Tracker: コントラスティブランダムウォークによる自己教師あり手術組織追跡医療画像/追跡2026/9/13
ラベルなしの内視鏡動画からコントラスティブランダムウォークで画素対応を学習し、軟組織の変形に対応した任意点追跡を自己教師ありで実現した研究。
- X$^2$Localizer: プログレッシブなクロスビュー動画地理的定位のためのクロス粒度アライメント地理的定位2026/8/17
本論文は、地上視点の動画を対応する航空画像に位置づけるクロスビュー動画地理的定位(CVG)を、部分的な観測や動的な時間予算に対応できるプログレッシブな設定(PCVG)に拡張し、新しいフレームワークX$^2$Localizerを提案する。
- Tri-Info: 情報理論によるVLAモデルの汎用的で解釈可能な失敗予測VLA/失敗予測2026/6/1
VLAモデルの動作を情報理論の観点から分析し、成功と失敗で異なる情報的シグネチャを捉えるTri-Info信号を提案。再学習なしでアーキテクチャや環境をまたいで失敗を検出でき、実世界タスクでも高い精度を達成。
- 小型ロボットの移動性能向上のための高自由度・軽量な生体模倣脚脚機構/生体模倣2026/6/1
昆虫の脚を模した4自由度のマイクロ並進脚機構を提案し、設計・運動学解析と実験により高い運動柔軟性と軽量性を実証した。
- EgoExoMem: 同期した自己中心・他者中心ビデオにわたるクロスビュー記憶推論ビデオ理解/ベンチマーク2026/5/18
自己中心視点と他者中心視点の同期ビデオを用いたクロスビュー記憶推論のベンチマークを新たに構築し、既存のマルチモーダルLLMでは困難であることを示した。また、学習不要のフレーム選択手法E^2-Selectを提案し、ベースラインを上回る性能を達成した。
- 速さか強さか:重み付き集約とトークンプルーニングによる柔軟な視覚場所認識視覚場所認識2026/5/1
視覚場所認識の性能と推論速度を両立するため、クラスタへの重み付き集約で識別性を高め、トークンプルーニングで特徴抽出コストを削減する手法を提案した。
- 実世界マルチロボットシステムにおける分散協調はモデル規模拡大よりも構造的相互作用の再設計で向上する群制御2026/5/1
実機10台の運搬・地図作成タスクで、ロボット間の通信トポロジーを全結合から階層型に変えると性能が47ポイント向上し、ニューラルネットの規模を2倍にしても9ポイントしか向上しないことを示した。
- 犬には障害物でなく人間には危険:盲導犬ロボットのための共自我ナビゲーションシステム歩行2026/3/1
盲導犬ロボットのナビゲーションにおいて、ロボットの地面センサーでは検知できないが人間の身長では危険な障害物(例:曲がった枝)を扱うため、ユーザーの視点を統合した二重分岐の回避システムを提案し、実験で有効性を示した。
- 360度を幻視する:局所シーン拡散と確率的プロンプティングによるパノラマ街路ビュー生成生成モデル2025/7/1
自動運転向けに、ステッチされたパノラマ画像を制御信号として一貫性のある360度パノラマ街路ビューを生成する初の手法Percep360を提案。局所シーン拡散法と確率的プロンプティング法で一貫性と制御性を実現。
- 制約からの解放:ソースフリー遮蔽認識シームレスセグメンテーションセグメンテーション2025/6/1
ソースデータやラベルなしで全景画像のセグメンテーションを行う新しいタスクSFOASSを提案し、UNLOCKという手法で360度視点と遮蔽認識を実現した。
- パノラマ分布外セグメンテーションセグメンテーション2025/5/1
360度パノラマ画像において、未知の物体(分布外)を検出する新タスクPanOoSを提案し、テキスト誘導プロンプト分布学習により既存手法を上回るPOSを実現した。
- ノイズラベル下での動画ベース運転者行動認識の探求行動認識2025/4/1
運転者行動認識においてラベルノイズに対処する初の手法を提案し、クラスタリングとサンプル選択で高精度化を実現した。
- dARt Vinci: 手術ロボット学習のための大規模一人称視点データ収集手術ロボット/模倣学習2025/3/1
ARハンドトラッキングと高忠実度物理シミュレーションを組み合わせ、da Vinci手術ロボットの基本タスクにおけるデータ収集を効率化するプラットフォームを提案し、実機比でデータ量41%増、実験時間10%減を達成した。
- LFX: ライトフィールドの密な意味セグメンテーションと顕著物体検出を統合するフレームワークライトフィールド認識2025/3/1
ライトフィールドの異なる表現形式に依存せず、意味セグメンテーションと顕著物体検出を同時に扱える初の統一学習フレームワークLFXを提案し、複数ベンチマークで最高精度を達成した。
- 経頭蓋磁気刺激のための画像誘導ロボットシステム:開発と実験的評価医療ロボティクス2024/10/1
脳画像を用いてTMSコイルの標準的な位置決めを計画し、ロボットで高精度・高再現性に配置するシステムを開発し、ファントムと予備的人間被験者実験で精度向上を実証した。
- 遮蔽を考慮したシームレスセグメンテーションセグメンテーション2024/7/1
パノラマ画像の狭い視野・遮蔽・ドメインギャップを同時に解決する新タスクOASSを提案し、データセットBlendPASSと手法UnmaskFormerを構築した。
- 指示付き原子行動認識行動認識2024/7/1
テキスト記述に基づいて特定人物の原子行動を動画から認識する新タスクRAVARを提案し、データセットRefAVAと専用手法RefAtomNetを構築した。
- DTCLMapper: ベクトル化HDマップ構築のための二重時間一貫性学習自動運転/HDマップ2024/5/1
BEV知覚における時間融合の冗長性を抑えるため、インスタンス埋め込みと幾何マップを組み合わせた二重時間一貫性学習でベクトル化HDマップを構築する手法を提案。
- GBEC: 幾何学ベースのハンドアイキャリブレーションキャリブレーション2024/4/1
ロボットのエンドエフェクタとセンサ間の変換を、従来の回帰手法ではなくエンドエフェクタとセンサ取り付けの幾何学のみから求める手法を提案し、経頭蓋磁気刺激や大腿骨形成術で精度と再現性の向上を示した。
- ノイズラベルに頑健な骨格ベース人間行動認識フレームワークNoiseEraSAR行動認識2024/3/1
骨格データによる行動認識で問題となるラベルノイズに対処するため、サンプル選択・共教示・クロスモーダルMoEを統合したNoiseEraSARを提案し、ベンチマークで最高性能を達成した。
- 変形可能な線状物体のリアルタイムロバスト形状推定形状推定2024/3/1
散在するキーポイントから確率的ラベリングとスプライン補間により、遮蔽や絡まりがある線状柔軟物体の形状をリアルタイムに推定する手法を提案した。
- 自動運転向けハイブリッド伝播によるオフボード占有予測の精緻化自動運転/3Dシーン理解2024/3/1
車載の視覚ベース3D意味シーン補完(SSC)予測を、オフボードで局所・大域の二段階伝播により高精度化するフレームワークOccFinerを提案し、SemanticKITTIで最先端性能を達成した。
- Fourier Prompt Tuning for Modality-Incomplete Scene Segmentation2024/1/1
- LF Tracy: A Unified Single-Pipeline Approach for Salient Object Detection in Light Field Cameras2024/1/1
- Navigating Open Set Scenarios for Skeleton-based Action Recognition2023/12/1
- CoBEV: Elevating Roadside 3D Object Detection with Depth and Height Complementarity2023/10/1
- Exploring Self-supervised Skeleton-based Action Recognition in Occluded Environments2023/9/1
- Elevating Skeleton-Based Action Recognition with Efficient Multi-Modality Self-Supervision2023/9/1
- OAFuser: Towards Omni-Aperture Fusion for Light Field Semantic Segmentation2023/7/1
- Tightly-Coupled LiDAR-Visual SLAM Based on Geometric Features for Mobile Agents2023/7/1
- Open Scene Understanding: Grounded Situation Recognition Meets Segment Anything for Helping People with Visual Impairments2023/7/1
- Bi-Mapper: Holistic BEV Semantic Mapping for Autonomous Driving2023/5/1
- Exploring Few-Shot Adaptation for Activity Recognition on Diverse Domains2023/5/1
- FishDreamer: Towards Fisheye Semantic Completion via Unified Image Outpainting and Segmentation2023/3/1
- Towards Activated Muscle Group Estimation in the Wild2023/3/1
- MateRobot: Material Recognition in Wearable Robotics for People with Visual Impairments2023/2/1
- Behind Every Domain There is a Shift: Adapting Distortion-aware Vision Transformers for Panoramic Semantic Segmentation2022/7/1
- Multi-modal Depression Estimation based on Sub-attentional Fusion2022/7/1
- Trans4Map: Revisiting Holistic Bird's-Eye-View Mapping from Egocentric Images to Allocentric Semantics with Vision Transformers2022/7/1
- Indoor Navigation Assistance for Visually Impaired People via Dynamic SLAM and Panoptic Segmentation with an RGB-D Sensor2022/4/1
- CMX: Cross-Modal Fusion for RGB-X Semantic Segmentation with Transformers2022/3/1
- MatchFormer: Interleaving Attention in Transformers for Feature Matching2022/3/1
- TransDARC: Transformer-based Driver Activity Recognition with Latent Space Feature Calibration2022/3/1
- Towards Robust Semantic Segmentation of Accident Scenes via Multi-Source Mixed Sampling and Meta-Learning2022/3/1
- Bending Reality: Distortion-aware Transformers for Adapting to Panoramic Semantic Segmentation2022/3/1
- TransKD: Transformer Knowledge Distillation for Efficient Semantic Segmentation2022/2/1
- Delving Deep into One-Shot Skeleton-based Action Recognition with Diverse Occlusions2022/2/1
- Transfer beyond the Field of View: Dense Panoramic Semantic Segmentation via Unsupervised Domain Adaptation2021/10/1
- Trans4Trans: Efficient Transformer for Transparent Object and Semantic Scene Segmentation in Real-World Navigation Assistance2021/8/1
- Flying Guide Dog: Walkable Path Discovery for the Visually Impaired Utilizing Drones and Transformer-based Semantic Segmentation2021/8/1
- DensePASS: Dense Panoramic Semantic Segmentation via Unsupervised Domain Adaptation with Attention-Augmented Context Exchange2021/8/1
- Trans4Trans: Efficient Transformer for Transparent Object Segmentation to Help Visually Impaired People Navigate in the Real World2021/7/1
- HIDA: Towards Holistic Indoor Understanding for the Visually Impaired via Semantic Instance Segmentation with a Wearable Solid-State LiDAR Sensor2021/7/1
- MASS: Multi-Attentional Semantic Segmentation of LiDAR Data for Dense Top-View Understanding2021/7/1
- Pose2Drone: A Skeleton-Pose-based Framework for Human-Drone Interaction2021/5/1
- Learning a Skill-sequence-dependent Policy for Long-horizon Manipulation Tasks2021/5/1
- Perception Framework through Real-Time Semantic Segmentation and Scene Recognition on a Wearable System for the Visually Impaired2021/3/1
- Capturing Omni-Range Context for Omnidirectional Segmentation2021/3/1
- Panoptic Lintention Network: Towards Efficient Navigational Perception for the Visually Impaired2021/3/1