Mohammad Mahdavian
収録論文 6本 ・ フィジカルAI/ロボット学習
VLA/空間推論3D再構成行動認識
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 空間思考の連鎖:視覚言語モデルのためのモダリティ非依存の空間接地VLA/空間推論2026/8/10
追加の推論時モジュールを必要とせず、連続的な空間トークンを導入して視覚言語モデルの空間推論能力を向上させる軽量フレームワークを提案した。
- UniScale:ロボット知覚のための事前情報注入による統一スケール対応多視点3D再構成3D再構成2026/2/1
多視点画像からカメラ内部・外部パラメータ、スケール不変な深度と点群、実スケールを単一のフィードフォワードネットワークで推定し、既存モデルの事前情報を活用してロボット向け3D再構成を高精度化するフレームワーク。
- LS-HAR: 骨格と視覚を言語で監督する人間行動認識と建設現場データセット行動認識2024/10/1
骨格と視覚の特徴を言語モデルで監督しながら顕著性融合する行動認識手法LS-HARを提案し、建設現場向けの新データセットVolvoConstActを構築した。
- STPOTR: Simultaneous Human Trajectory and Pose Prediction Using a Non-Autoregressive Transformer for Robot Following Ahead2022/9/1
- DMMGAN: Diverse Multi Motion Prediction of 3D Human Joints using Attention-Based Generative Adverserial Network2022/9/1
- Robust Visual Teach and Repeat for UGVs Using 3D Semantic Maps2021/9/1