Danda Pani Paudel
INSAIT, Sofia University "St. Kliment Ohridski"
収録論文 26本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 2D VLMを3Dプログラマに変えるタスク適応型グラウンディングVLA2026/10/1
2Dの視覚言語モデルに座標系の統一とタスク適応フィードバックを組み合わせ、再学習なしで3D理解・操作・生成を可能にするフレームワーク3D-Progを提案。
- 局所的な動画理解は遭遇をまたいで転移するか?EgoGearsベンチマーク一人称視点/動画理解/ベンチマーク2026/9/29
一人称視点の動画を単一・複数本で比較するベンチマークEgoGearsを提案し、複数動画間での対応付けや証拠統合が必要になるとMLLMの性能が平均22.5ポイント低下することを示した。
- φ-RIE: フォトリアリスティック再構成からインタラクティブ環境へsim2real2026/9/22
3Dガウススプラッティングで再構成したシーンから、選択した物体をシミュレータで動かせるアセットに変換し、背景も補完してインタラクティブ環境を構築するパイプラインを提案。
- LiDAR言語モデルは時空間関係を本当に理解しているのか?VLA2026/9/21
4D LiDAR言語モデルの時空間推論を診断するため、nuScenesを用いた1万問のベンチマークLiDAR-Halluを提案し、集計精度では隠れる失敗を明らかにした。
- CoRef-GS: マルチエージェント協調型参照3DガウシアンスプラッティングVLA2026/9/17
複数ロボットが各自構築した3Dガウシアンマップを統合し、言語クエリで対象物を特定する協調型シーン理解フレームワークを提案。
- X-MULTI: VLMを用いた画像生成因子の分離と因子認識画像合成画像生成2026/8/25
テキストから画像を生成する際に、カメラレンズやセンサー種類などの撮影因子を独立に制御する手法を提案。事前学習済み視覚言語モデルで新規組み合わせを監督し、評価指標の欠陥も修正した。
- 配向距離場によるイベントベースのモーション推定イベントカメラ/モーション推定2026/8/25
イベントカメラの動き推定を、反復最適化の代わりに事前計算した距離場の平均化で行う手法を提案し、低遅延かつ高精度を実現。さらに、ぼけ除去と瞳孔追跡への応用も示した。
- iARCS: 反復エージェント強化学習による制御可能な3Dシーン生成3Dシーン生成/強化学習2026/8/6
事前学習済みの3Dシーン生成器を自然言語のタスク要件に適応させる反復エージェント強化学習フレームワークを提案。物理的妥当性とレイアウト品質を向上させつつ、タスク固有の制約(歩行可能性、到達可能性、クリアランス)を満たすシーンを生成する。
- 共に見る:マルチモーダル大規模言語モデルによる多ロボット協調的自我中心空間推論群制御2026/5/18
複数の移動ロボットの同期した一人称視点ビデオを統合し、空間・時間・可視性・協調に関する質問に答える多ロボット協調動的空間推論の課題を研究。新ベンチマークCoopSRとデータセットEgoTeamを構築し、提案手法SP-CoRが既存MLLMを上回る性能を示した。
- ProOOD: プロトタイプ誘導による分布外3D占有予測3D占有予測2026/4/1
自動運転向けの3D占有予測において、長尾クラスバイアスと分布外入力への脆弱性を軽減する、プロトタイプ誘導の軽量プラグアンドプレイ手法を提案した。
- InterEdit: テキスト誘導による3D二人組動作編集動作生成2026/3/1
テキスト指示に従って二人の3D動作を編集する新タスクを提案し、専用データセットと拡散モデルベースの手法を構築した。
- マルチエージェントロボットシステム(MARS)チャレンジの進歩と革新マルチエージェント2026/1/1
NeurIPS 2025ワークショップで開催されたMARSチャレンジを紹介し、VLMを用いたマルチエージェントの計画とロボットマニピュレーションの制御という2領域での取り組みを概説した論文。
- SPEAR-1: 3D理解によるロボット実演を超えるスケーリングVLA2025/11/1
非ロボット画像に3D注釈を付与してVLMを強化し、3D認識と言語指示制御を統合したロボット基盤モデルSPEAR-1を提案。ロボット実演を20分の1に抑えつつ最先端性能を達成。
- 微分可能シミュレーションを用いた探索による自動運転の経路計画経路計画2025/11/1
微分可能シミュレータWaymaxを次状態予測器と評価器として活用し、勾配降下と確率的探索を組み合わせて行動系列を最適化する経路計画手法DSSを提案した。
- RefAtomNet++: 意味検索に基づくマルチトラジェクトリMambaによる参照的原子ビデオ行動認識の高度化VLA2025/10/1
自然言語で指定された人物の細粒度行動を認識するタスク(RAVAR)に対し、部分キーワード・シーン属性・文全体の3階層で意味を揃えたクロスアテンションとマルチトラジェクトリMambaを組み合わせたRefAtomNet++を提案し、大規模データセットRefAVA++で評価した。
- ノイズラベル下のオープンセット領域汎化のための証拠信頼性対応残差フローメタ学習メタ学習2025/10/1
ノイズラベルを含むデータで未知カテゴリを新領域で認識するオープンセット領域汎化のため、証拠的信頼性と残差フローマッチングを組み合わせたメタ学習手法を提案し、最先端性能を達成した。
- 行動ラベルなしデータを活用した汎用ロボットマニピュレーションマニピュレーション2025/9/1
人間やロボットの行動動画から3D点群の動きを自己教師あり学習し、少数のラベル付きデータで行動予測器に調整することで、ラベルなしでも新しいタスクを学習できる汎用マニピュレーション手法を提案。
- RoHOI: 人物-物体インタラクション検出のためのロバスト性ベンチマーク人物-物体インタラクション検出2025/7/1
人物-物体インタラクション検出モデルのロバスト性を評価する初のベンチマークRoHOIを提案し、20種類の汚染条件下での性能低下を分析。ロバスト性向上のためのSAMPL戦略も提案。
- スキャンから行動へ:実世界スキャンを活用した身体性シーン理解シーン理解2025/7/1
実世界の3Dスキャンデータと注釈をUSDで統合し、LLMによるシーン編集とロボットシミュレーションでの政策学習に応用した研究。
- GaussianVLM: 言語対応ガウシアンスプラットによるシーン中心3D視覚言語モデルVLA2025/7/1
3Dガウシアンスプラットに言語特徴を直接埋め込み、物体検出器に依存せずに3Dシーン理解と身体性推論を行う視覚言語モデルを提案した。
- 解析的世界モデルによる効率的な車両ダイナミクスモデリングの実現自動運転2025/2/1
微分可能シミュレータを状態予測器と組み合わせることで、相対オドメトリ、最適プランナ、最適逆状態を学習する解析的世界モデル(AWM)を提案し、自動運転における意思決定を強化する。
- Articulate3D: 3Dシーンを汎用シーン記述として包括的に理解する3Dシーン理解2024/12/1
関節物体の高品質アノテーションを備えた3D屋内シーンデータセットArticulate3Dと、部位分割と運動属性を同時予測する統一フレームワークUSDNetを提案した論文。
- 微分可能シミュレータによる自動運転車両のエンドツーエンド制御自動運転2024/9/1
微分可能シミュレータと解析的方策勾配法を組み合わせ、Waymo大規模データセット上で自動運転車両の制御器を学習する手法を提案。
- ReVLA: ロボット基盤モデルの視覚的ドメイン制限を回復するVLA2024/9/1
既存のロボット基盤モデルが視覚的なドメイン外シーンに弱い問題を分析し、モデルマージによる段階的バックボーン復元で視覚汎化性能を回復させる手法を提案した。
- EgoSpot:Egocentric Multimodal Control for Hands-Free Mobile Manipulation2023/6/1
- Event-Free Moving Object Segmentation from Moving Ego Vehicle2023/5/1