Min Sun
収録論文 21本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 指示が軌道を呼び出すとき:VLAモデルの汎化失敗の診断と緩和VLA2026/9/30
VLAモデルが言語と視覚を組み合わせて行動を選べず失敗する「指示-行動バインディング」問題を分析し、同指示で異なる行動を要するデータと損失で訓練するECTを提案した。
- メモリツリー誘導キーフレーム問い合わせによる効率的な3D質問応答VQA/3Dシーン理解2026/8/18
3D環境での質問応答を効率化するため、メモリツリー構造でシーンを表現し、質問に関連するキーフレームを高速に選択する手法を提案。
- 任意のオープンソースMLLMの部品レベル点接地を強化する手法視覚接地2026/6/28
MLLMの注意機構を利用し、凍結したまま部品レベルの2D点接地を可能にする軽量デコーダを提案した。
- 私たちが語る嘘:接空間上のスコアマッチングによる視覚言語行動ポリシーにおけるユークリッド誤謬の修正拡散モデル/操作2026/6/1
拡散ベースの視覚言語行動ポリシーがSE(3)姿勢を平坦なユークリッドベクトルとして扱う幾何学的誤りを指摘し、SE(3)上で直接動作する拡散フレームワークを提案して、較正精度と実ロボット性能を向上させた。
- ADAPT: 不特定のアフォーダンス制約下での常識的計画のベンチマーク計画/アフォーダンス2026/4/1
動的環境で物体のアフォーダンスが変化し指示に明示されない状況を評価するベンチマークDynAffordを導入し、既存プランナーにアフォーダンス推論を追加するモジュールADAPTを提案した。
- VLN-NF: 偽の前提指示を用いた実現可能性を考慮した視覚言語ナビゲーションナビゲーション2026/4/1
偽の前提(目標が存在しない)を含む指示でエージェントが探索し「見つからない」と明示する新しいベンチマークと手法を提案した。
- SceneFoundry: インタラクティブな無限3D世界の生成シーン生成2026/1/1
言語プロンプトから、関節付き家具を含むアパート規模の物理的に実現可能な3D環境を拡散モデルで自動生成し、ロボット学習用のシーンを提供するフレームワーク。
- オンライン3Dガウススプラッティングによる明示的メモリでクラス非依存動画セグメンテーションを改善動画セグメンテーション2025/10/1
動画中の物体セグメントをオンライン3Dガウススプラッティングで明示的に記憶し、FastSAMやSAM2の予測精度と一貫性を向上させる手法を提案。
- 属性に基づく物体グラウンディングと空間推論によるロボット把持検出マニピュレーション2025/9/1
自然言語で指定された物体を空間推論で特定し、把持姿勢を予測するフレームワークOGRGを提案。重複物体がある場面でも機能し、弱教師あり学習にも対応する。
- UA-Pose: 部分参照を用いた不確かさ考慮型6D物体姿勢推定とオンライン物体補完6D姿勢推定2025/6/1
物体の一部しか写っていない少数のRGBD画像や単一画像から、不確かさを考慮して6D姿勢推定とオンラインでの物体形状補完を同時に行う手法を提案。
- POp-GS: P最適性による3Dガウシアンスプラッティングの次の視点3Dガウシアンスプラッティング2025/3/1
3Dガウシアンスプラッティングにおける不確実性と情報獲得量をP最適性で定量化し、次の視点選択を改善する手法を提案。
- 連続的セマンティックスプラッティングによる3Dガウシアンスプラッティングの不確かさモデリング3Dシーン理解2024/11/1
3Dガウシアンスプラッティングにおいて、共役事前分布を用いて3D楕円体上で確率的なセマンティック更新を行い、不確かさを定量化できるラスタライズ手法を提案した。
- ロボット身体性に合わせて構成可能なRGB-D動画セグメンテーションデータ生成セグメンテーション2024/10/1
3D再構成からロボットの身体性(センサ種類・配置・照明)に合わせて構成可能な大規模RGB-D動画パノプティックセグメンテーションデータセットMVPdを生成し、ファインチューニングによる性能向上を実証した。
- 不正確なセマンティックマップに適応する文脈認識型再計画手法物体ナビゲーション2024/9/1
VLMで事前探索したセマンティックマップの不確かさを信頼度スコアと多視点整合性で推定し、追加ラベルなしで誤った判断を修正する再計画手法CAReを提案。物体ナビゲーションで性能向上を実証。
- 教師なし同変学習によるRKHS上の対応不要SE(3)点群位置合わせ点群位置合わせ2024/7/1
点群を再生核ヒルベルト空間の関数として扱い、SE(3)同変特徴を用いることで対応点を必要とせずに位置合わせを行う教師なし学習手法を提案した。
- CSCPR: クロスソースコンテキストによる屋内RGB-D場所認識場所認識2024/7/1
RGB-D屋内場所認識のためのCSCPRを提案。グローバル検索と再ランキングを統合し、クラスタコンテキストで特徴処理を一貫させ、新データセットも公開した。
- Tabletop Transparent Scene Reconstruction via Epipolar-Guided Optical Flow with Monocular Depth Completion Prior2023/10/1
- The Study of Highway for Lifelong Multi-Agent Path Finding2023/4/1
- CLA-NeRF: Category-Level Articulated Neural Radiance Field2022/2/1
- Robust 360-8PA: Redesigning The Normalized 8-point Algorithm for 360-FoV Images2021/4/1
- Autonomous UAV Landing System Based on Visual Navigation2019/10/1