Boyang Sun
収録論文 20本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 人型ロボットのための疎な3次元構造物の俊敏な知覚横断学習歩行2026/8/30
人型ロボットが猿渡りバーを跳び移りながら渡り切るタスクを強化学習で実現。頭部搭載ライダーの生データを注意機構付きエンコーダで処理し、実機で高い成功率を達成した。
- EgoTrack3D: 自己中心視点3D物体追跡のためのモジュラーフレームワーク3D追跡2026/8/8
自己中心視点のRGBビデオから動的な3Dシーン表現を再構築・維持するモジュラーフレームワークを提案し、静的・動的物体の持続的な3D追跡を実現した。
- LIME: 一人称視点ビデオから意図を考慮したカメラモーションを学習するカメラモーション生成2026/7/1
ロボットが自然言語の指示に基づいて次に観察すべきカメラの相対姿勢を生成する手法を提案。一人称ビデオから多様な意図とカメラ動作のペアを学習し、観察利得の予測と連続的なフローマッチングによる姿勢生成を組み合わせる。
- PROSE: 視覚言語モデルによる学習不要の自己中心視点シーン位置合わせシーン位置合わせ2026/6/15
頭部装着カメラで撮影した同一室内の異なる時刻のRGB映像を、事前学習済み視覚言語モデルを用いて物体レベルの3Dシーングラフに変換し、物体対応付けと幾何的検証により位置合わせする学習不要の手法を提案した。
- LocalNav: フロンティアVLMと身体化RLの蒸留によるオンデバイス物体目標ナビゲーションナビゲーション2026/6/1
大規模VLMの空間推論能力を軽量な4BパラメータのローカルVLMに蒸留し、組み込みGPU上で低遅延な物体目標ナビゲーションを実現する手法を提案した。
- OpenFrontier: 視覚言語に基づくフロンティアを用いた汎用ナビゲーションナビゲーション2026/3/1
視覚言語モデルを活用し、フロンティアを意味的アンカーとして用いることで、タスク固有の学習や微調整なしに効率的なゼロショットナビゲーションを実現するフレームワークを提案。
- 地図より記憶を:再構成なしの3D物体位置推定物体位置推定2026/3/1
3Dシーン再構成を行わず、姿勢付きRGB-Dキーフレームのみを記憶して視覚言語モデルで候補を絞り、必要時に奥行き逆投影と多視点融合で対象の3D位置を推定する手法を提案。
- 物体目標ナビゲーションのための強化学習手法で重要な要素は何か?実証研究と統合フレームワーク物体目標ナビゲーション2025/10/1
物体目標ナビゲーションの強化学習システムを認識・方策・テスト時強化の3要素に分解し、大規模実験で各要素の影響を分析。認識とテスト時戦略の改善が方策改善より効果的であることを示し、統合フレームワークを提案。
- REACT3D: 対話型物理3Dシーンの関節構造を復元シーン理解2025/10/1
静的な3Dシーンから可動部を検出し、関節の種類や動作を推定して、シミュレーション可能な対話型シーンへと自動変換するゼロショット手法を提案。
- 見えれば到達不要:知覚考慮型強化学習による効率的なロボット検査ナビゲーション2025/9/1
検査対象が見えた時点で移動を止めることを目的とし、地図なしで最短の視認可能軌道を学習する強化学習フレームワークを提案。シミュレーションで訓練し実機に展開、従来手法より効率的な検査軌道を実現。
- ActLoc: 能動的視点選択による移動中の自己位置推定ナビゲーション2025/8/1
地図構築時のカメラ姿勢を学習し、任意の3D位置でのヨー・ピッチ方向の自己位置推定精度を予測する注意機構モデルを提案。これを経路計画に組み込み、タスク・運動制約下で自己位置推定が最も頑健になる視点を能動的に選ぶ枠組み。
- ForesightNav: シーン想像による効率的な探索学習ナビゲーション2025/4/1
未探索領域の占有・意味情報を予測する想像モジュールを備え、長期的なナビゲーション目標を効率的に選択することで未知環境での探索性能を高める手法を提案。
- VidBot: 野生の2D人間動画から汎化可能な3D行動を学習し、ゼロショットロボットマニピュレーションを実現VLA2025/3/1
インターネット上の一人称RGB動画から3Dハンド軌跡を抽出し、粗から細へのアフォーダンス学習と拡散モデルでロボットのゼロショット操作を可能にするフレームワークを提案。
- SG-Tailor: シーングラフ操作のための物体間常識関係推論シーングラフ/常識推論2025/3/1
シーングラフのノード追加やエッジ変更時に生じる矛盾を解消し、常識的な関係を自己回帰的に予測するモデルを提案。シーン生成やロボット操作に組み込み可能。
- 二視点ループ閉じによる再構築不要なスケーラブル軌道推定VSLAM2025/3/1
再構築を行わず、二視点ループ閉じと単眼深度事前分布を活用して、スケーラブルなVisual SLAMを実現する2GOシステムを提案。
- FrontierNet: 視覚的手がかりで探索する学習モデル探索2025/1/1
RGB画像と単眼深度からフロンティアを提案し情報利得を予測する視覚ベースの探索システムを開発し、3D地図依存の手法より初期探索効率を15%改善した。
- どこを見るべきかを学習:幾何情報を用いた能動的定位のための自己教師あり視点選択能動的定位2024/7/1
幾何情報を活用した自己教師あり学習により、ロボットが定位精度を高めるための視点をリアルタイムに選択する手法を提案し、合成・実データで既存手法を上回る性能を示した。
- A 3D Mixed Reality Interface for Human-Robot Teaming2023/10/1
- Active Visual Localization for Multi-Agent Collaboration: A Data-Driven Approach2023/10/1
- See Yourself in Others: Attending Multiple Tasks for Own Failure Detection2021/10/1