Yunxuan Mao
収録論文 8本 ・ フィジカルAI/ロボット学習
VLAsim2realシーン再構成マニピュレーションSLAM/3D再構成
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- RxBrain:言語と視覚の推論・想像を統合した身体化認知基盤モデルVLA2026/7/1
身体化認知のための基盤モデルRxBrainを提案。言語による計画構造と視覚による世界状態予測を統合し、単一の計画シーケンスで表現する。
- 方向が鍵:力の方向を学習することで接触の多い操作のSim-to-Real転移を実現sim2real2026/2/1
シミュレーションで人間設計の位置・力制御器を教師として使い、接触力の方向を予測する方策を学習。実機では力覚アダミタンス制御器を構成し、電子レンジ開けやペグ挿しなど4タスクで高い成功率と頑健性を示した。
- RynnBrain: オープンな身体性基盤モデルVLA2026/2/1
知覚・推論・計画を統合した時空間基盤モデルRynnBrainを提案し、2B/8B/30B-A3B MoEの3規模と下流タスク向け4変種を公開、20の身体性ベンチマークで既存モデルを大幅に上回った。
- RynnEC:MLLMを身体性認知の世界へVLA2025/8/1
汎用視覚言語モデルに領域エンコーダとマスクデコーダを組み込み、領域中心の動画理解で物体属性・セグメンテーション・空間推論を高精度化した身体性認知向けMLLMを提案。
- UnIRe: 動的都市シーンの教師なしインスタンス分解シーン再構成2025/4/1
RGB画像とLiDAR点雲のみから、4Dスーパーポイントを用いて動的都市シーンを静的背景と個々の動的インスタンスに教師なしで分解し、3Dガウシアンスプラッティングで再構成する手法を提案。
- 雑然環境における言語条件付きピック&プレースのための無条件行動事前分布の効率的アラインメントマニピュレーション2025/3/1
視覚・言語・行動の基盤モデルの事前知識を統合し、1つのアテンション層で無条件行動事前分布を3D視覚言語事前分布にアラインメントすることで、少ないデータで学習しつつゼロショット汎化を保ち、雑然環境での言語条件付きピック&プレースを効率的に実現する手法A²を提案。
- ν-DBA: ニューラル陰的密バンドル調整による画像のみの走行シーン再構成SLAM/3D再構成2024/4/1
3Dニューラル陰的表面で地図を表現し、密オプティカルフローに導かれた幾何誤差で軌跡と地図を同時最適化する密バンドル調整フレームワークを提案し、走行シーンの軌跡推定と密再構成精度を向上させた。
- NGEL-SLAM: Neural Implicit Representation-based Global Consistent Low-Latency SLAM System2023/11/1