Jun Cen
収録論文 19本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 身体化操作のためのデータピラミッド:サーベイデータ収集/身体化AI2026/7/1
実ロボットデータからシミュレーションデータまで、身体化エージェントの学習に使われる5つのデータ源をピラミッド構造で整理し、各データの特性と組み合わせ方を分析したサーベイ論文。
- Dream-Tac: 接触を伴うロボット操作のための統合触覚世界行動モデル触覚/操作2026/6/1
視覚と触覚を統合した世界行動モデルを提案し、接触を伴う操作タスクでの行動予測精度を向上させた。
- RynnBrain: オープンな身体性基盤モデルVLA2026/2/1
知覚・推論・計画を統合した時空間基盤モデルRynnBrainを提案し、2B/8B/30B-A3B MoEの3規模と下流タスク向け4変種を公開、20の身体性ベンチマークで既存モデルを大幅に上回った。
- 産業点検シナリオにおける安全性評価のためのマルチモーダルベンチマークマルチモーダル/産業点検2026/1/1
実環境で稼働する点検ロボットから収集した、7種類のセンサモダリティと画素単位の注釈・安全度ラベルを備えた産業点検安全評価用マルチモーダルデータセットInspecSafe-V1を構築した。
- VLSA: プラグアンドプレイ安全制約層を備えた視覚-言語-行動モデルVLA2025/12/1
VLAモデルに制御バリア関数ベースの安全制約層を追加し、指示追従性能を保ちつつ衝突回避を改善する手法を提案し、SafeLIBEROベンチマークで評価した。
- 自動運転のための視覚-言語-行動モデル:過去・現在・未来VLA2025/12/1
自動運転における視覚-言語-行動(VLA)フレームワークの進化を整理し、End-to-End型とDual-System型の2つのパラダイムに分類して、その特徴と課題を概観したサーベイ論文。
- Token Expand-Merge: VLAモデルのための学習不要トークン圧縮VLA2025/12/1
VLAモデルの推論を高速化するため、追加トークンの動的展開と行動認識に基づく統合を組み合わせた学習不要のトークン圧縮手法TEAM-VLAを提案し、LIBEROで成功率を維持しつつ速度を改善した。
- RynnVLA-002:視覚言語行動と世界モデルの統合VLA2025/11/1
視覚言語行動モデルと世界モデルを統合し、環境の物理を学習して行動生成を洗練させるフレームワークを提案。シミュレーションと実機で性能向上を実証。
- HiMaCon: ラベルなしマルチモーダルデータからの階層的マニピュレーション概念の発見マニピュレーション2025/10/1
クロスモーダルな相関と複数時間スケールの予測を組み合わせ、人手アノテーションなしで階層的な操作概念を自己教師あり学習するフレームワークを提案。シミュレーションと実機で性能向上を示し、獲得概念が人間に解釈可能な操作プリミティブに似ることを明らかにした。
- RynnVLA-001:人間のデモンストレーションを活用したロボットマニピュレーションの改善VLA2025/9/1
人間の操作動画で大規模に事前学習した視覚-言語-行動モデルを提案し、2段階の事前学習とActionVAEで行動予測を効率化してロボット操作性能を向上させた。
- シミュレータ内での自己進化型模倣学習模倣学習2025/9/1
少数のデモンストレーションからシミュレータとの相互作用を通じて徐々に性能を向上させるSEILを提案し、LIBEROベンチマークで少数ショット模倣学習の最先端性能を達成した。
- 人間らしい事前知識を活用したアフォーダンス認識型ロボット巧み把持マニピュレーション2025/8/1
人間の手の動きを模倣した事前学習と、機能的に不適切な接触領域を避けるアフォーダンス認識モジュールを組み合わせ、自然で汎用的な巧み把持を実現するフレームワークAffordDexを提案。
- WorldVLA:自己回帰型行動世界モデルへの挑戦VLA2025/6/1
視覚・言語・行動モデルと世界モデルを統合し、行動と画像の相互生成を通じて行動生成と将来画像予測を同時に改善する自己回帰型フレームワークを提案。
- ロボットマニピュレーションにおける生成AI:サーベイマニピュレーション2025/3/1
GAN・VAE・拡散モデルなどの生成モデルをロボットマニピュレーションに応用する研究を、データ生成から方策学習まで階層的に整理したサーベイ。
- LargeAD: 自動運転のための大規模クロスセンサデータ事前学習自動運転/3D知覚2025/1/1
2D画像から視覚基盤モデルでスーパーピクセルを抽出しLiDAR点群と対応付けることで、自動運転向けのクロスモーダル3D表現を大規模事前学習するフレームワークを提案。
- Calib3D:信頼できる3Dシーン理解のためのモデル選好の校正3Dシーン理解2024/3/1
3Dシーン理解モデルの不確実性推定の信頼性を評価するベンチマークCalib3Dを提案し、28モデル・10データセットで検証。校正を改善する深度対応スケーリング手法DeptSも導入。
- Segment Any Point Cloud Sequences by Distilling Vision Foundation Models2023/6/1
- Open-world Semantic Segmentation for LIDAR Point Clouds2022/7/1
- BORM: Bayesian Object Relation Model for Indoor Scene Recognition2021/8/1