Song Wang
University of Central Florida
収録論文 38本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- ReF-HIL: 人間の行動近傍を中心に批評器を形成する効率的なHuman-in-the-Loop強化学習マニピュレーション2026/9/29
人間の成功体験から価値参照を学習し、人間行動の近傍領域を定義することで、模倣ペナルティを避けつつ実世界のマニピュレーションを効率的に強化学習する手法を提案。
- VLAQuantBench:視覚言語行動モデルの訓練後量子化の閉ループ評価VLA2026/9/21
VLAモデルの訓練後量子化について、層範囲・数値形式・キャリブレーションの相互作用を409回の実行と94,574エピソードで体系的に評価したベンチマークを提案。
- 言語と物理を橋渡しする:大規模言語モデルによる連続体ロボットの自動設計ロボット設計2026/9/8
大規模言語モデルを用いて、物理シミュレーションの状態をフィードバックとして組み込む多層フレームワークAID-SRを提案し、腱駆動連続体ロボットの自動設計を実現した。
- JoyNexus: VLAモデルのためのサービス指向マルチテナント後訓練VLA2026/7/17
VLAモデルの後訓練を効率化するため、マルチテナント対応の統合サービスを提案。訓練・推論・環境サービスを分離し、APIで提供することで、リソース利用の効率化とコスト削減を実現。
- 遅い推論器から速いプランナーへのトークン単位潜在ストリーミングによる動的視覚言語ナビゲーションナビゲーション2026/7/1
動的な人間中心環境での視覚言語ナビゲーションにおいて、遅いVLMの推論中に中間隠れ状態をストリーミングして高速なプランナーを逐次更新するSPARK-VLNを提案し、ナビゲーション成功率と社会的コンプライアンスを向上させた。
- ABot-Earth 0.5: 生成型3D地球モデル3D生成2026/6/8
衛星画像から広大な3D環境を生成する生成モデルを提案し、3Dガウススプラッティングを用いてリアルな都市景観を高速に合成する。
- JoyAI-Sim: 具現化データピラミッドのためのシミュレーション対応相互変換ツールチェーンシミュレーション2026/6/1
実ロボットのデータ収集と評価の限界を補うため、シミュレーションを介してロボットと人間のデータを相互変換するツールチェーンを提案し、評価とデータ生成のスケーラビリティを向上させる。
- ARP: 視覚的整合と反復的洗練による量子化スキル抽象化の強化でロボット操作を実現操作学習2026/6/1
長期的な操作タスク向けに、視覚と行動を整合させ、離散スキル表現の精度を反復的に洗練する新しいポリシーを提案し、ベンチマークと実機で効果を実証した。
- 具身知能のためのスケーラブルで再現可能なクローズドループシミュレーション基盤の構築シミュレーション基盤2026/6/1
クラウドネイティブ技術を用いて、大規模トレーニング・標準評価・データ収集を統合した具身知能向けシミュレーション基盤を提案する論文。
- IMWM: 直感モデルが世界モデルを補完し潜在計画を実現計画2026/6/1
学習した潜在世界モデルによる計画では、世界モデルの精度だけでなく探索もボトルネックになることを示し、デモから学習した直感モデルを世界モデルと組み合わせるIMWMを提案した。
- 行動不変なタスク表現学習とTransformer基盤の世界モデルによるオフラインメタ強化学習オフライン強化学習2026/5/30
オフラインメタ強化学習におけるコンテキストとポリシーの分布シフト問題を解決するため、情報理論に基づくタスク表現学習とTransformer型確率的世界モデルを統合したフレームワークを提案した。
- JoyAI-RA 0.1: ロボット自律性のための基盤モデルVLA2026/4/1
オープンワールドでのロボット操作の汎化を目指し、ウェブデータ、人間の操作動画、シミュレーション、実ロボットデータを統合したVLA基盤モデルJoyAI-RAを提案。実世界とシミュレーションで最先端性能を達成した。
- AIネイティブクラウド具身知能基盤のための千GPU大規模訓練と最適化レシピ基盤技術2026/3/1
具身知能の大規模訓練を実現するため、クラウド上に千GPU分散訓練プラットフォームを構築し、データパイプラインやモデル最適化、インフラ連携により訓練時間を40倍短縮した。
- DynFlowDrive: フローベース動的世界モデルによる自動運転自動運転/世界モデル2026/3/1
拡散フローで運転行動に応じたシーン状態の遷移を学習する潜在世界モデルを提案し、安定性を考慮した軌道選択で自動運転の計画信頼性を向上させた。
- 自己カリキュラム型モデルベース強化学習による変形可能な線状物体の形状制御変形物体マニピュレーション2026/2/1
モデルベース強化学習とオンライン視覚サーボを組み合わせ、変形可能な線状物体の複雑な大変形形状制御を高効率・高精度に実現し、実機へゼロショット転移した研究。
- GenMRP: 効率的でパーソナライズされたリアルタイム産業ナビゲーションのための生成的多経路計画フレームワーク経路計画2026/2/1
大規模道路網において、動的に部分ネットワークを構築し、ユーザ履歴と道路特徴を考慮したリンクコストモデルとダイクストラ法を反復適用することで、効率的かつ多様でパーソナライズされた複数経路を生成する生成的枠組みを提案。
- 自動運転のための視覚-言語-行動モデル:過去・現在・未来VLA2025/12/1
自動運転における視覚-言語-行動(VLA)フレームワークの進化を整理し、End-to-End型とDual-System型の2つのパラダイムに分類して、その特徴と課題を概観したサーベイ論文。
- 空間知能の構築:自律システムのためのマルチモーダル事前学習ロードマップマルチモーダル事前学習2025/12/1
自動運転車やドローンなどの自律システムに向けて、カメラやLiDARなどのマルチモーダルセンサーデータを活用した事前学習技術を整理し、統一的な分類と今後の課題・ロードマップを提示したサーベイ論文。
- RoboCOIN: 統合マニピュレーションのためのオープンソース両腕ロボットデータ収集マニピュレーション2025/11/1
15種類のロボットプラットフォームから18万件以上の両腕操作デモを集めた大規模データセットを構築し、階層的な注釈とデータ処理パイプラインを提供した。
- OneOcc: 単一パノラマカメラによる脚式ロボットの意味的占有予測意味的占有予測2025/11/1
脚式ロボット向けに、単一のパノラマカメラ映像から360度の3D意味的占有を予測するフレームワークOneOccを提案。歩行時の揺れ補償や二重投影融合などの工夫で高精度を実現し、新たなベンチマークも公開。
- GUIDE: 自動運転の障害物認識を強化するガウス統合インスタンス検出自動運転認識2025/11/1
3Dガウス表現を用いてインスタンス検出と占有予測を統合し、追跡も可能な自動運転向けフレームワークを提案。nuScenesで従来比50%向上の精度を達成。
- Classifier-Free Guidanceで拡散ポリシーを強化する時系列ロボットタスクVLA2025/10/1
条件付き・無条件モデルを組み合わせたClassifier-Free Guidanceを拡散ポリシーに導入し、時系列タスクでの局所最適化や反復動作を抑えてヒューマノイドロボットの成功率と信頼性を高めた研究。
- 3D・4D世界モデリングのサーベイ世界モデル2025/9/1
RGB-D画像や占有グリッド、LiDAR点群といったネイティブな3D/4D表現を用いた世界モデリング研究を初めて体系的に整理し、定義・分類・データセット・評価指標をまとめたサーベイ。
- 不確実な嵌合タイプと嵌合量を伴うバッチ精密組立タスクのためのロバストでコンプライアントなロボット組立制御戦略組立/強化学習2025/8/1
嵌合タイプや嵌合量が不確実なバッチ精密組立において、力・視覚融合制御とマルチタスク強化学習、マルチティーチャー方策蒸留を組み合わせ、ロバストなコンプライアンス制御戦略を構築した研究。
- 粗から細へのアプローチによるマルチモーダル3D占有グラウンディング3Dグラウンディング2025/8/1
自然言語記述に基づき3D空間内の物体をボクセル単位で特定する新しいベンチマークと、視覚・テキスト・点群を統合したエンドツーエンドモデルGroundingOccを提案。
- 単一視点・単一ショットを超えて:LiDAR表現学習のためのクロスビュー・長期蒸留LiDAR表現学習2025/7/1
LiDARシーケンスの時空間的手がかりを活用し、複数カメラ視点と長期フレームの画像特徴を統合してLiDAR表現学習を強化するLiMAを提案。セグメンテーションと3D物体検出を改善。
- マスク付きリカレントネットワークによる単眼セマンティックシーン補完3Dシーン理解2025/7/1
単眼RGB画像からボクセル単位の占有と意味カテゴリを予測するMSSCを、粗い予測とマスク付きリカレントネットワークの2段階に分解し、屋内・屋外両方で最先端性能を達成した研究。
- SAM4D: カメラとLiDARストリームを横断するセグメンテーションモデルマルチモーダルセグメンテーション2025/6/1
カメラとLiDARの両ストリームでプロンプト可能なセグメンテーションを行うマルチモーダル基盤モデルを提案し、自動運転シーンでの時系列一貫性とアノテーション効率を大幅に向上させた。
- イベントカメラ支援による意味的シーン補完3Dシーン理解2025/2/1
イベントカメラとRGBを融合し、動きぼやけや悪天候下でも頑健な3Dシーン補完を実現するフレームワークEvSSCと、その評価用ベンチマークDSEC-SSCを提案した論文。
- GenMapping: 逆透視変換を活用したロバストなオンラインHDマップ構築自動運転/HDマップ2024/9/1
逆透視変換でカメラパラメータを学習から切り離し、3分岐の協調アーキテクチャとクロスビュー学習により、未知のカメラ設定でも汎化するオンラインHDマップ生成フレームワークを提案。
- ReliOcc: 不確実性学習による信頼性の高い意味的占有予測自動運転/占有予測2024/9/1
カメラベースの意味的占有予測の信頼性を評価し、不確実性を組み込んだプラグアンドプレイ手法ReliOccで予測の信頼性を向上させた研究。
- PR2: 物理・フォトリアルなヒューマノイドテストベッドと競技会でのパイロット研究sim2real2024/9/1
物理シミュレーションとフォトリアルな描画を両立したヒューマノイドロボットのテストベッドPR2を開発し、全国規模の大学ロボット競技会で実証した。
- DTCLMapper: ベクトル化HDマップ構築のための二重時間一貫性学習自動運転/HDマップ2024/5/1
BEV知覚における時間融合の冗長性を抑えるため、インスタンス埋め込みと幾何マップを組み合わせた二重時間一貫性学習でベクトル化HDマップを構築する手法を提案。
- スクリブル注釈によるラベル効率的な意味的シーン補完意味的シーン補完2024/5/1
スパースなスクリブル注釈と密な幾何ラベルを組み合わせた新しいベンチマークScribbleSCを構築し、Scribble2Sceneという手法で完全教師ありに匹敵する性能を少ないラベルで実現した。
- すべてのボクセルは平等ではない:自己蒸留を用いた難易度認識型セマンティックシーン補完セマンティックシーン補完2024/4/1
3D空間のボクセルごとに難易度を考慮し、学習が難しい領域を重点的に学習する自己蒸留ベースのセマンティックシーン補完手法を提案。
- 自動運転向けハイブリッド伝播によるオフボード占有予測の精緻化自動運転/3Dシーン理解2024/3/1
車載の視覚ベース3D意味シーン補完(SSC)予測を、オフボードで局所・大域の二段階伝播により高精度化するフレームワークOccFinerを提案し、SemanticKITTIで最先端性能を達成した。
- LiDAR2Map: In Defense of LiDAR-Based Semantic Map Construction Using Online Camera Distillation2023/4/1
- Meta-RangeSeg: LiDAR Sequence Semantic Segmentation Using Multiple Feature Aggregation2022/2/1