Haoming Song
収録論文 16本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- Hyper-DP3: 視覚運動制御のための3D拡散ポリシーの周波数認識型最適化拡散ポリシー/視覚運動制御2026/5/1
ロボットの動作軌跡が低周波成分に集中する性質を利用し、3D拡散ポリシーの復元モデルを大幅に簡素化して2ステップ推論を可能にする軽量モデルHyper-DP3を提案した。
- ZeroWBC: 一人称視点の人間データから自然な全身ヒューマノイド動作を学習全身制御2026/3/1
人間の一人称視点動画と全身動作・テキスト注釈から、テレオペレーションなしでヒューマノイドの全身インタラクションを学習するフレームワークを提案し、Unitree G1で多様なシーン適応行動を実現した。
- エゴから世界へ:強化学習による身体化システムにおける協調的空間推論空間推論2026/3/1
複数のエージェントが異なる視点から環境を認識する問題を扱い、視覚言語モデルが視点を融合して空間推論を行うためのベンチマークE2Wと、強化学習を用いたフレームワークCoRLを提案した。
- PocketDP3: ポケットサイズの効率的な3D視覚運動ポリシーマニピュレーション2026/1/1
重いU-Netデコーダを軽量なMLP-MixerベースのDiffusion Mixerに置き換え、従来の1%未満のパラメータで高性能な3D拡散ポリシーを実現した研究。
- 変分正則化による情報フィルタリングでロボットマニピュレーションを改善マニピュレーション2026/1/1
拡散ベースの視覚運動方策の中間特徴に含まれるタスク無関係なノイズを、文脈条件付きガウス分布とKL正則化による適応的情報ボトルネックで除去するプラグアンドプレイ手法を提案し、シミュレーションと実機で成功率を向上させた。
- マルチエージェントロボットシステム(MARS)チャレンジの進歩と革新マルチエージェント2026/1/1
NeurIPS 2025ワークショップで開催されたMARSチャレンジを紹介し、VLMを用いたマルチエージェントの計画とロボットマニピュレーションの制御という2領域での取り組みを概説した論文。
- LAP: 自動運転のための高速潜在拡散プランナー自動運転計画2025/12/1
VAEで学習した潜在空間で拡散計画を行うことで、マルチモーダルな運転戦略を捉えつつ、1ステップのデノイジングで最大10倍高速な自動運転プランナーを実現した。
- FastUMI-100K:大規模UMI形式データセットによるデータ駆動型ロボットマニピュレーションの進展マニピュレーション2025/10/1
モジュール型ハードウェアと軽量トラッキングを備えたFastUMIシステムで収集した10万件超の家庭内タスク実演データセットを構築し、多様な模倣学習アルゴリズムで高い成功率を示した。
- 軌道条件付き異形態間スキル転移模倣学習2025/10/1
人間のデモ動画から疎なオプティカルフロー軌道を抽出し、それを条件としてロボットの操作動画と実行行動を生成することで、形態の違いを超えたスキル転移を実現した研究。
- F1: 理解と生成を行動に橋渡しする視覚-言語-行動モデルVLA2025/9/1
将来の視覚状態を予測する「視覚的先見」を意思決定に組み込み、それを目標として逆動力学で行動を生成するVLAフレームワークF1を提案し、実世界タスクとシミュレーションで成功率と汎化性能を大幅に向上させた。
- EO-1: 汎用ロボット制御のためのオープンな統合身体性基盤モデルVLA2025/8/1
視覚・言語・行動を統合的に扱う基盤モデルEO-1と150万件のデータセットEO-Data1.5Mを提案し、多様なロボットでの長期的な器用マニピュレーションを実現した。
- Hume:視覚-言語-行動モデルにシステム2思考を導入VLA2025/5/1
価値誘導型の熟考(システム2)と軽量な反応型ポリシー(システム1)を組み合わせた二重システムVLAモデルを提案し、器用なロボット制御を実現した。
- 小さく考え、大きく行動する:生涯ロボットマニピュレーションのためのプリミティブプロンプト学習マニピュレーション2025/4/1
スキル間で共有されるプリミティブをプロンプトとして学習し、生涯にわたるロボットマニピュレーションを実現する手法を提案。
- SpatialVLA:視覚-言語-行動モデルのための空間表現の探求VLA2025/1/1
ロボット操作における空間理解の重要性に着目し、3D位置エンコーディングと適応的行動グリッドを導入した視覚-言語-行動基盤モデルSpatialVLAを提案。110万件の実世界ロボットデータで事前学習し、ゼロショットでの操作や新環境への適応を実現した。
- FastUMI: スケーラブルでハードウェア非依存の汎用マニピュレーションインターフェースとデータセットマニピュレーション2024/9/1
ロボットアームの実世界データ収集を低コスト・ハードウェア非依存で実現するため、UMIを再設計したFastUMIを提案し、22タスク・1万軌跡超のデータセットを公開した。
- 相互作用予測によるマニピュレーション学習マニピュレーション2024/6/1
初期・最終状態と言語指示から遷移フレームと操作対象物体を予測する事前学習手法MPIを提案し、実機・シミュレーションで従来手法を10〜64%上回る性能を達成した。