Song Guo
収録論文 14本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- SteerQuant: 行動誘導スケーリングによるWorld-Actionモデルの量子化誤差制御量子化2026/9/30
World-Actionモデル向けの4bit量子化フレームワークで、各ストリームの量子化誤差が最終行動に与える影響を考慮してスケーリングを調整し、精度を保ちつつ推論を高速化する。
- Sparse-WAM: 行動誘導スパース想像によるWorld Action Modelの高速化VLA2026/9/30
World Action Modelの推論時、行動トークンから未来フレームへの注意分布が連続するデノイズステップ間で類似している点を利用し、行動に関連するトークンだけを選択処理する学習不要の高速化フレームワークを提案。
- 予測を超えて:回顧的世界モデリングによるVLMエージェントの誘導VLA2026/9/30
VLMエージェントに回顧的世界モデリングを導入し、行動の原因を逆推定する能力と自己整合性報酬を組み合わせることで、物理的に整合した行動を学習させる手法を提案。
- OnlineWM: 因果性を考慮した能動的オンライン学習による効果的な世界モデリング世界モデル2026/9/20
シミュレータと能動的に対話しながら、モデルの弱点を狙ったデータを収集し、反事実学習で行動と状態遷移の因果関係を捉える世界モデルのオンライン学習フレームワークを提案。
- 基盤モデル時代における人間中心知能:サーベイサーベイ2026/8/18
基盤モデル時代の人間中心知能について、人間を観察対象・動的アクター・状況エージェントとして捉える6層のタクソノミーを導入し、方法論、代表的手法、データセット、課題を体系的にレビューしたサーベイ論文。
- WorldCycle: 長期的ビデオワールドモデルのための自己検証型強化学習ワールドモデル/強化学習2026/8/5
可逆なアクションサイクルを用いて、長期的な正確性を検証する自己教師あり強化学習フレームワークを提案し、ワールドモデルのドリフトを大幅に低減した。
- RedFlow: 失敗をアクションレベルの修正へと変換するフローマッチングVLAポリシーVLA/オフラインRL2026/7/1
フローマッチングVLAポリシー向けに、失敗データをアクションレベルの修正信号に変換するオフライン強化学習フレームワークRedFlowを提案。実世界成功率を56.7%から74.7%に向上させた。
- インテリジェントなサイバー・物理・社会システムのためのブロックチェーン基盤:具現化AI時代における耐量子セキュリティ、相互運用性、信頼できるデータ経済ブロックチェーン/データ経済2026/6/5
具現化AIと量子コンピューティングの進展に対応するため、ブロックチェーンを耐量子暗号とデータ共有を実現する基盤として解説するチュートリアル。
- WorldCraft: カメラナビゲーションからオブジェクト操作へ - インタラクティブビデオワールドモデルにおけるビデオワールドモデル2026/5/24
ビデオベースのワールドモデルをカメラ操作からオブジェクトレベルの軌跡操作へ拡張するフレームワークを提案。ユーザーのクリックと描画パスに基づき、選択オブジェクトが軌跡に沿って動く未来フレームを生成する。
- 具身AIとロボットシミュレーションのための3D生成:サーベイ3D生成/サーベイ2026/4/1
本論文は、具身AIとロボットシステムにおける3D生成の役割を、データ生成、シミュレーション環境構築、Sim2Real橋渡しの3つの観点から整理したサーベイである。物理的整合性やインタラクション対応など、視覚的リアリズムを超えた要件に焦点を当て、現状の課題を分析している。
- HALO: 身体性マルチモーダル連鎖推論のための統合視覚-言語-行動モデルVLA2026/2/1
テキスト推論・視覚的サブゴール予測・行動予測を統合したEM-CoT推論を可能にするVLAモデルHALOを提案し、シミュレーションと実環境でベースラインを上回る性能を示した。
- WMPO:世界モデルに基づく視覚-言語-行動モデルの方策最適化VLA2025/11/1
実環境と相互作用せずにピクセルベースの世界モデル上でVLAモデルを強化学習し、自己修正などの創発行動やサンプル効率の向上を実現した。
- 低遅延エッジSLAMのためのジョイントオフローディングとスケジューリングの統合エッジSLAM2025/2/1
移動ロボットのvSLAMをエッジサーバで支援する際に、入力変動と時間変化する要求に対応するため、領域特徴予測・圧縮/オフロード統合・制約付きスケジューリングを組み合わせた新アーキテクチャを提案し、姿勢推定精度の向上と通信コストの最大47%削減を実現した。
- IRASim: ロボットマニピュレーションのための細粒度ワールドモデルワールドモデル2024/6/1
拡散トランスフォーマーとフレーム単位の行動条件付けモジュールを導入し、ロボットと物体の細かな相互作用を捉えた動画を生成するワールドモデルを提案。方策評価の加速やモデルベース計画による性能向上を実証した。