Haoyu Zhang
収録論文 20本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- インラインメモリと再利用可能スキルの融合:視覚-言語-行動モデルのためのメモリ中心フレームワークVLA2026/9/30
VLAモデルに学習可能なメモリトークンを挿入し、クエリ-スキルメモリバンクでスキルを外部化することで、パラメータ更新を抑えつつ新タスクへの適応と破滅的忘却の緩和を実現した。
- どこからどのようにへ:自己中心視点ビデオからの連続4Dインタラクション予測動作予測2026/9/8
自己中心視点ビデオから将来の3Dインタラクション位置と全身動作を連続的に予測する手法を提案し、大規模データセットと評価指標も導入した。
- Dream2Reward: 正のデモンストレーションからの遷移整合報酬モデルによるロボット操作マニピュレーション2026/8/19
成功デモから遷移レベルの潜在変位を予測し、観測された動作との整合性で密な報酬を生成する手法を提案。失敗アノテーション不要で報酬ハッキングを軽減し、実ロボット操作を含む下流性能を向上させる。
- AeroGround: 航空・地上協調推論のための包括的ベンチマークベンチマーク2026/8/12
UAVと地上の協調シナリオにおける視覚言語モデルの推論能力を評価する新しいベンチマークを提案し、既存モデルと人間の性能差を明らかにした。
- XPolicyLab: ロボットポリシー評価と展開のための統一標準・オープンエコシステムロボットポリシー評価2026/8/1
ロボットポリシーの評価と展開を統一する標準規格とオープンエコシステムを提案し、N個のポリシーとM個の環境の接続コストをO(NM)からO(N+M)に削減した。
- G0.5: ロボットの推論と行動のための単一自己回帰ストリームVLA2026/8/1
単一のトランスフォーマーデコーダが推論トークンと行動トークンを同一の目的で生成する、事前学習済み自己回帰VLAモデルG0.5を提案。異なるロボットの行動を共有語彙に変換するトークナイザーや、チェーン・オブ・ソート、視覚メモリを導入し、複数のベンチマークでSOTAを達成。
- 大規模視覚言語モデルへの過負荷攻撃による脱獄手法セキュリティ2026/7/3
テキストと画像を再帰的に組み合わせて情報過負荷を起こし、LVLMの安全機構を回避する新しい脱獄攻撃を提案。オープンソース・商用モデルで高い成功率を達成した。
- SpaceEra++: ビデオにおける3次元空間推論のための統合フレームワーク空間推論2026/7/2
本論文は、ビデオから3次元空間推論を行うための統合フレームワークSpaceEra++を提案する。フレーム選択戦略と空間整合手法を導入し、空間理解の精度を向上させた。
- VLAモデルのテスト時モダリティ適応のための因果性を考慮した推論-診断-精緻化フレームワークVLA2026/7/1
視覚と言語と行動を統合するVLAモデルにおいて、テスト時に視覚情報の重要度を因果効果として推定し、行動予測を動的に調整するフレームワークを提案した。
- ウェイポイントを超えて:視覚言語ナビゲーションのための軌跡中心のウェイポイントパラダイムナビゲーション2026/6/1
連続環境での視覚言語ナビゲーションにおいて、孤立したウェイポイントではなく実行可能な軌跡に基づく新しいウェイポイント予測手法を提案し、計画と制御の一貫性を向上させた。
- BridgeACT: 人間のデモンストレーションを統一的なツール・ターゲットのアフォーダンスでロボット動作に橋渡しする操作学習2026/4/1
人間のビデオからロボット操作を直接学習するフレームワークを提案。アフォーダンスを身体非依存の中間表現として使い、把握位置と動作を分解して実ロボットに展開する。
- AdaMorph: 身体性適応型Transformerによる統合モーションリターゲティングモーションリターゲティング2026/1/1
人間の動作を多様なロボット形態へ変換する際、単一モデルで対応できる統合的なニューラルリターゲティング手法を提案。身体性制約に応じて特徴を動的に調整し、12種の人型ロボットでゼロショット汎化を実証した。
- ラベルなしロボット動画に対する変分ボトルネックによる行動情報の強化模倣学習2025/8/1
行動ラベルなしのロボット動画から、潜在行動と真の行動の相互情報量を最大化する変分情報ボトルネックを提案し、模倣学習の性能を向上させた。
- Duawlfin: 車輪移動と飛行を統合アクチュエーションで実現するドローン移動ロボット2025/5/1
標準的なクアッドロータモータと一方向ベアリングを用いた差動駆動機構により、追加アクチュエータなしで車輪移動と飛行を両立するドローンを開発し、その設計・制御・実験検証を示した。
- Depth-PC: クロスモーダル融合を統合したSim2Real転移のためのビジュアルサーボフレームワークsim2real2024/11/1
深度と点群のクロスモーダル特徴融合とグラフニューラルネットワークを組み合わせ、シミュレーション学習から実機へのゼロショット転移を実現したビジュアルサーボ手法を提案。
- MOSE: NeRFによるノイズを含む単眼事前情報を持ち上げたセマンティック再構成3D再構成/セマンティック2024/9/1
単眼画像からノイズの多い2Dセマンティック事前情報をNeRFで3Dに持ち上げ、クラス非依存のセグメンテーションマスクをガイドに使うことで、3D/2Dのセマンティックセグメンテーションと表面再構成を同時に高精度化する手法を提案。
- 制御推論と状態空間ダイナミクスによるマルチエージェント軌道予測の高精度化軌道予測2024/8/1
状態空間モデルとグラフニューラルネットワークを組み合わせ、制御変数を「Mixed Mamba」で推定することで、自動運転における周辺車両や歩行者の軌道予測精度を向上させた研究。
- ニューラルネットワーク学習による動的システムの安定化:ロバストなアプローチ模倣学習2024/7/1
模倣学習において、ニューラルリアプノフ関数と横断収縮理論を組み合わせ、点間運動と周期運動の学習精度と安定性を両立させる新しい自律動的システムアルゴリズムを提案した。
- Learning a Stable Dynamic System with a Lyapunov Energy Function for Demonstratives Using Neural Networks2023/9/1
- Learning Variable Impedance Skills from Demonstrations with Passivity Guarantee2023/6/1