Hao Li
Stanford University
収録論文 68本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- EgoTools: 実世界の一人称視点動画における道具中心の推論に向けて一人称視点/道具使用推論2026/9/30
道具を使う一人称視点動画の大規模データセット(100時間)と、知覚・幾何・手順・因果推論を問う1,000問のベンチマークを構築し、既存の動画マルチモーダルモデルが道具使用の理解に苦戦することを示した。
- GroundAnything: 並列デコーディングと高精度視覚グラウンディングをフラッシュ速度で両立視覚グラウンディング2026/9/30
拡散モデルによる並列デコーディングで視覚グラウンディングを高速化し、4Bモデルで同規模の最先端性能を達成した研究。
- TacClip: 指先を覆わずに動的接触力を計測するクリップ型センサ触覚センサ2026/9/8
爪に取り付ける小型クリップ型センサで、指先の変形を計測し、接触力や振動を推定する。指の腹を覆わないため、触覚を保ちつつ、視覚ベースの手の追跡と併用できる。
- 身体性を持つSLMにおける幾何条件付け:0.8Bハイブリッドモデルでの訓練制御とロバスト性診断VLA2026/9/6
0.8Bのハイブリッド言語モデルを操作タスクに適応させ、幾何学的入力の条件付けが性能に与える影響を評価した。訓練時の幾何学的整合性による明確な優位性は見られず、座標不変性と物理的配置の汎化のギャップを示した。
- 水中ロボットのための生体模倣型流体力学的知覚を実現するFBGひげセンサ水中ロボット/センサ2026/8/25
アザラシのひげを模倣したFBGひげセンサを開発し、水中ロボットが流れや渦を検知して分岐選択ができることを実証した。
- DreamHand: ビデオ拡散モデルを転用した、遮蔽に頑健な自己中心視点3D手動作復元手動作復元2026/8/20
ビデオ拡散モデルを決定的な幾何エンコーダとして転用し、遮蔽やフレーム外の手の動きを復元する新しい手法を提案。5つのベンチマークでSOTAを達成し、特に遮蔽の多いデータで誤差を大幅に削減した。
- 現代のVLMにおける強力な画素レベル画像改ざん検出のためのシンプルなドメイン一般化手法画像改ざん検出2026/7/20
現代のVLMによる画像編集に対応するため、バランスの取れたミニバッチサンプリングと後期注入戦略を用いたシンプルで効果的なドメイン一般化トレーニングフレームワークを提案し、画素レベルの改ざん検出性能とOOD堅牢性を大幅に向上させた。
- GigaWorld-1: ロボットポリシー評価のためのワールドモデル構築ロードマップワールドモデル2026/7/1
ロボットポリシーの評価を効率化するため、ワールドモデルの信頼性を体系的に研究し、ベンチマークWMBenchを構築して、7つのビデオワールドモデルと4つの行動表現を比較した。
- PhysMani: 動的物体操作のための物理原理に基づく3Dワールドモデル操作2026/7/1
高速で動く物体を操作するための、物理原理に基づく3Dガウシアンワールドモデルと将来予測を考慮した行動ポリシーを組み合わせたフレームワークを提案し、シミュレーションと実機で高い成功率を示した。
- InternVLA-A1.5: 理解・潜在予測・行動の統合による構成的汎化VLA2026/7/1
ロボット操作のための統一モデルで、事前学習済みVLMの意味理解とビデオ生成モデルの動的予測を活用し、将来予測を潜在コードのクエリ問題として再構成することで、実時間制御を維持しつつ構成的汎化を実現した。
- RoboInter1.5: 身体性世界モデリングとロボット操作のための包括的中間表現スイート操作/データセット/世界モデル2026/7/1
ロボット操作と身体性世界モデリングのための、多様な中間表現(サブタスク、プリミティブスキル、物体・グリッパー接地、セグメンテーション、アフォーダンス、把持姿勢、接触点、動作軌跡など)を備えた大規模データセット、ベンチマーク、モデル群を構築した。
- ACE-Ego-0: 自己中心視点の人間とロボットデータを統合したVLA事前学習VLA2026/6/1
ロボットの軌跡データ収集のコストを抑えるため、大規模な自己中心視点の人間ビデオを擬似行動ラベルに変換し、ロボットデータと統合してVLAモデルを事前学習するフレームワークを提案した。
- EBench: 汎用モバイル操作ポリシーの要素診断ベンチマーク/モバイル操作2026/6/1
単一の成功率スコアを超えて、汎用モバイル操作ポリシーの能力と汎化を多次元で診断するシミュレーションベンチマークを提案し、最新モデルの特性を明らかにした。
- SpatialBench:あなたの空間基盤モデルは万能選手か?ベンチマーク2026/5/26
空間基盤モデルの真の汎化能力を評価するため、多様な領域・タスク・入力密度をカバーする大規模ベンチマークSpatialBenchを構築し、41モデルを体系的に評価した。
- VLA初期化のためのVLM表現の再考VLA2026/5/25
VLAモデルの初期化に使う事前学習済みVLM表現の設計を、能力別のVQA教師信号・パラメータ更新戦略・ロボットデータ事前学習の3軸で分析し、元のVLM表現の保持が重要で、LoRAベースの段階的学習が最良であることを示した。
- L-Learning:ラグランジュ力学に基づくリアプノフ安定性を活用した効率的で安定なロボット軌道追従制御2026/5/1
データ駆動制御とリアプノフ安定性理論、ラグランジュ力学を統合し、システムのエネルギー関数を学習することで、安定性を保証しつつ軌道追従性能を高める新しい制御フレームワークを提案した。
- PhysInOne: 一つのスイートで実現する視覚物理の学習と推論データセット/物理推論2026/4/1
物理現象を捉えた大規模合成動画データセットPhysInOneを構築し、物理に基づく映像生成や将来予測、物理特性推定などの性能向上を示した。
- ViVa: ロボット強化学習のためのビデオ生成価値モデル強化学習2026/4/1
事前学習済みのビデオ生成モデルを価値関数として再利用し、将来の身体状態とスカラー価値を同時に予測することで、ロボット操作タスクにおける価値推定を改善する手法を提案した。
- UMI-Underwater: 水中テレオペレーションなしで水中マニピュレーションを学習するマニピュレーション2026/3/1
自己教師ありデータ収集と陸上デモからの知識転移により、水中ロボットの把持を学習するシステムを提案。
- FutureVLA: 視覚言語行動モデルのための統合視覚運動予測VLA2026/3/1
ロボットの行動予測において、視覚と運動の相互作用を捉える新しいアーキテクチャFutureVLAを提案。視覚情報と運動情報を分離しつつ、時間的連続性を保った統合予測を実現する。
- 世界の連鎖:潜在運動における世界モデル思考VLA2026/3/1
視覚言語行動モデルに、潜在運動表現を用いた世界モデルの時間的推論を統合し、効率的なロボット学習を実現する新しいパラダイムを提案した。
- IMPASTO: モデルベース計画と学習された力学モデルを統合したロボット油絵再現ロボットアート/計画2026/3/1
ロボットが油絵の画像列から筆の軌道や力、色を推論して再現するシステムを提案。学習したピクセル力学モデルとモデル予測制御を統合し、自己対戦のみで学習する。
- RoboInter:ロボットマニピュレーションのための包括的中間表現スイートマニピュレーション2026/2/1
ロボット操作のためのデータ・ベンチマーク・モデルを統合した中間表現スイートを提案し、大規模データセットとVQAベンチマーク、計画実行フレームワークを提供する。
- Robo3R: 高精度フィードフォワード3D再構成によるロボットマニピュレーションの強化マニピュレーション2026/2/1
RGB画像とロボット状態から実時間でメートルスケールの3Dシーンを再構成するフィードフォワードモデルを提案し、模倣学習や把持生成などの操作タスクで性能を向上させた。
- IRIS-SLAM: 幾何・インスタンス統合表現による堅牢な意味論的定位とマッピングSLAM2026/2/1
幾何基盤モデルを拡張して密な幾何と視点間で一貫したインスタンス埋め込みを同時予測し、意味論的に対応付けられたループ閉じ込み検出を可能にしたRGB意味論SLAMシステムを提案。
- Wow, wo, val! 具現化世界モデル評価のためのチューリングテスト世界モデル評価2026/1/1
ロボット操作データ609件を用い、動画基盤モデルを世界モデルとして評価する5能力・22指標のベンチマークを提案し、人間の選好との相関0.93超を達成した。
- 理学療法の触診におけるロボット支援皮下組織特徴検出のためのマルチモーダルセンシング触覚2025/12/1
視覚ベースの触覚イメージングと6軸力覚センサを統合した小型マルチモーダルセンサを開発し、シリコンファントム実験で皮下腱の存在・径・深さ・交差・多重性を検出できることを示した。
- ProbeMDE: 手術ロボティクスにおける単眼深度推定のための不確実性誘導型能動固有受容触覚2025/12/1
RGB画像と触覚による疎な深度測定を組み合わせ、アンサンブルの不確実性とSVGDを用いて効率的に触る場所を選び、手術シーンでの単眼深度推定精度を向上させる手法を提案。
- 経尿道的前立腺正中葉核出術のための監督付き自律切除・牽引フレームワーク医療ロボティクス2025/11/1
二本腕の同心管ロボットを用い、CT画像から切除計画を自動生成し、学習ベースの牽引ネットワークと連携して前立腺ファントムの正中葉を97.1%自律切除するシステムを実現した。
- STRIDER: 指示に整合した構造的決定空間最適化によるナビゲーションナビゲーション2025/11/1
未見の3D環境を自然言語指示でナビゲートするゼロショットVLN-CEにおいて、空間構造の事前知識とタスク進捗フィードバックを組み合わせて決定空間を最適化し、成功率を29%から35%へ向上させたフレームワーク。
- InternVLA-M1: 空間誘導型視覚-言語-行動フレームワークによる汎用ロボットポリシーVLA2025/10/1
空間グラウンディングを手がかりに「どこで行動するか」と「どう行動するか」を二段階で学習し、汎用ロボット制御を実現するVLAフレームワークを提案。
- 空間から行動へ:空間基盤事前分布に基づく視覚-言語-行動モデルVLA2025/10/1
RGB画像から空間基盤モデルで3D幾何事前分布を抽出し、行動ヘッドに注入することで、追加センサーなしにVLAモデルの空間推論能力を高めるFALCONを提案。
- DrivingScene: 動的運転シーン向けマルチタスクオンラインフィードフォワード3Dガウシアンスプラッティング3D再構成/自動運転2025/10/1
2枚の連続した全方位画像から動的な運転シーンをオンラインで4D再構成するフィードフォワード型3Dガウシアンスプラッティング手法を提案。
- WoW: 身体性インタラクションを通じた世界全知モデルへの挑戦世界モデル2025/9/1
200万件のロボット操作軌道で学習した140億パラメータの生成的世界モデルを構築し、物理的因果推論を評価する新ベンチマークWoWBenchを提案した論文。
- PERSEUS: 意味論的内視鏡理解とSLAMによる知覚医療ロボティクス2025/9/1
内視鏡手術向けに、学習ベースのセグメンテーション・深度推定・3D再構成を統合し、ロボット姿勢との位置合わせで単眼画像のスケール曖昧性を解消するリアルタイム意味論的SLAMパイプラインを提案。
- F1: 理解と生成を行動に橋渡しする視覚-言語-行動モデルVLA2025/9/1
将来の視覚状態を予測する「視覚的先見」を意思決定に組み込み、それを目標として逆動力学で行動を生成するVLAフレームワークF1を提案し、実世界タスクとシミュレーションで成功率と汎化性能を大幅に向上させた。
- 識別セキュリティタスクのための可変AprilTag視覚マーカー2025/8/1
公開環境での敵対的攻撃に備え、固定ではなく調整可能なAprilTagを利用することを提案した論文。
- TypeTele: 操作タイプでテレオペレーションに器用さを引き出すテレオペレーション2025/7/1
人間の手の動きを模倣するのではなく、ロボットハンド特有の操作タイプをライブラリ化し、MLLMでタスクに適したタイプを選択することで、テレオペレーションの器用さと成功率を向上させるシステムを提案。
- InstructVLA: 理解から操作へと導く視覚-言語-行動インストラクションチューニングVLA2025/7/1
大規模視覚言語モデルの推論能力を保ちつつ、身体性推論を活用して操作性能を高める新しいVLAモデルと学習法を提案し、汎化ベンチマークで大幅な改善を示した。
- GenManip: LLM駆動シミュレーションによる汎化可能な指示追従マニピュレーションマニピュレーション2025/6/1
LLM駆動のシーングラフで多様なタスクを自動生成する卓上シミュレーション環境GenManipと、200シナリオのベンチマークGenManip-Benchを提案し、モジュール型とエンドツーエンド方策の汎化性能を比較評価した。
- STAR: 回転拡張ベクトル量子化による多様なロボットスキル抽象化の学習VLA2025/6/1
VQ-VAEのコードブック崩壊とスキル間因果関係の欠如を解決するため、回転拡張残差スキル量子化と因果スキルトランスフォーマーを組み合わせ、LIBEROベンチマークと実世界タスクで約12%の性能向上を達成した。
- CronusVLA: マルチフレーム視覚-言語-行動モデリングによる効率的で堅牢なマニピュレーションVLA2025/6/1
単一フレームのVLAモデルをマルチフレームに拡張し、特徴チャンキングで履歴情報を集約することで、計算負荷を抑えつつ操作性能と観測の堅牢性を向上させた。
- 任意のLiDARをガイドとする拡散事前分布による教師なしレーダー点群強調センサーフュージョン2025/5/1
ペアデータ不要で、任意のLiDAR知識を組み込んだ拡散モデルを事前分布として使い、レーダー点群の角度分解能を教師なしで高める手法を提案した。
- RoboGround: 接地視覚言語事前知識を用いたロボットマニピュレーションマニピュレーション2025/4/1
視覚言語モデルによるグラウンディングマスクを中間表現として用い、対象物の位置・形状情報を政策ネットワークに与えることで汎化性能を高めるロボット操作システムを提案。大規模シミュレーションデータ生成パイプラインも構築した。
- 単眼視から自律行動へ:3D再構成による腫瘍切除の誘導医療ロボティクス2025/3/1
RGB画像のみから対象解剖のセグメント化点群を生成する3Dマッピングパイプラインを提案し、気道閉塞の再構成と腫瘍切除タスクでRGB-Dカメラに匹敵する性能を示した。
- TacCap: 人間からロボットへの技能転移を可能にするウェアラブルFBG触覚センサ触覚2025/3/1
Fiber Bragg Gratingを用いた軽量・耐久性のあるウェアラブル触覚センサTacCapを開発し、人間の把持データをロボットへ転移できることを把持安定性予測で示した論文。
- 運動学モデリングを統合した時空間グラフ拡散政策による双腕ロボットマニピュレーションマニピュレーション2025/3/1
双腕ロボット操作のための拡散政策に、ロボットの物理構造を反映した動的時空間グラフと微分可能な運動学制約を導入し、自己衝突や関節限界を考慮した運動学的に整合する動作生成を実現した。
- 車両上部タグ支援による自動運転バス向け車路協調測位測位2025/3/1
交差点など遮蔽物の多い環境で、車両上部に付けたタグを路側から検出して車両位置を推定する車路協調測位手法を提案し、シミュレーションで有効性を示した。
- 目標追跡から目標軌道へ:正則化多項式軌道最適化目標追跡2025/2/1
目標の軌道を多項式で表現し、次数制限やL0ノルム正則化を用いて測定値に最も適合する軌道を推定する手法を提案した。
- トラクタ・トレーラ型車輪ロボットにおける統合動画安定化とスティッチングのための統一点運動推定動画安定化・スティッチング2024/12/1
トラクタ・トレーラ型ロボットの振動や姿勢変化、視差に対応するため、統一点運動推定法を提案し、動画安定化とスティッチングを統合した。実機で検証した。
- 信頼度誘導データ関連付けに基づくLiDAR SLAMMOTSLAM/追跡統合2024/12/1
LiDARを用いたSLAMと動物体追跡を統合し、予測と検出の信頼度をデータ関連付けに活用することで、動的環境での自己位置推定と物体追跡の精度を向上させる手法を提案した論文。
- 協調台数を決定する通信効率の良い協調SLAMMOT協調認識2024/11/1
LiDARを用いた協調SLAMMOTにおいて、協調車両数を動的に決定することで性能と通信コストのトレードオフを改善する手法を提案した。
- 複数運動モデルを考慮した視覚SLAMMOTSLAM/物体追跡2024/11/1
LiDAR向けに提案された複数運動モデルを統合したSLAMMOTを視覚センサに適用し、その有効性を検証した研究。
- ヒゲに着想を得た触覚センシング:水中接触追跡のためのSim2Realアプローチ触覚2024/10/1
アザラシなどのヒゲを模した光ファイバーセンサーで水中の接触点を高精度に追跡する手法を開発し、シミュレーションから実世界への転移学習により2mm未満の精度を実現した。
- Kubelka-Munkモデルに着想を得たニューラルネットワークによるスプレー塗装ロボットの軌道最適化における塗料色効果予測の解決塗装ロボット/軌道最適化2024/9/1
Kubelka-Munkモデルと3Dマシンビジョン、人工ニューラルネットワークを組み合わせ、スプレー塗装後の表面色をピクセル単位で予測する手法を提案し、多色塗料の組み合わせ塗装における軌道最適化を可能にした。
- エンドツーエンド自動運転の因果関係を探る自動運転2024/7/1
エンドツーエンド自動運転モデルの意思決定に寄与する要因を、反事実介入と統計分析で解明し、CARLA上で因果探索ツールと強力なベースラインを構築した。
- 受動的ヒゲセンシングによるナビゲーションと3D表面再構成触覚2024/6/1
ロボットアームに取り付けた柔軟な受動的ヒゲが物体に触れた際の接触位置をベイズフィルタリングで推定し、周囲の占有マップと物体表面の3D形状を再構成する手法を提案した。
- 言われたとおりに掴む:言語誘導による巧みな把持生成マニピュレーション2024/5/1
自然言語の指示に従ってロボットが巧みに把持を行うためのデータセットDexGYSNetと、意図に沿った高品質で多様な把持を生成するDexGYSGraspフレームワークを提案した。
- RoboMP²: マルチモーダル大規模言語モデルによるロボットのマルチモーダル知覚・計画フレームワークマニピュレーション2024/4/1
マルチモーダル大規模言語モデルを活用し、目標条件付き知覚器と検索拡張計画器を組み合わせてロボットマニピュレーションの汎化性能を高めるフレームワークを提案。
- Risk-anticipatory autonomous driving strategies considering vehicles' weights, based on hierarchical deep reinforcement learning2024/1/1
- Split Covariance Intersection Filter Based Visual Localization With Accurate AprilTag Map For Warehouse Robot Navigation2023/10/1
- Sonicverse: A Multisensory Simulation Platform for Embodied Household Agents that See and Hear2023/6/1
- The ObjectFolder Benchmark: Multisensory Learning with Neural and Real Objects2023/6/1
- OVO: Open-Vocabulary Occupancy2023/5/1
- CASOG: Conservative Actor-critic with SmOoth Gradient for Skill Learning in Robot-Assisted Intervention2023/4/1
- See, Hear, and Feel: Smart Sensory Fusion for Robotic Manipulation2022/12/1
- Reciprocal Collision Avoidance for General Nonlinear Agents using Reinforcement Learning2019/10/1
- Robust and Precise Vehicle Localization based on Multi-sensor Fusion in Diverse City Scenes2017/11/1