Tao Huang
収録論文 40本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- SlackDrive: 実行時余裕を活用した適応的運転推論自動運転推論最適化2026/9/23
運転世界行動モデルの推論コストを、実測レイテンシから計算余裕を推定して制御ステップごとに計算予算を適応配分することで削減する手法。
- RiverVLN: フェーズ接地型時間的視覚言語ナビゲーションによる無人水上艇の河川航行VLA2026/9/20
河川を航行する無人水上艇(USV)向けに、長期的な言語指示を視覚的に検証可能な意味フェーズ列に変換し、予測・実行・再観測ループで連続的なSE(2)姿勢増分を予測するナビゲーション手法PGT-NAVとベンチマークRiverVLNを提案した。
- 適応的動作計画と追従による人型ロボットのプロテニススタイル実現ヒューマノイド/模倣学習/sim2real2026/8/20
放送映像からプロのテニス動作を学習し、適応機構でシミュレーションと実機のギャップを埋めることで、人型ロボットにプロ級のサーブとラリーを実現するフレームワークを提案した。
- 見ずして先を見通す:ワールドアクションモデルのための潜在的未来VLA2026/8/12
未来のビデオを生成せずに、潜在的な未来の状態をアクション生成に活用する新しいワールドアクションモデル「ForeWAM」を提案し、LIBEROベンチマークで高い成功率を達成した。
- StellaVLA: 汎用視覚言語行動モデルのための文脈内構造化デモンストレーションVLA2026/8/1
StellaVLAは、テスト時に単一の構造化デモンストレーションを条件付けすることで、分布外の状況でも適応できる視覚言語行動モデルを提案する。
- Kairos: 後悔を考慮した物理AI向けネイティブ世界行動モデルスタック世界モデル2026/6/15
物理AIのための世界モデルスタックを提案し、制御に重要な情報のみを学習・維持・展開する手法を導入した。
- 視覚言語行動モデルにおけるパラメータ冗長性の再考:VLMからVLAへの適応からの洞察VLA/モデル圧縮2026/6/1
VLAモデルのパラメータ削減時に性能劣化が不可避とされる従来の見解に疑問を呈し、適応時のパラメータ変化の空間分布を解析し、モジュールごとの重要度に基づくマルチモジュール同時刈り込み手法を提案した。
- 身体化知能における触覚ベースのマルチモーダル融合:視覚・言語・接触駆動パラダイムのサーベイ触覚/サーベイ2026/5/1
触覚と視覚・言語を統合するマルチモーダル触覚融合の研究を包括的に調査し、データセットと手法の階層的分類法を提案した論文。
- シミュレーションからリアリズムを見る:視覚言語行動データ拡張のための効率的なビデオ変換VLA/データ拡張2026/5/1
シミュレーションで生成したVLA学習用ビデオを、タスクの意味と行動軌跡を保ちつつ現実的なビデオに変換する効率的なデータ拡張フレームワークを提案。拡散モデルの特徴再利用とコアセットサンプリングにより計算コストを抑え、実ロボットを含む複数ベンチマークで性能を向上させた。
- SMASH: 自己中心視覚によるヒューマノイド卓球のスケーラブルな全身スキルの習得全身制御2026/4/1
外部センサに頼らず、自己中心視覚のみで連続打撃可能なヒューマノイド卓球システムを構築し、全身協調動作と生成モデルによる多様な打撃動作の学習を実現した。
- ロボットの触覚を感じる:器用な操作のための触覚フィードバックアレイグローブ遠隔操作/触覚2026/3/1
高精度な磁気式モーションキャプチャと指先の触覚アクチュエータアレイを組み合わせた低コストグローブを開発し、触覚を活用した遠隔操作による器用なマニピュレーションを実現した。
- WaterVideoQA:マルチモーダルエージェントによるASV中心の知覚と規則準拠推論VLA2026/2/1
水上航行環境に特化した大規模動画QAベンチマークWaterVideoQAと、マルチエージェント神経記号システムNaviMindを提案し、ASVの認知・推論能力を評価・向上させる。
- アフォーダンス場介入:ロボットマニピュレーションにおけるVLAの記憶トラップからの脱出VLA2025/12/1
VLAモデルが未知環境で記憶した軌道に固執する「記憶トラップ」を固有感覚で検知し、3D空間アフォーダンス場をプラグインとして用いて軌道を修正する軽量ハイブリッド手法を提案。
- RoboMirror: 模倣の前に理解する、動画からヒューマノイド歩行への変換VLA2025/12/1
VLMを用いて動画から視覚的な運動意図を抽出し、拡散ポリシーを条件付けることで、ポーズ再構成やリターゲティングなしにヒューマノイドの歩行を生成するフレームワークを提案。
- フリースタイルはできる?音声制御による表現豊かなヒューマノイド歩行歩行2025/12/1
音声から直接ヒューマノイドのダンスや身振りを生成する統一フレームワークRoboPerformを提案し、低遅延で高忠実な音声同期動作を実現した。
- 光明探検者:汎用環境における自律探査のための四脚ロボットプラットフォーム歩行2025/12/1
多様な環境で自律探査を行うためのハードウェアとソフトウェアを統合した四脚ロボットプラットフォームを開発し、実世界実験で有効性を示した。
- AerialMind:UAVシナリオにおける参照マルチオブジェクト追跡に向けてVLA2025/11/1
UAV(ドローン)映像で自然言語指示に基づくマルチオブジェクト追跡を行うための大規模ベンチマークAerialMindと、半自動ラベリング手法COALA、追跡手法HawkEyeTrackを提案した論文。
- ヒューマノイドゴールキーパー:位置条件付きタスク運動制約からの学習ヒューマノイド2025/10/1
人間の運動事前分布を敵対的学習で取り込み、ヒューマノイドが高速で飛来するボールを自律的に自然な全身動作で阻止する強化学習フレームワークを実現した。
- PhysHSI:実世界で汎化可能な自然なヒューマノイド・シーンインタラクションシステムヒューマノイド2025/10/1
シミュレーションでの敵対的動作事前分布に基づく方策学習と、LiDARとカメラを組み合わせた粗から細への物体位置推定により、ヒューマノイドが実世界で物体運搬や着座などの多様なインタラクションを自然に自律実行できるシステムを構築した。
- 言語から運動へ:動作潜在ガイダンスによるリターゲティング不要なヒューマノイド制御VLA2025/10/1
言語指示から直接ヒューマノイドの動作を生成するフレームワークRoboGhostを提案し、従来の動作デコード・リターゲティングを省略して低遅延かつ高精度な制御を実現した。
- 適応的な動作追従による柔軟なヒューマノイド制御ヒューマノイド制御2025/10/1
単一の参照動作からキーフレームを抽出・編集してデータを拡張し、追従速度を調整するアダプタを学習することで、ヒューマノイドが多様な実環境条件に動作パターンを保ちながら適応できる手法を提案。
- 任意のLiDARをガイドとする拡散事前分布による教師なしレーダー点群強調センサーフュージョン2025/5/1
ペアデータ不要で、任意のLiDAR知識を組み込んだ拡散モデルを事前分布として使い、レーダー点群の角度分解能を教師なしで高める手法を提案した。
- GLEAM: 複雑な3D屋内環境における能動的マッピングのための汎化可能な探索方策の学習能動的マッピング/探索2025/5/1
合成・実スキャンの1,152シーンからなる大規模ベンチマークGLEAM-Benchを構築し、意味表現と長期目標・ランダム化戦略で未知の複雑シーンでも高被覆・高精度に探索する汎化可能な能動的マッピング方策を提案した。
- OptiPMB: 最適化ポアソン多ベルヌーイフィルタによる3D多物体追跡の強化3D多物体追跡2025/3/1
自律走行向けの3D多物体追跡において、最適化されたポアソン多ベルヌーイフィルタを用いたモデルベース手法を提案し、nuScenesとKITTIで最先端の精度を達成した。
- 多様な姿勢からのヒューマノイド起立制御の学習sim2real2025/2/1
強化学習により、多様な姿勢から実機ヒューマノイドが滑らかに起立できる制御則を学習し、シミュレーションから実世界への転移を実現した。
- BeamDojo: 疎な足場上での俊敏なヒューマノイド歩行の学習歩行2025/2/1
多角形の足に適したサンプリングベースの足場報酬と二重クリティック、2段階強化学習を組み合わせ、疎な足場を正確に踏み分けるヒューマノイド歩行を実現した。LiDARによるオンボード標高マップで実機展開も可能。
- VB-Com: 知覚欠損下でも歩行可能な視覚・盲複合ヒューマノイド制御歩行2025/2/1
視覚ポリシーと盲ポリシーを状況に応じて切り替える複合フレームワークVB-Comを提案し、知覚が不十分な動的環境でもヒューマノイドが安定して歩行できることを示した。
- VLA-Cache: 適応的トークンキャッシュによる効率的な視覚-言語-行動マニピュレーションVLA2025/2/1
ロボット操作におけるVLAモデルの推論を高速化するため、フレーム間で変化の少ない視覚トークンをキャッシュ・再利用し、重要なトークンのみ再計算する学習不要の手法を提案。最大1.7倍の高速化と制御周波数15%向上を達成。
- 知覚的内部モデルによるヒューマノイドの歩行学習歩行2024/11/1
機体周辺の高さマップを内部モデルとして用い、ノイズに強く低計算コストでヒューマノイドの階段昇降を含む不整地歩行を実現した研究。
- ロボットがロボットを事前学習:大規模ロボットデータセットからの操作中心のロボット表現マニピュレーション2024/10/1
大規模ロボットデータセットDROIDを用い、視覚特徴と操作のダイナミクス(行動・固有感覚)を対比学習で結びつけた操作中心の基盤表現MCRを提案し、4シミュレーション領域20タスクで有効性を示した。
- 最大航続距離制約下でのマルチロボットタスク割り当てと経路計画群制御2024/9/1
ロボットの最大航続距離を考慮し、経路計画とオークションを統合したタスク割り当て手法を提案。障害物回避距離を反映し、遅延オークションで高速化を図り、実機実験で有効性を検証した。
- GRUtopia:大規模都市で汎用ロボットを夢見るsim2real2024/7/1
10万の対話可能なシーンからなる都市規模のシミュレーション環境と、LLM駆動のNPCによる社会シミュレーション、脚式ロボット向けベンチマークを提供し、Embodied AIのSim2Real研究を加速するプロジェクト。
- LiDAR点群を用いた確率的測定領域関連付けによる複数車両追跡物体追跡2024/3/1
LiDAR点群から車両を追跡するため、目標の広がりを領域分割して測定分布を表現する確率的測定領域関連付け(PMRA)モデルを提案し、PMBMフィルタと統合して複数車両追跡の精度を向上させた。
- Diffusion Reward: Learning Rewards via Conditional Video Diffusion2023/12/1
- Value-Informed Skill Chaining for Policy Learning of Long-Horizon Tasks with Surgical Robot2023/7/1
- Homography matrix based trajectory planning method for robot uncalibrated visual servoing2023/3/1
- Demonstration-Guided Reinforcement Learning with Efficient Exploration for Task Automation of Surgical Robot2023/2/1
- Human-in-the-loop Embodied Intelligence with Interactive Simulation Environment for Surgical Robot Learning2023/1/1
- Efficient Trajectory Planning and Control for USV with Vessel Dynamics and Differential Flatness2022/9/1
- Cooperative trajectory planning algorithm of USV-UAV with hull dynamic constraints2022/9/1