Hong Zhang
収録論文 73本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- eRLT: 行動に関連するトークンルーティングによる効率的なVLA強化学習VLA2026/10/1
凍結したVLAモデルからタスク固有の行動関連特徴をトークンと層をまたいで抽出し、強化学習のサンプル効率を向上させる手法を提案。
- 形を超えた機能:異種ハンド間の機能的対応による器用把持生成マニピュレーション2026/9/30
異なる構造のロボットハンド間で把持の機能的役割を対応付け、未見のハンドでも把持データや再学習なしに器用な把持を生成する手法を提案。
- テキスト・視覚相乗トークンキャッシュ:効率的なVLA推論のための学習不要フレームワークVLA2026/9/28
VLAモデルの推論を高速化するため、テキストと視覚の相乗効果を利用して注意ヘッドを選別し、キャッシュ再利用層を選択する学習不要のトークンキャッシュ手法を提案。
- HAM-VLN: 階層的エージェント記憶を活用したゼロショット視覚言語ナビゲーションナビゲーション2026/7/1
ロボットが未知環境で指示に従って移動する際、画像や地図の代わりにエージェント自身が書き込む永続的な世界グラフを記憶として使い、次の行動選択と同じLLM呼び出しで記憶も更新することで、長期的なナビゲーションの記憶・推論ボトルネックを解消した。追加のLLM呼び出しなしで文脈長を65%以上削減しつつ、複数のナビゲーションベンチマークで最高性能を達成した。
- Traj-VLN: 自己回帰軌道生成によるピクセル空間でのインタラクション学習VLA2026/7/1
連続環境における視覚言語ナビゲーション(VLN-CE)において、大規模言語モデルを微調整し、言語指示と過去の観測から2Dピクセル座標の軌道を自己回帰的に生成することで、深度情報を使わずにナビゲーション行動を学習する手法を提案した。
- ReferTrack: 参照してから追跡する身体化視覚追跡手法視覚追跡2026/7/1
身体化視覚追跡において、自然言語で指定された対象をまず画像中のバウンディングボックスから選択し、その選択に基づいて追跡経路を生成する「参照→追跡」パラダイムを提案。時間的な対象情報を保持する工夫と参照QA学習により、単眼カメラで高い追跡成功率を達成し、実ロボットでも有効性を確認した。
- 単一視点メッシュ再構成はロボットカメラの回転に汎化できるか?3D再構成2026/6/1
ロボット搭載カメラの回転が単一視点メッシュ再構成の性能に与える影響を評価し、回転による深度推定の歪みやレイアウトずれを明らかにした。重力情報を活用した改良によりレイアウト誤差を47.1%削減できることを示した。
- GCNGrasp-VP: アフォーダンス誘導による視点計画を用いた効率的なタスク指向把持マニピュレーション2026/6/1
オクルージョンによるタスク指向把持の性能低下を解決するため、アフォーダンス場の予測と能動的な視点計画を統合したフレームワークを提案。シーン再構成を不要とし、1回の視点調整で高精度な把持を実現する。
- FLM-Occ: フィードフォワード尤度最大化による効率的な屋内占有予測3Dシーン理解2026/6/1
屋内占有予測をボクセル分布推定として再定式化し、ガウスプリミティブの分布を大域的に最適化する新しいフレームワークを提案。従来の局所的なボクセル分類に基づく手法より少ないプリミティブで高精度かつ高速な予測を実現した。
- VLAConf: 視覚言語行動モデルのための校正されたタスク成功信頼度VLA2026/5/1
VLAモデルのタスク成功確率を、軽量な信頼度ヘッドで単一フォワードパス推定する手法を提案。既存手法より高速で、連続行動空間にも適用可能。
- 空中VLAモデルは協力できるか?CARLA-Airによる閉ループ空陸協調の評価VLA/空陸協調2026/5/1
空中VLAモデルの単機能力が空陸協調に転移するかを、CARLAとAirSimを統合した環境CARLA-Airで評価した。移動プラットフォーム着陸と遮蔽回復エスコートの2タスクで、現行モデルは追従はできても安定した協調行動には至らず、追加要素の必要性を示した。
- TARIC: 遮断された意味的手がかり下でのメモリ拡張型・走行可能性認識屋外視覚言語ナビゲーションナビゲーション2026/5/1
屋外視覚言語ナビゲーションにおいて、意味的手がかりが途切れる状況でも、走行可能性を考慮した実行可能なガイダンスを維持する統合フレームワークを提案。3Dキューメモリと不確実性を考慮した読み出し機構により、長期的な手がかり欠如フェーズでも安定したナビゲーションを実現する。
- 夢のように掴む:生成された人間デモから機能的把持を模倣する把持2026/4/1
ビデオ生成モデルなどの視覚生成モデルで合成した人間のデモを使って、ロボットの機能的把持をゼロショットで学習する手法GraspDreamerを提案。データ収集の手間を省きつつ、多様な物体・タスクへの汎化を実現した。
- 深度事前情報によるガラス表面再構成の強化とロボットナビゲーションへの応用ロボットナビゲーション2026/4/1
ガラス面による深度センサの誤差を、深度基盤モデルを構造事前情報として用い、RANSACによる位置合わせで融合することで補正する訓練不要のフレームワークを提案。新規RGB-Dデータセットも導入し、既存手法を上回る性能を示した。
- ProDrive: 自己と環境の共進化による自動運転のためのプロアクティブ計画自動運転2026/4/1
現在の観測のみに依存する反応的な自動運転計画の問題を解決するため、自己と環境の共進化を可能にするワールドモデルベースのプロアクティブ計画フレームワークを提案した。
- Easy-IIL: アシスタント専門家による対話型模倣学習の人間の操作負担軽減模倣学習2026/3/1
対話型模倣学習において、モデルベースの模倣手法をアシスタント専門家として活用し、人間の介入を最小限に抑えつつ性能を維持するフレームワークを提案した。
- 身体性ナビゲーションのためのエージェント的自己進化的再計画ナビゲーション2026/3/1
複雑環境での身体性ナビゲーションの失敗に対処するため、ロボット自身を実行時学習で進化させる自己進化的再計画法(SERP)を提案。適応的機能調整とグラフ上のLLM推論により、成功率向上とトークン消費削減を実現。
- 効率的な通信を備えたエッジ支援型マルチロボット視覚慣性SLAMSLAM2026/3/1
ロボット-エッジ-クラウドの階層アーキテクチャに基づく集中型マルチロボットSLAMシステムを提案し、特徴点とキーフレーム記述子のロスレス圧縮により帯域幅を削減しつつ、リアルタイムな協調SLAMを実現した。
- CARLA-Air: CARLA世界でのドローン飛行--空陸具現知能のための統合基盤シミュレーション2026/3/1
CARLAとAirSimを単一のUnreal Engineプロセス内で統合し、都市運転とマルチローター飛行を物理的に一貫した環境で同時にシミュレートするオープンソース基盤を提案した。
- MfNeuPAN: 多フレーム点制約による動的環境での先読み型エンドツーエンドナビゲーションナビゲーション2025/11/1
移動障害物の将来経路を予測するモジュールを組み込み、現在と未来の多フレーム点制約を用いて動的環境で先回りして障害物を回避するエンドツーエンドナビゲーション手法を提案した。
- 不確実性を考慮した自律協調学習ベースの計画戦略の解明協調計画2025/10/1
深層強化学習(SACとGRU)を用いて、知覚・計画・通信の不確実性に対処する自律協調計画フレームワークを提案し、CARLAシミュレーションで有効性を示した。
- TrackVLA++:具現化視覚追跡のための推論と記憶能力を引き出すVLAモデルVLA2025/10/1
移動する対象を追跡する具現化視覚追跡において、空間推論と長期記憶のモジュールを導入し、遮蔽や類似物体に強いVLAモデルを提案した。
- VG-Mapping: 半静的環境におけるオンライン3Dガウシアンマッピングのための変化認識型密度制御3Dマッピング2025/10/1
半静的な環境で変化した領域を検出し、3Dガウシアンスプラッティングの密度制御を最適化から分離することで、オンライン地図更新の品質と効率を高める手法を提案し、合成・実環境のRGB-Dデータセットも構築した。
- Adap-RPF: 動的混雑環境におけるロボット人物追従のための適応的軌道サンプリング人物追従2025/10/1
混雑環境での人物追従のため、社会的に配慮した領域で密な候補点を生成し多目的コストで評価する適応的軌道サンプリングと、歩行者予測を考慮したMPPI制御器を提案した。
- EZREAL: 視界変動下で遠方目標へ向かうゼロショット屋外ロボットナビゲーションの強化ナビゲーション2025/9/1
遠方で小さく映る目標や一時的な遮蔽に対応するため、マルチスケール画像タイル階層と顕著性融合を用いた軽量なゼロショット物体ナビゲーションシステムを提案し、実環境で成功率を向上させた。
- Follow-Bench:社会的配慮を伴うロボット追従のための統合動作計画ベンチマーク動作計画2025/9/1
ロボットが人を追従する際の安全性と快適性を評価するため、多様なシナリオを再現する統一ベンチマークFollow-Benchを提案し、代表的な8手法を再実装して比較した。
- Meta-Memory: ロボットの空間推論のための意味・空間記憶の検索と統合空間推論2025/9/1
LLM駆動エージェントが環境の高密度記憶を構築し、自然言語の位置質問に対して意味と空間の記憶を統合して応答する手法を提案。SpaceLocQAデータセットを導入し、実機でも検証した。
- ROVER: 反復環境における軌道事前分布を用いたロバストなループ閉じ込み検証SLAM2025/8/1
反復環境でのSLAMにおいて、ロボットの過去の軌道を事前制約として利用し、誤ったループ閉じ込みを棄却する検証手法を提案。
- GraphCoT-VLA:曖昧な指示に対応する3D空間認識推論型視覚言語行動モデルVLA2025/8/1
曖昧な指示や未知環境に対応するため、構造化Chain-of-Thought推論とリアルタイム更新可能な3Dポーズ・物体グラフを統合したロボットマニピュレーション向けVLAモデルを提案。
- MimicFunc: 単一の人間動画から機能対応を介して道具操作を模倣する模倣学習2025/8/1
機能中心の局所座標系「ファンクションフレーム」を構築し、1本のRGB-D人間動画から新しい道具への操作スキルを汎化するフレームワークを提案。
- JAM: 分類考慮型周辺提案後のキーポイント誘導型マルチエージェント相互作用予測軌道予測2025/7/1
自動運転における他車両の将来軌道予測で、低確率モードの生成品質を改善するため、軌道タイプ別分類を行う周辺予測とキーポイントで誘導するジョイント予測を組み合わせた2段階フレームワークを提案し、Waymoデータセットで最先端性能を達成した。
- TPT-Bench:混雑環境での目標人物追跡をベンチマークする大規模長期ロボット視点データセット目標人物追跡2025/5/1
ロボット視点で混雑した屋内・屋外環境の目標人物を長期的に追跡するための大規模マルチモーダルデータセットを構築し、既存手法の性能を評価した。
- 模倣学習による巧みなマニピュレーション:サーベイマニピュレーション2025/4/1
ロボットハンドの巧みな操作を模倣学習で実現する手法を体系的にまとめ、課題と今後の研究方向を論じたサーベイ論文。
- HGDiffuser: 人間誘導型把持拡散モデルによる効率的なタスク指向把持生成マニピュレーション2025/3/1
人間の把持実演を拡散モデルの誘導サンプリングに組み込み、6自由度のタスク指向把持を一段階で直接生成する手法を提案し、従来の二段階手法より高効率・高品質を実現した。
- RPF-Search: 未知の動的環境におけるロボット人物追従のための場ベース探索人物追従2025/3/1
未知の動的環境で人物追従ロボットが遮蔽物により目標を見失う問題に対し、地形遮蔽と動的遮蔽に別々に対処するヒューリスティック探索フレームワークを提案し、シミュレーションと実機で探索効率と成功率を向上させた。
- FlowPlan: LLMフローエンジニアリングによるロボット指示追従のゼロショットタスク計画タスク計画2025/3/1
LLMを多段階ワークフローで活用し、ラベル付きデータなしでロボットの指示追従タスクを計画するゼロショット手法を提案。ALFREDベンチマークと実環境でデータ駆動型手法に匹敵する性能を示した。
- カメラ自己運動下での単眼人物位置推定人物位置推定2025/3/1
移動する単眼カメラから人物の3D位置を推定するため、4点モデルでカメラ姿勢と人物位置を同時最適化する手法を提案し、四足歩行ロボットの追従システムに実装した。
- ReJSHand: 精密化された関節・骨格特徴を用いたリアルタイム手姿勢推定とメッシュ再構成手姿勢推定2025/3/1
2D画像から3D手姿勢とメッシュをリアルタイムで高精度に推定するネットワークReJSHandを提案し、FreiHandデータセットで72fps・PA-MPJPE 6.3mmを達成した。
- TextInPlace: シーンテキスト検出と検証による反復構造屋内環境での視覚的位置認識VPR2025/3/1
屋内環境に頻出する看板や標識などのテキストを検出・認識し、その類似度で画像検索結果を再ランク付けすることで、反復構造の多い屋内での視覚的位置認識精度を向上させる手法を提案。
- FUNCTO: 機能中心のワンショット模倣学習による道具操作模倣学習2025/2/1
人間の1回のデモ動画から、同じ機能を持つ形状の異なる道具へ操作スキルを汎化できる、3D機能キーポイント表現を用いたワンショット模倣学習手法を提案。
- 軌道平滑性制約によるNeRFベースSLAMの最適化SLAM2024/10/1
カメラ軌道をBスプラインで表現し平滑性制約を導入することで、NeRFベースSLAMのギクシャクした軌道推定を改善し、軌道精度とマップ品質を向上させた。
- FLAF: 視覚教示・再現のための焦点線と特徴量に基づく能動的視点計画視覚ナビゲーション2024/9/1
移動ロボットの視覚ナビゲーションにおいて、特徴量に基づく視覚SLAMの追跡失敗を避けるため、焦点線と特徴量を考慮した能動的視点計画手法FLAFを提案し、教示・再現システムに統合して実環境で有効性を示した。
- RTAGrasp: 人間の動画からの検索・転移・整合によるタスク指向把持の学習マニピュレーション2024/9/1
人間の把持動画から把持位置と方向の制約を抽出し、視覚基盤モデルで対象物に転移してロボットの動作に整合させる、訓練不要のタスク指向把持フレームワークを提案。
- GV-Bench:長期ループ閉じ込め検出の幾何検証のための局所特徴マッチングベンチマークSLAM2024/7/1
長期にわたる環境変化下でのループ閉じ込め検出の幾何検証に焦点を当てた統一ベンチマークを提案し、6つの代表的な局所特徴マッチング手法を評価した。
- FoundationGrasp: 基盤モデルによる汎化可能なタスク指向把持マニピュレーション2024/4/1
基盤モデルのオープンエンドな知識を活用し、未知の物体やタスクにも汎化できるタスク指向把持フレームワークを提案。実機実験で有効性を検証。
- 常識シーングラフに基づく物体探索のための目標位置推定物体探索2024/4/1
LLMで生成した常識知識と部屋レベルの知識を統合した常識シーングラフ(CSG)を構築し、家庭内ロボットが対象物体を効率的に探索できる目標位置推定手法を提案した。
- 部分観測下における人間の向き推定人物追従2024/4/1
単眼画像から人の向きを推定する際、体の一部しか見えない場合でも可視関節を活用し、信頼度を考慮して精度よく推定する手法を提案。ロボットの人物追従タスクの安定性向上も実証した。
- Person Re-Identification for Robot Person Following with Online Continual Learning2023/9/1
- Efficient Object Rearrangement via Multi-view Fusion2023/9/1
- GraspGPT: Leveraging Semantic Knowledge from a Large Language Model for Task-Oriented Grasping2023/7/1
- Prediction of SLAM ATE Using an Ensemble Learning Regression Model and 1-D Global Pooling of Data Characterization2023/3/1
- Task-Oriented Grasp Prediction with Visual-Language Inputs2023/2/1
- Robot Person Following Under Partial Occlusion2023/2/1
- NDD: A 3D Point Cloud Descriptor Based on Normal Distribution for Loop Closure Detection2022/9/1
- Optimizing SLAM Evaluation Footprint Through Dynamic Range Coverage Analysis of Datasets2022/9/1
- Condition-Invariant and Compact Visual Place Description by Convolutional Autoencoder2022/4/1
- Mapping While Following: 2D LiDAR SLAM in Indoor Dynamic Environments with a Person Tracker2022/4/1
- Following Closely: A Robust Monocular Person Following System for Mobile Robot2022/4/1
- Are We Ready for Robust and Resilient SLAM? A Framework For Quantitative Characterization of SLAM Datasets2022/2/1
- Online Mutual Adaptation of Deep Depth Prediction and Visual SLAM2021/11/1
- Relationship Oriented Affordance Learning through Manipulation Graph Construction2021/10/1
- Curiosity-based Robot Navigation under Uncertainty in Crowded Environments2021/6/1
- Polarimetric Monocular Dense Mapping Using Relative Deep Depth Prior2021/2/1
- PL-VINS: Real-Time Monocular Visual-Inertial SLAM with Point and Line Features2020/9/1
- Fast ORB-SLAM without Keypoint Descriptors2020/8/1
- DeepRelativeFusion: Dense Monocular SLAM using Single-Image Relative Depth Prediction2020/6/1
- Semi-Supervised Monocular Depth Estimation with Left-Right Consistency Using Deep Neural Network2019/5/1
- Towards A Deep Insight into Landmark-based Visual Place Recognition: Methodology and Practice2018/8/1
- Submap-based Pose-graph Visual SLAM: A Robust Visual Exploration and Localization System2018/7/1
- COROLA: A Sequential Solution to Moving Object Detection Using Low-rank Approximation2015/5/1
- Convolutional Neural Network-Based Image Representation for Visual Loop Closure Detection2015/4/1
- Stopping Rules for Bag-of-Words Image Search and Its Application in Appearance-Based Localization2013/12/1
- An Efficient Index for Visual Search in Appearance-based SLAM2013/9/1