David Hsu
National University of Singapore
収録論文 70本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- RAPID: 実演からのロボットエージェントプログラミングVLA2026/9/24
人間の一回の視覚的実演から、コード生成エージェントがロボットプログラムを自動生成・検証・改良し、物体中心の関係表現で汎化を実現する手法を提案。
- どこに加わるべきか?言語誘導型目標予測によるロボットのグループ参加ソーシャルナビゲーション2026/9/23
自然言語で指定されたグループにロボットが参加するため、言語条件付きモデルでグループを特定し、人間の隊形事前分布を用いて社会的に適切な参加位置を予測する手法を提案した。
- 不確実性下でのマルチモーダル指示グラウンディングによるマニピュレーション計画マニピュレーション2026/9/21
言語とジェスチャーの不確実な手がかりを統合し、VLMの意味情報と3D幾何学的尤度をベイズ的に融合して対象物体を推定、必要に応じて確認質問も行うマニピュレーション計画フレームワークMIGUを提案した。
- 物体中心ポリシーを組み合わせたリcedingホライズン押し動作マニピュレーション2026/9/20
任意形状の3D物体を長期的に押して目標姿勢へ移動させるため、物体中心の学習ポリシーとBIT*探索を組み合わせた階層的フレームワークを提案し、実機実験で有効性を示した。
- 不確実性下での仮説駆動型モデル拡張によるオープンワールドロボット計画プランニング2026/7/1
未知環境で動作するサービスロボットが、基盤モデルを用いて世界モデルの仮説を生成・検証・更新しながら自律的に知識を拡張し、タスク計画を実行する枠組みを提案した。
- GROW$^2$: ロボットの道具使用における「何を」「どこで」の接地ツール使用2026/6/1
ロボットが既存の道具を別の用途に使う際、物体の部品を手がかりに、言語モデルで道具と対象を選び、視覚モデルで正確な3D領域を特定する手法を提案。ベンチマークと実機実験で優位性を示した。
- CANINE: 視覚障害者へのロボット盲導犬を用いた対話的ナビゲーションのコーチングナビゲーション支援2026/5/1
視覚障害者がロボット盲導犬と協調してナビゲーションするスキルを、個別適応的な音声フィードバックで自動コーチングするシステムを提案し、実験で学習効率と最終性能の向上を実証した。
- ロボットから人への物体受け渡しを堅牢にする能動的接触センシングマニピュレーション2026/5/1
ロボットが物体を人に渡す際、人がしっかり握ったかどうかを能動的な動きと力センシングで推定し、誤ったタイミングでの解放を防ぐ手法を提案。実験で97.5%の成功率を達成した。
- 動的環境における可視性を考慮した移動把持移動把持2026/5/1
限られた視野を持つ移動ロボットが、動的で未知の環境で安全に物体を把持するための統合システムを提案。低レベルの全身プランナーと高レベルの行動木プランナーを組み合わせ、シミュレーションと実機で有効性を実証した。
- 道案内を超えたナビゲーション:視覚障害者との環境インタラクションのためのロボット協調支援技術/ナビゲーション2026/3/1
視覚障害者とロボットが協力し、ドアを開けるなどの環境操作を伴う移動を支援するシステムを提案・評価した論文。
- 障害物からエチケットへ:VLMに基づく経路選択によるロボットのソーシャルナビゲーションソーシャルナビゲーション2026/2/1
幾何学的な経路計画に微調整した視覚言語モデルによる社会的文脈の推論を組み合わせ、人間の活動や社会規範に配慮した経路をリアルタイムで選ぶロボットナビゲーション手法を提案した。
- 看板を頼りに地図なしで移動するロボットの視覚的看板グラウンディングナビゲーション2026/2/1
実世界の看板の意味を3Dシーンに結びつける「看板グラウンディング」を定式化し、VLMに適した空間・意味表現SignSceneを提案。地図なしで看板のみを使ったSpotロボットのナビゲーションを実現した。
- 視覚-言語-行動モデルの未来を導く10の未解決課題VLA2025/11/1
VLAモデルの発展における10の主要マイルストーンと新たな研究動向を議論し、今後の研究方向に注目を促す論文。
- InFeR: 学習済み視覚ナビゲーション制御における情報に基づく故障回復視覚ナビゲーション2025/10/1
模倣学習ポリシーに変分情報ボトルネックとGrad-CAMを組み合わせ、追加データなしで分布外故障の検出・原因特定・自律回復を可能にするフレームワークを提案。
- Set It Up:構成可能な生成モデルによる機能的物体配置物体配置2025/8/1
大規模言語モデルと拡散モデルを組み合わせ、食卓や本棚、家具の配置など、指示に応じた機能的で美的な物体配置を実現するフレームワークを提案。
- MimicFunc: 単一の人間動画から機能対応を介して道具操作を模倣する模倣学習2025/8/1
機能中心の局所座標系「ファンクションフレーム」を構築し、1本のRGB-D人間動画から新しい道具への操作スキルを汎化するフレームワークを提案。
- SignLoc: ナビゲーションサインと公開地図を用いたロバストな自己位置推定自己位置推定2025/8/1
ナビゲーションサインと公開地図(間取り図やOpenStreetMap)を利用し、事前のセンサマッピングなしでロボットの大域自己位置推定を行う手法を提案。モンテカルロフレームワーク内で確率的観測モデルによりサインの方向・位置情報を地図グラフにマッチングさせ、1〜2個のサイン観測で高精度に位置推定できることを大学キャンパス、ショッピングモール、病院で実証した。
- オープンワールド物体ゴールナビゲーションのためのオープンシーングラフ物体ゴールナビゲーション2025/8/1
基盤モデルとオープンシーングラフ表現を組み合わせ、未知環境で自然言語指定の物体を探索するモジュラー型ロボットシステムを提案し、シミュレーションと実機で高い性能を示した。
- CLASP: セマンティックキーポイントによる汎用衣服操作マニピュレーション2025/7/1
衣服のセマンティックキーポイントを中間表現として用い、VLMによるタスク計画とキーポイント条件付き操作スキルを組み合わせることで、多様な衣服の折り畳み・吊り下げ等の汎用操作を実現した。
- 標識理解によるロボット自律ナビゲーションVLA2025/6/1
ロボットが公共空間の案内標識を視覚言語モデルで解釈し、場所と方向を抽出するタスクを提案し、ベンチマークと評価指標を構築した。
- 取扱説明書を読んで家電を操作するロボットVLA2025/5/1
家電の取扱説明書を大規模視覚言語モデルで解釈し、記号的なモデルを構築して実際の操作に結びつけるロボットシステムApBotを提案した。
- FUNCTO: 機能中心のワンショット模倣学習による道具操作模倣学習2025/2/1
人間の1回のデモ動画から、同じ機能を持つ形状の異なる道具へ操作スキルを汎化できる、3D機能キーポイント表現を用いたワンショット模倣学習手法を提案。
- 幾何学的不確かさ下での安定物体配置のための微分可能接触ダイナミクスマニピュレーション2024/9/1
接触ダイナミクスの微分可能シミュレーションを用いて、力覚センサの読みから物体の姿勢や形状の不確かさを推定し、ロボットアームによる安定した物体配置を実現する手法を提案。
- Robi Butler: 家庭用ロボットアシスタントとのマルチモーダル遠隔インタラクション遠隔操作/マルチモーダル指示2024/9/1
Zoom通話のように遠隔から家庭用ロボットへ音声・テキスト・指差しで指示し、LLMが多段階行動計画を生成して家事を実行するシステムを構築し、ユーザー研究で遠隔操作体験を評価した。
- セマンティックキーポイントによる汎用衣服操作マニピュレーション2024/8/1
衣服の「右肩」「左袖」などの意味的キーポイントを深度画像から抽出し、LLMによるタスク計画と低レベル動作を階層的に繋ぐことで、折り畳み・平展ばし・吊り下げ・配置など多様な衣服操作を実現した。
- オープンワールド物体目標ナビゲーションのためのオープンシーングラフナビゲーション2024/7/1
基盤モデルとオープンシーングラフを統合し、未知環境で自然言語指定の物体を探索するゼロショット物体目標ナビゲーションシステムOpenSearchを提案した。
- IntentionNet:キロメートル規模の地図に依存しない視覚ナビゲーションナビゲーション2024/7/1
単一のニューラルネットワークを低レベル制御器として使い、「意図」と呼ばれる汎用インターフェースで操舵するナビゲーションシステムを提案し、Spotロボットで1km以上の屋内・屋外走行を実現した。
- シーン行動マップ:メートル情報なしでナビゲーションするための行動マップナビゲーション2024/5/1
間取り図や手描きスケッチなどの抽象的な2Dマップから、ナビゲーション行動を表すトポロジカルグラフ(SAM)を学習的に抽出し、四足ロボットでのナビゲーションに活用する手法を提案。
- セット・イット・アップ!:構成的生成モデルによる機能的物体配置物体配置2024/5/1
「二人用の食卓をセットして」のような曖昧な指示から、物体間の抽象的な空間関係をLLMで推論し、拡散モデルを組み合わせて機能的で美しい配置を生成するフレームワークを提案。
- 汎用変形物体操作のための微分可能粒子法変形物体操作2024/5/1
変形物体を粒子集合として表現し、微分可能な粒子ダイナミクスシミュレータと軌道最適化を組み合わせることで、豆・ロープ・布・液体など多様な物体の操作を可能にする汎用アルゴリズムDiPacを提案した。
- 全身ロボット動作のためのニューラルランダム化プランニング全身運動計画2024/5/1
サンプリングベース運動計画とニューラルサンプラーを組み合わせ、家庭環境での全身移動マニピュレーション計画を実時間で行う手法を提案。シミュレーション学習のみで実機の未知環境にゼロショット転移できる。
- LLMs for Robotic Object Disambiguation2024/1/1
- LLM-State: Open World State Representation for Long-horizon Task Planning with Large Language Model2023/11/1
- Invariance is Key to Generalization: Examining the Role of Representation in Sim-to-Real Transfer for Visual Navigation2023/10/1
- TeachingBot: Robot Teacher for Human Handwriting2023/9/1
- "Tidy Up the Table": Grounding Common-sense Objective for Tabletop Object Rearrangement2023/7/1
- What Truly Matters in Trajectory Prediction for Autonomous Driving?2023/6/1
- Large Language Models as Commonsense Knowledge for Large-Scale Task Planning2023/5/1
- The Planner Optimization Problem: Formulations and Frameworks2023/3/1
- COACH: Cooperative Robot Teaching2023/2/1
- DaXBench: Benchmarking Deformable Object Manipulation with Differentiable Physics2022/10/1
- Differentiable Parsing and Visual Grounding of Natural Language Instructions for Object Placement2022/10/1
- LEADER: Learning Attention over Driving Behaviors for Planning under Uncertainty2022/9/1
- Partially Observable Markov Decision Processes in Robotics: A Survey2022/9/1
- Deep Visual Navigation under Partial Observability2021/9/1
- INVIGORATE: Interactive Visual Grounding and Grasping in Clutter2021/8/1
- Ab Initio Particle-based Object Manipulation2021/7/1
- Differentiable SLAM-net: Learning Particle SLAM for Visual Navigation2021/5/1
- Learning Latent Graph Dynamics for Visual Manipulation of Deformable Objects2021/4/1
- Closing the Planning-Learning Loop with Application to Autonomous Driving2021/1/1
- MAGIC: Learning Macro-Actions for Online POMDP Planning2020/11/1
- Simulating Autonomous Driving in Massive Mixed Urban Traffic2020/11/1
- SUMMIT: A Simulator for Urban Driving in Massive Mixed Traffic2019/11/1
- Robot Capability and Intention in Trust-based Decisions across Tasks2019/9/1
- GAMMA: A General Agent Motion Model for Autonomous Driving2019/6/1
- LeTS-Drive: Driving in a Crowd by Learning from Tree Search2019/5/1
- Differentiable Algorithm Networks for Composable Robot Learning2019/5/1
- Guided Exploration of Human Intentions for Human-Robot Interaction2018/12/1
- Integrating Algorithmic Planning and Deep Learning for Partially Observable Navigation2018/7/1
- Multi-Task Trust Transfer for Human-Robot Interaction2018/7/1
- Interactive Visual Grounding of Referring Expressions for Human-Robot Interaction2018/6/1
- PORCA: Modeling and Planning for Autonomous Driving among Many Pedestrians2018/5/1
- Particle Filter Networks with Application to Visual Localization2018/5/1
- Trust-Aware Decision Making for Human-Robot Collaboration: Model Learning and Planning2018/1/1
- Grounding Spatio-Semantic Referring Expressions for Human-Robot Interaction2017/7/1
- Mathematical Models of Adaptation in Human-Robot Collaboration2017/7/1
- Human-Robot Mutual Adaptation in Shared Autonomy2017/1/1
- Factored Contextual Policy Search with Bayesian Optimization2016/12/1
- Configuration Lattices for Planar Contact Manipulation Under Uncertainty2016/5/1
- Learning Dynamic Robot-to-Human Object Handover from Human Feedback2016/3/1