Harold Soh
National University of Singapore
収録論文 50本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- 分割して記憶する:長期的VLAポリシーのための再帰的行動関連メモリVLA2026/10/1
現在の観測だけでは行動を決められない履歴依存の操作タスクに向け、行動に関連する情報を履歴から再帰的に選択・記憶する軽量メモリ手法を提案し、長期的操作ベンチマークで最高精度を達成した。
- 長期物体探索のための回顧的オープンボキャブラリメモリ物体探索2026/9/29
ロボットが繰り返し観測する中で「観測の機会」に応じて物体の存在確率を推定し、クエリ時に指定された概念の長期出現傾向を能動探索の事前分布に変換する手法ECROMを提案。
- エージェント事前分布に導かれた政策学習マニピュレーション2026/9/28
各スキルの構造的事前分布を政策のインターフェースとして用いることで、スキルの汎化と新規タスクへの組み合わせを両立させる手法APPLを提案。
- インターネット動画から方策状態空間でソーシャルナビゲーションを学習ソーシャルナビゲーション2026/9/26
単眼歩行動画を方策の状態空間における閉ループのソーシャルナビゲーション訓練環境に変換する手法を提案し、実機実験で高い成功率を達成した。
- VLAモデルをより良く訓練する方法:ICRA 2026 REAL-Iチャレンジからの教訓VLA2026/9/12
ICRA 2026の実世界 embodied AI 学習チャレンジREAL-Iの結果を報告し、NUS-CLEAR、RCL-Lab、Deeptouch.aiの3チームのVLAと模倣学習を組み合わせたアプローチを比較して、固定データからのロボット学習の教訓をまとめた論文。
- 物理的インタラクションの学習:触覚・力覚を考慮したロボット学習のサーベイ触覚・力覚学習2026/8/1
触覚・力覚センシングを統合したロボット学習手法を、マルチモーダルかつ多段階のシステム設計の観点から統一的な分類学TF-ARTを用いて整理し、今後の研究課題を考察したサーベイ論文。
- ACME: 多文化・多形態の社会的ナビゲーションデータセットデータセット2026/7/1
ロボットと人間の共有空間での移動を理解するため、5カ国8拠点で7種類のロボットを用いて収集した、多文化・多形態の社会的ナビゲーションデータセットを紹介する。
- 異種触覚トランスフォーマー触覚2026/6/1
異なる触覚センサー間で共有可能な表現を学習するフレームワークを提案し、多様な触覚データからの操作ポリシー学習を可能にした。
- 変化に頑健なオンライン空間意味トポロジカルマッピングマッピング2026/5/1
環境変化に頑健な空間意味推論のため、RGB-Dキーフレームのオンライン・ポーズ認識トポロジカルグラフを提案し、連続SE(3)での逐次仮説検定により曖昧さを扱う。実ロボット実験でSLAMベース手法より頑健性が向上。
- ガイド付きストリーミング確率的補間ポリシーロボットポリシー2026/5/1
推論時のガイダンスをストリーミングアーキテクチャに統合し、動的環境でのリアルタイム制御を可能にする新しいポリシーを提案。理論的な最適ガイダンス項を導出し、ゼロショット適応と学習ベースの手法を組み合わせて性能を向上させた。
- 構成報酬下でのフローモデルに対する競合認識型加法的ガイダンス生成モデル2026/5/1
複数の制約を同時に課す際に生じるオフマニフォールドドリフトを、勾配の競合を動的に検出・解決することで補正する軽量な学習可能なガイダンス手法を提案した。
- 意味的に汎化可能な計画のための接地された世界モデルVLA/計画2026/4/1
視覚と言語を整合させた潜在空間で世界モデルを学習し、行動の将来結果とタスク指示の類似度で行動を評価するMPC手法を提案。未見の視覚信号や指示表現を含むベンチマークで従来のVLAを大幅に上回る汎化性能を示した。
- SkillVLA: スキル再利用による双腕操作の組合せ多様性への挑戦双腕操作/VLA2026/3/1
双腕操作におけるVLAモデルが、左右の腕のスキルを組み合わせて再利用できるようにするフレームワークを提案し、成功率を大幅に向上させた。
- 生成型視覚-言語-行動モデルにおける行動ハルシネーションVLA2026/2/1
生成型ロボットポリシーが物理制約に反する行動を生成する「行動ハルシネーション」の構造的原因を分析し、信頼性向上の方向性を示した。
- Mixture-of-Experts拡散ポリシーによるロボットマニピュレーションスキルの抽象化マニピュレーション2026/1/1
拡散ポリシーをマルチタスクに拡張するため、直交スキル基底を学習し、スティッキールーティングで必要な専門家のみを活性化するMixture-of-Expertsポリシーを提案。シミュレーションと実機で高い成功率と低推論コストを実現。
- OpenRoboCare: ロボット介護のためのマルチモーダル・マルチタスク専門家デモンストレーションデータセット介護ロボティクス2025/11/1
作業療法士21名が2体のマネキンに対して行った15種類の日常生活動作(ADL)の介護デモを、RGB-D動画・姿勢・視線・触覚・アノテーションの5モダリティで収録した大規模データセットを構築し、介護戦略の分析と既存手法の課題評価を行った。
- GBPP: 二段階学習による把持を考慮したロボットのベース配置予測マニピュレーション2025/9/1
RGB-D画像1枚から把持に適したロボットのベース姿勢を高速に選ぶ学習ベースのスコアラーを提案。安価なヒューリスティックで大規模データを自動ラベリングし、少数の高忠実度シミュレーションで微調整する二段階カリキュラムを採用した。
- VLA-Touch:二段階の触覚フィードバックで視覚-言語-行動モデルを強化VLA2025/7/1
ベースのVLAモデルを微調整せずに、触覚言語モデルによる高レベル計画と拡散ベース制御器による行動修正の二段階で触覚フィードバックを統合し、接触を伴うタスクの計画効率と実行精度を向上させた。
- Octopi-1.5:視覚・触覚・言語モデルの実演VLA2025/7/1
触覚信号を複数部位から処理し、RAGで新規物体を学習できる視覚・触覚・言語モデルOctopi-1.5を、手持ち型触覚デバイスTMIを通じて実演する。
- GeNIE: 実世界環境のための汎化可能なナビゲーションシステムナビゲーション2025/6/1
SAM2を基にした走行可能性予測と経路融合戦略を組み合わせ、多様な地形や天候で動作する汎用的な屋外ナビゲーションシステムを開発し、ICRA 2025のEarth Rover Challengeで優勝した。
- CHD: 長期的タスクのための結合階層拡散拡散計画2025/5/1
高レベルなサブゴール選択と低レベルな軌道生成を単一の拡散プロセスで結合し、長期的なタスクにおける計画の一貫性と性能を向上させるフレームワークを提案。
- 訓練不要のタスク指向把持生成マニピュレーション2025/2/1
事前学習済みの把持生成モデルと視覚言語モデルを組み合わせ、追加学習なしでタスクに適した把持を生成する手法を提案し、5つのクエリ戦略を評価した。
- SocRATES: ソーシャルナビゲーションアルゴリズムの自動シナリオベーステストに向けてソーシャルナビゲーション2024/12/1
LLMを活用し、文脈や場所に適したソーシャルナビゲーションのシナリオを自動生成してシミュレーション可能にするパイプラインを提案し、専門家による評価とケーススタディを示した。
- NUSense: 頑健な軟質光学触覚センサ触覚2024/10/1
せん断ひずみの計測に基づく光学式触覚センサを提案し、着色シリコーン層の変形を広角カメラで捉えることで力覚や接触位置の推定に応用できることを示した。
- 限られた行動データで模倣学習を実現する拡散プランナとDeep Koopman制御器模倣学習2024/10/1
観測のみのデモデータからDeep Koopman作用素で潜在行動表現を学習し、拡散プランナと組み合わせることで、行動ラベル付きデータを大幅に削減してロボットの模倣学習を高成功率で行う手法を提案した。
- 拡散モデルとオプションの融合:時間的に拡張されたタスクのための階層的生成スキル構成階層的強化学習2024/10/1
線形時相論理で指定された長期タスクを、拡散モデルと階層強化学習を組み合わせてオプションの連鎖に分解し、再計画しながら実行するフレームワークを提案。
- Arena 4.0: 生成モデルによる環境生成を用いた人間中心ナビゲーションのためのROS2開発・ベンチマークプラットフォームソーシャルナビゲーション2024/9/1
LLMと拡散モデルでテキストや2D図面から人間中心の複雑な環境を自動生成し、ROS2上でソーシャルナビゲーションの開発・評価を可能にするプラットフォームを提案した。
- Arena 3.0: 協調的で高度に動的な環境におけるソーシャルナビゲーションの進展ソーシャルナビゲーション2024/6/1
人とロボットの相互作用をより現実的にシミュレートする新モデルとタスクモードを備え、複数のシミュレータでソーシャルナビゲーションの開発・ベンチマークを可能にするオープンソースプラットフォームを提案。
- DISCO: 拡散ポリシーと制約付きインペインティングによる言語誘導マニピュレーションマニピュレーション2024/6/1
視覚言語モデルで言語指示を3Dキーフレームに変換し、拡散ポリシーのインペインティングを制約することで、未知の語彙の指示にも対応できるロボット操作手法を提案した。
- Octopi: 大規模触覚言語モデルによる物体特性推論触覚2024/5/1
触覚知覚と大規模視覚言語モデルを組み合わせ、物体の物理的特性を予測・推論するシステムOctopiと、触覚動画を含むデータセットPhysiCLeARを提案した。
- LTLDoG: 時相論理制約を満たす安全な拡散ベース計画拡散計画2024/5/1
線形時相論理(LTL_f)で与えられた制約を満たす長期的軌道を生成するため、拡散モデルのサンプリング過程を満足度関数の勾配で誘導する手法を提案。
- ゼロから始めない:補間ベースのポリシー拡散による行動洗練模倣学習2024/2/1
ガウスノイズではなく既存のポリシーを起点に拡散モデルで模倣学習を行うBRIDGERを提案し、シミュレーションと実機で性能を向上させた。
- Probable Object Location (POLo) Score Estimation for Efficient Object Goal Navigation2023/11/1
- GRaCE: Balancing Multiple Criteria to Achieve Stable, Collision-Free, and Functional Grasps2023/9/1
- Latent Emission-Augmented Perspective-Taking (LEAPT) for Human-Robot Interaction2023/8/1
- Refining 6-DoF Grasps with Context-Specific Classifiers2023/8/1
- Large Language Models as Zero-Shot Human Models for Human-Robot Interaction2023/3/1
- Translating Natural Language to Planning Goals with Large-Language Models2023/2/1
- MIRROR: Differentiable Deep Social Projection for Assistive Human-Robot Communication2022/3/1
- Multi-Modal Mutual Information (MuMMI) Training for Robust Self-Supervised Deep Reinforcement Learning2021/7/1
- Extended Tactile Perception: Vibration Sensing through Tools and Grasped Objects2021/6/1
- Embedding Symbolic Temporal Knowledge into Deep Sequential Models2021/1/1
- Efficient Exploration of Reward Functions in Inverse Reinforcement Learning via Bayesian Optimization2020/11/1
- Event-Driven Visual-Tactile Sensing and Learning for Robots2020/9/1
- TactileSGNet: A Spiking Graph Neural Network for Event-based Tactile Object Recognition2020/8/1
- Getting to Know One Another: Calibrating Intent, Capabilities and Trust for Human-Robot Collaboration2020/8/1
- ST-MNIST -- The Spiking Tactile MNIST Neuromorphic Dataset2020/5/1
- Robot Capability and Intention in Trust-based Decisions across Tasks2019/9/1
- Multi-Task Trust Transfer for Human-Robot Interaction2018/7/1
- Trust-Aware Decision Making for Human-Robot Collaboration: Model Learning and Planning2018/1/1