Pheng-Ann Heng
収録論文 18本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- PackLab: ロボットビンパッキングのためのMLLM開発・訓練・評価フレームワークマニピュレーション2026/9/20
物理シミュレータ・専用MLLM・ベンチマークを統合し、閉ループで物体選択と配置を予測するロボットビンパッキング用フレームワークを提案。従来のヒューリスティクスや強化学習、汎用MLLMを上回る性能を示した。
- 手術トリプレット認識の最適化:知識駆動型Mixture-of-Expertsソリューション手術認識2026/8/24
手術映像から器具・動作・対象のトリプレットを認識するタスクで、成分間・カテゴリ間の最適化競合を解消し、知識駆動のMoE機構で表現を強化するフレームワークを提案した。
- EPS3D: エンドツーエンドのフィードフォワード型3Dパノプティックセグメンテーション3Dセグメンテーション2026/6/8
多視点画像から3Dセマンティック特徴とインスタンス特徴を直接予測するエンドツーエンドのフレームワークを提案し、相互強化モジュールでセマンティクスとインスタンスの一貫性を高めた。
- LaST-R1: 適応的物理潜在推論によるロボット操作の強化学習強化操作学習2026/4/1
ロボット操作の基盤モデルに対し、潜在推論と行動生成を共同最適化する強化学習フレームワークを提案し、LIBEROベンチマークで99.9%の成功率を達成した。
- LaST₀:ロボット視覚言語行動モデルのための潜在時空間チェーン・オブ・ソートVLA2026/1/1
言語ではなく潜在空間で未来の視覚・3D・固有感覚を推論する時空間Chain-of-Thoughtを導入し、低頻度推論と高頻度行動生成を分離した二重システムVLAフレームワークを提案。
- ManualVLA:思考連鎖による手順書生成とロボット操作を統合したVLAモデルVLA2025/12/1
目標状態から実行手順を推論する「Manual Chain-of-Thought」を導入し、手順書生成と操作実行をMixture-of-Transformersで統合したVLAモデルを提案。3D Gaussian Splattingによるデジタルツインで訓練データを自動生成する。
- VLMベースロボットマニピュレーションのための中間表現の再考マニピュレーション2025/11/1
VLMが理解しやすく汎用性の高い中間表現SEAMを提案し、語彙と文法に分解することで多様な未見タスクに対応。さらに検索拡張少数ショット学習による開放語彙セグメンテーションを設計し、実世界実験でSOTA性能を示した。
- DisCo-Layout: 3D屋内レイアウト合成のための意味的・物理的洗練を分離・協調するマルチエージェントフレームワークシーン生成2025/10/1
LLM/VLMを用いた3D屋内レイアウト生成において、意味的関係の修正と物理的空間問題の解決を分離し、マルチエージェントで協調させることで、高品質で汎用性の高いレイアウトを生成するフレームワークを提案。
- Fast-in-Slow:高速操作と低速推論を統合するデュアルシステム基盤モデルVLA2025/6/1
VLMベースの推論システムに実行モジュールを部分的にパラメータ共有して組み込み、高速かつ精密なロボット操作を実現する統合型VLAモデルを提案。
- OPA-Pack: 物体特性を考慮したロボットビンパッキングマニピュレーション2025/5/1
物体の壊れやすさや相性などの特性を認識し、非互換な物体の分離と壊れやすい物体への圧力低減を両立するロボットビンパッキングフレームワークを提案。
- HybridVLA:拡散と自己回帰を統合した視覚-言語-行動モデルVLA2025/3/1
拡散モデルによる連続的な行動生成と自己回帰による文脈推論を単一の大規模言語モデル内で統合し、両者を協調的に学習・アンサンブルするロボット操作フレームワークを提案。
- 未見物体インスタンスセグメンテーションへのSegment Anything Modelの適応セグメンテーション2024/9/1
SAMを活用し、ヒートマップベースのプロンプト生成と階層的識別ネットワークで適応させることで、訓練データを10%しか使わずに未見物体のセグメンテーションで最先端性能を達成した。
- SDF-Pack: Towards Compact Bin Packing with Signed-Distance-Field Minimization2023/7/1
- 3D Perception based Imitation Learning under Limited Demonstration for Laparoscope Control in Robotic Surgery2022/4/1
- SurRoL: An Open-source Reinforcement Learning Centered and dVRK Compatible Platform for Surgical Robot Learning2021/8/1
- Domain Adaptive Robotic Gesture Recognition with Unsupervised Kinematic-Visual Data Alignment2021/3/1
- A Learning-Driven Framework with Spatial Optimization For Surgical Suture Thread Reconstruction and Autonomous Grasping Under Multiple Topologies and Environmental Noises2020/7/1
- Automatic Gesture Recognition in Robot-assisted Surgery with Reinforcement Learning and Tree Search2020/2/1