Byoung-Tak Zhang
収録論文 22本 ・ フィジカルAI/ロボット学習
※arXiv著者名で収集。同姓同名の別人の論文が含まれる場合があります。
論文
- ドメイン不変潜在先読みによるVLAモデルの偽相関の解消VLA2026/9/29
視覚言語行動モデルが視覚分布シフトで脆くなる原因である偽相関を、ドメイン変換軌道から学んだドメイン不変の未来潜在表現で方策を監督することで軽減するDILLを提案し、LIBERO-Plusで平均成功率69.1%を達成した。
- HABILIS Brain 0: 視覚言語行動と残差フロー回復のための幾何変化監督VLA2026/9/22
現在の観測からマルチビューの未来-現在の幾何変化トークンを予測するGC-VLAを提案し、4段階の学習でLIBEROにおいて99.55%の成功率を達成した。
- タスク成功を超えて:センシング劣化下におけるワールドモデル計画の段階別信頼性ワールドモデル計画2026/9/7
ワールドモデル計画におけるセンシング劣化の影響を、表現・予測・計画・物理的結果の各段階で評価し、劣化の影響が段階間で非一様に伝播することを示した論文。
- DA-Fusion: 変形可能アテンションに基づくRGB-D融合トランスフォーマーによる未知物体のインスタンスセグメンテーションセグメンテーション2026/7/20
RGBと深度データを変形可能アテンションで融合するトランスフォーマーを提案し、物流のビンピッキング等の乱雑環境での未知物体のインスタンスセグメンテーション精度を向上させた。
- CDIS: 2Dマスク追跡と3D-2D投影マージによるクロス次元クラス非依存3Dインスタンス分割3Dインスタンス分割2026/7/20
2Dインスタンスマスクをフレーム間で追跡し、3Dスーパーポイントと関連付けることで、3D専用学習なしに一貫した3Dインスタンスラベルを生成するゼロショット手法を提案した。
- Seg2Grasp: ビンピッキングにおける堅牢なモジュール式吸着把持マニピュレーション2026/7/1
ビンピッキングのためのモジュール式パイプラインSeg2Graspを提案。セグメンテーション、把持点計算、分類の3段階で構成し、未知の物体や複雑な環境でも高い把持成功率を実現する。
- 馴染みのある未来への回帰:事前生成マイルストーン選択によるVLAポリシーの失敗回復VLA/失敗回復2026/6/1
VLAポリシーが操作中に軌道から逸脱した際、事前に生成した未来状態のマイルストーンを選択して固定目標とすることで、微調整なしに失敗から回復させる手法を提案した。
- LiDAR位置認識における白色化距離を用いたボロノイベース二次記述子LiDAR位置認識2026/3/1
LiDAR位置認識のための新しいプーリング手法を提案。ボロノイセルの誘導バイアスを二次統計量に統合し、白色化によりマハラノビス距離を暗黙的に測定して性能を向上させた。
- Habilis-β: 高速動作と長時間稼働を実現するオンデバイス視覚言語行動モデルVLA2026/2/1
実環境での連続稼働を想定し、大規模プレイデータでの事前学習と整流フロー蒸留を組み合わせることで、エッジデバイス上で高速かつ長時間安定して動作するVLAモデルを実現した。
- ESPADA: 模倣学習のための意味認識型デモデータ間引きによる実行速度向上模倣学習2025/12/1
VLM-LLMと3D把持物体関係でデモを意味的に区間分割し、重要でない区間だけを間引くことで、再学習なしに成功率を保ちつつ約2倍の速度向上を実現した。
- 疎から密へ:目標指向強化学習における幼児に着想を得た報酬遷移強化学習2025/1/1
幼児の学習過程に倣い、疎な報酬からポテンシャルベースの密な報酬へと遷移させる手法を提案し、ロボットアーム操作や3Dナビゲーションで学習性能とサンプル効率が向上することを示した。
- CLIP-RT: 自然言語監督から言語条件付きロボット方策を学習VLA2024/11/1
非専門家が自然言語でロボットのデモを収集できる枠組みと、そのデータから言語条件付き視覚運動方策を学習するVLAモデルCLIP-RTを提案し、OpenVLAより7倍小さいパラメータで成功率を24%上回った。
- 履歴を考慮した情報融合に基づく計画手法HAPFIVLA2024/7/1
自然言語指示による長期的なタスク遂行のため、エージェントが環境と相互作用しながら収集したマルチモーダルな履歴情報を相互注意融合で活用し、次の行動計画を生成する手法を提案した。
- ソクラテス式プランナー:自己質問応答によるゼロショット身体性指示追従プランニングVLA2024/4/1
大規模言語モデルに自己質問応答させてサブゴール列を生成し、視覚フィードバックで再計画するゼロショットの身体性指示追従プランナーを提案。ALFREDベンチマークで最先端を上回り、実機ロボットでも検証した。
- 深層オートエンコーダによるマルチモーダル異常検知を用いた移動マニピュレーションロボットの物体滑り知覚マニピュレーション2024/3/1
RGB-Dカメラ・マイク・力覚センサのマルチモーダルデータを深層オートエンコーダで学習し、再構成誤差から物体の滑りを異常として検知する手法を提案した。
- マルチオブジェクトRANSAC:雑然とした環境における効率的な平面クラスタリング手法把持2024/3/1
RGB-Dカメラを用いた雑然とした環境向けの平面クラスタリング手法を提案し、ロボットの吸着把持実験で有効性を検証した。
- PGA: Personalizing Grasping Agents with Single Human-Robot Interaction2023/10/1
- PROGrasp: Pragmatic Human-Robot Communication for Object Grasping2023/9/1
- GVCCI: Lifelong Learning of Visual Grounding for Language-Guided Robotic Manipulation2023/7/1
- From Scratch to Sketch: Deep Decoupled Hierarchical Reinforcement Learning for Robotic Sketching Agent2022/8/1
- Goal-Aware Cross-Entropy for Multi-Target Reinforcement Learning2021/10/1
- Human Body Orientation Estimation using Convolutional Neural Network2016/9/1