何が起きたか
Qualia Roboticsは、OpenArmロボットアーム向けの強化学習(RL)最適方針「openarm-rl-best-policy」をHugging Faceで公開した。この方針は、MuJoCoシミュレーション環境でのキューブインボックスキャンペーン向けに訓練されたPPO教師方針のチェーンであり、単一のチェックポイントではなく、複数のコンポーネントから構成される。
詳細
公開されたリポジトリ「qualia-robotics/openarm-rl-best-policy」には、最適なPPO教師方針チェーンが含まれており、これはOpenArm MuJoCoキューブインボックスキャンペーン向けに訓練されたものである。このチェーンは単一のモノリシックなチェックポイントではなく、把持脚(checkpoints/grasp_hover_v3_vm_ppo_1000000_steps.zip)、配置脚(checkpoints/place_fixed_v5_ppo_1000000_steps.zip)、およびランタイムゲート/コントローラ(code/eval_chained_gated.py)から構成されるチェーン型コントローラである。 最終検証数値はBEST_POLICY.mdに記載されており、インボックス成功率は50回中43回(86.0%)、ジェントル成功率は50回中42回(84.0%)である。評価シードは1000から1049までが使用された。ハンドオーバーは、10回連続で把持・リフトに成功した後に切り替わる(STREAK=10、ZTHR=0.52)。リリースゲートは、キューブがボックスフットプリント上にあり、水平速度が低い状態を保つまでグリッパーを閉じたままにする。 正確な再現コマンド、既知の失敗、履歴はBEST_POLICY.mdを参照のこと。アップロード時点のソース作業ツリーは/home/nvidia/.openclaw/workspace/projects/openarmmujocoにあった。このリポジトリの過去1か月のダウンロード数は15件である。
Key Facts
| Qualia Roboticsは、OpenArm MuJoCoキューブインボックスキャンペーン向けの最適なPPO教師方針チェーンをHugging Faceで公開した。 | [0] |
| この方針は単一のチェックポイントではなく、把持脚と配置脚の2つの方針とランタイムゲートから構成されるチェーン型コントローラである。 | [0] |
| 把持脚はcheckpoints/grasp_hover_v3_vm_ppo_1000000_steps.zip、配置脚はcheckpoints/place_fixed_v5_ppo_1000000_steps.zip、ランタイムゲートはcode/eval_chained_gated.pyに格納されている。 | [0] |
| 最終検証数値として、インボックス成功率は50回中43回(86.0%)、ジェントル成功率は50回中42回(84.0%)と報告されている。 | [0] |
| 評価シードは1000から1049までが使用された。 | [0] |
| ハンドオーバーは10回連続で把持・リフトに成功した後に切り替わる(STREAK=10、ZTHR=0.52)。 | [0] |
| リリースゲートは、キューブがボックスフットプリント上にあり、水平速度が低い状態を保つまでグリッパーを閉じたままにする。 | [0] |
| 正確な再現コマンド、既知の失敗、履歴はBEST_POLICY.mdに記載されている。 | [0] |
| アップロード時点のソース作業ツリーは/home/nvidia/.openclaw/workspace/projects/openarmmujocoにあった。 | [0] |
| このリポジトリの過去1か月のダウンロード数は15件である。 | [0] |
なぜ重要か
この公開は、ロボットアームの操作タスクにおける強化学習方針の実用的な実装例を示すものであり、チェーン型コントローラの設計と検証方法がコミュニティに共有される点で意義がある。成功率86%という数値は、シミュレーション環境での性能指標として参考になる。