何が起きたか
研究者らは、複雑な力学システムにおけるフィードバック制御設計のためのLLMベンチマーク「CoDyControlBench」を導入した。このベンチマークは、132のシステム構成と5つの評価次元で構成され、6つの最先端LLMを評価した。その結果、GPTが最高の設計成功率94.8%を達成し、Qwenが最低の50.0%だった。
詳細
既存のベンチマークは線形の1自由度(DoF)システムと大規模APIホスト型モデルに焦点を当てており、複雑な制御設計タスクやエッジ展開の実現可能性は不明瞭だった。CoDyControlBenchは、DoF数、システムタイプ、結合レベル、減衰レジーム、コントローラタイプの5つの評価次元にわたる132のシステム構成を提供する。 評価では、GPT、Gemini、Claudeの3つの商用モデルと、GLM、DeepSeek、Qwenの3つのオープンソースモデルを含む6つのLLMを、3回の独立した実行で評価した。GPTが最高の設計成功率94.8%を記録し、Qwenが最低の50.0%だった。ベンチマーク次元全体で、DoFとコントローラタイプがモデル平均の設計成功率の変動が最も大きく、成功率の範囲はそれぞれ36.3%と17.6%で、システムタイプ、結合レベル、減衰レジームを上回った。 GPTとQwenの比較では、性能差は主に制御設計知識、特にゲイン選択と過渡制限メカニズムの使用に起因することが示された。エッジ展開のために、推論蒸留により特殊な1.5Bパラメータモデルが開発された。この推論蒸留モデルは、CoDyControlBenchで回答蒸留モデルとベースモデルを上回り、1〜6 DoFで安定した性能を維持し、空気圧人工筋肉駆動ロボットアームでの3回の物理試験すべてで目標追跡に成功した。
Key Facts
| CoDyControlBenchは132のシステム構成と5つの評価次元(DoF数、システムタイプ、結合レベル、減衰レジーム、コントローラタイプ)で構成される。 | [0] |
| 6つのLLM(GPT、Gemini、Claude、GLM、DeepSeek、Qwen)が3回の独立した実行で評価された。 | [0] |
| GPTが最高の設計成功率94.8%を達成し、Qwenが最低の50.0%だった。 | [0] |
| DoFとコントローラタイプは、モデル平均の設計成功率の変動が最も大きく、成功率の範囲はそれぞれ36.3%と17.6%だった。 | [0] |
| GPTとQwenの性能差は主に制御設計知識、特にゲイン選択と過渡制限メカニズムの使用に起因する。 | [0] |
| 推論蒸留により1.5Bパラメータの特殊モデルが開発された。 | [0] |
| 推論蒸留モデルはCoDyControlBenchで回答蒸留モデルとベースモデルを上回った。 | [0] |
| 推論蒸留モデルは1〜6 DoFで安定した性能を維持し、空気圧人工筋肉駆動ロボットアームでの3回の物理試験すべてで目標追跡に成功した。 | [0] |
なぜ重要か
この研究は、複雑な制御設計タスクにおけるLLMの性能を評価するベンチマークを提供し、エッジ展開可能な軽量モデルの可能性を示している。これにより、LLMの制御設計への応用が進み、実世界のロボットやシステムへの展開が促進される可能性がある。