HumanEval、MBPP、MultiPL-E、および15以上のベンチマークでコード生成モデルを評価し、pass@kメトリクスを使用します。コードモデルのベンチマークやコーディングの比較を行う際に使用してください。
npx skills add https://github.com/firecrawl/ai-research-skills --skill evaluating-code-models