evaluating-code-models
par firecrawl
Évalue les modèles de génération de code sur HumanEval, MBPP, MultiPL-E et plus de 15 benchmarks avec les métriques pass@k. À utiliser pour évaluer les modèles de code, comparer les capacités de codage…
npx skills add https://github.com/firecrawl/ai-research-skills --skill evaluating-code-models