evaluating-code-models
por firecrawl
Evalúa modelos de generación de código en HumanEval, MBPP, MultiPL-E y más de 15 benchmarks con métricas pass@k. Úsalo al comparar modelos de código, comparar codificación…
npx skills add https://github.com/firecrawl/ai-research-skills --skill evaluating-code-models