evaluating-code-models
von firecrawl
Bewertet Code-Generierungsmodelle über HumanEval, MBPP, MultiPL-E und 15+ Benchmarks mit pass@k-Metriken. Verwenden Sie dies beim Benchmarking von Code-Modellen, Vergleichen von Codierungs…
npx skills add https://github.com/firecrawl/ai-research-skills --skill evaluating-code-models