evaluating-code-models
por firecrawl
Avalia modelos de geração de código nos benchmarks HumanEval, MBPP, MultiPL-E e mais de 15 outros, utilizando métricas pass@k. Use ao avaliar modelos de código, comparar codificação…
npx skills add https://github.com/firecrawl/ai-research-skills --skill evaluating-code-models