evaluating-code-models
от firecrawl
Оценивает модели генерации кода на HumanEval, MBPP, MultiPL-E и 15+ бенчмарках с метриками pass@k. Используйте при бенчмаркинге кодовых моделей, сравнении кодирования…
npx skills add https://github.com/firecrawl/ai-research-skills --skill evaluating-code-models