evaluating-llms-harness
por firecrawl
Avalia LLMs em mais de 60 benchmarks acadêmicos (MMLU, HumanEval, GSM8K, TruthfulQA, HellaSwag). Use ao avaliar a qualidade do modelo, comparar modelos, relatar…
npx skills add https://github.com/firecrawl/ai-research-skills --skill evaluating-llms-harness