evaluating-llms-harness
por firecrawl
Evalúa LLMs en más de 60 benchmarks académicos (MMLU, HumanEval, GSM8K, TruthfulQA, HellaSwag). Úsalo al evaluar la calidad del modelo, comparar modelos, reportar…
npx skills add https://github.com/firecrawl/ai-research-skills --skill evaluating-llms-harness