evaluating-llms-harness
von firecrawl
Bewertet LLMs anhand von über 60 akademischen Benchmarks (MMLU, HumanEval, GSM8K, TruthfulQA, HellaSwag). Verwenden Sie dies beim Benchmarking der Modellqualität, beim Vergleichen von Modellen, beim Berichten…
npx skills add https://github.com/firecrawl/ai-research-skills --skill evaluating-llms-harness