evaluating-llms-harness

Evaluates LLMs across 60+ academic benchmarks (MMLU, HumanEval, GSM8K, TruthfulQA, HellaSwag). Use when benchmarking model quality, comparing models, reporting…

npx skills add https://github.com/firecrawl/ai-research-skills --skill evaluating-llms-harness

More skills from firecrawl