evaluating-llms-harness

作者: firecrawl

在60多个学术基准(MMLU、HumanEval、GSM8K、TruthfulQA、HellaSwag)上评估LLM。用于基准测试模型质量、比较模型、报告……

npx skills add https://github.com/firecrawl/ai-research-skills --skill evaluating-llms-harness