evaluating-llms-harness
oleh firecrawl
Mengevaluasi LLM di lebih dari 60 tolok ukur akademis (MMLU, HumanEval, GSM8K, TruthfulQA, HellaSwag). Gunakan saat melakukan benchmarking kualitas model, membandingkan model, melaporkan…
npx skills add https://github.com/firecrawl/ai-research-skills --skill evaluating-llms-harness