evaluating-llms-harness
bởi firecrawl
Đánh giá các LLM trên 60+ điểm chuẩn học thuật (MMLU, HumanEval, GSM8K, TruthfulQA, HellaSwag). Sử dụng khi đo điểm chuẩn chất lượng mô hình, so sánh mô hình, báo cáo…
npx skills add https://github.com/firecrawl/ai-research-skills --skill evaluating-llms-harness