evaluating-llms-harness
par firecrawl
Évalue les LLMs sur plus de 60 benchmarks académiques (MMLU, HumanEval, GSM8K, TruthfulQA, HellaSwag). À utiliser pour évaluer la qualité des modèles, comparer des modèles, faire des rapports…
npx skills add https://github.com/firecrawl/ai-research-skills --skill evaluating-llms-harness