evaluating-llms-harness
tarafından firecrawl
60'tan fazla akademik kıyaslamada (MMLU, HumanEval, GSM8K, TruthfulQA, HellaSwag) LLM'leri değerlendirir. Model kalitesini kıyaslarken, modelleri karşılaştırırken, raporlarken kullanın…
npx skills add https://github.com/firecrawl/ai-research-skills --skill evaluating-llms-harness