slashyear
Pesquise 85.753 eventos históricos datados ao longo de 2.909 anos. Cada resultado é citado verbatim de uma revisão numerada da Wikipédia e carrega o id dessa revisão, então uma resposta construída sobre ele pode citar uma fonte que ainda diz a mesma coisa no próximo ano. Ferramentas para busca, um ano, um dia de calendário em todos os anos e 2.941 linhas do tempo de assuntos com ids do Wikidata. HTTP remoto e streamable em https://slashyear.com/mcp — sem autenticação, sem chave, sem limite de taxa.
Documentação
O conjunto de dados
Este site publica um conjunto de dados com cento e vinte e um mil, trezentos e vinte e nove entradas datadas, cobrindo três mil e setenta e oito anos, desde aproximadamente três mil anos antes da era comum até os dias atuais. Setenta e nove mil, duzentos e cinquenta dessas entradas são eventos; as quarenta e duas mil e setenta e nove restantes registram um nascimento ou uma morte, que os artigos de origem listam separadamente, e este site também o faz. Trinta e quatro mil, quatrocentas e cinquenta e quatro das linhas nomeiam o país onde ocorreram, abrangendo cento e oitenta e quatro países, porque a Wikipédia em inglês escreve um artigo separado para cada país em cada ano, e esses também foram lidos, além dos artigos mundiais. É gratuito, com licença aberta e disponível como download em massa, como API REST, como endpoint de busca em texto completo e como servidor Model Context Protocol. Não há chave a solicitar, limite de taxa a negociar ou conta a criar.
O que o distingue de qualquer outra lista de datas históricas é que cada linha pode ser rastreada até uma fonte específica e congelada. Cada evento é uma frase retirada palavra por palavra de um artigo da Wikipédia em inglês, e, armazenado junto a ela, está o identificador numérico de revisão da versão exata daquele artigo de onde a frase foi retirada. Os artigos da Wikipédia mudam constantemente, o que normalmente os torna impossíveis de citar adequadamente: uma citação que você extrai hoje pode não estar lá em seis meses, e um leitor que segue seu link não tem como ver o que você realmente leu. Um identificador de revisão elimina esse problema por completo. Ele nomeia uma versão imutável da página, que será lida da mesma forma daqui a dez anos como é lida agora.
O que realmente contém
A tabela principal tem uma linha por evento. Cada linha carrega a frase em si, o ano em que ocorreu, a data do calendário quando a fonte fornece uma, um rótulo de tópico, o título do artigo da Wikipédia de onde veio, o caminho da seção dentro desse artigo onde a frase se encontra, o identificador de revisão e um link permanente que abre exatamente aquela revisão naquela seção exata. Os anos são armazenados usando numeração astronômica, o que significa que o ano anterior ao ano um é escrito como zero, e o ano quarenta e quatro antes da era comum é escrito como menos quarenta e três. Isso não é agradável de ler, mas é a única convenção sob a qual a aritmética de anos funciona corretamente através da fronteira, e é o que qualquer programa que consuma esses dados desejaria.
Uma segunda tabela contém dois mil, novecentas e quarenta e uma linhas do tempo de assuntos. Um assunto aqui é uma pessoa, lugar, instituição ou evento para o qual os próprios editores da Wikipédia criaram links a partir de uma linha datada, o que significa que a associação entre o assunto e o evento foi escrita por um editor humano, em vez de inferida por nós ou adivinhada por um modelo. Dois mil, setecentos e vinte e dois desses assuntos carregam um identificador Wikidata, e é isso que transforma a tabela de algo que você pode ler em algo que você pode unir: qualquer outro banco de dados indexado por Wikidata pode ser mesclado com este sem qualquer correspondência de nomes ou comparação difusa de strings.
Uma terceira tabela contém uma linha por ano, com o parágrafo de resumo daquele ano e sua própria revisão de origem. Juntas, as três tabelas são descritas por um pacote de dados Frictionless, que é uma descrição padrão legível por máquina de quais são as colunas e quais tipos elas contêm, para que um programa possa carregar tudo sem que ninguém precise ler documentação primeiro.
Como foi construído e o que isso exclui
A extração é determinística. Um programa lê o wikitexto dos artigos de ano, década e século da Wikipédia em uma revisão fixada, extrai as linhas datadas, remove a marcação mecanicamente e escreve as frases resultantes sem alterações. Nada neste site é escrito por nós. Nenhum modelo de linguagem reescreve, resume, parafraseia ou de qualquer outra forma toca no texto de uma única entrada. Um modelo é usado para exatamente uma coisa, que é decidir a qual dos doze rótulos de tópico uma frase pertence, e essa decisão não pode fazer uma linha dizer algo falso porque nunca altera a linha.
A consequência que vale a pena afirmar claramente é que este conjunto de dados herda os erros da Wikipédia. Se uma data está errada na Wikipédia, também está errada aqui. O que ele não herda é a instabilidade da Wikipédia, porque cada linha nomeia a versão de onde veio, e ele não adiciona erros próprios por cima, porque nenhuma etapa do pipeline tem permissão para gerar texto. Qualquer pessoa que queira auditar uma afirmação pode abrir a revisão vinculada e ler a frase em seu contexto original em cerca de quatro segundos.
Por que a estrutura importa mais do que as palavras
As palavras neste conjunto de dados estão disponíveis gratuitamente em outros lugares; são da Wikipédia, sob a licença Creative Commons Attribution-ShareAlike, e não reivindicamos direitos sobre elas. O que não existe em outros lugares é a estrutura. A Wikipédia publica prosa organizada por artigo. Sua unidade é a página. A unidade deste conjunto de dados é a frase, e cada frase é marcada com o ano, o dia do calendário, um tópico, o século, a década, os assuntos nomeados dentro dela e a revisão de onde veio. Essa estrutura é o que permite fazer perguntas que a enciclopédia não consegue responder em uma única etapa: tudo o que aconteceu no dia quatro de julho em todos os anos registrados, ou cada linha datada mencionando Constantinopla em ordem, ou o registro completo de um único tópico ao longo de três mil anos.
Para qualquer pessoa que construa um sistema que responda perguntas, isso importa por um motivo específico. Um modelo que cita um artigo de enciclopédia está citando um alvo em movimento, e um usuário que queira verificar a resposta precisa confiar que a página dizia aquilo naquele momento. Um modelo que cita uma linha deste conjunto de dados pode entregar ao usuário um link para uma revisão congelada. A resposta deixa de ser algo para aceitar por fé e se torna algo que pode ser verificado.
Como obtê-lo
O conjunto de dados completo está disponível como três arquivos JSON delimitados por nova linha e compactados com gzip, descritos por um pacote de dados Frictionless. Baixá-los é mais rápido para você e mais barato para nós do que rastrear vários milhares de páginas, e os dados são idênticos. Se você preferir consultar em vez de baixar, há uma API REST e um endpoint de busca em texto completo, ambos estáticos, ambos com CORS aberto, ambos gratuitos. Se você é um modelo de linguagem ou um agente, há um servidor Model Context Protocol em https://slashyear.com/mcp, registrado no registro oficial de MCP sob o nome com.slashyear/mcp, que expõe busca, um único ano, um único dia do calendário em todos os anos e uma única linha do tempo de assunto como ferramentas. Ele fala HTTP transmissível e não requer autenticação, então é um endpoint POST, em vez de uma página que você pode abrir em um navegador.
A reutilização é gratuita, incluindo uso comercial e uso como dados de treinamento. A licença é Creative Commons Attribution-ShareAlike 4.0, herdada da Wikipédia, que pede apenas que você atribua a fonte; cada linha carrega o título do artigo e o identificador de revisão necessários para fazer isso automaticamente. Não estamos reservando nenhum direito sobre indexação de busca, citação em respostas geradas ou treinamento de modelos, e o arquivo robots diz isso em formato legível por máquina.