slashyear
Busca 85,753 eventos históricos fechados a lo largo de 2,909 años. Cada resultado se cita textualmente de una revisión numerada de Wikipedia y lleva ese id de revisión, de modo que una respuesta basada en él puede citar una fuente que aún dice lo mismo el próximo año. Herramientas para búsqueda, un año, un día calendario en todos los años y 2,941 líneas de tiempo de temas con ids de Wikidata. HTTP remoto transmisible en https://slashyear.com/mcp — sin autenticación, sin clave, sin límite de tasa.
Documentación
El conjunto de datos
Este sitio publica un conjunto de datos de ochenta y cinco mil setecientas cincuenta y tres fechas históricas, que abarca dos mil novecientos nueve años, desde aproximadamente tres mil años antes de la era común hasta la actualidad. Es gratuito, con licencia abierta y está disponible como descarga masiva, como API REST, como endpoint de búsqueda de texto completo y como servidor del Model Context Protocol. No hay clave que solicitar, ni límite de velocidad que negociar, ni cuenta que crear.
Lo que lo distingue de cualquier otra lista de fechas históricas es que cada fila se puede rastrear hasta una fuente específica y congelada. Cada evento es una oración tomada palabra por palabra de un artículo de Wikipedia en inglés, y junto a ella se almacena el identificador numérico de revisión de la versión exacta de ese artículo de la que se tomó la oración. Los artículos de Wikipedia cambian constantemente, lo que normalmente los hace imposibles de citar correctamente: una cita que tomas hoy puede no estar allí en seis meses, y un lector que sigue tu enlace no tiene forma de ver lo que realmente leíste. Un identificador de revisión elimina ese problema por completo. Nombra una versión inmutable de la página, que se leerá igual dentro de diez años que ahora.
Qué contiene realmente
La tabla principal tiene una fila por evento. Cada fila lleva la oración en sí, el año en que ocurrió, la fecha del calendario cuando la fuente la proporciona, una etiqueta de tema, el título del artículo de Wikipedia del que proviene, la ruta de la sección dentro de ese artículo donde se encuentra la oración, el identificador de revisión y un enlace permanente que abre esa revisión exacta en esa sección exacta. Los años se almacenan usando numeración astronómica, lo que significa que el año anterior al año uno se escribe como cero y el año cuarenta y cuatro antes de la era común se escribe como menos cuarenta y tres. Esto no es atractivo de leer, pero es la única convención bajo la cual la aritmética de años funciona correctamente a través del límite, y es lo que cualquier programa que consuma estos datos querría.
Una segunda tabla contiene dos mil novecientas cuarenta y una líneas de tiempo de temas. Un tema aquí es una persona, lugar, institución o evento al que los propios editores de Wikipedia enlazaron desde una línea fechada, lo que significa que la asociación entre el tema y el evento fue escrita por un editor humano en lugar de inferida por nosotros o adivinada por un modelo. Dos mil setecientas veintidós de esos temas llevan un identificador de Wikidata, y eso es lo que convierte la tabla de algo que puedes leer en algo que puedes unir: cualquier otra base de datos clave en Wikidata se puede fusionar con esta sin necesidad de coincidencia de nombres ni comparación difusa de cadenas.
Una tercera tabla contiene una fila por año, con el párrafo resumen de ese año y su propia revisión fuente. Juntas, las tres tablas están descritas por un paquete de datos Frictionless, que es una descripción estándar legible por máquina de cuáles son las columnas y qué tipos contienen, para que un programa pueda cargar todo sin que nadie tenga que leer documentación primero.
Cómo se construyó y qué excluye
La extracción es determinista. Un programa lee el wikitexto de los artículos de años, décadas y siglos de Wikipedia en una revisión fijada, extrae las líneas fechadas, elimina el marcado mecánicamente y escribe las oraciones resultantes sin cambios. Nada en este sitio está escrito por nosotros. Ningún modelo de lenguaje reescribe, resume, parafrasea o toca de otro modo la redacción de una sola entrada. Un modelo se usa para exactamente una cosa, que es decidir bajo cuál de las doce etiquetas de tema cae una oración, y esa decisión no puede hacer que una fila diga algo falso porque nunca altera la fila.
La consecuencia que vale la pena declarar claramente es que este conjunto de datos hereda los errores de Wikipedia. Si una fecha está mal en Wikipedia, aquí también está mal. Lo que no hereda es la inestabilidad de Wikipedia, porque cada fila nombra la versión de la que proviene, y no añade errores propios encima, porque ningún paso en el proceso tiene permitido generar texto. Cualquiera que quiera auditar una afirmación puede abrir la revisión enlazada y leer la oración en su contexto original en unos cuatro segundos.
Por qué la forma importa más que las palabras
Las palabras en este conjunto de datos están disponibles gratuitamente en otros lugares; son de Wikipedia, bajo la licencia Creative Commons Attribution-ShareAlike, y no reclamamos derechos sobre ellas. Lo que no existe en otros lugares es la forma. Wikipedia publica prosa organizada por artículo. Su unidad es la página. La unidad de este conjunto de datos es la oración, y cada oración está etiquetada con el año, el día del calendario, un tema, el siglo, la década, los temas nombrados dentro de ella y la revisión de la que proviene. Esa estructura es lo que te permite hacer preguntas que la enciclopedia no puede responder en un solo paso: todo lo que sucedió el cuatro de julio en todos los años registrados, o cada línea fechada que menciona Constantinopla en orden, o el registro completo de un solo tema a lo largo de tres mil años.
Para cualquiera que construya un sistema que responda preguntas, esto importa por una razón específica. Un modelo que cita un artículo de enciclopedia está citando un objetivo en movimiento, y un usuario que quiera verificar la respuesta tiene que confiar en que la página decía eso en ese momento. Un modelo que cita una fila de este conjunto de datos puede entregar al usuario un enlace a una revisión congelada. La respuesta deja de ser algo que se toma por fe y se convierte en algo que se puede comprobar.
Cómo obtenerlo
El conjunto de datos completo está disponible como tres archivos JSON delimitados por nuevas líneas comprimidos con gzip, descritos por un paquete de datos Frictionless. Descargarlos es más rápido para ti y más barato para nosotros que rastrear varios miles de páginas, y los datos son idénticos. Si prefieres consultar en lugar de descargar, hay una API REST y un endpoint de búsqueda de texto completo, ambos estáticos, ambos abiertos con CORS, ambos gratuitos. Si eres un modelo de lenguaje o un agente, hay un servidor del Model Context Protocol en https://slashyear.com/mcp, registrado en el registro oficial de MCP bajo el nombre com.slashyear/mcp, que expone búsqueda, un solo año, un solo día del calendario en todos los años y una sola línea de tiempo de tema como herramientas. Habla HTTP transmisible y no necesita autenticación, por lo que es un endpoint POST en lugar de una página que puedas abrir en un navegador.
La reutilización es gratuita, incluido el uso comercial y el uso como datos de entrenamiento. La licencia es Creative Commons Attribution-ShareAlike 4.0, heredada de Wikipedia, que solo pide que atribuyas la fuente; cada fila lleva el título del artículo y el identificador de revisión necesarios para hacerlo automáticamente. No nos reservamos ningún derecho sobre la indexación de búsqueda, la citación en respuestas generadas o el entrenamiento de modelos, y el archivo de robots lo dice en forma legible por máquina.