Dataset Viewer
Interactúa con la API de Hugging Face Dataset Viewer para explorar, filtrar y obtener estadísticas de conjuntos de datos.
Documentación
Servidor MCP Dataset Viewer
Un servidor MCP para interactuar con la Hugging Face Dataset Viewer API, que proporciona capacidades para explorar y analizar conjuntos de datos alojados en Hugging Face Hub.
Características
Recursos
- Utiliza el esquema URI
dataset://para acceder a conjuntos de datos de Hugging Face - Admite configuraciones y divisiones de conjuntos de datos
- Proporciona acceso paginado al contenido de los conjuntos de datos
- Maneja la autenticación para conjuntos de datos privados
- Admite búsqueda y filtrado del contenido de los conjuntos de datos
- Proporciona estadísticas y análisis de conjuntos de datos
Herramientas
El servidor proporciona las siguientes herramientas:
-
validate
- Comprueba si un conjunto de datos existe y es accesible
- Parámetros:
dataset: Identificador del conjunto de datos (p. ej. 'stanfordnlp/imdb')auth_token(opcional): Para conjuntos de datos privados
-
get_info
- Obtiene información detallada sobre un conjunto de datos
- Parámetros:
dataset: Identificador del conjunto de datosauth_token(opcional): Para conjuntos de datos privados
-
get_rows
- Obtiene el contenido paginado de un conjunto de datos
- Parámetros:
dataset: Identificador del conjunto de datosconfig: Nombre de la configuraciónsplit: Nombre de la divisiónpage(opcional): Número de página (basado en 0)auth_token(opcional): Para conjuntos de datos privados
-
get_first_rows
- Obtiene las primeras filas de una división de un conjunto de datos
- Parámetros:
dataset: Identificador del conjunto de datosconfig: Nombre de la configuraciónsplit: Nombre de la divisiónauth_token(opcional): Para conjuntos de datos privados
-
get_statistics
- Obtiene estadísticas sobre una división de un conjunto de datos
- Parámetros:
dataset: Identificador del conjunto de datosconfig: Nombre de la configuraciónsplit: Nombre de la divisiónauth_token(opcional): Para conjuntos de datos privados
-
search_dataset
- Busca texto dentro de un conjunto de datos
- Parámetros:
dataset: Identificador del conjunto de datosconfig: Nombre de la configuraciónsplit: Nombre de la divisiónquery: Texto a buscarauth_token(opcional): Para conjuntos de datos privados
-
filter
- Filtra filas usando condiciones similares a SQL
- Parámetros:
dataset: Identificador del conjunto de datosconfig: Nombre de la configuraciónsplit: Nombre de la divisiónwhere: Cláusula SQL WHERE (p. ej. "score > 0.5")orderby(opcional): Cláusula SQL ORDER BYpage(opcional): Número de página (basado en 0)auth_token(opcional): Para conjuntos de datos privados
-
get_parquet
- Descarga el conjunto de datos completo en formato Parquet
- Parámetros:
dataset: Identificador del conjunto de datosauth_token(opcional): Para conjuntos de datos privados
Instalación
Requisitos previos
- Python 3.12 o superior
- uv - Instalador y resolvedor de paquetes Python rápido
Configuración
- Clona el repositorio:
git clone https://github.com/privetin/dataset-viewer.git
cd dataset-viewer
- Crea un entorno virtual e instala:
# Create virtual environment
uv venv
# Activate virtual environment
# On Unix:
source .venv/bin/activate
# On Windows:
.venv\Scripts\activate
# Install in development mode
uv add -e .
Configuración
Variables de entorno
HUGGINGFACE_TOKEN: Tu token de API de Hugging Face para acceder a conjuntos de datos privados
Integración con Claude Desktop
Añade lo siguiente a tu archivo de configuración de Claude Desktop:
En Windows: %APPDATA%\Claude\claude_desktop_config.json
En MacOS: ~/Library/Application Support/Claude/claude_desktop_config.json
{
"mcpServers": {
"dataset-viewer": {
"command": "uv",
"args": [
"--directory",
"parent_to_repo/dataset-viewer",
"run",
"dataset-viewer"
]
}
}
}
Licencia
Licencia MIT - consulta LICENSE para más detalles