Dataset Viewer
Interaja com a API do Hugging Face Dataset Viewer para navegar, filtrar e obter estatísticas de conjuntos de dados.
Documentação
Servidor MCP Dataset Viewer
Um servidor MCP para interagir com a API do Dataset Viewer do Hugging Face, fornecendo capacidades para navegar e analisar datasets hospedados no Hugging Face Hub.
Recursos
Recursos
- Utiliza o esquema de URI
dataset://para acessar datasets do Hugging Face - Suporta configurações e divisões de dataset
- Fornece acesso paginado ao conteúdo dos datasets
- Gerencia autenticação para datasets privados
- Suporta busca e filtragem de conteúdo de datasets
- Fornece estatísticas e análises de datasets
Ferramentas
O servidor fornece as seguintes ferramentas:
-
validate
- Verifica se um dataset existe e é acessível
- Parâmetros:
dataset: Identificador do dataset (ex.: 'stanfordnlp/imdb')auth_token(opcional): Para datasets privados
-
get_info
- Obtém informações detalhadas sobre um dataset
- Parâmetros:
dataset: Identificador do datasetauth_token(opcional): Para datasets privados
-
get_rows
- Obtém o conteúdo paginado de um dataset
- Parâmetros:
dataset: Identificador do datasetconfig: Nome da configuraçãosplit: Nome do splitpage(opcional): Número da página (baseado em 0)auth_token(opcional): Para datasets privados
-
get_first_rows
- Obtém as primeiras linhas de um split do dataset
- Parâmetros:
dataset: Identificador do datasetconfig: Nome da configuraçãosplit: Nome do splitauth_token(opcional): Para datasets privados
-
get_statistics
- Obtém estatísticas sobre um split do dataset
- Parâmetros:
dataset: Identificador do datasetconfig: Nome da configuraçãosplit: Nome do splitauth_token(opcional): Para datasets privados
-
search_dataset
- Busca texto dentro de um dataset
- Parâmetros:
dataset: Identificador do datasetconfig: Nome da configuraçãosplit: Nome do splitquery: Texto a ser pesquisadoauth_token(opcional): Para datasets privados
-
filter
- Filtra linhas usando condições semelhantes a SQL
- Parâmetros:
dataset: Identificador do datasetconfig: Nome da configuraçãosplit: Nome do splitwhere: Cláusula SQL WHERE (ex.: "score > 0.5")orderby(opcional): Cláusula SQL ORDER BYpage(opcional): Número da página (baseado em 0)auth_token(opcional): Para datasets privados
-
get_parquet
- Baixa o dataset completo no formato Parquet
- Parâmetros:
dataset: Identificador do datasetauth_token(opcional): Para datasets privados
Instalação
Pré-requisitos
- Python 3.12 ou superior
- uv - Instalador e gerenciador de pacotes Python rápido
Configuração
- Clone o repositório:
git clone https://github.com/privetin/dataset-viewer.git
cd dataset-viewer
- Crie um ambiente virtual e instale:
# Create virtual environment
uv venv
# Activate virtual environment
# On Unix:
source .venv/bin/activate
# On Windows:
.venv\Scripts\activate
# Install in development mode
uv add -e .
Configuração
Variáveis de Ambiente
HUGGINGFACE_TOKEN: Seu token de API do Hugging Face para acessar datasets privados
Integração com Claude Desktop
Adicione o seguinte ao seu arquivo de configuração do Claude Desktop:
No Windows: %APPDATA%\Claude\claude_desktop_config.json
No MacOS: ~/Library/Application Support/Claude/claude_desktop_config.json
{
"mcpServers": {
"dataset-viewer": {
"command": "uv",
"args": [
"--directory",
"parent_to_repo/dataset-viewer",
"run",
"dataset-viewer"
]
}
}
}
Licença
Licença MIT - consulte LICENSE para obter detalhes