Dataset Viewer

Interaja com a API do Hugging Face Dataset Viewer para navegar, filtrar e obter estatísticas de conjuntos de dados.

Documentação

Servidor MCP Dataset Viewer

Um servidor MCP para interagir com a API do Dataset Viewer do Hugging Face, fornecendo capacidades para navegar e analisar datasets hospedados no Hugging Face Hub.

Recursos

Recursos

  • Utiliza o esquema de URI dataset:// para acessar datasets do Hugging Face
  • Suporta configurações e divisões de dataset
  • Fornece acesso paginado ao conteúdo dos datasets
  • Gerencia autenticação para datasets privados
  • Suporta busca e filtragem de conteúdo de datasets
  • Fornece estatísticas e análises de datasets

Ferramentas

O servidor fornece as seguintes ferramentas:

  1. validate

    • Verifica se um dataset existe e é acessível
    • Parâmetros:
      • dataset: Identificador do dataset (ex.: 'stanfordnlp/imdb')
      • auth_token (opcional): Para datasets privados
  2. get_info

    • Obtém informações detalhadas sobre um dataset
    • Parâmetros:
      • dataset: Identificador do dataset
      • auth_token (opcional): Para datasets privados
  3. get_rows

    • Obtém o conteúdo paginado de um dataset
    • Parâmetros:
      • dataset: Identificador do dataset
      • config: Nome da configuração
      • split: Nome do split
      • page (opcional): Número da página (baseado em 0)
      • auth_token (opcional): Para datasets privados
  4. get_first_rows

    • Obtém as primeiras linhas de um split do dataset
    • Parâmetros:
      • dataset: Identificador do dataset
      • config: Nome da configuração
      • split: Nome do split
      • auth_token (opcional): Para datasets privados
  5. get_statistics

    • Obtém estatísticas sobre um split do dataset
    • Parâmetros:
      • dataset: Identificador do dataset
      • config: Nome da configuração
      • split: Nome do split
      • auth_token (opcional): Para datasets privados
  6. search_dataset

    • Busca texto dentro de um dataset
    • Parâmetros:
      • dataset: Identificador do dataset
      • config: Nome da configuração
      • split: Nome do split
      • query: Texto a ser pesquisado
      • auth_token (opcional): Para datasets privados
  7. filter

    • Filtra linhas usando condições semelhantes a SQL
    • Parâmetros:
      • dataset: Identificador do dataset
      • config: Nome da configuração
      • split: Nome do split
      • where: Cláusula SQL WHERE (ex.: "score > 0.5")
      • orderby (opcional): Cláusula SQL ORDER BY
      • page (opcional): Número da página (baseado em 0)
      • auth_token (opcional): Para datasets privados
  8. get_parquet

    • Baixa o dataset completo no formato Parquet
    • Parâmetros:
      • dataset: Identificador do dataset
      • auth_token (opcional): Para datasets privados

Instalação

Pré-requisitos

  • Python 3.12 ou superior
  • uv - Instalador e gerenciador de pacotes Python rápido

Configuração

  1. Clone o repositório:
git clone https://github.com/privetin/dataset-viewer.git
cd dataset-viewer
  1. Crie um ambiente virtual e instale:
# Create virtual environment
uv venv

# Activate virtual environment
# On Unix:
source .venv/bin/activate
# On Windows:
.venv\Scripts\activate

# Install in development mode
uv add -e .

Configuração

Variáveis de Ambiente

  • HUGGINGFACE_TOKEN: Seu token de API do Hugging Face para acessar datasets privados

Integração com Claude Desktop

Adicione o seguinte ao seu arquivo de configuração do Claude Desktop:

No Windows: %APPDATA%\Claude\claude_desktop_config.json

No MacOS: ~/Library/Application Support/Claude/claude_desktop_config.json

{
  "mcpServers": {
    "dataset-viewer": {
      "command": "uv",
      "args": [
        "--directory",
        "parent_to_repo/dataset-viewer",
        "run",
        "dataset-viewer"
      ]
    }
  }
}

Licença

Licença MIT - consulte LICENSE para obter detalhes