profiling-tables

Análisis estadístico y de calidad exhaustivo de tablas de base de datos con salida de perfilado estructurada. Genera estadísticas a nivel de columna adaptadas al tipo de datos: mínimo/máximo/percentiles para columnas numéricas, métricas de longitud para cadenas, rangos de fechas para marcas de tiempo. Realiza análisis de cardinalidad para identificar columnas categóricas frente a las de alta cardinalidad y detectar distribuciones sesgadas. Evalúa la calidad de datos en cinco dimensiones: completitud (tasas NULL), unicidad (duplicados), frescura (marcas de tiempo de actualización),...

npx skills add https://github.com/astronomer/agents --skill profiling-tables

Data Profile

Generate a comprehensive profile of a table that a new team member could use to understand the data.

Step 1: Basic Metadata

Query column metadata:

SELECT COLUMN_NAME, DATA_TYPE, COMMENT
FROM <database>.INFORMATION_SCHEMA.COLUMNS
WHERE TABLE_SCHEMA = '<schema>' AND TABLE_NAME = '<table>'
ORDER BY ORDINAL_POSITION

If the table name isn't fully qualified, search INFORMATION_SCHEMA.TABLES to locate it first.

Step 2: Size and Shape

Run via run_sql:

SELECT
    COUNT(*) as total_rows,
    COUNT(*) / 1000000.0 as millions_of_rows
FROM <table>

Step 3: Column-Level Statistics

For each column, gather appropriate statistics based on data type:

Numeric Columns

SELECT
    MIN(column_name) as min_val,
    MAX(column_name) as max_val,
    AVG(column_name) as avg_val,
    STDDEV(column_name) as std_dev,
    PERCENTILE_CONT(0.5) WITHIN GROUP (ORDER BY column_name) as median,
    SUM(CASE WHEN column_name IS NULL THEN 1 ELSE 0 END) as null_count,
    COUNT(DISTINCT column_name) as distinct_count
FROM <table>

String Columns

SELECT
    MIN(LEN(column_name)) as min_length,
    MAX(LEN(column_name)) as max_length,
    AVG(LEN(column_name)) as avg_length,
    SUM(CASE WHEN column_name IS NULL OR column_name = '' THEN 1 ELSE 0 END) as empty_count,
    COUNT(DISTINCT column_name) as distinct_count
FROM <table>

Date/Timestamp Columns

SELECT
    MIN(column_name) as earliest,
    MAX(column_name) as latest,
    DATEDIFF('day', MIN(column_name), MAX(column_name)) as date_range_days,
    SUM(CASE WHEN column_name IS NULL THEN 1 ELSE 0 END) as null_count
FROM <table>

Step 4: Cardinality Analysis

For columns that look like categorical/dimension keys:

SELECT
    column_name,
    COUNT(*) as frequency,
    ROUND(COUNT(*) * 100.0 / SUM(COUNT(*)) OVER(), 2) as percentage
FROM <table>
GROUP BY column_name
ORDER BY frequency DESC
LIMIT 20

This reveals:

  • High-cardinality columns (likely IDs or unique values)
  • Low-cardinality columns (likely categories or status fields)
  • Skewed distributions (one value dominates)

Step 5: Sample Data

Get representative rows:

SELECT *
FROM <table>
LIMIT 10

If the table is large and you want variety, sample from different time periods or categories.

Step 6: Data Quality Assessment

Summarize quality across dimensions:

Completeness

  • Which columns have NULLs? What percentage?
  • Are NULLs expected or problematic?

Uniqueness

  • Does the apparent primary key have duplicates?
  • Are there unexpected duplicate rows?

Freshness

  • When was data last updated? (MAX of timestamp columns)
  • Is the update frequency as expected?

Validity

  • Are there values outside expected ranges?
  • Are there invalid formats (dates, emails, etc.)?
  • Are there orphaned foreign keys?

Consistency

  • Do related columns make sense together?
  • Are there logical contradictions?

Step 7: Output Summary

Provide a structured profile:

Overview

2-3 sentences describing what this table contains, who uses it, and how fresh it is.

Schema

ColumnTypeNulls%DistinctDescription
...............

Key Statistics

  • Row count: X
  • Date range: Y to Z
  • Last updated: timestamp

Data Quality Score

  • Completeness: X/10
  • Uniqueness: X/10
  • Freshness: X/10
  • Overall: X/10

Potential Issues

List any data quality concerns discovered.

Recommended Queries

3-5 useful queries for common questions about this data.

Más skills de astronomer

airflow-state-store
astronomer
Persists task and asset state across retries and DAG runs using Airflow 3.3's AIP-103 key/value stores (`task_state_store`, `asset_state_store`) and the…
creating-openlineage-extractors
astronomer
Extractores personalizados de OpenLineage para operadores de Airflow no soportados y escenarios complejos de linaje. Dos enfoques: agregar métodos de OpenLineage directamente a los operadores que posees (recomendado), o crear extractores personalizados para operadores de terceros que no puedes modificar. Los extractores interceptan la ejecución del operador en tres puntos: antes de la ejecución para linaje estático, después del éxito para salidas determinadas en tiempo de ejecución, y opcionalmente después del fallo para linaje parcial. Registra los extractores mediante airflow.cfg o variables de entorno...
debugging-dags
astronomer
Análisis sistemático de causa raíz y remediación para DAGs de Airflow fallidos con flujos de trabajo de investigación estructurados. Guía a través de un proceso de diagnóstico de cuatro pasos: identificar la falla, extraer detalles del error, recopilar información contextual y entregar pasos de remediación accionables. Clasifica las fallas en cuatro tipos (datos, código, infraestructura, dependencia) para enfocar la investigación y sugerir correcciones apropiadas. Proporciona comandos CLI listos para usar para recuperación de registros, comparación de ejecuciones, limpieza de tareas y DAG...
delegating-to-otto
astronomer
Drives Astronomer's Otto agent (`astro otto`) as a delegated sub-agent for Airflow, dbt, and data-engineering work. Use when the user explicitly asks to "use…
deploying-airflow
astronomer
Desplegar DAGs y proyectos de Airflow. Úsalo cuando el usuario quiera desplegar código, enviar DAGs, configurar CI/CD, desplegar a producción, o pregunte sobre estrategias de despliegue…
deploying-go-sdk-bundles
astronomer
Compila, empaqueta e implementa paquetes compilados del SDK de Airflow Go para que ExecutableCoordinator pueda ejecutarlos. Úsalo cuando el usuario quiera compilar un paquete de tareas de Go, solicite…
testing-dags
astronomer
Ciclos iterativos de prueba-depuración-corrección para DAGs de Airflow con diagnóstico completo de fallos. Comience con af runs trigger-wait <dag_id> para ejecutar un DAG y esperar su finalización; no se necesitan comprobaciones previas. En caso de fallo, use af runs diagnose para obtener un resumen completo del fallo y af tasks logs para inspeccionar los detalles del error de tareas específicas. Admite configuración personalizada, tiempos de espera e intentos de reintento; maneja escenarios de éxito, fallo y tiempo de espera con una interpretación clara de la respuesta. Validación rápida disponible...
tracing-downstream-lineage
astronomer
Rastrea el linaje de datos descendente para evaluar el impacto de cambios antes de modificar tablas o DAGs. Identifica los consumidores directos de una tabla o DAG objetivo mediante búsqueda en código fuente, dependencias de vistas y conexiones de herramientas de BI. Construye un árbol de dependencias completo que mapea todos los impactos descendentes, desde tablas hasta paneles y modelos de ML. Clasifica las dependencias por criticidad (crítica, alta, media, baja) para priorizar la comunicación con las partes interesadas y las pruebas. Genera un informe de impacto con evaluación de riesgos, afectados...