Misata
Gere dados de teste realistas para múltiplas tabelas, com chaves estrangeiras que resolvem e agregados que reconciliam, retornados com uma verificação de integridade. Popula Postgres, MySQL e SQLite a partir do seu próprio esquema, ou exporta CSV/JSON/SQL/Parquet. Determinístico, de modo que o mesmo esquema e seed geram as mesmas linhas.
Documentação
Misata
O mecanismo de dados sintéticos relacionais que atende a resultados de negócio exatos.
Gere bancos de dados multi-tabela completos com chaves estrangeiras que se resolvem, matemática que reconcilia e prosa autêntica de domínio com zero Lorem Ipsum. A partir de uma única frase, esquema YAML ou banco de dados ao vivo.
Prefere uma interface visual? Experimente Misata Studio para desenhar esquemas em um canvas interativo e gerar conjuntos de dados diretamente no seu navegador.
A Mudança de Paradigma
A maioria das ferramentas de dados sintéticos pega dados existentes e os imita. Mas na engenharia moderna, raramente você tem dados limpos para começar—ou você precisa de dados projetados em torno de um resultado-alvo específico:
- "A receita mensal sobe de $50k para $200k com uma queda no Q3."
- "A taxa de fraude começa em 1% no Q1 e sobe para 6% até o Q4."
- "O
total_spentde cada cliente é estritamente igual à soma dos itens de suas linhas de pedido."
Misata funciona ao contrário: você declara o resultado, e o Misata resolve as linhas individuais que o atingem com erro de $0,00, garantido por um mecanismo de soma condicional Gamma de forma fechada (arXiv:2606.08736). Sem modelos de aprendizado de máquina, sem dados reais necessários e zero chaves estrangeiras alucinadas.
⚡ Início Rápido em 30 Segundos
Instale via pip:
pip install misata
CLI
Gere um conjunto de dados relacional completo a partir de uma única descrição:
misata generate \
--story "Brazilian fintech with R$ payments, CPF verification, and 3% fraud" \
--rows 1000 \
--output-dir ./demo_data
Gera CSVs limpos e um oracle_report.json verificando zero órfãos de chaves estrangeiras, satisfação de restrições e fidelidade estatística.
Python
import misata
# Generate multi-table DataFrames from plain English
data = misata.generate("SaaS startup with 500 users, monthly subscriptions, and 12% churn")
users_df = data["users"]
subscriptions_df = data["subscriptions"]
Enriqueça Dados Existentes em 1 Linha
Substitua colunas chatas ou em branco em um DataFrame existente por prosa autêntica de domínio:
import misata
import pandas as pd
df = pd.read_csv("support_cases.csv")
# Automatically detects semantic columns (subjects, resolution notes, memos, error traces)
df_enriched = misata.enrich_text(df, seed=42)
🚀 As 6 Capacidades Únicas do Misata
O que separa o Misata de bibliotecas legadas como Faker e modelos de imitação como SDV:
1. Conformidade Exata de Resultado (Erro de $0,00)
Declare o resultado agregado (curva de receita, taxa de churn, pico sazonal, curva de inadimplência), e o Misata gera micro-linhas cujas somas mensais ou anuais correspondem ao seu alvo com erro de $0,00. Enquanto sintetizadores prontos para uso erram alvos agregados em 74–86%, o Misata os atinge de forma comprovável (leia o artigo de pesquisa).
2. Oracle de Sandbox Instantâneo para Agentes de Codificação de IA
O Misata inclui um servidor nativo Model Context Protocol (MCP). Cursor, Claude Code e Windsurf podem chamar create_sandbox para criar um banco de dados SQLite isolado, semeado com dados relacionais realistas em 2 segundos. Agentes de IA podem testar consultas SQL e código de teste contra tabelas reais em vez de adivinhar esquemas.
pip install "misata[mcp]" && misata mcp install --client all
3. Integridade Relacional DAG Topológica (0 Órfãos de Chaves Estrangeiras)
Relacionamentos pai-filho em mais de 10 tabelas são resolvidos via ordenação de classificação topológica. Hierarquias autorreferenciais, restrições únicas compostas e causalidade temporal (signup_date <= order_date <= payment_date <= refund_date) são estritamente aplicadas.
4. Realismo de Texto Entre Verticais (Zero Lorem Ipsum)
Sem gibberish de espaço reservado em latim. Geradores de microtexto combinatórios fornecem texto autêntico em mais de 15 indústrias do mundo real:
- E-Commerce: Descrições de produtos condicionadas por categoria (eletrônicos, vestuário, casa, beleza), motivos de devolução autênticos, notas de entrega.
- B2B SaaS: Assuntos de tickets de suporte, descrições de problemas em várias linhas, notas de resolução de agentes, motivos de churn de concorrentes.
- FinTech: Descritores de extratos bancários, memorandos de remessa ACH/wire, overrides de auditoria AML.
- Saúde: Notas de progresso SOAP clínicas, queixas principais, instruções de alta, cronogramas de dosagem médica (
TID,QID,PRN). - Avaliações de Clientes: Sentimento calibrado de forma comprovável para classificações de 1 a 5 estrelas.
5. Velocidade Vetorizada (100x–500x Mais Rápido que Faker)
Enquanto o Faker itera linha por linha em Python puro (5.000–15.000 linhas/s), o Misata usa operações vetorizadas de array NumPy. Ele gera 500.000 a 16.000.000 de linhas/segundo em um único núcleo de CPU.
6. Introspecte e Semeie Bancos de Dados ao Vivo (misata seed)
Aponte o Misata diretamente para um banco de dados PostgreSQL, MySQL ou SQLite. O Misata introspecta chaves estrangeiras, restrições de verificação, enums e tipos de coluna, gera um plano de inserção topológica e semeia dados semelhantes aos de produção diretamente de volta ao seu banco de dados sem escrever código de esquema.
🎯 Dezenas de Casos de Uso do Mundo Real
O Misata é construído para engenheiros, testadores, equipes de dados e fundadores em dezenas de cargas de trabalho do dia a dia:
🛠️ Engenharia de Dados e Pipelines ETL
- Teste de Pipeline com Resposta Conhecida: Declare metas exatas de KPI (ex.: receita de $1,2M no Q4), gere tabelas brutas sintéticas e verifique se suas transformações dbt, Spark ou SQL retornam o valor exato esperado.
- Teste de Estresse de Alto Throughput: Processe 10.000.000+ linhas em segundos para testar limites de partição, desempenho de shuffle e escalabilidade de warehouse.
- Ensaios de Migração de Esquema: Ensaie backfills destrutivos de colunas e adições de chaves estrangeiras contra dados realistas antes de implantar em produção.
- Fixtures Determinísticas de CI/CD: Sementes reproduzíveis garantem que as asserções de teste nunca falhem em execuções de integração contínua.
🤖 Agentes de Codificação de IA e Desenvolvimento de LLM
- Sandboxes SQL para Agentes: Forneça ao Cursor, Claude Code e Windsurf bancos de dados isolados e pré-semeados para validar consultas SQL sem acesso à produção.
- Geração de Benchmark Texto-para-SQL: Construa bancos de esquema relacional complexos com joins diversos para avaliar modelos de codificação ajustados.
- Pacotes de Avaliação de Banco de Dados (Evalpacks): Crie conjuntos de dados de avaliação verificados com chaves de resposta independentes DuckDB onde a verdade fundamental não pode estar errada.
🗄️ Desenvolvimento de Aplicativos e Semeadura de Banco de Dados
- Semeadura de Ambientes Locais e de Staging: Semeie bancos de dados Postgres, MySQL ou SQLite de staging com históricos de clientes realistas e 0 chaves estrangeiras quebradas (
misata seed). - Fixtures de Modelos ORM: Gere fixtures ricas correspondentes ao seu esquema Prisma ou modelos declarativos SQLAlchemy.
- Verificação de Isolamento Multi-Tenant: Teste segurança em nível de linha (RLS) e regras de isolamento de tenant sem vazamento de chaves entre tenants.
- Crescimento Incremental de Dados (
generate_diff): Adicione 5.000 novas linhas a um conjunto de dados existente enquanto desloca IDs automaticamente e preserva a integridade referencial.
📊 BI, Demonstrações de Produto e Engenharia de Vendas
- Demonstrações de Dashboards Prontas para o Board: Popule dashboards Tableau, PowerBI e Metabase com sazonalidade convincente (picos de Black Friday, quedas de verão) em vez de ruído aleatório plano.
- Protótipos de Engenharia de Vendas: Demonstre análises voltadas ao cliente com nomes de empresas autênticos, nomes humanos e históricos de transações com zero exposição de PII.
- Prévias de Recursos: Pré-visualize gráficos, coortes e métricas futuras antes que os dados de clientes de produção se acumulem.
💳 FinTech, Bancos e Pagamentos
- Balanceamento de Livro Contábil de Partidas Dobradas: Gere transações contábeis onde os débitos totais são estritamente iguais aos créditos em cada conta do livro.
- Tapes de Risco de Crédito e Empréstimos: Calibre curvas de inadimplência, distribuições de pontuação de crédito e taxas de default para testes de portfólio de crédito.
- Testes de Detecção de AML e Fraude: Aplique taxas exatas de incidência de fraude (ex.: 2,4%) com memorandos de transação autênticos e trilhas de auditoria AML.
- Remessa de Pagamentos: Simule transações SWIFT, ACH e de cartão com números de roteamento válidos, CVVs e descritores de extrato.
🏥 Saúde e Informática Clínica
- Coortes Sintéticas HIPAA Safe-Harbor: Gere populações de pacientes realistas, sinais vitais e históricos de encontros com zero responsabilidade de PHI.
- Avaliação de Modelos NLP Clínicos: Avalie LLMs de saúde contra notas SOAP autênticas, queixas principais e resumos de alta.
- Simulação de Enfermaria e Agendamento: Simule grades de consultas hospitalares com intervalos realistas de 15 minutos, horários comerciais e quedas de fim de semana.
📦 E-Commerce e Logística de Cadeia de Suprimentos
- Modelagem de Catálogo Multi-Categoria: Produza especificações e descrições de itens realistas condicionadas à categoria (eletrônicos, vestuário, casa, industrial).
- Fluxos de Devolução e Reembolso: Simule logística de devolução com motivos de devolução autênticos, marcos de reabastecimento e datas de reembolso ao cliente.
- Otimização de Rotas e Frotas: Calcule rotas realistas com cálculos de distância Haversine e endereços secundários válidos (Apt, Suite, Bldg).
🛡️ Cibersegurança e Infraestrutura de TI
- Conjuntos de Dados de Intrusão de Rede: Gere logs de netflow, varreduras de portas e padrões de tráfego DDoS para benchmarking de ferramentas de segurança.
- Análise de Exceções e Erros de Sistema: Popule dashboards de observabilidade com deadlocks realistas, timeouts HTTP 504 e logs de esgotamento de pool de conexões.
- Logs de Auditoria de Conformidade: Simule logs de acesso SOC2/HIPAA com justificativas documentadas de override de acesso gerencial.
🔬 Aprendizado de Máquina e Pesquisa Estatística
- Gêmeos Sintéticos de CSV (
misata.mimic): Clone distribuições e correlações de CSVs sensíveis sem copiar uma única linha original. - Modelagem de Cluster Hierárquico (ICC): Gere dados multi-site com Coeficientes de Correlação Intraclasse especificados para regressão de efeitos mistos.
- Autocorrelação de Séries Temporais (AR1): Gere trajetórias longitudinais de entidades que mantêm memória temporal realista.
⚡ Por Que Você Nunca Deve Usar Faker Novamente
O Faker foi construído há mais de uma década para valores mock de atributo único. Para aplicações modernas, ele introduz modos críticos de falha:
| Problema em 2026 | Realidade do Faker | Vantagem do Misata 0.9.6.60 |
|---|---|---|
| Topologia Relacional | ✗ 0 conceito de bancos de dados ou FKs; código de cola manual necessário | ✓ DAG topológico estrito; 0 órfãos de FKs garantidos |
| Coerência Entre Colunas | ✗ Incoerente (ex.: nome "Masculino", email incompatível, cidade inválida) | ✓ Identidades, endereços e causalidade coerentes |
| Realismo de Texto | ✗ "Lorem Ipsum" latino de 2.000 anos ou modelos robóticos | ✓ Mais de 15 pools de microtexto de domínio (notas SOAP, tickets, memorandos) |
| Consistência Matemática | ✗ Viola contabilidade básica (price * qty != total) | ✓ Fórmulas matemáticas exatas e livros contábeis balanceados |
| Desempenho | ✗ ~10k linhas/s (loops Python de thread única) | ✓ 500k a 16M linhas/s (mecanismo NumPy vetorizado) |
| Alvos Agregados | ✗ Impossível (ruído aleatório uniforme) | ✓ Conformidade exata de resultado em forma fechada (erro de $0,00) |
| Semeadura de Banco de Dados | ✗ Scripts SQL manuais ou boilerplate ORM | ✓ Introspecção e semeadura em um comando (misata seed) |
Leia o Guia Completo Faker vs SDV vs Misata para benchmarks completos e comparações de código.
🛠️ Oito Maneiras de Gerar Dados
O Misata se adapta a qualquer fluxo de trabalho que você já usa:
| Modo de Entrada | Melhor Para | Saiba Mais |
|---|---|---|
| 1. História em Inglês Simples | Prototipagem rápida, zero configuração | Guia de História |
| 2. YAML Schema-as-Code | Commit de definições de dados versionadas no git | Guia YAML |
| 3. Semeadura de Banco de Dados ao Vivo | Introspectar e popular Postgres, MySQL, SQLite | Guia de Semeadura de Banco de Dados |
| 4. Esquema Dict Python | Geração programática em memória em scripts Python | Guia de Esquema Dict |
| 5. Esquemas de Projetos dbt | Gerar fixtures diretamente de schema.yml | Guia de Semeadura dbt |
| 6. Esquema Prisma | Desenvolvedores Next.js e Node.js semeando aplicativos full-stack | Guia Prisma |
| 7. LLMs Multi-Provedores | Esquemas orientados por Groq, OpenAI, Claude, Gemini ou Ollama | Guia LLM |
| 8. Crescimento Incremental | Anexar linhas com IDs deslocados e FKs preservados | Guia Incremental |
🌐 Mais de 20 Domínios de Indústria Integrados
Gere esquemas completos por domínio com distribuições estatísticas ajustadas prontas para uso:
SaaS · E-Commerce · FinTech · Healthcare · Logistics · Credit Risk · HR & People · Streaming Media · Insurance · CRM & Sales · Food Delivery · Travel & Hospitality · Gaming · Crypto & DeFi · Predictive Maintenance · Network Intrusion · Islamic Finance · EdTech · Real Estate · Contact Centers · Manufacturing SPC
Consulte o Catálogo Completo de Domínios.
⚡ Desempenho
Medido em hardware padrão Apple da série M (núcleo único de CPU, sem GPU):
| Carga de Trabalho | Quantidade de Linhas | Tempo de Geração | Taxa de Transferência |
|---|---|---|---|
| Tabela única (distribuição lognormal) | 1.000.000 | 0,06 s | ~16M linhas/s |
| Esquema estrela (5 tabelas, 4 dependências FK) | 1.055.030 | 1,54 s | ~687k linhas/s |
| Banco de dados empresarial multtabela | 100.000 | 0,42 s | ~240k linhas/s |
📚 Índice de Documentação
Para guias aprofundados, referências de API e análises detalhadas de arquitetura:
- Introdução e Início Rápido: Tutorial de 5 minutos, da instalação ao seu primeiro conjunto de dados.
- Realismo de Texto e
enrich_text: Análise aprofundada de todos os 15 pools de microtexto e enriquecimento textual de DataFrames. - Guia do Servidor MCP para Agentes de IA: Configuração e referência de ferramentas para Cursor, Claude Code e Windsurf.
- Curvas de Resultado e Sazonalidade: Especificação matemática das curvas de receita e crescimento.
- Semeadura de Banco de Dados em Python: Introspecção e semeadura de bancos de dados de produção.
- Guia do Modo Mimic: Geração de gêmeos sintéticos seguros para privacidade a partir de CSVs.
- Formatos de Exportação: Exportação para DuckDB, Apache Parquet, Arrow IPC e SQL ANSI/Postgres.
- Apache Spark e Databricks: Escalando a geração sintética em clusters Spark distribuídos.
- Referência Completa de Declarações de Esquema: Referência completa de parâmetros para cada tipo de coluna e restrição.
📄 Pesquisa e Citação
O mecanismo de conformidade de resultado exato em forma fechada é formalizado no preprint arXiv 2606.08736:
@article{rasin2026declarative,
title = {Declarative Outcome-Conformant Synthesis: Exact, Closed-Form
Specification Satisfaction and a Conformance Benchmark},
author = {Rasin, Muhammed},
year = {2026},
url = {https://arxiv.org/abs/2606.08736v1}
}
🤝 Contribuição e Status de Desenvolvimento
O Misata está atualmente em desenvolvimento massivo e acelerado para levar o realismo sintético ao seu limite absoluto: expandindo o conhecimento de domínios do mundo real, aprofundando os vocabulários dos pools de sementes, elevando o realismo das colunas textuais e avançando a fidelidade estatística em todos os verticais da indústria.
Contribuições de especialistas de domínio, engenheiros de dados e pesquisadores são calorosamente bem-vindas! Seja para:
- Enriquecer Pools de Texto e Vocabulário: Adicionar sementes autênticas e regras gramaticais para domínios especializados em
misata/vocab_seeds.pyemisata/microtext.py. - Contribuir com uma Cápsula de Domínio: Expandir os modelos de indústria integrados (saúde, jurídico, bancário, engenharia, cadeia de suprimentos).
- Avançar a Fidelidade Estatística: Melhorar cópulas multivariadas, dinâmicas de séries temporais ou solucionadores de curvas de resultado.
- Reportar Casos Extremos e Falhas de Realismo: Abrir uma issue ou discussão sempre que os valores gerados não parecerem 100% autênticos para humanos.
git clone https://github.com/rasinmuhammed/misata
cd Misata
python3 -m venv .venv && source .venv/bin/activate
pip install -e ".[dev]"
pytest -q
O Misata é open-source sob a Licença MIT.