Skip to main content
O Data Pipelines é a camada que ingere, conecta e transforma dados de fontes externas para dentro da infraestrutura do cliente. Cada conector traz os dados de um sistema — CRM, ERP, helpdesk, banco de dados — e os deixa limpos, estruturados e registrados no Data Catalog.
Esta página explica o que é o Data Pipelines e como ele funciona. Para conectar sua primeira fonte passo a passo, vá para o Quickstart.

Por que o Data Pipelines existe

Sem pipelines confiáveis, não existe contexto. Memory, Knowledge e todos os produtos da camada de AI dependem de dados que cheguem limpos e atualizados. Antes do Data Pipelines, um time de dados gasta horas toda semana em ETL manual: extrair de cada sistema, normalizar formatos, reconciliar chaves, agendar cargas. O trabalho é repetitivo, quebra quando um schema muda e não deixa rastro de linhagem. O Data Pipelines remove esse trabalho. Você configura um conector uma vez e a ingestão passa a rodar de forma agendada, com o estado de cada carga visível e auditável.

Como funciona

O fluxo de ingestão tem três componentes. Cada um resolve uma parte do caminho entre a fonte e o dado pronto para consumo.

Conectores (dlt)

Cada fonte tem um conector que extrai os dados via API, CDC ou polling e os grava na camada raw/ do Data Catalog, exatamente como chegaram. Os conectores são construídos sobre dlt, que cuida de paginação, incrementalidade e evolução de schema. A camada raw/ é imutável. Serve como fonte de verdade para auditoria e para reprocessar o histórico quando uma regra de transformação muda.

Orquestração (Prefect)

O Prefect agenda e executa os flows de cada pipeline. Ele controla quando cada conector roda, captura falhas, faz retry e registra o resultado de cada execução. Cada flow de ingestão dispara, ao terminar, a transformação da camada clean/ correspondente. O resultado é uma cadeia previsível: fonte muda, raw/ recebe, clean/ normaliza.

Transformação (clean/)

Os dados de raw/ são normalizados na camada clean/: emails em minúsculo, telefones no padrão +55, chaves como CPF e CNPJ padronizadas, deduplicação. É essa camada que alimenta Memory (grafos), Knowledge (vetores) e consultas SQL. A transformação é incremental por padrão. Só o que mudou desde a última carga é reprocessado.

O que cada camada entrega

O Data Pipelines organiza os dados em camadas dentro do Data Catalog. Cada uma tem um papel definido.

Capacidades de ingestão

O que o Data Pipelines faz além de mover dados de A para B:

Catálogo de conectores

O primeiro conector de cada categoria já está disponível; os demais entram conforme a demanda dos clientes.
A lista completa de conectores e o status de cada um estão no catálogo de conectores.

Como se conecta aos outros produtos

O Data Pipelines é o pré-requisito da plataforma. Cada dataset ingerido vira insumo para as camadas seguintes.

Casos de uso

Uma fintech conecta o sistema de originação (PostgreSQL), o CRM e a plataforma de cobrança. O Data Pipelines ingere as três fontes, normaliza as chaves em clean/ e registra cada dataset no Catalog. A partir daí, o Memory monta o perfil unificado do tomador sem que o analista consulte três sistemas.
O time de produto ingere dados de uso do produto, tickets e NPS. Com as fontes em clean/, um data mart em semantic/ consolida um health score por conta, consultável via SQL.
O conector Zendesk opera em modo event-driven: recebe o webhook do ticket, persiste em raw/ e dispara a transformação clean/. O ciclo completo, do evento ao dado disponível, roda em 1–3 minutos.

Próximos passos

Quickstart

Conecte sua primeira fonte e ative uma pipeline em menos de 10 minutos.

Data Catalog

Entenda como os dados ingeridos são organizados, governados e descobertos.

Frequência de sync

Veja as opções de frequência de sincronização por conector.

Memory

Transforme os dados ingeridos em contexto estruturado sobre cada entidade.