Esta página explica o que é o Data Pipelines e como ele funciona. Para conectar sua primeira fonte passo a passo, vá para o Quickstart.
Por que o Data Pipelines existe
Sem pipelines confiáveis, não existe contexto. Memory, Knowledge e todos os produtos da camada de AI dependem de dados que cheguem limpos e atualizados. Antes do Data Pipelines, um time de dados gasta horas toda semana em ETL manual: extrair de cada sistema, normalizar formatos, reconciliar chaves, agendar cargas. O trabalho é repetitivo, quebra quando um schema muda e não deixa rastro de linhagem. O Data Pipelines remove esse trabalho. Você configura um conector uma vez e a ingestão passa a rodar de forma agendada, com o estado de cada carga visível e auditável.Como funciona
O fluxo de ingestão tem três componentes. Cada um resolve uma parte do caminho entre a fonte e o dado pronto para consumo.Conectores (dlt)
Cada fonte tem um conector que extrai os dados via API, CDC ou polling e os grava na camadaraw/ do Data Catalog, exatamente como chegaram. Os conectores são construídos sobre dlt, que cuida de paginação, incrementalidade e evolução de schema.
A camada raw/ é imutável. Serve como fonte de verdade para auditoria e para reprocessar o histórico quando uma regra de transformação muda.
Orquestração (Prefect)
O Prefect agenda e executa os flows de cada pipeline. Ele controla quando cada conector roda, captura falhas, faz retry e registra o resultado de cada execução. Cada flow de ingestão dispara, ao terminar, a transformação da camadaclean/ correspondente. O resultado é uma cadeia previsível: fonte muda, raw/ recebe, clean/ normaliza.
Transformação (clean/)
Os dados deraw/ são normalizados na camada clean/: emails em minúsculo, telefones no padrão +55, chaves como CPF e CNPJ padronizadas, deduplicação. É essa camada que alimenta Memory (grafos), Knowledge (vetores) e consultas SQL.
A transformação é incremental por padrão. Só o que mudou desde a última carga é reprocessado.
O que cada camada entrega
O Data Pipelines organiza os dados em camadas dentro do Data Catalog. Cada uma tem um papel definido.Capacidades de ingestão
O que o Data Pipelines faz além de mover dados de A para B:Catálogo de conectores
O primeiro conector de cada categoria já está disponível; os demais entram conforme a demanda dos clientes.A lista completa de conectores e o status de cada um estão no catálogo de conectores.
Como se conecta aos outros produtos
O Data Pipelines é o pré-requisito da plataforma. Cada dataset ingerido vira insumo para as camadas seguintes.Casos de uso
Fintech — unificar originação, CRM e cobrança
Fintech — unificar originação, CRM e cobrança
Uma fintech conecta o sistema de originação (PostgreSQL), o CRM e a plataforma de cobrança. O Data Pipelines ingere as três fontes, normaliza as chaves em
clean/ e registra cada dataset no Catalog. A partir daí, o Memory monta o perfil unificado do tomador sem que o analista consulte três sistemas.SaaS B2B — base pronta para análise de churn
SaaS B2B — base pronta para análise de churn
O time de produto ingere dados de uso do produto, tickets e NPS. Com as fontes em
clean/, um data mart em semantic/ consolida um health score por conta, consultável via SQL.Helpdesk — contexto de atendimento em tempo quase real
Helpdesk — contexto de atendimento em tempo quase real
O conector Zendesk opera em modo event-driven: recebe o webhook do ticket, persiste em
raw/ e dispara a transformação clean/. O ciclo completo, do evento ao dado disponível, roda em 1–3 minutos.Próximos passos
Quickstart
Conecte sua primeira fonte e ative uma pipeline em menos de 10 minutos.
Data Catalog
Entenda como os dados ingeridos são organizados, governados e descobertos.
Frequência de sync
Veja as opções de frequência de sincronização por conector.
Memory
Transforme os dados ingeridos em contexto estruturado sobre cada entidade.