Ir para o conteúdo

Databricks Delta Sharing

O Databricks Delta Sharing permite compartilhar com segurança dados de engajamento e de Campaign da Braze em tempo real no seu ambiente Databricks. Este artigo descreve como o compartilhamento funciona a partir da Braze como provedora de dados para a sua conta do Databricks como destinatária, e como consultar tabelas compartilhadas.

O Databricks Delta Sharing faz parte da Distribuição de Dados da Braze. Para uma visão geral completa das opções de Distribuição de Dados, consulte Distribuição de dados.

Pré-requisitos

Requisito Descrição
Acesso ao beta fechado Entre em contato com seu gerente de sucesso do cliente da Braze para participar ou confirmar se esse recurso está ativado para o seu espaço de trabalho.
Permissões do espaço de trabalho da Braze Visualizar integrações do Currents para visualizar o Compartilhamento de Dados. Editar integrações do Currents para criar, atualizar ou excluir um compartilhamento Delta.

Configurar o Delta Sharing

Para o Databricks, o compartilhamento de dados acontece entre um provedor de dados e um destinatário de dados. Sua conta da Braze é o provedor de dados porque cria e envia o compartilhamento, e sua conta do Databricks é o destinatário de dados porque consome o compartilhamento para criar um catálogo que você pode consultar. Para saber mais, consulte a documentação do Databricks sobre leitura de dados compartilhados usando o Databricks-to-Databricks Delta Sharing (para destinatários).

Etapa 1: Configurar o compartilhamento a partir da Braze

  1. Na Braze, acesse Partner Integrations > Data Sharing > Databricks Delta Sharing.
  2. Insira seu identificador de compartilhamento do Databricks.
  3. Quando terminar, selecione Create Datashare. A Braze envia o compartilhamento para sua conta do Databricks.

Etapa 2: Criar um catálogo no Databricks

  1. Após alguns minutos, você deverá receber o compartilhamento de entrada na sua conta do Databricks.
  2. Usando o compartilhamento de entrada, crie um catálogo para visualizar e consultar as tabelas. Por exemplo:

     CREATE CATALOG [IF NOT EXISTS] <catalog-name> USING SHARE braze.<share-name>;
    
  3. Conceda privilégios para que os usuários e grupos certos possam consultar o novo catálogo.

Uso e visualização

Após o compartilhamento de dados ser provisionado, crie um catálogo a partir do compartilhamento recebido para que as tabelas compartilhadas apareçam no seu espaço de trabalho do Databricks e possam ser consultadas como qualquer outro dado armazenado lá. Os dados compartilhados permanecem somente leitura.

De forma semelhante ao Currents, você pode usar o Databricks Delta Sharing para:

  • Criar relatórios complexos
  • Realizar modelagem de atribuição
  • Compartilhar dados de forma segura dentro da sua empresa
  • Mapear dados brutos de eventos ou dados de usuários para um CRM (como o Salesforce)
  • E muito mais

Para uma lista completa de tabelas e colunas disponíveis no Databricks, baixe os esquemas de tabelas brutas do Databricks como um arquivo de texto. Esse arquivo reflete o esquema do Databricks Delta Sharing (por exemplo, DB_CREATED_AT para tempo de ingestão). Ele não é intercambiável com os esquemas de tabelas brutas do Snowflake ou com a referência de tabelas SQL, que descrevem a nomenclatura e os campos do Snowflake.

Esquema de ID do usuário

Observe as seguintes diferenças entre as convenções de nomenclatura da Braze e do Databricks para IDs de usuário.

Esquema Braze Esquema Databricks Descrição
braze_id USER_ID O identificador exclusivo que a Braze atribui automaticamente.
external_id EXTERNAL_USER_ID O identificador exclusivo do perfil de um usuário que você define na Braze.

Informações importantes e limitações

Disponibilidade do beta fechado

Durante o beta fechado, seu compartilhamento pode não incluir todas as tabelas no arquivo de esquemas de tabelas brutas do Databricks. Os dados compartilhados também podem diferir do Snowflake Data Sharing em nomes e tipos de colunas. Por exemplo, os compartilhamentos do Databricks usam DB_CREATED_AT para o horário de ingestão, enquanto os compartilhamentos do Snowflake usam SF_CREATED_AT.

Alterações com e sem quebra de compatibilidade

Alterações sem quebra de compatibilidade

Alterações sem quebra de compatibilidade podem acontecer a qualquer momento e geralmente fornecem funcionalidades adicionais. Exemplos de alterações sem quebra de compatibilidade:

  • Adicionar uma nova tabela ou view
  • Adicionar uma coluna a uma tabela ou view existente

Alterações com quebra de compatibilidade

Quando possível, alterações com quebra de compatibilidade são precedidas por um comunicado e um período de migração. Exemplos de alterações com quebra de compatibilidade incluem:

  • Remover uma tabela ou view
  • Remover uma coluna de uma tabela ou view existente
  • Alterar o tipo ou a nulabilidade de uma coluna existente

Regiões do Databricks

Durante o beta fechado, os provedores de nuvem e regiões compatíveis podem variar por espaço de trabalho e implantação. Entre em contato com seu gerente de sucesso do cliente da Braze para conhecer as opções disponíveis para sua conta.

Política de retenção

Durante o beta fechado, o preenchimento histórico além da janela de retenção padrão pode ser limitado.

Você pode consultar os dados mais recentes de dois anos para cada evento na view USERS_*_SHARED correspondente.

Conformidade com o Regulamento Geral sobre a Proteção de Dados (GDPR)

Quase todos os registros de eventos armazenados pelo Braze incluem alguns campos que representam informações de identificação pessoal (IPI) dos usuários. Alguns eventos podem incluir endereço de e-mail, número de telefone, ID do dispositivo, idioma, gênero e local. Se a solicitação de esquecimento de um usuário for enviada ao Braze, anularemos esses campos de IPI para qualquer evento pertencente a esses usuários. Dessa forma, não removemos o registro histórico do evento, mas agora o evento jamais poderá ser vinculado a um indivíduo específico.

Consulta de dados compartilhados: TIME e desempenho de consultas

Os dados de eventos nas views de compartilhamento de dados (por exemplo, USERS_BEHAVIORS_CUSTOMEVENT_SHARED) são clusterizados no campo TIME. Ao filtrar por quando o evento ocorreu, use TIME como filtro preferencial. Consultas que restringem linhas usando TIME geralmente têm melhor desempenho do que consultas que filtram por DB_CREATED_AT, porque a clusterização está alinhada com o horário do evento.

Campo Significado
TIME Timestamp Unix de quando o evento aconteceu. Prefira este campo ao filtrar por horário de ocorrência.
DB_CREATED_AT Timestamp de quando a linha foi carregada no Databricks (horário de ingestão).

Velocidade, desempenho e custo das consultas

A velocidade, o desempenho e o custo de qualquer consulta que você execute sobre os dados dependem do tamanho do SQL warehouse utilizado. Dependendo da quantidade de dados acessados, pode ser necessário um warehouse maior para que a consulta seja concluída com sucesso. Para saber mais, consulte a documentação do Databricks sobre criar e configurar um SQL warehouse (incluindo tamanho do cluster e escalonamento).

New Stuff!