Passer au contenu

Databricks Delta Sharing

Databricks Delta Sharing vous permet de partager en toute sécurité des données d’engagement et de campagne Braze en temps réel dans votre environnement Databricks. Cet article décrit le fonctionnement du partage depuis Braze en tant que fournisseur de données vers votre compte Databricks en tant que destinataire, et comment interroger les tables partagées.

Databricks Delta Sharing fait partie de la distribution de données Braze. Pour un aperçu complet des options de distribution de données, consultez Distribution de données.

Prérequis

Condition Description
Accès à la bêta fermée Contactez votre gestionnaire de la satisfaction client Braze pour participer ou pour confirmer si cette fonctionnalité est activée pour votre espace de travail.
Autorisations de l’espace de travail Braze Afficher les intégrations Currents pour consulter le partage de données. Modifier les intégrations Currents pour créer, mettre à jour ou supprimer un partage Delta.

Configurer le partage Delta Sharing

Pour Databricks, le partage de données s’effectue entre un fournisseur de données et un destinataire de données. Votre compte Braze est le fournisseur de données car il crée et envoie le partage, et votre compte Databricks est le destinataire de données car il consomme le partage pour créer un catalogue que vous pouvez interroger. Pour plus de détails, consultez la documentation Databricks sur la lecture de données partagées via le partage Delta Sharing Databricks-à-Databricks (pour les destinataires).

Étape 1 : Configurer le partage depuis Braze

  1. Dans Braze, accédez à Partner Integrations > Data Sharing > Databricks Delta Sharing.
  2. Saisissez votre identifiant de partage Databricks.
  3. Lorsque vous avez terminé, sélectionnez Create Datashare. Braze envoie le partage à votre compte Databricks.

Étape 2 : Créer un catalogue dans Databricks

  1. Après quelques minutes, vous devriez recevoir le partage entrant dans votre compte Databricks.
  2. À l’aide du partage entrant, créez un catalogue pour visualiser et interroger les tables. Par exemple :

     CREATE CATALOG [IF NOT EXISTS] <catalog-name> USING SHARE braze.<share-name>;
    
  3. Accordez les privilèges nécessaires pour que les utilisateurs et groupes appropriés puissent interroger le nouveau catalogue.

Utilisation et visualisation

Une fois le partage de données provisionné, créez un catalogue à partir du partage entrant afin que les tables partagées apparaissent dans votre espace de travail Databricks et soient interrogeables comme les autres données que vous y stockez. Les données partagées restent en lecture seule.

De manière similaire à Currents, vous pouvez utiliser Databricks Delta Sharing pour :

  • Créer des rapports complexes
  • Effectuer une modélisation d’attribution
  • Partager des données de manière sécurisée au sein de votre entreprise
  • Associer des données brutes d’événements ou d’utilisateurs à un CRM (comme Salesforce)
  • Et bien plus encore

Pour une liste complète des tables et colonnes disponibles dans Databricks, téléchargez les schémas de tables brutes Databricks sous forme de fichier texte. Ce fichier reflète le schéma Databricks Delta Sharing (par exemple, DB_CREATED_AT pour l’heure d’ingestion). Il n’est pas interchangeable avec les schémas de tables brutes Snowflake ni avec la référence des tables SQL, qui décrivent la nomenclature et les champs Snowflake.

Schéma des identifiants utilisateur

Notez les différences suivantes entre les conventions de nommage Braze et Databricks pour les identifiants utilisateur.

Schéma Braze Schéma Databricks Description
braze_id USER_ID L’identifiant unique que Braze attribue automatiquement.
external_id EXTERNAL_USER_ID L’identifiant unique du profil d’un utilisateur que vous définissez dans Braze.

Informations importantes et limitations

Disponibilité en bêta fermée

Pendant la bêta fermée, votre partage peut ne pas inclure toutes les tables du fichier Schémas de tables brutes Databricks. Les données partagées peuvent également différer du partage de données Snowflake au niveau des noms et des types de colonnes. Par exemple, les partages Databricks utilisent DB_CREATED_AT pour l’heure d’ingestion, tandis que les partages Snowflake utilisent SF_CREATED_AT.

Changements avec rupture versus sans rupture

Changements sans rupture

Les changements sans rupture peuvent survenir à tout moment et fournissent généralement des fonctionnalités supplémentaires. Exemples de changements sans rupture :

  • Ajout d’une nouvelle table ou vue
  • Ajout d’une colonne à une table ou vue existante

Changements avec rupture

Lorsque cela est possible, les changements avec rupture sont précédés d’une annonce et d’une période de migration. Voici des exemples de changements avec rupture :

  • Suppression d’une table ou d’une vue
  • Suppression d’une colonne d’une table ou d’une vue existante
  • Modification du type ou de la possibilité de valeur nulle d’une colonne existante

Régions Databricks

Pendant la bêta fermée, les fournisseurs cloud et les régions pris en charge peuvent varier selon l’espace de travail et le déploiement. Contactez votre gestionnaire de la satisfaction client Braze pour connaître les options applicables à votre compte.

Politique de rétention

Pendant la bêta fermée, le remplissage historique au-delà de la fenêtre de rétention standard peut être limité.

Vous pouvez interroger les deux années les plus récentes de données pour chaque événement dans la vue USERS_*_SHARED correspondante.

Conformité au Règlement général sur la protection des données (RGPD)

Presque tous les enregistrements d’événements que Braze stocke incluent quelques champs représentant les informations personnelles identifiables (PII) des utilisateurs. Certains événements peuvent inclure l’adresse e-mail, le numéro de téléphone, l’ID de l’appareil, la langue, le sexe et les informations d’emplacement/localisation. Si la requête d’oubli d’un utilisateur est soumise à Braze, nous annulerons ces champs PII pour tout événement appartenant à ces utilisateurs. De cette façon, nous ne supprimons pas l’historique de l’événement, mais celui-ci ne peut plus jamais être lié à une personne en particulier.

Interrogation des données partagées : TIME et performance des requêtes

Les données d’événements dans les vues de partage de données (par exemple, USERS_BEHAVIORS_CUSTOMEVENT_SHARED) sont regroupées sur le champ TIME. Lorsque vous filtrez par date d’occurrence de l’événement, utilisez TIME comme filtre privilégié. Les requêtes qui restreignent les lignes en utilisant TIME sont généralement plus performantes que celles qui filtrent sur DB_CREATED_AT, car le regroupement est aligné sur l’heure de l’événement.

Champ Signification
TIME Horodatage Unix correspondant au moment où l’événement s’est produit. À privilégier lors du filtrage par date d’occurrence.
DB_CREATED_AT Horodatage du chargement de la ligne dans Databricks (heure d’ingestion).

Vitesse, performance et coût des requêtes

La vitesse, la performance et le coût de toute requête que vous exécutez sur les données dépendent de la taille de l’entrepôt SQL que vous utilisez. En fonction du volume de données auxquelles vous accédez, vous pourrez avoir besoin d’un entrepôt plus grand pour que la requête aboutisse. Pour plus d’informations, consultez la documentation Databricks sur la création et la configuration d’un entrepôt SQL (y compris la taille du cluster et la mise à l’échelle).

New Stuff!