Zum Inhalt springen

Databricks Delta Sharing

Databricks Delta Sharing ermöglicht es Ihnen, Live-Daten zu Braze-Engagement und Campaigns sicher in Ihre Databricks-Umgebung zu teilen. Dieser Artikel beschreibt, wie die Datenfreigabe von Braze als Datenanbieter an Ihr Databricks-Konto als Empfänger funktioniert und wie Sie freigegebene Tabellen abfragen können.

Databricks Delta Sharing ist Teil der Braze-Datenverteilung. Einen vollständigen Überblick über die Optionen der Datenverteilung finden Sie unter Datenverteilung.

Voraussetzungen

Anforderung Beschreibung
Zugang zur geschlossenen Beta Wenden Sie sich an Ihren Customer-Success-Manager bei Braze, um teilzunehmen oder zu bestätigen, ob dieses Feature für Ihren Workspace aktiviert ist.
Braze-Workspace-Berechtigungen Currents-Integrationen anzeigen, um Data Sharing anzuzeigen. Currents-Integrationen bearbeiten, um einen Delta Share zu erstellen, zu aktualisieren oder zu löschen.

Delta Sharing einrichten

Für Databricks erfolgt die Datenfreigabe zwischen einem Datenanbieter und einem Datenempfänger. Ihr Braze-Konto ist der Datenanbieter, da es die Freigabe erstellt und sendet, und Ihr Databricks-Konto ist der Datenempfänger, da es die Freigabe nutzt, um einen Katalog zu erstellen, den Sie abfragen können. Weitere Informationen finden Sie in der Databricks-Dokumentation unter Lesen von Daten, die über Databricks-zu-Databricks Delta Sharing geteilt werden (für Empfänger:innen).

Schritt 1: Freigabe in Braze konfigurieren

  1. Gehen Sie in Braze zu Partnerintegrationen > Datenfreigabe > Databricks Delta Sharing.
  2. Geben Sie Ihren Databricks-Freigabebezeichner ein.
  3. Wenn Sie fertig sind, wählen Sie Create Datashare aus. Braze sendet die Freigabe an Ihr Databricks-Konto.

Schritt 2: Katalog in Databricks erstellen

  1. Nach einigen Minuten sollten Sie die eingehende Freigabe in Ihrem Databricks-Konto erhalten.
  2. Erstellen Sie mithilfe der eingehenden Freigabe einen Katalog, um die Tabellen anzuzeigen und abzufragen. Zum Beispiel:

     CREATE CATALOG [IF NOT EXISTS] <catalog-name> USING SHARE braze.<share-name>;
    
  3. Erteilen Sie Berechtigungen, damit die richtigen Nutzer:innen und Gruppen den neuen Katalog abfragen können.

Nutzung und Visualisierung

Nachdem der Daten-Share bereitgestellt wurde, erstellen Sie einen Katalog aus dem eingehenden Share, damit die freigegebenen Tabellen in Ihrem Databricks-Workspace erscheinen und wie andere dort gespeicherte Daten abgefragt werden können. Die freigegebenen Daten bleiben schreibgeschützt.

Ähnlich wie bei Currents können Sie Databricks Delta Sharing verwenden, um:

  • Komplexe Berichte erstellen
  • Attribution-Modellierung durchführen
  • Sicheres Teilen innerhalb Ihres eigenen Unternehmens
  • Rohe Event- oder Nutzerdaten einem CRM zuordnen (wie Salesforce)
  • Und mehr

Eine vollständige Liste der in Databricks verfügbaren Tabellen und Spalten finden Sie in den Databricks-Rohtabellenschemata als Textdatei. Diese Datei spiegelt das Databricks-Delta-Sharing-Schema wider (zum Beispiel DB_CREATED_AT für den Aufnahmezeitpunkt). Sie ist nicht austauschbar mit den Snowflake-Rohtabellenschemata oder der SQL-Tabellenreferenz, die Snowflake-Benennungen und -Felder beschreiben.

Nutzer:innen-ID-Schema

Beachten Sie die folgenden Unterschiede zwischen den Braze- und Databricks-Benennungskonventionen für Nutzer:innen-IDs.

Braze-Schema Databricks-Schema Beschreibung
braze_id USER_ID Der eindeutige Bezeichner, den Braze automatisch zuweist.
external_id EXTERNAL_USER_ID Der eindeutige Bezeichner eines Nutzer:innenprofils, den Sie in Braze festlegen.

Wichtige Informationen und Einschränkungen

Verfügbarkeit der geschlossenen Beta

Während der geschlossenen Beta enthält Ihre Freigabe möglicherweise nicht jede Tabelle in der Datei Databricks-Rohtabellenschemas. Freigegebene Daten können sich auch von Snowflake Data Sharing in Spaltennamen und -typen unterscheiden. Beispielsweise verwenden Databricks-Freigaben DB_CREATED_AT für die Aufnahmezeit, während Snowflake-Freigaben SF_CREATED_AT verwenden.

Nicht abwärtskompatible versus abwärtskompatible Änderungen

Abwärtskompatible Änderungen

Abwärtskompatible Änderungen können jederzeit auftreten und bieten in der Regel zusätzliche Funktionalität. Beispiele für abwärtskompatible Änderungen:

  • Hinzufügen einer neuen Tabelle oder Ansicht
  • Hinzufügen einer Spalte zu einer bestehenden Tabelle oder Ansicht

Nicht abwärtskompatible Änderungen

Wenn möglich, werden nicht abwärtskompatible Änderungen durch eine Ankündigung und eine Migrationsphase eingeleitet. Beispiele für nicht abwärtskompatible Änderungen:

  • Entfernen einer Tabelle oder Ansicht
  • Entfernen einer Spalte aus einer bestehenden Tabelle oder Ansicht
  • Ändern des Typs oder der Nullbarkeit einer bestehenden Spalte

Databricks-Regionen

Während der geschlossenen Beta können unterstützte Cloud-Anbieter und Regionen je nach Workspace und Rollout variieren. Wenden Sie sich an Ihren Braze Customer-Success-Manager, um die für Ihr Konto geltenden Optionen zu erfahren.

Aufbewahrungsrichtlinie

Während der geschlossenen Beta kann ein historischer Backfill über das Standard-Aufbewahrungsfenster hinaus eingeschränkt sein.

Sie können die Daten der letzten zwei Jahre für jedes Ereignis in der entsprechenden USERS_*_SHARED-Ansicht abfragen.

Konformität mit der Datenschutz-Grundverordnung (DSGVO)

Nahezu jeder Ereignisdatensatz, den Braze speichert, enthält einige Felder, die Nutzer:innen persönlich identifizierbare Informationen (PII) liefern. Einige Ereignisse können E-Mail Adresse, Telefonnummer, ID des Geräts, Sprache, Geschlecht und Standortinformationen enthalten. Wenn die Anfrage eines Nutzers auf Vergessenwerden an Braze übermittelt wird, löschen wir diese PII-Felder für alle Ereignisse, die diesen Nutzer:innen gehören. Auf diese Weise wird die historische Aufzeichnung des Ereignisses nicht gelöscht, aber das Ereignis kann nun nicht mehr mit einer bestimmten Person in Verbindung gebracht werden.

Abfrage freigegebener Daten: TIME und Abfrage-Performance

Ereignisdaten in den Data-Sharing-Ansichten (zum Beispiel USERS_BEHAVIORS_CUSTOMEVENT_SHARED) sind nach dem Feld TIME geclustert. Wenn Sie nach dem Zeitpunkt des Ereignisses filtern, verwenden Sie TIME als bevorzugten Filter. Abfragen, die Zeilen mithilfe von TIME einschränken, sind in der Regel performanter als Abfragen, die nach DB_CREATED_AT filtern, da das Clustering auf die Ereigniszeit ausgerichtet ist.

Feld Bedeutung
TIME Unix-Zeitstempel, zu dem das Ereignis aufgetreten ist. Bevorzugen Sie diesen beim Filtern nach Vorkommen.
DB_CREATED_AT Zeitstempel, zu dem die Zeile in Databricks geladen wurde (Aufnahmezeit).

Geschwindigkeit, Performance und Kosten von Abfragen

Geschwindigkeit, Performance und Kosten jeder Abfrage, die Sie auf den Daten ausführen, hängen von der Größe des verwendeten SQL-Warehouse ab. Je nachdem, auf wie viele Daten Sie zugreifen, benötigen Sie möglicherweise ein größeres Warehouse, damit die Abfrage erfolgreich abgeschlossen werden kann. Weitere Informationen finden Sie in der Databricks-Dokumentation zum Erstellen und Konfigurieren eines SQL-Warehouse (einschließlich Clustergröße und Skalierung).

New Stuff!