Erstgespräch vereinbaren

Azure Databricks Plattform für BaFin-Regulierung in der Finanzdienstleistung

Auf einen Blick:

  • Kunde: Wirtschaftsauskunftei und Inkassodienstleister
  • Branche: Finanzdienstleistung
  • Projektziel: Aufbau einer sicheren Azure-Databricks-Plattform für Data Engineering, Analytics und KI-Workloads unter regulatorischen Vorgaben
  • Tools: Azure Databricks, Unity Catalog, Terraform, GitLab CI/CD

Die Ausgangssituation

Der Kunde betrieb seine Dateninfrastruktur bislang auf Basis von Hadoop. Die Umgebung funktionierte, band aber viel Kapazität in Administration, Wartung und Optimierung – Kapazität, die angesichts wachsender Anforderungen an skalierbare Datenpipelines, ML-Workloads und fachnahe Nutzung an anderer Stelle fehlte. Der regulierte Kontext verschärfte die Anforderungen zusätzlich: Personenbezogene Daten mussten geschützt, Entwicklungs- und Produktionsumgebungen strikt getrennt, Zugriffe nachvollziehbar geregelt und Netzwerkpfade kontrolliert werden.

Für die ersten produktionsnahen Datenstrecken standen sensible personenbezogene und finanzbezogene Daten im Fokus, die unter anderem über REST-Schnittstellen und strukturierte Datei-Exporte in die Plattform einfließen sollten.

Vor diesen Herausforderungen stand unser Kunde:

Wartungsintensive Hadoop-Landschaft

Die bestehende Plattform erforderte hohen Administrations- und Optimierungsaufwand und band Kapazitäten, die für neue datengetriebene Anwendungsfälle fehlten.

Regulierte Datenverarbeitung

Personenbezogene Daten mussten klar getrennt, rollenbasiert berechtigt und lückenlos auditierbar verarbeitet werden – ein Muss im BaFin-regulierten Umfeld.

Fehlende Produktionsreife für Data & KI

Die neue Plattform musste Data Engineering, Analytics und Machine Learning unter einem kontrollierten, nachvollziehbaren Betriebsmodell vereinen.

Sichere Databricks-Plattform mit durchgängiger PII-Isolation

Wir bauten Azure Databricks als kontrollierte betreibbare Plattformschicht auf der Azure Landing Zone des Kunden auf. Die Workspaces wurden in Dev, Test, Prod und Datascience strukturiert, sodass Entwicklung, Qualitätssicherung, produktiver Betrieb und datenwissenschaftliche Arbeit strikt getrennt bleiben. Im Zentrum der Daten-Governance steht Unity Catalog: Personenbezogene Daten werden über eigene PII-Schemas und separate Storage-Bereiche logisch und physisch von Non-PII-Daten getrennt. Berechtigungen folgen einem kombinierten RBAC- und ABAC-Modell, das Rollen wie Data Engineer, Data Scientist, Analyst oder Business User nur die für ihre Aufgabe notwendigen Rechte einräumt – ergänzt um Column Masking und Row Filtering über Tags und Attribute im Unity Catalog.

1.

Private Netzwerkanbindung

Databricks nutzt Frontend- und Backend-Private-Connectivity über Private Endpoints und private DNS-Auflösung. Workspace-Zugriff, Compute-zu-Control-Plane-Kommunikation und Authentifizierung laufen ausschließlich über private Netzwerkpfade.

2.

Kontrollierte Compute-Schicht

Cluster Policies erzwingen in Test und Produktion Confidential Compute, verschlüsselte Inter-Cluster-Kommunikation über Init-Skripte, interne Package-Quellen sowie Kostenleitplanken wie Auto-Shutdowns und DBU-Begrenzungen.

3.

Verschlüsselung & Secrets Management

Customer Managed Keys, Azure Key Vault, Azure Managed HSM und Databricks Secret Scopes sichern Schlüssel und Zugangsdaten ab. Nicht-produktive Umgebungen nutzen Key Vault, produktive Schlüsselpfade sind HSM-gestützt; Zugangsdaten externer Systeme werden zentral verwaltet und über Secret Scopes bereitgestellt.

Der Weg zum Erfolg

Gemeinsam mit dem Data-Team des Kunden hat Datasolut die neue Plattform Schritt für Schritt von der Landing Zone bis zu den ersten produktiven Pipelines aufgebaut. Bereits nach drei Monaten lief die Plattform produktiv – seitdem wird sie im laufenden Betrieb kontinuierlich um neue Anforderungen erweitert.

Das Ergebnis

Das Data-Team arbeitet heute auf Azure Databricks, produktive Pipelines laufen auf der neuen Plattform, und neue Anforderungen werden schrittweise im laufenden Betrieb ergänzt.

Der Kunde verfügt damit über eine reproduzierbare technische Grundlage für Data Engineering, Analytics und Machine Learning – mit konkreten Kontrollen für den Betrieb im BaFin-regulierten Umfeld: Unity Catalog, getrennte Workspaces, PII-Isolation, RBAC/ABAC, Private Endpoints, Confidential Compute, Customer Managed Keys und Secret Scopes greifen dabei ineinander. Terraform, GitLab CI/CD und Databricks Asset Bundles sorgen zusätzlich dafür, dass jede Änderung an der Plattform nachvollziehbar und reproduzierbar bleibt.

Die Ergebnisse des Use Case:

Produktiv nach 3 Monaten

Durchgängige Nutzung im laufenden Betrieb

PII-Isolation nach BaFin-Standard

RBAC/ABAC, Confidential Compute, Customer Managed Keys

Reproduzierbarer Betrieb

Terraform, GitLab CI/CD, Databricks Asset Bundles

Profilbild von Vinzent Wuttke Geschäftsführer Datasolut GmbH
Vinzent Wuttke
Geschäftsführer

Lassen Sie uns sprechen und Ihr Potenzial entdecken.

Ob und wie künstliche Intelligenz Ihnen weiterhelfen kann, können Sie in einem ersten, unverbindlichen Gespräch mit uns herausfinden.

In diesem Gespräch erfahren Sie:

  • Wie Ihr Use-Case technisch am besten umgesetzt werden kann
  • Wie wir maximal sicher mit Ihren Kundendaten umgehen
  • Wie lange wir für die Umsetzung benötigen und wie ein konkreter Projektplan aussehen könnte
Jetzt Erstgespräch vereinbaren
Newsletter und Updates

Sie sehen gerade einen Platzhalterinhalt von HubSpot. Um auf den eigentlichen Inhalt zuzugreifen, klicken Sie auf die Schaltfläche unten. Bitte beachten Sie, dass dabei Daten an Drittanbieter weitergegeben werden.

Mehr Informationen
Erstgespräch vereinbaren