Azure Databricks Plattform für BaFin-Regulierung in der Finanzdienstleistung
Auf einen Blick:
- Kunde: Wirtschaftsauskunftei und Inkassodienstleister
- Branche: Finanzdienstleistung
- Projektziel: Aufbau einer sicheren Azure-Databricks-Plattform für Data Engineering, Analytics und KI-Workloads unter regulatorischen Vorgaben
- Tools: Azure Databricks, Unity Catalog, Terraform, GitLab CI/CD
Die Ausgangssituation
Der Kunde betrieb seine Dateninfrastruktur bislang auf Basis von Hadoop. Die Umgebung funktionierte, band aber viel Kapazität in Administration, Wartung und Optimierung – Kapazität, die angesichts wachsender Anforderungen an skalierbare Datenpipelines, ML-Workloads und fachnahe Nutzung an anderer Stelle fehlte. Der regulierte Kontext verschärfte die Anforderungen zusätzlich: Personenbezogene Daten mussten geschützt, Entwicklungs- und Produktionsumgebungen strikt getrennt, Zugriffe nachvollziehbar geregelt und Netzwerkpfade kontrolliert werden.
Für die ersten produktionsnahen Datenstrecken standen sensible personenbezogene und finanzbezogene Daten im Fokus, die unter anderem über REST-Schnittstellen und strukturierte Datei-Exporte in die Plattform einfließen sollten.
Wir bauten Azure Databricks als kontrollierte betreibbare Plattformschicht auf der Azure Landing Zone des Kunden auf. Die Workspaces wurden in Dev, Test, Prod und Datascience strukturiert, sodass Entwicklung, Qualitätssicherung, produktiver Betrieb und datenwissenschaftliche Arbeit strikt getrennt bleiben. Im Zentrum der Daten-Governance steht Unity Catalog: Personenbezogene Daten werden über eigene PII-Schemas und separate Storage-Bereiche logisch und physisch von Non-PII-Daten getrennt. Berechtigungen folgen einem kombinierten RBAC- und ABAC-Modell, das Rollen wie Data Engineer, Data Scientist, Analyst oder Business User nur die für ihre Aufgabe notwendigen Rechte einräumt – ergänzt um Column Masking und Row Filtering über Tags und Attribute im Unity Catalog.
1.
Databricks nutzt Frontend- und Backend-Private-Connectivity über Private Endpoints und private DNS-Auflösung. Workspace-Zugriff, Compute-zu-Control-Plane-Kommunikation und Authentifizierung laufen ausschließlich über private Netzwerkpfade.
2.
Cluster Policies erzwingen in Test und Produktion Confidential Compute, verschlüsselte Inter-Cluster-Kommunikation über Init-Skripte, interne Package-Quellen sowie Kostenleitplanken wie Auto-Shutdowns und DBU-Begrenzungen.
3.
Customer Managed Keys, Azure Key Vault, Azure Managed HSM und Databricks Secret Scopes sichern Schlüssel und Zugangsdaten ab. Nicht-produktive Umgebungen nutzen Key Vault, produktive Schlüsselpfade sind HSM-gestützt; Zugangsdaten externer Systeme werden zentral verwaltet und über Secret Scopes bereitgestellt.
Der Weg zum Erfolg
Gemeinsam mit dem Data-Team des Kunden hat Datasolut die neue Plattform Schritt für Schritt von der Landing Zone bis zu den ersten produktiven Pipelines aufgebaut. Bereits nach drei Monaten lief die Plattform produktiv – seitdem wird sie im laufenden Betrieb kontinuierlich um neue Anforderungen erweitert.
Das Ergebnis
Das Data-Team arbeitet heute auf Azure Databricks, produktive Pipelines laufen auf der neuen Plattform, und neue Anforderungen werden schrittweise im laufenden Betrieb ergänzt.
Der Kunde verfügt damit über eine reproduzierbare technische Grundlage für Data Engineering, Analytics und Machine Learning – mit konkreten Kontrollen für den Betrieb im BaFin-regulierten Umfeld: Unity Catalog, getrennte Workspaces, PII-Isolation, RBAC/ABAC, Private Endpoints, Confidential Compute, Customer Managed Keys und Secret Scopes greifen dabei ineinander. Terraform, GitLab CI/CD und Databricks Asset Bundles sorgen zusätzlich dafür, dass jede Änderung an der Plattform nachvollziehbar und reproduzierbar bleibt.
Lassen Sie uns sprechen und Ihr Potenzial entdecken.
Ob und wie künstliche Intelligenz Ihnen weiterhelfen kann, können Sie in einem ersten, unverbindlichen Gespräch mit uns herausfinden.
In diesem Gespräch erfahren Sie:
- Wie Ihr Use-Case technisch am besten umgesetzt werden kann
- Wie wir maximal sicher mit Ihren Kundendaten umgehen
- Wie lange wir für die Umsetzung benötigen und wie ein konkreter Projektplan aussehen könnte