Erstgespräch vereinbaren

Migration zu Azure Databricks bei einem Immobilien Investment Management Unternehmen

Auf einen Blick:

  • Branche: Immobilien
  • Projektziel: Migration der ETL-Plattform von Microsoft Fabric zu Azure Databricks, inklusive sicherer Netzwerkarchitektur, automatisierter Datenpipelines und klarer Governance-Strukturen
  • Tools: Azure Databricks, Terraform, Spark Declarative Pipelines, Declarative Automation Bundles, PySpark, Unity Catalog, Data Quality Dashboard

Die Herausforderung des Kunden

Das Unternehmen führte seine ETL-Prozesse für verschiedene Datenprodukte bisher in Microsoft Fabric durch. Diese Datenprodukte wurden von Power-BI-Dashboards und Excel-Dateien konsumiert und bildeten die Grundlage für operative Entscheidungen im Immobiliengeschäft. Mit wachsenden Anforderungen an Sicherheit, Automatisierung und Skalierbarkeit stieß die bestehende Umgebung jedoch zunehmend an ihre Grenzen, die strategische Entscheidung für eine Migration zu Azure Databricks war die logische Konsequenz.

Vor diesen Herausforderungen stand unser Kunde

Unklare Governance Strukturen

Die Verwaltung von Zugriffsrechten und Datenkatalogen war in Fabric stark eingeschränkt. Ein durchgängiges Sicherheits- und Compliance-Konzept ließ sich damit nicht zuverlässig umsetzen, ein erhebliches Risiko für ein Unternehmen, das mit sensiblen Investment- und Immobiliendaten arbeitet.

Begrenzte Plattformfeatures & fehlende Skalierbarkeit

Fortgeschrittene Funktionen für komplexe Datenprozesse, Automatisierung und ML/KI-Workloads standen in Fabric nicht zur Verfügung. Das Unternehmen benötigte eine Plattform, die mit den Anforderungen mitwächst und auch zukünftige KI-Anwendungsfälle unterstützt.

Eingeschränkte CI/CD-Funktionalität

Die bestehende Fabric-Umgebung bot keine flexiblen Optionen für automatisierte Bereitstellung und Continuous Integration. Ein moderner Entwicklungsworkflow mit versioniertem Code und reproduzierbaren Deployments war für das Team unverzichtbar.

Wie gehen wir dabei vor?

1.

Infrastruktur-Setup

Aufbau einer sicheren und sauberen Netzwerkarchitektur in Azure über Terraform Infrastructure-as-Code. Alle Ressourcen wurden versioniert, reproduzierbar und vollständig automatisiert bereitgestellt.

2.

ETL & Medallion Architektur

Entwicklung eines Metadata-Driven-Frameworks für die Dateningestion: Bronze- und Silbertabellen werden über YAML-Dateien konfiguriert. Dedizierte Spark Declarative Pipelines übernehmen die Transformation in Silber und Gold, gesteuert über Declarative Automation Bundles.

3.

Datenquellen-Integration

Vollständige Anbindung heterogener Quellsysteme: SAP, Salesforce und Datenbanken über File-Exporte sowie SharePoint über eine Direktanbindung.

Unsere Lösung

 

Gemeinsam mit dem internen Entwicklungsteam aus 3 Developern und einem Project Manager haben wir eine vollständige Datenplattform auf Azure Databricks aufgebaut. Da das Projekt im September startete und im März abgeschlossen war, dauerte die Umsetzung insgesamt 7 Monate, vom ersten Infrastruktur-Setup bis zu den fertigen Datenprodukten.

Das Herzstück der Lösung ist ein Metadata-Driven-Framework, das wir bei Datasolut intern entwickelt haben und das wir in diesem Projekt erstmals in großem Maßstab eingesetzt haben. Weil wir Ingestion-Prozesse über YAML-Dateien konfigurieren statt jede Pipeline manuell zu bauen, sparen wir Entwicklungszeit und vermeiden Fehler. Außerdem nutzen wir Declarative Automation Bundles für das Deployment, sodass Continuous Integration und automatisierte Bereitstellung jetzt erstmals möglich sind.

Die Datenarchitektur folgt dem Medallion-Prinzip: Raw-Daten fließen zunächst in die Bronze-Schicht, werden dann in Silber bereinigt und standardisiert, und landen schließlich als fertige Datenprodukte in der Gold-Schicht, direkt nutzbar für Power-BI-Dashboards und Excel-Dateien.

„Es ist besonders spannend, Teil eines Projekts zu sein, bei dem wir End-to-End Mehrwert schaffen: von der Entwicklung einer sicheren und skalierbaren Architektur bis hin zu aufbereiteten, leicht zugänglichen und effizient nutzbaren Datenprodukten.“ — Rik, Data + AI Engineer bei Datasolut

Die Ergebnisse des Use Case:

Vollautomatisierte End-to-End-Datenpipeline

Sämtliche Daten werden metadata-driven ingested, transformiert und für die Fachbereiche bereitgestellt. Manuelle Eingriffe sind nicht mehr notwendig, das gesamte Deployment läuft über Automation Bundles.

Transparentes Data Quality Monitoring

Abweichungen in den Daten werden über das Data Quality Dashboard sofort sichtbar. Die Vertrauenswürdigkeit der Datenprodukte steigt, und Korrekturen können schnell und gezielt vorgenommen werden.

Klare Sicherheit & Governance

Das hierarchische Rollen- und Nutzerkonzept über Entra-Gruppen und Unity Catalog trennt Entwickler- und Business-Zugriffe klar voneinander. Compliance-Anforderungen werden erfüllt, Verantwortlichkeiten sind transparent.

Profilbild von Vinzent Wuttke Geschäftsführer Datasolut GmbH
Vinzent Wuttke
Geschäftsführer

Lassen Sie uns sprechen und Ihr Potenzial entdecken.

Ob und wie künstliche Intelligenz Ihnen weiterhelfen kann, können Sie in einem ersten, unverbindlichen Gespräch mit uns herausfinden.

In diesem Gespräch erfahren Sie:

  • Wie Ihr Use-Case technisch am besten umgesetzt werden kann
  • Wie wir maximal sicher mit Ihren Kundendaten umgehen
  • Wie lange wir für die Umsetzung benötigen und wie ein konkreter Projektplan aussehen könnte
Jetzt Erstgespräch vereinbaren
Newsletter und Updates

Sie sehen gerade einen Platzhalterinhalt von HubSpot. Um auf den eigentlichen Inhalt zuzugreifen, klicken Sie auf die Schaltfläche unten. Bitte beachten Sie, dass dabei Daten an Drittanbieter weitergegeben werden.

Mehr Informationen
Erstgespräch vereinbaren