capture_d_ecran_2022-06-10_a_08.01.56.jpg

Data lineage pour Unity Catalog : quel intérêt ?

Databricks lance le data lineage pour Unity Catalog. Objectif : offrir plus de transparence et un contrôle proactif sur la façon dont les données sont utilisées dans leur lakehouse.

capture_d_ecran_2022-06-10_a_08.01.56.jpg

Les entreprises sont confrontées à un afflux de données provenant de sources multiples, et il est extrêmement difficile de comprendre d’où viennent ces données, comment elles se déplacent et évoluent, qui y a accès et comment elles sont utilisées. La fonction de data lineage pour Unity Catalog viendra étendre les capacités de gouvernance des données du lakehouse, selon Databricks.

De quoi parle-t-on ?

Le data lineage décrit la manière dont les données circulent dans une entreprise. Grâce à cette nouvelle fonctionnalité, les clients sont en mesure d’obtenir une visibilité sur l’origine des données de leur lakehouse, qui les a créées et quand, comment elles ont été modifiées au fil du temps, mais aussi comment elles sont utilisées.

Le data lineage permet aux consommateurs de données, tels que les data scientists, les data ingénieurs et les data analystes, de tenir compte du contexte lorsqu’ils effectuent des analyses.

Concrètement

Les principales spécificités d’Unity Catalog incluent le lignage automatisé en cours d’exécution pour capturer tout le lignage généré dans Databricks. Ces informations sont capturées pour les tables, les vues et les colonnes afin de donner une image granulaire des flux de données en amont et en aval. En outre, le lignage fonctionne dans tous les workloads pris en charge par Databricks, notamment SQL, Python, R et Scala.

Disponibilité

Le data lineage pour Unity Catalog est disponible en avant-première, d’abord sur AWS et Microsoft Azure.

Retour en haut