Un data lakehouse est une plateforme de données unique qui combine le stockage brut d'un data lake avec la structure et les requêtes rapides d'un entrepôt de données, dans un seul système. Il garde les données brutes de tout type sur un stockage objet bon marché, puis ajoute par-dessus une couche de métadonnées et de transactions pour que ces données puissent être interrogées comme dans un entrepôt.
Un seul dépôt sert à la fois les rapports BI et l'apprentissage automatique, sans copier les données entre des systèmes séparés.

Comment fonctionne
Un data lakehouse fonctionne en stockant des fichiers bruts sur un stockage objet peu coûteux, puis en ajoutant un format de table et des métadonnées par-dessus pour que les moteurs lisent et écrivent les données comme dans une base structurée. Cette couche de métadonnées est ce qui transforme un simple data lake en lakehouse.
Comparaison
Un entrepôt de données stocke des données structurées et modélisées pour les rapports. Un data lake stocke des données brutes de tout type pour l'exploration. Un data lakehouse combine les deux, en gardant les données brutes sur un stockage bon marché et en ajoutant par-dessus une structure et des transactions de type entrepôt.
Choisissez un entrepôt quand le but est un rapport propre à partir de données connues. Choisissez un data lake quand vous devez garder des données brutes et variées pour la science des données. Un lakehouse convient aux équipes qui veulent les deux à partir d'un seul dépôt et qui sont prêtes à faire tourner le format de table ouvert qui le rend possible.
| Dépôt | Type de données | Idéal pour |
|---|---|---|
| Entrepôt de données | Structurées, modélisées | Rapports, tableaux de bord, BI |
| Data lake | Brutes, tout format | Exploration, science des données |
| Data lakehouse | Brutes et structurées | BI et apprentissage automatique ensemble |
Quand votre entreprise en a besoin
- Vous faites tourner un data lake et un entrepôt côte à côte et vous copiez les données de l'un à l'autre.
- Le travail d'apprentissage automatique a besoin de données brutes et non structurées qu'un entrepôt ne peut pas contenir.
- La BI et la science des données s'éloignent l'une de l'autre parce que chacune lit une copie différente des mêmes données.
- Les coûts de stockage de l'entrepôt grimpent sur des données rarement interrogées.
- Vous voulez pouvoir choisir votre moteur et travailler en formats ouverts plutôt que d'avoir vos données enfermées dans la base d'un seul fournisseur.
Avantages et limites
- Une seule copie des données — la BI et l'apprentissage automatique lisent les mêmes tables, donc moins de pipelines et moins d'écart entre les systèmes.
- Un coût de stockage plus bas — les données brutes reposent sur un stockage objet bon marché plutôt que sur un stockage d'entrepôt plus cher.
- Tout type de données — les données structurées, semi-structurées et non structurées vivent au même endroit, ce qui convient au travail d'IA et d'apprentissage automatique.
- Une fiabilité de type entrepôt — les transactions ACID et l'application du schéma gardent les requêtes cohérentes sur un stockage brut.
- Des formats ouverts — les formats de table ouverts réduisent la dépendance à un fournisseur, donc différents moteurs peuvent lire les mêmes données.
- Les plateformes lakehouse supposent une équipe de données pour gérer l'ingestion, la modélisation et la gouvernance autour d'elles, ce qui convient plus aux grandes organisations d'ingénierie qu'aux équipes réduites.
- Le format de table ouvert est un véritable engagement d'exploitation : la disposition des fichiers, le compactage et l'entretien des tables ne se font pas tout seuls.
- Pour de la BI simple sur des données connues et structurées, un entrepôt est plus simple et habituellement plus rapide à bien faire.
- Sans gouvernance, un stockage brut bon marché invite un marécage de données que personne ne peut trouver ni croire.
- L'écosystème bouge encore, alors les formats de table et la prise en charge par les moteurs changent plus vite que l'outillage d'entrepôt.
- Un lakehouse est un data lake auquel on ajoute une couche de métadonnées et de transactions, ce qui donne au stockage objet brut une structure et une fiabilité de type entrepôt.
- Son intérêt est d'avoir une seule copie des données qui sert à la fois la BI et l'apprentissage automatique, au lieu d'un data lake et d'un entrepôt à garder synchronisés.
- Les plateformes les plus connues sont Databricks et Snowflake, avec les formats de table ouverts Delta Lake, Apache Iceberg et Apache Hudi qui rendent le modèle possible.
Questions fréquentes
Qu'est-ce qu'un data lakehouse en termes simples?
Un data lakehouse est un seul système qui fait le travail d'un data lake et d'un entrepôt de données à la fois. Il garde les données brutes de tout type sur un stockage bon marché, puis ajoute une structure par-dessus pour que les mêmes données servent aux rapports et à l'apprentissage automatique. Il évite aux équipes de faire tourner deux systèmes séparés et de copier les données de l'un à l'autre.
Quelle est la différence entre un data lakehouse et un entrepôt de données?
Un entrepôt de données stocke des données structurées et modélisées et est optimisé pour les rapports propres. Un data lakehouse gère aussi les données brutes et non structurées sur un stockage objet bon marché, puis ajoute par-dessus une structure et des transactions de type entrepôt. Un entrepôt convient d'abord à la BI, tandis qu'un lakehouse vise à servir la BI et l'apprentissage automatique à partir d'un seul dépôt.
Quelle est la différence entre un data lake et un data lakehouse?
Un data lake stocke des données brutes de tout type mais n'a pas de structure intégrée, il peut donc se transformer en marécage difficile à interroger. Un data lakehouse ajoute une couche de métadonnées et de tables par-dessus ce stockage brut, apportant un schéma, du versionnage et des transactions ACID. En bref, un lakehouse est un data lake auquel on a ajouté une fiabilité de type entrepôt.
Comment fonctionne un data lakehouse?
Un data lakehouse stocke des fichiers bruts dans des formats ouverts comme Parquet sur un stockage objet comme Amazon S3. Un format de table ouvert comme Delta Lake, Apache Iceberg ou Apache Hudi suit ces fichiers comme des tables et ajoute un schéma et des transactions ACID. Les moteurs SQL et d'apprentissage automatique interrogent ensuite directement les mêmes tables.
Databricks est-il un data lakehouse?
Oui. Databricks a popularisé le lakehouse et s'appuie sur Delta Lake et Apache Spark pour combiner le stockage d'un data lake avec des requêtes de type entrepôt. Snowflake et les moteurs ouverts bâtis sur Apache Iceberg prennent en charge des patrons lakehouse semblables. Chacun stocke les données sur un stockage objet et ajoute une couche de tables transactionnelle pour l'analytique et l'apprentissage automatique.
BEEM offre-t-il un data lakehouse?
Non. BEEM repose sur un entrepôt, avec un entrepôt de données intégré sur Amazon Redshift plutôt qu'un lakehouse brut en format ouvert. BEEM est l'option gérée tout-en-un quand vous voulez un entrepôt, des tableaux de bord et de l'IA dans un seul service, avec 750+ connecteurs et des forfaits à partir de 899 $ par mois. Pour de l'apprentissage automatique à grande échelle sur des données brutes, une plateforme lakehouse convient mieux.

