大数据之什么是数仓
来源:千锋教育
发布人:qyf
2022-12-08
推荐
在线提问>>
数仓是一个面向主题的、集成的、稳定的、时变的,存储历史数据的仓库。
面向主题的:数仓中的数据按照主题进行存储,每个主题都是决策层分析的一个角度;
集成的:不同来源的数据会统一整合后存入数仓中;
稳定的:数据一旦进入仓库后不会轻易发生改变,就算数据本身需要变化也轻易不会改动原数据,会根据分析需求考虑数据的更新策略;
时变的:随着时间的推移,长时间不更新的数据会逐渐失去时效性,失去时效性的数据一般会被导出到外部压缩存储。目前常用的策略是"7年13个月",即保存维度信息的拉链表不保存七年前的数据,保存流水信息的事实表不保存13个月前的数据。
当然,上述保存策略也是根据情况决定,利用价值较低的原始数据可能只保存一个周期就被导出,高度聚合的数据可能保存更长的时间。