01 它是干嘛的
Fabric 是把数据集成、存储、分析、可视化合并成一套的云端数据平台。它用一个统一的底层存储(OneLake)承载所有数据,让原本分散在不同产品里的环节连成一条线,减少数据在多个系统之间反复搬运。
02 为什么会有它
在统一数据平台之前:数据散在十几个系统里,搬来搬去
一家公司运转几年,数据就会散落到各处:业务数据库、日志文件、导出的表格、第三方接口。想做一次分析,分析师要把数据从 A 系统导出、清洗、再导入 B 系统,每个环节都可能出错,而且一改口径就要从头再来一遍。
更麻烦的是「工具割裂」。整理数据用一套工具,建报表用另一套,做机器学习又是第三套,每套各有各的存储,数据在它们之间被反复复制。复制一次就要同步一次,时间久了没人说得清哪份数据才是最新的。
Fabric 的做法是「统一仓库加一套工具」:所有数据先汇入同一个底层存储,不同工具都直接读这一份,避免反复搬运;做分析的人也能用自己熟悉的方式(写代码或拖拽)取同一份数据。它的核心思路是减少「数据在系统之间搬家」带来的损耗与不一致。
03 它怎么工作
数据先被采集进统一存储,分层整理成可信的数据模型,最后由分析工具直接读取生成报表,全程尽量不复制、不搬运。
一份数据从各处汇入到出报表的路径
- 1① 采集与汇入
把业务数据库、日志、外部接口的数据接入统一存储,形成原始数据层。
- 2② 清洗与分层
按原始层、明细层、汇总层逐层整理,去重、补全、统一口径,让数据可信。
- 3③ 建立数据模型
把整理好的数据组织成便于分析的结构(如按客户、订单、时间对齐)。
- 4④ 分析与查询
分析师用代码或可视化拖拽查询同一份数据,不必再从别处导入。
- 5⑤ 生成报表与共享
结果做成仪表盘与报表分发给业务方,数据更新后可自动刷新。
04 谁在用它
把销售、库存、财务数据汇总,做成每天自动刷新的经营看板。
把多个系统里各说各话的指标统一成一套口径,避免开会时数字对不上。
整合用户行为与交易数据,分析留存、转化与偏好。
为建模准备清洗好的训练数据,减少在多个工具之间来回倒腾。
对关键指标持续计算,异常时触发提醒,供运营及时干预。
05 怎么用
有基础的数据分析或写 SQL 的能力就能上手;纯做报表的人也能用拖拽方式完成。
- 01开通 Fabric 并在工作区里创建所需的容量与项目。
- 02用采集工具把业务数据库或文件接入统一存储。
- 03在数据工程环节做清洗与分层加工,形成可信的明细与汇总表。
- 04用分析工具建立数据模型与指标,统一定义口径。
- 05制作报表与仪表盘,设定定时刷新。
- 06把看板共享给业务方,并按反馈迭代指标。
-- 按城市汇总订单并取金额最高的前几名
SELECT
city,
COUNT(*) AS order_count,
SUM(amount) AS total_amount
FROM curated.orders
WHERE order_date >= '2024-01-01'
GROUP BY city
ORDER BY total_amount DESC
LIMIT 10;避坑提示
- !数据分层不是为了好看,而是为了让口径可追溯:哪一层出错,一眼能定位。
- !报表数字对不上,多半是口径没统一,先把指标定义写清楚再动手做表。
- !接入数据时注意权限最小化,敏感字段尽量在加工环节脱敏后再对外使用。
06 关键概念
- 数据仓库
- 专门为分析整理过的数据存放处,结构比业务库更适合统计和查询。
- 数据湖
- 存原始、未加工数据的大池子,形式灵活,但需要额外整理才能分析。
- 分层建模
- 把数据从原始到汇总逐层加工,越往上越贴合业务口径,便于追溯与复用。
- 数据口径
- 一个指标到底怎么算的定义,口径不统一就会出现「同一个数字两个答案」。