Microsoft Fabric 数据平台

Microsoft Fabric

把公司各处散落的数据收进一个统一仓库,再在同一套工具里做整理、分析和出报表。

存储与数据出现时间 · 2023按所购算力容量计费(容量单位按月包),用量超出或需要更高性能再扩容。数据平台湖仓一体数据仓库数据分析
看官方文档

01 它是干嘛的

Fabric 是把数据集成、存储、分析、可视化合并成一套的云端数据平台。它用一个统一的底层存储(OneLake)承载所有数据,让原本分散在不同产品里的环节连成一条线,减少数据在多个系统之间反复搬运。

02 为什么会有它

在统一数据平台之前:数据散在十几个系统里,搬来搬去

一家公司运转几年,数据就会散落到各处:业务数据库、日志文件、导出的表格、第三方接口。想做一次分析,分析师要把数据从 A 系统导出、清洗、再导入 B 系统,每个环节都可能出错,而且一改口径就要从头再来一遍。

更麻烦的是「工具割裂」。整理数据用一套工具,建报表用另一套,做机器学习又是第三套,每套各有各的存储,数据在它们之间被反复复制。复制一次就要同步一次,时间久了没人说得清哪份数据才是最新的。

Fabric 的做法是「统一仓库加一套工具」:所有数据先汇入同一个底层存储,不同工具都直接读这一份,避免反复搬运;做分析的人也能用自己熟悉的方式(写代码或拖拽)取同一份数据。它的核心思路是减少「数据在系统之间搬家」带来的损耗与不一致。

03 它怎么工作

数据先被采集进统一存储,分层整理成可信的数据模型,最后由分析工具直接读取生成报表,全程尽量不复制、不搬运。

数据仓库的分层:数据只往上流① 定时同步② 清洗③ 聚合④ 出表业务数据库订单 / 用户表日志与埋点用户行为流水第三方数据广告 / 渠道回传原始层 ODS原样搬进来,不改动明细层 DWD清洗、去重、统一口径汇总层 DWS按天/按用户聚合应用层 ADS直接给业务用看板报表给运营和老板看模型训练喂给算法为什么要分层?因为「原始数据不干净、口径不统一」。先如实存下来,再逐层加工成可信的指标。对外服务层加工环节
看图里从下到上的分层(原始数据、明细、汇总、报表):每一层都是上一层的加工结果,越往上越贴合业务口径,这套分层是让数据「可信、可追溯」的基本功。

一份数据从各处汇入到出报表的路径

  1. 1
    ① 采集与汇入

    把业务数据库、日志、外部接口的数据接入统一存储,形成原始数据层。

  2. 2
    ② 清洗与分层

    按原始层、明细层、汇总层逐层整理,去重、补全、统一口径,让数据可信。

  3. 3
    ③ 建立数据模型

    把整理好的数据组织成便于分析的结构(如按客户、订单、时间对齐)。

  4. 4
    ④ 分析与查询

    分析师用代码或可视化拖拽查询同一份数据,不必再从别处导入。

  5. 5
    ⑤ 生成报表与共享

    结果做成仪表盘与报表分发给业务方,数据更新后可自动刷新。

04 谁在用它

经营分析与报表

把销售、库存、财务数据汇总,做成每天自动刷新的经营看板。

数据整合与统一口径

把多个系统里各说各话的指标统一成一套口径,避免开会时数字对不上。

客户与用户洞察

整合用户行为与交易数据,分析留存、转化与偏好。

机器学习数据准备

为建模准备清洗好的训练数据,减少在多个工具之间来回倒腾。

实时监控与预警

对关键指标持续计算,异常时触发提醒,供运营及时干预。

05 怎么用

有基础的数据分析或写 SQL 的能力就能上手;纯做报表的人也能用拖拽方式完成。

  1. 01开通 Fabric 并在工作区里创建所需的容量与项目。
  2. 02用采集工具把业务数据库或文件接入统一存储。
  3. 03在数据工程环节做清洗与分层加工,形成可信的明细与汇总表。
  4. 04用分析工具建立数据模型与指标,统一定义口径。
  5. 05制作报表与仪表盘,设定定时刷新。
  6. 06把看板共享给业务方,并按反馈迭代指标。
在整理好的数据上做一次汇总sql
-- 按城市汇总订单并取金额最高的前几名
SELECT
  city,
  COUNT(*)    AS order_count,
  SUM(amount) AS total_amount
FROM curated.orders
WHERE order_date >= '2024-01-01'
GROUP BY city
ORDER BY total_amount DESC
LIMIT 10;

避坑提示

  • !数据分层不是为了好看,而是为了让口径可追溯:哪一层出错,一眼能定位。
  • !报表数字对不上,多半是口径没统一,先把指标定义写清楚再动手做表。
  • !接入数据时注意权限最小化,敏感字段尽量在加工环节脱敏后再对外使用。

06 关键概念

数据仓库
专门为分析整理过的数据存放处,结构比业务库更适合统计和查询。
数据湖
存原始、未加工数据的大池子,形式灵活,但需要额外整理才能分析。
分层建模
把数据从原始到汇总逐层加工,越往上越贴合业务口径,便于追溯与复用。
数据口径
一个指标到底怎么算的定义,口径不统一就会出现「同一个数字两个答案」。

07 容易混淆的对比

Snowflake / Databricks同类云端数据平台,侧重数据仓库或湖仓一体,生态与擅长场景各有不同。
自建数据平台自由度高、可控性强,但要多套系统自行拼接并维护,人力成本大。
图软件图鉴

纯静态站点,无后端、无追踪。内容为中文原创撰写,用于帮助非技术读者理解主流软件产品。

关于本站

全部内容在构建时生成
产品名称与商标归各自公司所有

© 2026 软件图鉴Nuxt 4 · Vue 3 · Tailwind 4 · 纯静态