01 它是干嘛的
数据市场让供应商把数据集发布出来,需求方在自己的环境里直接查询,无需下载、无需搬运、无需自己维护同步链路。它把「数据交易」从「发文件」变成「开权限」。
02 为什么会有它
以前:买数据就是收一批文件,然后永远对不上
企业过去要获取外部数据,流程通常是:签合同 → 对方发一批 CSV 或通过接口推送 → 自己建表导入 → 每天定时同步更新。一旦供应商改了字段,导入脚本就报错;对方更新了历史数据,你这边也不会自动跟着变。
更麻烦的是合规:数据一旦复制到自己库里,就要对它负责——保存多久、谁能看、能否转给第三方,这些都变成自己的责任。
数据共享的思路是反过来:数据始终留在提供方那里,需求方只获得查询权。对方更新你立刻看到最新;撤销授权你立刻查不到。数据的控制权与责任都留在源头。
03 它怎么工作
提供方发布数据对象并授权,需求方在自己的计算资源上执行查询,数据本身不发生复制。
一次跨组织的查询是怎么完成的
- 1① 提供方发布
供应商把数据集登记为可共享对象,设定价格或免费。
- 2② 授权
需求方申请并获得查询权限,实际获得的是访问指针而非副本。
- 3③ 本地查询
需求方用自己的仓库执行 SQL,计算发生在自己这边。
- 4④ 实时一致
源头数据更新后,查询结果立刻反映最新状态,无需同步任务。
- 5⑤ 可撤销
任一方撤回授权,访问立即失效,数据不会残留在对方库中。
04 谁在用它
获取外部行业与宏观数据
天气、人口、经济指标等无需自建采集。
供应链协同
上下游共享库存与销量,减少牛鞭效应。
数据供应商变现
一次发布,多方订阅,无需为每个客户做交付。
合规敏感的数据合作
数据不出源头,责任边界清晰。
05 怎么用
先用免费数据集练手,理解「共享」与「复制」的区别。
- 01在市场里找一个免费公开数据集并获取。
- 02在自己的仓库里直接查询它,观察速度。
- 03把自己的一份数据设为可共享,邀请同事查询体验。
- 04正式采购前确认更新频率与历史覆盖范围。
避坑提示
- !共享查询会消耗自己的计算资源,费用仍由查询方承担。
- !订阅前务必确认数据的更新延迟,有些数据并非实时。
06 关键概念
- 数据共享
- 授权对方直接查询自己的数据,而不发生复制。
- 实时同步
- 源头更新后查询方立刻可见,省掉定期搬运的任务。
- 数据权限
- 可随时授予或撤销的读取权,是数据交易的控制点。
- ETL
- 抽取、转换、加载,把数据从一个系统搬到另一个系统的过程。
07 容易混淆的对比
传统数据采购(发文件)拿到的是快照,同步与合规责任都转嫁到自己身上。
API 接口调用实时性好,但无法做大规模历史分析与关联查询。