短网址系统(一)原理分析

前言

短网址已经是一个老生常谈的话题了,我们的链接常常会因为需要携带各式各样的参数,或者随着业务增长,变得越来越长。对于用户而言,过长的链接体验必然是不好的,短网址也由此而生。其原理大致便是,通过将原链接和短链接一一对应,在用户访问短链接后,重定向到原链接。短链接主要有几个作用:

  • 缩短原链接长度,便于营销推广
  • 数据统计,在重定向的过程中进行PV、UV等数据统计
  • 屏蔽原链接域名

短链接生成算法

短网址一般包含的字符是a-z,A-Z,0-9,共62个字符

自增序列算法

  • 设置一个10进制的自增变量x,生成短链接时将其转换为62进制的数值,该数值便作为短链接,下次生成短链接则x+1。该算法运用了低进制转高进制,字符数会变少的原理。

例如:当前10进制自增变量值为20190519,转换为62进制后,值为BNBU3

哈希算法

MD5消息摘要算法
(英语:MD5 Message-Digest Algorithm),一种被广泛使用的密码散列函数用于确保信息传输完整一致。MD5 加密后的位数一般为两种,16 位与32 位,这里我们使用32位。

  • 先将长链接通过md5加密为32位字符串,分为4段,每段8个字节
  • 对这四段循环处理, 取 8 个字节, 将他看成 16 进制串与 0x3fffffff(30位1) 与操作, 即超过 30 位的忽略处理
  • 每次这30位的尾部6位 与16进制的3D进行 &运算,得到一个小于3D的数值(16进制的3D对应10进制的61),再到字符表[a-zA-Z0-9]中取到对应的字符。将这30位进行右移5位的操作,再次进行第三步,最终将得到一个长度为6的字符串。其中为什么是61而不是62呢?因为获取字符串时下标从0开始。
  • 总共能得到4段长度为6的字符串,任取其一即可

优缺点

  • 自增序列算法的优点是简单易理解,而且永不重复。但是该算法存在安全问题,容易被爬取数据。开源的yourls使用的就是这种算法。
  • 哈希算法得到的短链接长度固定,但是存在重复的可能性。

参考:
https://hufangyun.com/2017/short-url/
https://blog.csdn.net/is_zhoufeng/article/details/26503725

你可能感兴趣的:(项目实战)