当前位置:首页 > 短网址资讯 > 正文内容

短网址服务开发关键问题与解决方案

www.ft12.com4年前 (2017-08-28)短网址资讯14723

一、背景分析

二维码的出现使资源传输由原来的USB拷贝转变为二维码扫描访问或下载。为下载资源提供短网址服务,需将短网址生成二维码。资源数据量预计可达10亿级别,日新增数据1000万左右,每秒并发访问数预计2000个连接,响应时间在0.1秒以内。

二、基本原理

  1. 将原始地址转换为短网址

    原始网址→网址缩短→短网址

  2. 将短网址转换为原始网址

    短网址→短网址还原→原始网址

  3. 关键问题

    将原始地址转换为不重复的6位地址标志,海量数据的高并发读写。

三、项目实现

  1. 短网址实现方案

    实现短网址服务,首先要将海量的链接数据转化为不重复的6位字符。

    (1)哈希算法。哈希算法相对简单,具体算法如下:

    ①将原网址md5转换成32位哈希码,分为4段,每段8字节。

    ②对这四短网址进行循环处理,取8个字节,将其看成16进制串与0x3fffffff(30位1)与操作,即超过30位的忽略处理。

    ③将30位生成6段,每5位数字作为字母表在索引取得特定字符,依次进行获取6位字符串。

    ④总的md5串可以获得4个6位串,取任意一个就可作为这个长url的短url地址。这种方法实现起来简单,但是有较高的重复度。

    (2)62位字符表示。把数字和字符组合成一定的映射,就可以产生唯一的字符串,再利用洗牌算法,把原字符串打乱后保存,对应位置的组合字符串就会是无序的组合。

  2. 大数据存储解决方案

    在本项目中,主要存储数据有资源下载地址及引用页地址,预估资源下载地址长度为150个字符,引用页地址长度为50字符,两者存起来共200字符,再加上数据库自身结构占用的空间及其他信息,如时间、ID等,存储一条数据最少需要250个字节。从当前访问量来看,预计数据将达到10亿条。

    总数据量 = 250 * 10^9 /(1024*1024*1024)= 230G   当前采用的是mysql架构, 10亿条数据远远超过了其处理能力。因此要对数据库进行分库分表,将表大小限定为10万条数据,每个数据库1000张表,数据库随着数据的增长而扩展,表中的ID进行自增长,通过数据库ID、表ID、数据ID三者就可以唯一确定条数据,将这个值转换成62进制就得出了唯一的短链接地址。

    合成ID算法代码:($database_id*self::database_tables*self::table_rows)+$row_id+ ($table_id*self::table_rows);

    每个数据库将存储1000*100000=1亿条数据,数据将分布在10台机器上,10台机器将分解高峰阶段的每秒2000个并发读写操作。这种算法在初期可能会对单台机器造成过载,可采用逐步加压的方式,当数据库服务器增多后可全部开放。

  3. 高并发解决方案

    应对每秒2000次的并发访问需要服务器具有快速的读写及负载均衡能力,主要需要解决两方面的问题:用户在创建短网址时,需确认该资源没有创建过;当用户在访问一个短网址时,服务器需快速响应。从数据库直接读取无法满足速度需求,同时会造成服务器过载导致系统崩溃。因此,需要将资源url放到内存中,使用内快进行快速读取。

  4. 关键问题解决方式

    (1)问题一解决方案。由于数据是先有ID后有短网址,无法通过资源地址反查到短网址,因此,需要使用一个内存映射,将资源与短网址(数据ID)联系起来。操作流程:原始网址→16字节长度的原始二进制md5→从redis中查找是否存在数据ID→从内存缓存或数据库中取出数据→判断数据库中的地址是否与原网址相同→不同则插入数据库中,建立16字节长度原始二进制md5与数据ID建立联系存入redis中。

    (2)问题二解决方案。将热数据放入缓存中,减轻数据库负载,限制一天过期时间,可以防止内存使用过大。操作流程:短网址→查找内存→未找到将短网址转为ID→从数据库中查找→存入缓存→返回数据。

四、小结

短网址服务是一个比较复杂的项目,生成短6位短码是关键点,采用数据ID递增进行62位转换的方式,可简单有效地实现需求。


扫描二维码推送至手机访问。

版权声明:本文由短链接发布,如需转载请注明出处。

本文链接:https://www.ft12.com/article_447.html

分享给朋友:

相关文章

阿里巴巴马云:快递公司注定将成为技术公司,保证所有小企业通货权

阿里巴巴马云:快递公司注定将成为技术公司,保证所有小企业通货权

[ 短网址资讯导读 ] 5月22日,杭州云栖小镇,在2017全球才智物流峰会上,阿里巴巴董事局主席马云说,物流公司应当出资人才、技能,而且要联合作战,方能应对天天10亿包裹的业务体量。“我通知我们,一天十亿只包裹,不会超过八年,估...

林肯公园主唱自杀:这个世上有人正承受着你所不能理解的痛苦

林肯公园主唱自杀:这个世上有人正承受着你所不能理解的痛苦

昨天刷微博的时候看见一条新闻,林肯公园主唱切斯特上吊自杀,那时候我心里只是微微一惊,毕竟这是一个麻木的时代,死亡换来人们一次短暂的叹息,然后大家又陷入彼此庸碌的一生,虽然我们不知道灾难和明天哪一个会先来,但我们终究学会的只是在麻木里等待明天...

从怼人到被怼,在线短租到底怎么了?

从怼人到被怼,在线短租到底怎么了?

[FT12短网址资讯 ] 2016年10月在线短租活泼用户占在线酒店预定活泼用户超越1/5,已经成为旅行住宿的首要形式之一。作为同享经济的一员,在线短租不甘示弱,迎合了年青用户花费需要的它正在改动大家的出游寓居习气,即民...

FT12短网址:干事业不是先有钱,而是先有胆!

FT12短网址:干事业不是先有钱,而是先有胆!

胆量决议财富1、想常人之不敢想,做常人之不敢做2、不拼,怎么知道不行3、有没有勇气走出第一步,往往是人生的分水岭4、人的成功是被冒险逼出来的5、不冒险即是最大的冒险,咱们坚决不做老实人6、惧怕失利,就等于回绝成功7、要想知道梨子的滋味,就要...

短网址在日常生活中的应用

短网址是一个特殊的群体网站,很多很多人都不知道其存在的意义,也不知道他是什么时候发展起来的。第一个发明短网址的人真的非常的有头脑,堪比第一个吃螃蟹的英雄。我估计,发明短网址的人一定是一个设计师,而且还是个顶级的设计师和处女座强迫症患者。很长...

【官方说法】只需两步,正确识别百度蜘蛛

【官方说法】只需两步,正确识别百度蜘蛛

经常听到站长们问,百度蜘蛛是什么?最近百度蜘蛛来的太频繁服务器抓爆了,最近百度蜘蛛都不来了怎么办,还有很多站点想得到百度蜘蛛的IP段,想把IP加入白名单,但IP不固定,我们无法对外公布。那怎么才能识别正确的百度蜘蛛呢?来来来,以短网址站为例...

发表评论

访客

◎欢迎参与讨论,请在这里发表您的看法和观点。