您现在的位置:首页 --> 查看专题: 链接补全
Spider位于搜索引擎数据流的最上游,负责将互联网上的资源采集到本地,提供给后续检索使用,是搜索引擎的最主要数据来源之一。spider系统的目标就是发现并抓取互联网中一切有价值的网页,为达到这个目标,首先就是发现有价值网页的链接,当前spider有多种链接发现机制来尽量快而全的发现资源链接,本文主要描述其中一种针对特定索引页的链接补全机制,并给出对这种特定类型的索引页面的建议处理规范用于优化收录效果。
背景 Spider位于搜索引擎数据流的最上游,负责将互联网上的资源采集到本地,提供给后续检索使用,是搜索引擎的最主要数据来源之一。spider系统的目标就是发现并抓取互联网中一切有价值的网页,为达到这个目标,首先就是发现有价值网页的链接,当前spider有多种链接发现机制来尽量快而全的发现资源链接,本文主要描述其中一种针对特定索引页的链接补全机制,并给出对这种特定类型的索引页面的建议处理规范用于优化收录效果。 当前大多数互联网网站以索引页和翻页的形式来组织网站资源,当有新资源增加时,老资源往后推移到翻页系列中。
[ 共2篇文章 ][ 第1页/共1页 ][ 1 ]
近3天十大热文
- [111] WEB系统需要关注的一些点
- [16] 浏览器的工作原理:新式网络浏览器幕后揭秘
- [12] 一次神奇的MySQL优化
- [12] Spark性能优化——和shuffle搏斗
- [12] 我的git笔记
- [11] Android设计中的.9.png
- [11] 内网穿透神器frp
- [11] InnoDB insert性能拐点测试
- [11] Python 代码规范小结
- [10] 深入剖析 redis replication
赞助商广告