2020年,你需要一个全网通用的网站平台

历下区网站建设公司谈内容处理

编辑:历下区新城建站 关注: 时间:2019-12-09 10:48:36


温馨提示:专业网站建设、小程序制作、APP开发,尽在新城建站,详询 15544599750(手机、微信、QQ同号)

2.2.1内容处理

内容处理即搜索引擎对Spider抓取回来的页面进行处理。处理步骤简单介绍如下。

要判断该页面的类型

首先要判断该页面的类型是普通网页,还是PDF、Word.Excel等特殊文件文档。如果是普通网页还要判断该网页的类型是普通文本内容、视频内容,还是图片内容。甚至还会对网页是普通文章页还是论坛帖子进行判断,然后有针对性地进行

内容处理。

步骤02提取网页的文本信息

当下搜索引擎虽然在努力读取JavaScript.Flash.图片和视频,但是对于普通网页的索引还是以文本为主。此时还会提取页面的Title.Keywords>Description等标

签中的内容,虽然一直有信息说Keywords标签已经被主流大型搜索引擎抛弃了,但是经过多人实际测试,至少百度多多少少还是会参考Keywords标签的。

步骤03去除页面噪声

如果该网页是普通网页,则搜索引擎会把与该网页内容无关的广告、导航、链接、图片、登入框、网站版权信息等内容全部剔除掉,只提取出该网页的主体内容。

其实目前在这一步中,百度并不会把主体内容之外的东西全部抛弃,相关推荐的内容在一定程度上也会被算作本页的内容,或者是对本页主体内容的补充,也会在搜索排名中有直观的体现。甚至与页面不相干的链接文本也会被保留索引,比如,百度搜索“复制本页链接”向后翻几页,就会看到如图2?7所示的结果。

其实“复制本页链接”只存在于这些页面按钮上,但是也被索引了,如图2?8所示。所以搜索引擎的去除噪声,并不是很严格。因此SEO人员对于网页主体内容外的推荐内容、链接、链接锚文本等一切元素也要善于利用,而不是随便堆一些不相干的内容。很多人都说SEO需要注重细节,但是这些细节又有多少站长和SEO人员真正地重视、研究和利用了呢?
图2?7百度搜索“复制本页链接”

图2?7百度搜索“复制本页链接”
图2?7百度搜索“复制本页链接”

图2-8“复制本页链接”文字所在位置

去除内容中的停止词接下来应该是对剩余文本内容的分词处理(2.2.2节独立介绍),然后搜索引擎会剔除掉诸如“得”“的”“啊”“地”“呀”“却”之类的停止词。其实此步骤是存在疑问的,对于普通文章来说,去除这些停止词会有利于搜索引擎对内容进行分词和理解,并且可以减少搜索引擎的计算量。但是在搜索引擎中单独搜索这

些词也是有丰富的搜索结果的,如图2?9所示;当搜索包含这些词的关键词时,也会有比较丰富的搜索结果,不过会弱化这些停止词对搜索结果的影响,如图2-10所示。所以搜索引擎在对普通文章的处理中应该会有此步骤,但并不是机械严格去除的,也要看这些词在页面上的作用(搜索引擎在分词的时候也会进行词性识别,同一个词在不同位置词性可能不同)。此处对SEO人员的工作并没有太多影响,所以不必深究。

经过这些处理后,Spider抓取回来的网页内容就被“洗”干净了,再经过2.2.2中独立介绍的分词处理及2.3中独立介绍的去重处理后,搜索引擎就会对已经被初步处理过且有索引价值的
图2?9百度搜索“的”

图2?9百度搜索“的”
图2-10百度搜索“世界的”

图2-10百度搜索“世界的”

拓展阅读:

历下区建站公司分享外贸网站的一些注意事项

历下区网络优化分享企业网络推广的标准你知

历下区建站公司分享凭自己对用户的理解来选择关键

历下区SEO分享增量型Spider

历下区建站公司分享垂直型Spider

历下区网站推广谈百度阿拉丁解决暗网抓取

历下区小程序谈SEO是什么?

历下区建站分享语义分析

本文由新城建站整理发布,喜欢请收藏,转载请保留链接 历下区网站建设公司谈内容处理https://www.nccpu.net/jinan/lixiaqu/10447.html

服务支持

我们珍惜您每一次在线询盘,有问必答,用专业的态度,贴心的服务。

让您真正感受到我们的与众不同!