当前位置:首页 > 网络科技 > 头条搜索蜘蛛 Bytespider 介绍

头条搜索蜘蛛 Bytespider 介绍

10个月前 (08-30)admin网络科技33

关于头条搜索的相关内容开始来袭,子凡作为一个专注于搜索引擎研究的 SEOer 来说,无疑也是特别的关注,前段时间子凡就偷偷的告诉了大家头条搜索站长平台已经在路上了,目前还处于内测阶段也不便给大家透露太多,但是官方已经开始正式的介绍头条搜索,包括前面子凡也在泪雪网发现了大量的头条搜索蜘蛛 Bytespider,下面就给大家来个介绍。

首先可以非常明确的是头条搜索的爬虫 UA 为“Bytespider”首写字母为大写。

例如

1
Mozilla/5.0 (Linux; Android 6.0; Nexus 5 Build/MRA58N) AppleWebKit/537.36 (KHTML,like Gecko)Chrome/41.0.6633.1032 Mobile Safari/537.36;Bytespider;bytespider@bytedance.com

随着头条搜索站长平台的上线,头条搜索蜘蛛 UA 似乎也有了一些小小的变化,将原有的邮箱换成了 https://zhanzhang.toutiao.com

1
2
3
4
5
6
7
8
//PC
Mozilla/5.0 (compatible; Bytespider;[https://zhanzhang.toutiao.com/] AppleWebKit/537.36 (KHTML, like Gecko) Chrome/[70.0.0.0](http://70.0.0.0) Safari/537.36
 
//Android
Mozilla/5.0 (Linux; Android 5.0) AppleWebKit/537.36 (KHTML, like Gecko) Mobile Safari/537.36 (compatible; Bytespider; [https://zhanzhang.toutiao.com/]
 
//IOS
Mozilla/5.0 (iPhone; CPU iPhone OS 7\_1\_2 like Mac OS X) AppleWebKit/537.36 (KHTML, like Gecko) Version/7.0 Mobile Safari/537.36 (compatible; Bytespider; [https://zhanzhang.toutiao.com/]

子凡在前面的文章中就提取了抓取泪雪网的一些详细 UA,但并没有统一固定,存在稍有不同的 UA 变化,具体可以查看子凡前面的文章《头条搜索 Bytespider 开始大规模抓取》。

头条搜索 ip 字段介绍

头条搜索的 ip 字段总共涉及 6 个,具体字段如下:

1
2
3
4
5
6
110.249.201.0/24
110.249.202.0/24
111.225.148.0/24
111.225.149.0/24
220.243.135.0/24
220.243.136.0/24

如果你无法判断,你还可以通过子凡开发的搜索引擎 IP 查询工具来查询,地址为:https://ip.leiue.com

头条搜索蜘蛛基本工作流程

1.抓取网页。每个独立的搜索引擎都有自己的网页抓取程序爬虫(Spider)。爬虫顺着网页中的超链接,从这个网站爬到另一个网站,通过超链接分析连续访问抓取更多网页。被抓取的网页被称之为网页快照。由于互联网中超链接的应用很普遍,理论上,从一定范围的网页出发,就能搜集到绝大多数的网页。

2.处理网页。搜索引擎抓到网页后,还要做大量的预处理工作,才能提供检索服务。其中,最重要的就是提取关键词,建立索引库和索引。其他还包括去除重复网页、分词(中文)、判断网页类型、分析超链接、计算网页的重要度/丰富度等。

3.提供检索服务。用户输入关键词进行检索,搜索引擎从索引数据库中找到匹配该关键词的网页;为了用户便于判断,除了网页标题和 URL 外,还会提供一段来自网页的摘要以及其他信息。

其它

如果您的网站发现有头条 spider 的 UA“Bytespider”抓取存在抓取量过大,导致您的网站出现缓慢、挂掉等问题,等到后期头条搜索站长平台正式上线后,就可以通过“抓取频次”功能,对网站进行设置抓取要求,官方称会在 1 天内时间内生效。同时关于 Bytespider 头条搜索还可以向 [email protected] 邮箱获取联系。

w.haolusi.com

本文链接:https://w.haolusi.com/about-bytespider.html

扫描二维码推送至手机访问。

版权声明:本文由豪鲁斯兴趣网发布,如需转载请注明出处。

本文链接:https://w.haolusi.com/?id=2172

分享给朋友:

“头条搜索蜘蛛 Bytespider 介绍” 的相关文章

In terms of equipment acquisition, what improvements can be made?

In terms of equipment acquisition, what improvements can be made?

In terms of equipment acquisition in World of Warcraft, Players often discuss some areas that can be improved to enhance the gaming experien...

尽早觉醒:找到自己一人能做的互联网生意

尽早觉醒:找到自己一人能做的互联网生意

没有经历过裁员的职场是不完美的。无论何种原因经历次裁员,可能对心智都是一次提升,前面也写过技术人怎么利用空窗期的文章技术人的空窗期,你的涅槃重生。经历过裁员的时候难免感到复杂和沉重。离开的背后,不仅有情感的波动,还有对未来的深深焦虑。当你被通知离职的那一刻,情绪复杂得难以描述。但是,当冷静下来,你会...

告别焦虑,技术人的“慢功夫”哲学

告别焦虑,技术人的“慢功夫”哲学

我们现在处一个快节奏的时代,每一个行业都在高速发展,我们也常常被告知要抓住每一个机会,快速成长,迅速成功。但对许多技术人来说,所谓的“快”,有时反而会让我们失去平衡,陷入焦虑和迷茫, 常常又进入事倍功半的困境。之前遇到过一位刚入行不久的年轻技术人,他一脸焦虑地问我:“如果我现在不快点提高,是不是以后...

WordPress如何将管理员用户主页改为网站首页

WordPress如何将管理员用户主页改为网站首页

最近在做 WordPress 站群的一些项目测试,主题在调用作者的时候就会链接到作者主页,加上很多时候 WordPress 网站就只会使用一个账户来发布文章,虽然可以通过修改主题代码的方式将作者的链接直接链接到网站首页,但是作为一个优雅的 WordPress 开发者来说,肯定是不会轻易动主题源码的,...

百度正式下线“快速收录”功能,VIP可以申请“快速抓取”权限

百度正式下线“快速收录”功能,VIP可以申请“快速抓取”权限

最近可以说是站长们一片哀嚎,清明节前刚经历一次大的波动恢复没两天,让后百度又一次性的在清明节再次送走了,目前又开始缓慢的在恢复,但是似乎情况也并不是很妙。就在这时,百度搜索资源平台发布了一则“关于升级平台「快速收录」工具的通知”的公告,意思就是正式下线快速收录功能,换新上线一个叫做“快速抓取”的工具...

最新免费可用!ChatGPT 4.0/4o/3.5 镜像 Mirror|免翻直链中文镜像(2024年8月更新)

最新免费可用!ChatGPT 4.0/4o/3.5 镜像 Mirror|免翻直链中文镜像(2024年8月更新)

本篇文章目录|Table of Contents Hide ChatGPT 4.0/4o/3.5 镜像站列表ChatGPT镜像更新历史什么是Cha...

发表评论

访客

◎欢迎参与讨论,请在这里发表您的看法和观点。