关于robots协议

2024-06-30 08:35:30

robots协议也称爬虫协议、爬虫规则等,是指网站可建立一个robots.txt文件来告诉搜索引擎哪些页面可以抓取,哪些页面不能抓取,而搜索引擎则通过读取robots.txt文件来识别这个页面是否允许被抓取。通常被放置在根目录下

目前位置robots协议文件写法有如下：
user-agent:* 这里的代表对所有的搜索引擎种类类型，其实就是通配符的意思。
allow:/ 是代表所有的robots允许访问。
Disallow: /是代表所有的robots不允许访问。

文件写法

User-agent: * 这里的*代表的所有的搜索引擎种类，*是一个通配符

Disallow: /admin/ 这里定义是禁止爬寻admin目录下面的目录

Disallow: /require/ 这里定义是禁止爬寻require目录下面的目录

Disallow: /ABC/ 这里定义是禁止爬寻ABC目录下面的目录

Disallow: /cgi-bin/*.htm 禁止访问/cgi-bin/目录下的所有以".htm"为后缀的URL(包含子目录)。

Disallow: /*?* 禁止访问网站中所有包含问号 (?) 的网址

Disallow: /.jpg$ 禁止抓取网页所有的.jpg格式的图片

Disallow:/ab/adc.html 禁止爬取ab文件夹下面的adc.html文件。

Allow: /cgi-bin/　这里定义是允许爬寻cgi-bin目录下面的目录

Allow: /tmp 这里定义是允许爬寻tmp的整个目录

Allow: .htm$ 仅允许访问以".htm"为后缀的URL。

Allow: .gif$ 允许抓取网页和gif格式图片

Sitemap: 网站地图告诉爬虫这个页面是网站地图

robots文件的作用：

1、可以屏蔽网站内一些打不开的链接，也就是死链接

2、可以屏蔽搜索引擎蜘蛛访问网站内重复的内容和重复的页面

3、阻止搜索引擎访问网站的隐私性的内容。

4、阻止搜索引擎访问网站的后台内容。

5、告诉搜索引擎那些内容是需要被访问的。指定爬网延迟，以便在爬网程序一次加载多个内容时防止服务器过载

6、防止搜索引擎索引您网站上的某些文件(图像，PDF等)

关于robots协议相关推荐

robots协议是什么？对网站SEO有什么好处？
在网站优化中,robots协议一直是优化人员重视的细节,想要网站能够有更高的抓取和排名,此协议也起到很大的作用,那么robots协议是什么呢?它对网站的SEO有什么作用和好处呢?下面一起来了解一下. ...
“盗”亦有道，关于robots协议
robots.txt robots协议(全名为"网络爬虫排除标准")(Robots Exclusion Protocol)网站通过Robots协议告诉搜索引擎哪些页面可以抓取,哪些 ...
丑憨批的爬虫笔记2（爬虫引发的问题+robots协议）
去搜 user-agent!!!! referer!!!!! 网页中怎么查看请求头header信息点一下Name里的东西就会出来规模大小分类 robots协议 User-agent: * /// ...
python遵循什么协议_《Python网络爬虫》2.3 Robots协议的遵守方式
在实际操作中我们这样的爬虫该如何遵守robots协议呢? Robots协议的使用对于任何网络爬虫来讲,它应该能够自动或人工的识别robots.txt文件,根据文件的内容再进行爬取. 即使不写这样的代 ...
【K哥爬虫普法】百度、360八年乱战，robots 协议之战终落幕
我国目前并未出台专门针对网络爬虫技术的法律规范,但在司法实践中,相关判决已屡见不鲜,K哥特设了"K哥爬虫普法"专栏,本栏目通过对真实案例的分析,旨在提高广大爬虫工程师的法律意识,知 ...
Python爬虫——爬虫是什么都可以爬的吗？Robots协议！
Python爬虫--爬虫是什么都可以爬的吗? 初识"爬虫"这个词时,想必大家都会和我一样,认为"爬虫"就是爬取网站上的各种内容,可以抓取网站的信息为我们所用. ...
闲聊Robots协议
其实,我了解搜索引擎方面的知识是比较晚的~~~对robots协议还是来自2012年的"3B大战"也就是360和百度之间的一场争论!! 360呢,在2012年推出了自己的一款搜索引擎 ...
爬虫：Robots协议
Robots 协议也称作爬虫协议.机器人协议,它的全名叫作网络爬虫排除标准( Robots Exclusion Protocol ),用来告诉爬虫和搜索引擎哪些页面可以抓取,哪些不可以抓取它通常是一 ...
第三周实验题目2——robots协议
Robots协议起不到阻止爬虫的作用,是爬虫的"君子协定" 格式好像是这样的: https://www.jd.com/robots.txt 现在题里面给了一个靶机的IP: 大概用I ...
SEO优化 - robots协议
前言搜索引擎都有自己的"搜索机器人"(ROBOTS),并通过这些ROBOTS在网络上沿着网页上的链接(一般是http和src链接)不断抓取资料建立自己的数据库. 网站所有者使用/ ...

最新文章

热门文章