国产一二三四区中,精品无码人妻一区二区三区免费,亚洲欧美日本国产专区一区,欧美成人A激情

網(wǎng)站公告

robots.txt標(biāo)準(zhǔn)格式

時間:2011-11-13 17:21:35   作者:未知   來源:互聯(lián)網(wǎng)   閱讀:1359   評論:5
內(nèi)容摘要:Google,雅虎,微軟合作,共同遵守統(tǒng)一的Sitemaps標(biāo)準(zhǔn)。又同時宣布,共同遵守的robots.txt文件標(biāo)準(zhǔn)。Google,雅虎,微軟各自支持的robots.txt文件及Meta標(biāo)簽的標(biāo)準(zhǔn),以及一些各自特有的標(biāo)準(zhǔn)。下面做一個總結(jié)。  三家都支持的robots文件記...

  Google,雅虎,微軟合作,共同遵守統(tǒng)一的Sitemaps標(biāo)準(zhǔn)。又同時宣布,共同遵守的robots.txt文件標(biāo)準(zhǔn)。Google,雅虎,微軟各自支持的robots.txt文件及Meta標(biāo)簽的標(biāo)準(zhǔn),以及一些各自特有的標(biāo)準(zhǔn)。下面做一個總結(jié)。

  三家都支持的robots文件記錄包括:

  Disallow - 告訴蜘蛛不要抓取某些文件或目錄。如下面代碼將阻止蜘蛛抓取所有的網(wǎng)站文件:

User-agent: *
Disallow: /

  Allow - 告訴蜘蛛應(yīng)該抓取某些文件。Allow和Disallow配合使用,可以告訴蜘蛛某個目錄下,大部分都不抓取/只抓取一部分。如下面代碼將使蜘蛛不抓取ab目錄下其他文件,而只抓取其中cd下的文件:

User-agent: *
Disallow: /ab/
Allow: /ab/cd

  $通配符 - 匹配URL結(jié)尾的字符。如下面代碼將允許蜘蛛訪問以.htm為后綴的URL:

User-agent: *
Allow: .htm$

  *通配符 - 告訴蜘蛛匹配任意一段字符。如下面一段代碼將禁止蜘蛛抓取所有htm文件:

User-agent: *
Disallow: /*.htm

  Sitemaps位置 - 告訴蜘蛛你的網(wǎng)站地圖在哪里,格式為:

Sitemap: <sitemap_location>

  三家都支持的Meta標(biāo)簽包括:

  NOINDEX - 告訴蜘蛛不要索引某個網(wǎng)頁。

  NOFOLLOW - 告訴蜘蛛不要跟蹤網(wǎng)頁上的鏈接。

  NOSNIPPET - 告訴蜘蛛不要在搜索結(jié)果中顯示說明文字。

  NOARCHIVE - 告訴蜘蛛不要顯示快照。

  NOODP - 告訴蜘蛛不要使用開放目錄中的標(biāo)題和說明。

  上面這些記錄或標(biāo)簽,現(xiàn)在三家都共同支持。其中通配符好像以前雅虎微軟并不支持。百度現(xiàn)在也支持Disallow,Allow及兩種通配符。Meta標(biāo)簽我沒有>到百度是否支持的官方說明。

  只有Google支持的Meta標(biāo)簽有:

  UNAVAILABLE_AFTER - 告訴蜘蛛網(wǎng)頁什么時候過期。在這個日期之后,不應(yīng)該再出現(xiàn)在搜索結(jié)果中。

  NOIMAGEINDEX - 告訴蜘蛛不要索引頁面上的圖片。

  NOTRANSLATE - 告訴蜘蛛不要翻譯頁面內(nèi)容。

  雅虎還支持Meta標(biāo)簽:

  Crawl-Delay - 允許蜘蛛延時抓取的頻率。

  NOYDIR - 和NOODP標(biāo)簽相似,但是指雅虎目錄,而不是開放目錄。

  Robots-nocontent - 告訴蜘蛛被標(biāo)注的部分html不是網(wǎng)頁內(nèi)容的一部分,或者換個角度,告訴蜘蛛哪些部分是頁面的主要內(nèi)容(想被檢索的內(nèi)容)。

  MSN還支持Meta標(biāo)簽:

  Crawl-Delay

  另外提醒大家注意的是,robots.txt文件可以不存在,返回404錯誤,意味著允許蜘蛛抓取所有內(nèi)容。但抓取robots.txt文件時卻發(fā)生超時之類的錯誤,可能導(dǎo)致搜索引擎不收錄網(wǎng)站,因為蜘蛛不知道robots.txt文件是否存在或者里面有什么內(nèi)容,這與確認(rèn)文件不存在是不一樣的。


標(biāo)簽:robots  標(biāo)準(zhǔn)格式