扒开老师双腿猛进入白浆小说,熟女人妻私密按摩内射,成人A片激情免费视频,亚洲欧洲AV无码区玉蒲区

在線客服與您一對一交流
當(dāng)前位置: 主頁 > 行業(yè)新聞 > seo >

搜索引擎統(tǒng)一Robots文件標(biāo)準(zhǔn)

  搜索引擎三巨頭打的不亦樂乎,但偶爾也合作一下。去年Google,雅虎,微軟就合作,共同遵守統(tǒng)一的Sitemaps標(biāo)準(zhǔn)。前兩天三巨頭又同時宣布,共同遵守的robots.txt文件標(biāo)準(zhǔn)。Google,雅虎,微軟各自在自己的官方博客上發(fā)了一篇帖子,公布三家都支持的robots.txt文件及Meta標(biāo)簽的標(biāo)準(zhǔn),以及一些各自特有的標(biāo)準(zhǔn)。下面做一個總結(jié)。

  三家都支持的robots文件記錄包括:

  Disallow – 告訴蜘蛛不要抓取某些文件或目錄。如下面代碼將阻止蜘蛛抓取所有的網(wǎng)站文件:

  User-agent: *

  Disallow: /

  Allow – 告訴蜘蛛應(yīng)該抓取某些文件。Allow和Disallow配合使用,可以告訴蜘蛛某個目錄下,大部分都不抓取,只抓取一部分。如下面代碼將使蜘蛛不抓取ab目錄下其他文件,而只抓取其中cd下的文件:

  User-agent: *

  Disallow: /ab/

  Allow: /ab/cd

  $通配符 – 匹配URL結(jié)尾的字符。如下面代碼將允許蜘蛛訪問以。htm為后綴的URL:

  User-agent: *

  Allow: .htm$

  *通配符 – 告訴蜘蛛匹配任意一段字符。如下面一段代碼將禁止蜘蛛抓取所有htm文件:

  User-agent: *

  Disallow: /*.htm

  Sitemaps位置 – 告訴蜘蛛你的網(wǎng)站地圖在哪里,格式為:

  Sitemap:

  三家都支持的Meta標(biāo)簽包括:

  NOINDEX – 告訴蜘蛛不要索引某個網(wǎng)頁。西安網(wǎng)站建設(shè)推薦閱讀>>> robots.txt文件的重要作用意義,

  NOFOLLOW – 告訴蜘蛛不要跟蹤網(wǎng)頁上的鏈接。

  NOSNIPPET – 告訴蜘蛛不要在搜索結(jié)果中顯示說明文字。

  NOARCHIVE – 告訴蜘蛛不要顯示快照。

  NOODP – 告訴蜘蛛不要使用開放目錄中的標(biāo)題和說明。

  上面這些記錄或標(biāo)簽,現(xiàn)在三家都共同支持。其中通配符好像以前雅虎微軟并不支持。百度現(xiàn)在也支持Disallow,Allow及兩種通配符。Meta標(biāo)簽我沒有找到百度是否支持的官方說明。

  只有Google支持的Meta標(biāo)簽有:

  UNAVAILABLE_AFTER – 告訴蜘蛛網(wǎng)頁什么時候過期。在這個日期之后,不應(yīng)該再出現(xiàn)在搜索結(jié)果中。西安做網(wǎng)站推薦閱讀>>> 使用robots.txt引導(dǎo)百度爬蟲合理分配抓取資源,

  NOIMAGEINDEX – 告訴蜘蛛不要索引頁面上的圖片。

  NOTRANSLATE – 告訴蜘蛛不要翻譯頁面內(nèi)容。

  雅虎還支持Meta標(biāo)簽:

  Crawl-Delay – 允許蜘蛛延時抓取的頻率。

  NOYDIR – 和NOODP標(biāo)簽相似,但是指雅虎目錄,而不是開放目錄。

  Robots-nocontent – 告訴蜘蛛被標(biāo)注的部分html不是網(wǎng)頁內(nèi)容的一部分,或者換個角度,告訴蜘蛛哪些部分是頁面的主要內(nèi)容(想被檢索的內(nèi)容)。西安網(wǎng)站建設(shè)推薦閱讀>>> 帶你玩轉(zhuǎn)robots協(xié)議,新手必備,

  MSN還支持Meta標(biāo)簽:

  Crawl-Delay

  另外提醒大家注意的是,robots.txt文件可以不存在,返回404錯誤,意味著允許蜘蛛抓取所有內(nèi)容。但抓取robots.txt文件時卻發(fā)生超時之類的錯誤,可能導(dǎo)致搜索引擎不收錄網(wǎng)站,因為蜘蛛不知道robots.txt文件是否存在或者里面有什么內(nèi)容,這與確認文件不存在是不一樣的。

相關(guān)文章:

  • User-agent: * Disallow: / Allow: /complain/ Allow: /media_partners/ Allow: /about/ Allow: /user_agreement/ User-agent: ByteSpider Allow: / User-agent: ToutiaoSpider Allow: / 以上是今日頭條的robots.txt,禁止所有搜索引擎收錄,同時又...

  • 有同學(xué)問百度站長學(xué)院一個關(guān)于robots的問題:我們有個站點的目錄結(jié)構(gòu)使用的是中文,這樣式兒的:www.a.com/冒險島/123.html,那在制作robots文件和sitemap文件的時候,可以直接使用中文嗎?百度能...

  • robots文件是搜索生態(tài)中很重要的一個環(huán)節(jié),同時也是一個很細節(jié)的環(huán)節(jié)。很多站長同學(xué)在網(wǎng)站運營過程中,很容易忽視robots文件的存在,進行錯誤覆蓋或者全部封禁robots,造成不必要損失! 那...

  • 目前百度圖片搜索也使用了與百度網(wǎng)頁搜索相同的spider,如果想禁止Baiduspider抓取網(wǎng)站上所有圖片、禁止或允許Baiduspider抓取網(wǎng)站上的某種特定格式的圖片文件可以通過設(shè)置robots實現(xiàn):西安廣告...

  • 對于百度搜索引擎來說,蜘蛛黑洞特指網(wǎng)站通過極低的成本制造出大量參數(shù)過多、內(nèi)容類同但url不同的動態(tài)URL ,就像一個無限循環(huán)的黑洞,將spider困住。spider浪費了大量資源抓取的卻是無效網(wǎng)...

  • robots是站點與spider溝通的重要渠道,站點通過robots文件聲明該網(wǎng)站中不想被搜索引擎收錄的部分或者指定搜索引擎只收錄特定的部分。請注意,僅當(dāng)您的網(wǎng)站包含不希望被搜索引擎收錄的內(nèi)容...

  • 親愛的網(wǎng)站管理員, 很高興的告訴大家,百度站長平臺 robots 工具全新升級,升級后能夠?qū)崟r查看網(wǎng)站在百度中已生效的的robots文件,并支持對robots進行語法及邏輯校驗,有助于站長更清晰的...

  • 資料一 1.robots.txt文件是什么 robots.txt是一個純文本文件,是搜索引擎中訪問網(wǎng)站的時候要查看的第一個文件。robots.txt文件告訴蜘蛛程序在服務(wù)器上什么文件是可以被查看的。每個站點最好建立...

  • robots.txt文件包含一條或更多的記錄,這些記錄通過空行分開(以CR,CR/NL, or NL作為結(jié)束符),每一條記錄的格式如下所示: field:optional spacevalueoptionalspace 在該文件中可以使用#進行注解,具體使...

  • 搜索引擎通過一種程序robot(又稱spider),自動訪問互聯(lián)網(wǎng)上的網(wǎng)頁并獲取網(wǎng)頁信 息。您可以在您的網(wǎng)站中創(chuàng)建一個純文本文件robots.txt,在這個文件中聲明該網(wǎng)站中不想被robot 訪問的部分,這...

  • 公司:西安蟠龍網(wǎng)絡(luò)科技有限公司
  • 聯(lián)系人:張經(jīng)理
  • 手機/微信:
  • Q Q: 點擊這里給我發(fā)消息
  • 地址:西安市雁塔區(qū)唐延南路11號逸翠園i都會