網頁工具 / 02

Robots.txt檢查工具

將網站的robots.txt檔案轉換成快速易讀的爬蟲政策報告。

Robots.txt檢查工具: 讀取網站的robots.txt爬蟲規則、代理程式群組、Sitemap宣告與原始碼。TOEA會從網站根目錄擷取檔案,並摘要根路徑的萬用字元政策。這有助於找出廣泛封鎖與放置錯誤的規則;但不會測試每個頁面是否都能建立索引。 依需求安全處理。

使用次數
在TOEA的伺服器上
費用
免費・免註冊
可用狀態
可立即使用
Robots.txt讀取工具安全的公開網址檢查

TOEA會檢查網站根目錄中的robots.txt檔案。

簡短的robots.txt範例

將檔案放在主機的根目錄,也就是/robots.txt。User-agent會選擇爬蟲群組,Disallow要求該群組不要抓取符合條件的路徑,而Allow可以建立例外。此範例會封鎖私人目錄,但允許其中的公開新聞資料夾,並宣告sitemap。

User-agent: *
Disallow: /private/
Allow: /private/press/

Sitemap: https://example.com/sitemap.xml

符合條件的最長路徑優先;若長度相同,Allow優先。路徑會區分大小寫。符合相同代理程式的群組規則會合併;具名爬蟲不會繼承萬用字元群組的規則。協定參考:https://www.rfc-editor.org/rfc/rfc9309.html

檢查常見錯誤

Disallow: /會封鎖所有路徑,而空白的Disallow值則不會封鎖任何內容。放在/blog/robots.txt的檔案不會控制網站根目錄,某個主機的規則也不會套用到子網域。請避免封鎖搜尋引擎算繪頁面所需的資源。

robots.txt控制的是爬取,不是存取權限,也不能保證從搜尋結果中移除內容。私人內容請使用驗證。若公開頁面必須排除在搜尋結果之外,請允許爬取並提供noindex。此檢查工具會摘要群組和萬用字元根目錄政策,不會測試每個網址。搜尋指南:https://developers.google.com/search/docs/crawling-indexing/robots/intro

使用方式

  1. 輸入要檢查網站上的任一頁面。
  2. 選擇「檢查robots.txt」。
  3. 查看其中的群組、規則總數、Sitemap與完整原始碼。

隱私與限制

網站網址會傳送至TOEA的受限擷取服務,且不會儲存。robots.txt僅供參考;這份報告無法證明每個爬蟲都會遵循其中規則。

相關工具

常見問題

robots.txt應該放在哪裡?

應放在要控制之主機的/robots.txt,例如https://example.com/robots.txt。放在/blog/下的檔案無法控制整個網站,而子網域也需要自己的檔案。

Disallow會將頁面從搜尋結果中移除嗎?

不會。robots.txt控制的是爬取,不是建立索引或存取權限。遭封鎖的網址仍可能出現在搜尋結果中。若要排除公開頁面,請允許爬取並提供noindex指示;私人內容則應使用驗證保護。

我應該先檢查哪些錯誤?

Disallow: /會封鎖整個網站,而空白的Disallow值則不會封鎖任何內容。請檢查區分大小寫的路徑、群組邊界,以及必要資源是否遭到封鎖。指定名稱的爬蟲群組不會繼承萬用字元群組的規則。

免費工具・使用在toea的伺服器上次・免註冊