搜尋觀點

robots.txt 與 Sitemap:搜尋引擎第一步到底在找甚麼?

robots.txt 與 Sitemap 如何協助搜尋引擎發現重要 URL

robots.txt 與 Sitemap 是搜尋工具發現網站內容的第一層入口。

在 Inspect The Path 的第一步,首頁藏了一句提示:Where do bots usually start? 答案就是 robots.txt。這個設計很適合拿來說明一件事:搜尋引擎不是像客戶一樣先欣賞首頁設計,而是先判斷哪些地方可以抓、哪些地方不應該碰、網站有沒有提供 sitemap。

對香港中小企網站來說,robots.txt 和 Sitemap 經常被當成「技術同事處理的小文件」。但一旦搬站、改 URL、轉多語言、加入 AI crawler 策略,它們就會直接影響收錄速度和重要頁面是否被發現。

robots.txt 不是用來保證收錄

robots.txt 的主要作用是控制 crawler 抓取,不是保證 Google 收錄。你可以用它阻止某些路徑被抓取,例如測試環境、後台、內部搜尋結果頁;但如果把服務頁、分類頁、blog 或圖片資產誤封,搜尋工具就可能無法讀到完整內容。

Inspect The Path 的 robots.txt 給出 sitemap 線索:

Sitemap: https://inspectthepath.com/map-of-the-lost-legends.xml

真實網站也一樣。robots.txt 裏的 Sitemap 行可以幫 Google、Bing 和其他 crawler 更快找到 URL 清單。若你開始做 GEO / Agent SEO,亦應該檢查 GPTBot、ClaudeBot、PerplexityBot、Google-Extended 等策略是否符合品牌需要。

Sitemap 要幫搜尋引擎做選擇

Sitemap 不是把所有 URL 倒進去就算完成。它應該反映網站最重要、可收錄、可被索引的頁面。Inspect The Path 的 sitemap 迷宮用 priority 讓玩家判斷真正路線;現實世界雖然 Google 不會把 priority 當成排名保證,但 sitemap 的清潔程度會影響 crawler 對網站的理解效率。

檢查 Sitemap 時,我們會看:

  • 是否包含核心服務頁、分類頁、重要文章和語言版本
  • 是否混入 404、redirect、noindex 或 canonical 到別處的 URL
  • lastmod 是否可信,而不是每次 build 都全部刷新
  • 多語言頁是否能配合 hreflang 和 canonical
  • 舊站搬新站後,舊 URL 是否有對應 301,而不是仍留在 sitemap

搬站時最常見的錯誤

第一種錯誤是 staging 環境的 Disallow: / 被帶到正式站。表面上網站可以打開,但 Googlebot 被拒絕抓取,幾星期後流量開始跌。

第二種錯誤是 Sitemap 繼續提交舊 URL。搜尋引擎看到大量 redirect 或 404,會浪費抓取資源,也會令新站重要頁面發現變慢。

第三種錯誤是隻提交首頁和少量頁面。對內容型網站或 SEO 集羣文章來說,分類頁、標籤頁、文章頁、工具頁都應該有清晰入口。

YUSIHK 建議的檢查流程

  1. 先打開 /robots.txt,確認沒有封鎖核心頁面。
  2. 檢查 robots.txt 是否列出正確 sitemap。
  3. 抽查 sitemap 內 URL 是否回傳 200、canonical 指自己、沒有 noindex。
  4. 把服務頁、工具頁、blog 文章和多語言頁分開看。
  5. 搬站後用 Search Console 觀察索引覆蓋和抓取統計。

你可以先用 robots.txt 檢測工具 做初步檢查,再回到 Inspect The Path 完整攻略 看整條技術 SEO 路線。若你正把這些基礎入口接回香港商業查詢,可加讀 Google SEO 主文章Google SEO 首 90 日優先次序Google 搜尋 SEO 服務入口

Inspect The Path 對應關卡:從首頁到 Sitemap

在遊戲裏,第一段流程可以拆成三步:首頁提示、robots.txt、sitemap index。它看似簡單,但正好對應網站 SEO 診斷最容易被跳過的部分。

  1. 首頁提示 Where do bots usually start?,代表 crawler discovery。
  2. /robots.txt 暴露 Sitemap: /map-of-the-lost-legends.xml,代表站點主動提供 URL 清單。
  3. sitemap index 內只有一個 priority=1.0 URL,代表要從一堆 URL 中分辨重要入口。

現實網站不會把答案寫在 priority 裏,但會有同類問題:sitemap 裏有上千條 URL,真正能排名、能轉化、能代表服務價值的可能只有幾十條。如果 sitemap 混入大量舊文章、測試頁、redirect、noindex 或低質頁,搜尋引擎會浪費抓取資源。

技術原理:robots 控制抓取,sitemap 幫助發現

robots.txt 的任務是告訴 crawler 哪些地方可以抓、哪些地方不建議抓。它不是安全機制,也不是收錄保證。被 Disallow 的 URL 仍可能因外部連結而出現在結果中,只是 Googlebot 不會抓內容。

Sitemap 的任務是補充發現入口。它應該只提交可收錄、可被索引、canonical 清楚、狀態碼為 200 的重要 URL。對 YUSIHK 這種從 WordPress 轉 Astro 的站點,sitemap 還要和 301 map、canonical、blog 分頁、分類頁一起對齊。

香港網站常見 robots / sitemap 問題

  • 正式站保留了 staging 的 Disallow: /
  • Sitemap 還列出舊 WordPress attachment、tag 或不想排名的低質頁。
  • 改版後 sitemap 裏全是 301,真正新 URL 反而沒有提交。
  • 多語言頁只提交繁中 URL,英文 / 日文頁缺入口。
  • 圖片、PDF、工具頁沒有出現在任何可抓取入口。
  • AI crawler 策略完全沒有記錄,品牌不知道自己是開放、限制還是混亂。

YUSIHK 建議的檢查 SOP

  1. robots.txt 檢測工具 先看是否阻擋核心路徑。
  2. 打開 sitemap,抽查首頁、服務頁、工具頁、最新文章、分類分頁是否都在。
  3. 對 sitemap URL 批量檢查 200、canonical、indexability、final URL。
  4. 對比 Search Console 已提交 sitemap 與實際 build 出來的 sitemap。
  5. 搬站後一星期內每天看索引、抓取和 404 / redirect 報告。

這一段可回到 Inspect The Path 完整攻略 看原始路線,也可以接到 SEO 服務 做全站 URL 發現與索引診斷。

想把這套檢查用在自己網站?

如果你的網站剛搬站、改版、轉 static site,或者開始做 GEO / AISEO,最容易出事的往往不是單一關鍵字,而是 URL、canonical、headers、robots、Schema 與內容入口互相打架。你可以先用 YUSIHK 的 SEO 工具中心 做初步檢查,再把網站 URL 發給我們做 SEO / GEO 技術診斷

參考資料