伺服器日誌分析(Log File Analysis)是什麼?看懂 Googlebot 實際爬取行為|SEO・GEO 百科

Log File Analysis 用伺服器請求紀錄觀察 Googlebot 實際抓了哪些網址、狀態碼與頻率。本文說明流程、限制與驗證方式。

伺服器日誌分析(Log File Analysis)是分析網站伺服器收到的請求紀錄,確認搜尋引擎爬蟲實際抓取哪些網址、何時抓、回傳什麼狀態與耗時。它提供的是請求證據,不是排名報表;特別適合大型網站、抓取異常、改版與大量參數網址的技術稽核。

重點速覽

  • 日誌能看到真實請求、User-Agent、狀態碼、時間與回應大小,但欄位依伺服器與保留政策而異。
  • 只看 User-Agent 容易被假冒;重要分析要用反向與正向 DNS 或官方 IP 範圍驗證 Googlebot。
  • Search Console Crawl Stats 是彙整報表;伺服器日誌更細,但也需要清理、隱私與基礎設施知識。

伺服器日誌裡有什麼?

常見 Access Log 會記錄請求時間、網址、方法、HTTP 狀態碼、User-Agent、來源 IP、回應大小與處理時間。若網站經過 CDN、負載平衡器或無伺服器平台,真正來源 IP 與欄位位置可能不同,需要先確認架構。

欄位 能回答的問題
Timestamp 爬蟲何時來、頻率是否異常
URL/Method 抓了哪些頁與資源、是否有奇怪參數
Status 得到 200、轉址、404、429 或 5xx
User-Agent/IP 聲稱是哪種爬蟲,是否需要進一步驗證
Bytes/Response Time 抓取量、慢回應與伺服器負擔

Log File Analysis 能發現哪些 SEO 問題?

  • Googlebot 是否反覆抓取無價值參數、內部搜尋或重複網址。
  • 重要新頁是否長期沒有被抓取,或更新後很少刷新。
  • 爬蟲是否遇到大量轉址鏈、404、429、5xx 或慢回應。
  • JavaScript、CSS、圖片與 API 資源是否大量失敗。
  • 不同 Googlebot 類型與抓取目的在什麼時間出現。
  • 改版前後抓取路徑、舊網址與新網址是否如預期轉移。

日誌分析的基本流程

  1. 確認資料來源、時區、欄位、CDN/代理與保留期間。
  2. 排除監控、內部工具與一般訪客,篩出搜尋爬蟲候選。
  3. 驗證 Googlebot 身分,不只相信可自行填寫的 User-Agent。
  4. 正規化網址、狀態碼與模板,把請求分群。
  5. 對照 Sitemap、內鏈、GSC 索引與 Crawl Stats。
  6. 找出高量低價值抓取與低量高價值頁,再提出具體修正。
  7. 修正後用相同期間與口徑重新量測。

什麼網站需要做到日誌層級?

Google 的 Crawl Stats 文件把該報表定位為進階使用;小於約一千頁的網站通常不需要為這個層級過度焦慮。大型電商、新聞站、目錄站、程式化頁面與改版專案,才更容易從完整日誌得到額外價值。

日誌可能含 IP、路徑與使用者請求資料,取得、保存與分享要遵守公司資安、隱私與存取權限規則。分析時只保留完成目的所需欄位,交付前也應移除不必要個資。


關於這個名詞的常見迷思

迷思一:User-Agent 寫 Googlebot 就一定是真的

User-Agent 可以被假冒。需要時應依 Google 官方方法驗證來源 IP 或公開 IP 範圍。

迷思二:Search Console Crawl Stats 等於完整伺服器日誌

Crawl Stats 是 Google 提供的彙整與範例資料;日誌則是你的基礎設施收到的逐筆請求,兩者範圍與用途不同。

迷思三:所有網站都必須做 Log File Analysis

小型網站通常先把索引、內鏈、內容與伺服器錯誤處理好;日誌分析更適合規模大或有明確抓取問題的情境。


一句話總結

Log File Analysis 是用伺服器證據看爬蟲行為;先驗證來源與欄位,再把抓取、狀態、速度和網站價值對照。


延伸名詞

日誌分析常和這些概念一起使用:

參考資料