伺服器日誌分析(Log File Analysis)是分析網站伺服器收到的請求紀錄,確認搜尋引擎爬蟲實際抓取哪些網址、何時抓、回傳什麼狀態與耗時。它提供的是請求證據,不是排名報表;特別適合大型網站、抓取異常、改版與大量參數網址的技術稽核。
重點速覽
- 日誌能看到真實請求、User-Agent、狀態碼、時間與回應大小,但欄位依伺服器與保留政策而異。
- 只看 User-Agent 容易被假冒;重要分析要用反向與正向 DNS 或官方 IP 範圍驗證 Googlebot。
- Search Console Crawl Stats 是彙整報表;伺服器日誌更細,但也需要清理、隱私與基礎設施知識。
伺服器日誌裡有什麼?
常見 Access Log 會記錄請求時間、網址、方法、HTTP 狀態碼、User-Agent、來源 IP、回應大小與處理時間。若網站經過 CDN、負載平衡器或無伺服器平台,真正來源 IP 與欄位位置可能不同,需要先確認架構。
| 欄位 | 能回答的問題 |
|---|---|
| Timestamp | 爬蟲何時來、頻率是否異常 |
| URL/Method | 抓了哪些頁與資源、是否有奇怪參數 |
| Status | 得到 200、轉址、404、429 或 5xx |
| User-Agent/IP | 聲稱是哪種爬蟲,是否需要進一步驗證 |
| Bytes/Response Time | 抓取量、慢回應與伺服器負擔 |
Log File Analysis 能發現哪些 SEO 問題?
- Googlebot 是否反覆抓取無價值參數、內部搜尋或重複網址。
- 重要新頁是否長期沒有被抓取,或更新後很少刷新。
- 爬蟲是否遇到大量轉址鏈、404、429、5xx 或慢回應。
- JavaScript、CSS、圖片與 API 資源是否大量失敗。
- 不同 Googlebot 類型與抓取目的在什麼時間出現。
- 改版前後抓取路徑、舊網址與新網址是否如預期轉移。
日誌分析的基本流程
- 確認資料來源、時區、欄位、CDN/代理與保留期間。
- 排除監控、內部工具與一般訪客,篩出搜尋爬蟲候選。
- 驗證 Googlebot 身分,不只相信可自行填寫的 User-Agent。
- 正規化網址、狀態碼與模板,把請求分群。
- 對照 Sitemap、內鏈、GSC 索引與 Crawl Stats。
- 找出高量低價值抓取與低量高價值頁,再提出具體修正。
- 修正後用相同期間與口徑重新量測。
什麼網站需要做到日誌層級?
Google 的 Crawl Stats 文件把該報表定位為進階使用;小於約一千頁的網站通常不需要為這個層級過度焦慮。大型電商、新聞站、目錄站、程式化頁面與改版專案,才更容易從完整日誌得到額外價值。
日誌可能含 IP、路徑與使用者請求資料,取得、保存與分享要遵守公司資安、隱私與存取權限規則。分析時只保留完成目的所需欄位,交付前也應移除不必要個資。
關於這個名詞的常見迷思
迷思一:User-Agent 寫 Googlebot 就一定是真的
User-Agent 可以被假冒。需要時應依 Google 官方方法驗證來源 IP 或公開 IP 範圍。
迷思二:Search Console Crawl Stats 等於完整伺服器日誌
Crawl Stats 是 Google 提供的彙整與範例資料;日誌則是你的基礎設施收到的逐筆請求,兩者範圍與用途不同。
迷思三:所有網站都必須做 Log File Analysis
小型網站通常先把索引、內鏈、內容與伺服器錯誤處理好;日誌分析更適合規模大或有明確抓取問題的情境。
一句話總結
Log File Analysis 是用伺服器證據看爬蟲行為;先驗證來源與欄位,再把抓取、狀態、速度和網站價值對照。
延伸名詞
日誌分析常和這些概念一起使用:



