Google 爬蟲不只發送 GET 和 POST:HEAD、OPTIONS、PUT、PATCH、DELETE 請求的技術 SEO 啟示 — 香港網站開發者必讀

Google 搜尋團隊的 Gary Illyes 近日在 LinkedIn 上透露了一個許多 SEO 從業者可能不知道的技術細節:Google 爬蟲不只發送 GET 和 POST 請求,還會發送 HEAD、OPTIONS、PUT、PATCH 和 DELETE 等 HTTP 方法。雖然這些非標準請求的總佔比不到 1.5%,但對於香港的網站開發者和 SEO 從業者來說,這個資訊具有重要的實際意義。

事件背景

Gary Illyes 在 LinkedIn 上寫道:「過去幾週,我收到了一些關於 Google 爬蟲是否會發送 GET 和 POST 以外的 HTTP 請求的問題。」他的回答是肯定的——Google 爬蟲確實會發送 HEAD、OPTIONS、PUT、PATCH 和 DELETE 請求,但它們合計只佔 Google 所有爬蟲請求總數的不到 1.5%。

更重要的是,Illyes 解釋了 Google 發送這些請求的原因:JavaScript 渲染。他寫道:「基本上,似乎是某些 JavaScript 的『奇怪行為』(nonsense)引發了這些請求,而渲染(rendering)會執行它的渲染工作。」

這些 HTTP 方法在爬蟲中的角色

HEAD 請求

HEAD 請求與 GET 類似,但伺服器只返回 HTTP 標頭而不返回回應主體。Google 爬蟲使用 HEAD 請求來檢查資源是否存在、取得最後修改時間、檢查內容類型等,而不需要下載完整的資源內容。

對於香港的網站,特別是那些使用內容管理系統(CMS)的網站,確保伺服器正確回應 HEAD 請求是很重要的。如果伺服器對 HEAD 請求返回錯誤狀態碼,Google 可能會誤判資源的可用性。

OPTIONS 請求

OPTIONS 請求用於查詢伺服器支援哪些 HTTP 方法。在 JavaScript 應用程式中,瀏覽器有時會先發送 OPTIONS 請求(即 CORS 預檢請求)來確認是否允許跨來源請求。

如果香港的網站使用了嚴格的 CORS 政策或自訂的伺服器配置,確保伺服器正確回應 OPTIONS 請求可以避免 Google 爬蟲在渲染過程中遇到問題。

PUT、PATCH、DELETE 請求

這三種方法通常用於 RESTful API 的資料操作——PUT 用於建立或取代資源,PATCH 用於部分更新,DELETE 用於刪除資源。Google 爬蟲發送這些請求並不是因為 Google 想要修改你的網站內容,而是因為在渲染 JavaScript 應用程式時,某些前端框架或第三方腳本會自動觸發這些請求。

對香港網站開發者的實際影響

1. 檢查伺服器配置

對於香港的網站開發者,以下幾點值得注意:

  • Web 伺服器(Nginx、Apache):確保你的伺服器不會對 HEAD、OPTIONS、PUT、PATCH、DELETE 請求返回 405 Method Not Allowed 或 403 Forbidden
  • 防火牆規則:檢查你的防火牆或 WAF(Web Application Firewall)是否阻擋了這些 HTTP 方法。某些安全配置會預設阻擋非標準 HTTP 方法,但這可能無意中影響 Google 爬蟲
  • CDN 配置:如果你使用 Cloudflare、Akamai 或其他 CDN 服務,檢查它們是否允許這些 HTTP 方法通過

2. 不要過度解讀

很重要的一點是:Google 發送這些請求的比例極低(不到 1.5%),而且主要是針對 JavaScript 渲染的需求。這不代表 Google 會突然開始用 PUT 請求來爬取你的網站內容,也不代表你需要對這些請求做特殊的 SEO 優化。

Illyes 的這段話更像是提醒 SEO 社群一個技術細節,而非發布一個需要立即應對的變更。

3. JavaScript 渲染的啟示

Illyes 將這些請求歸因於「JavaScript 的奇怪行為」,這實際上是對現代網站開發者的一個提醒:JavaScript 應用程式在瀏覽器中的行為可能比你想像的更複雜。Google 爬蟲在渲染 JavaScript 時,會執行網頁中的腳本,而這些腳本可能會觸發各種 HTTP 請求——包括那些開發者可能沒有預料到的請求。

對於香港的網站開發者,這意味著:

  • 使用伺服器端渲染(SSR)或靜態生成(SSG):對於香港的企業網站,考慮使用 SSR 或 SSG 架構(如 Next.js、Astro、Nuxt.js),減少對客戶端 JavaScript 的依賴,從而降低爬蟲在渲染過程中遇到意外問題的風險
  • 測試 Google 爬蟲的路徑:使用 Google Search Console 的「檢查 URL」功能,確認 Google 爬蟲能夠正確存取和渲染你的網站
  • 避免過度複雜的 JavaScript 依賴:如果你的網站主要依賴香港本地客戶,確保不必要的第三方腳本不會阻礙 Google 爬蟲的基本功能

香港網站應如何應對?

1. 優先檢查 WAF 和防火牆配置

香港的許多企業網站使用商業 WAF 解決方案來保護網站安全。如果你使用的是這些服務,請確認你的 WAF 規則不會阻擋 Google 爬蟲的 HEAD 和 OPTIONS 請求:

  • 檢查 WAF 日誌中是否有 Google 爬蟲 IP 的請求被阻擋
  • 確保 WAF 規則允許 Google 爬蟲的 IP 範圍(可以參考 Google 的公開 IP 列表)
  • 測試 Google 爬蟲能否正常存取你的網站(使用 Search Console 的「檢查 URL」工具)

2. 檢視伺服器日誌

如果你管理自己的伺服器,可以查看伺服器日誌中是否有來自 Google 爬蟲的非 GET/POST 請求:

# 以 Nginx 為例,查看 Google 爬蟲的 HEAD 請求
grep "Googlebot" /var/log/nginx/access.log | grep "HEAD" | head -20

如果你看到 Google 爬蟲的 HEAD 請求返回了 4xx 或 5xx 狀態碼,建議修復相關問題。

3. 對於使用 SPA 的香港網站

如果你的網站是單頁應用程式(SPA),如使用 React、Vue 或 Angular 構建,請特別注意:

  • Google 爬蟲在渲染 SPA 時可能會觸發更多的非 GET 請求
  • 考慮使用 Prerender 或動態渲染(Dynamic Rendering)方案,為 Google 爬蟲提供預渲染的 HTML 版本
  • 測試你的 SPA 在 Google 爬蟲的渲染結果是否正確

總結

Gary Illyes 透露的這個技術細節,雖然對大多數 SEO 從業者來說不會立即改變日常工作,但它提供了一個重要的提醒:Google 爬蟲的行為遠比我們想像的複雜。在現代網路環境中,Google 爬蟲需要模擬瀏覽器的各種行為來正確渲染網頁,而這包括發送各種 HTTP 請求。

對於香港的網站開發者和 SEO 從業者,最重要的行動是:確保你的伺服器、防火牆和 CDN 配置不會意外阻擋 Google 爬蟲的正常請求。如果你已經正確配置了伺服器,那麼這則資訊更多是對你現有做法的確認,而非需要緊急應對的變更。

你的網站伺服器配置是否阻擋了 Google 爬蟲的正常工作? LocalSEO.com.hk 提供專業的技術 SEO 審計服務,幫助香港企業檢查網站伺服器配置、爬蟲可存取性及 JavaScript 渲染問題,確保 Google 爬蟲能夠順利索引你的網站內容。立即免費諮詢了解更多。

相關文章

🏪

Google 商家檔案三大更新:四日內拒絕編輯、自動偵測垃圾評論、Posts限制未驗證聯絡資料——香港商戶必須掌握的本地SEO新規

Google 九月下旬一口氣更新了三項與 Google Business Profiles 直接相關的政策和功能:商家收到編輯建議後僅有4天時間拒絕、系統自動偵測垃圾評論高峰並暫時暫停新評論、Google Posts 禁止未驗證的聯絡電話和電郵。對香港實體商家而言,這些變化將直接影響日常的商家檔案管理工作。

閱讀更多