封鎖 AI 爬蟲,還是讓它引用?網站現在多了一道選擇題

不要先把所有 AI 爬蟲一起封鎖。訓練模型、支援 AI 搜尋與代表使用者開啟頁面的爬蟲,目的可能不同;網站應先確認商業目標與內容風險,再決定哪些允許、哪些限制。

技術與檢查2026 年 9 月更新

為什麼突然要做這個選擇?

Cloudflare 在 2025 年宣布,新的網域將可預設封鎖已知 AI 爬蟲,並測試 Pay per Crawl,讓內容擁有者選擇免費開放、收費或拒絕存取。這項機制使用 HTTP 402 回應與爬蟲驗證,但推出時仍屬私人測試,不是所有網站都能立刻靠爬蟲收費。[1]

台灣媒體將這項變化放在內容被大量擷取、引用卻未必帶回流量的背景下討論。對出版商而言,這牽涉內容授權與收益;對一般品牌網站而言,問題則更像是:你是否希望產品、服務與專業內容被 AI 搜尋找到?[2]

AI 爬蟲不是只有一種

常見用途可能影響判斷重點
搜尋與答案引用可能讓頁面出現在 AI 搜尋來源中若重視 GEO 能見度,通常不宜誤擋
模型訓練內容可能被用於改善或訓練模型依內容授權、商業模式與平台政策決定
使用者要求開啟頁面代理工具代表使用者造訪或執行任務注意登入、個資、付款與操作安全

例如 OpenAI 將 OAI-SearchBotGPTBot 分開說明,前者用於搜尋,後者與模型訓練相關;Google 也區分一般搜尋的 Googlebot 與可控制部分 AI 訓練用途的 Google-Extended。因此,一條「全部封鎖 AI」規則可能同時阻斷你原本想保留的搜尋曝光。[3][4]

三種網站的判斷方式

一般品牌與服務網站

若目標是讓服務內容被搜尋、比較與引用,可優先保留搜尋用途爬蟲,再限制不需要的訓練用途。產品說明、服務範圍與聯絡方式本來就是公開資訊,重點是不要誤擋搜尋機器人。

媒體、研究與付費內容網站

內容本身就是主要資產,應把公開摘要、會員全文、資料授權與爬蟲規則分開設計。若只用一條全站規則處理,可能不是失去引用機會,就是讓付費內容暴露過多。

含個資或會員操作的網站

無論是否開放公開內容,都要確保登入後頁面、個人資料、訂單與付款流程不會被未授權代理存取。這屬於權限與安全設計,不是單靠 robots.txt 就能解決。

調整前後要檢查什麼?

  1. 列出目前 CDN、WAF 與 robots.txt 對各種爬蟲的規則。
  2. 分清搜尋、訓練與使用者操作用途,不要只看名稱裡有沒有 AI。
  3. 先在測試環境驗證,再觀察伺服器紀錄中的狀態碼與抓取量。
  4. 確認 Google、Bing 與重要 AI 搜尋平台仍能存取公開頁面。
  5. 把調整日期、目的與負責人記錄下來,避免日後沒人知道為何被封鎖。
沒有適合所有網站的統一答案。要不要開放,取決於內容價值、收益來源、法務要求與曝光目標。技術設定只是執行方式,決策應先從網站商業模式開始。

參考文獻

  1. Cloudflare(2025)。Introducing pay per crawl: Enabling content owners to charge AI crawlers for access查看來源
  2. iThome(2025)。Cloudflare 將預設封鎖 AI 網頁爬蟲,除非付費給內容網站查看來源
  3. OpenAI Help Center(2026)。Publishers and Developers — FAQ查看來源
  4. Google Search Central(2026)。AI features and your website查看來源

網站諮詢

想知道網站該先調整哪裡?

從 SEO 基礎、內容架構到 GEO、AEO 的搜尋能見度,藍眼行銷可以協助你盤點現況,釐清下一步。

預約 AI 搜尋諮詢