Cloudflare 為客戶推出新的 AI 流量管理選項 (★ 100 分)
Cloudflare 宣布為所有客戶新增 AI 流量管理選項,不再只以「是否為 AI」區分爬蟲,而是依照實際用途分成 Search(搜尋索引)、Agent(代表使用者即時執行工作的代理程式)與 Training(用於訓練或微調模型)三類。Search 會建立網站資料庫,理應帶來導流或其他合理回報;Agent 通常是替人完成即時任務;Training 則會把內容長期吸收到 AI 模型中。Cloudflare 也鼓勵業者將同時具備多種用途的爬蟲拆分,以便網站管理者了解對方行為並分別授權。
自 2026 年 9 月 15 日起,新加入 Cloudflare 的網域,在顯示廣告的頁面上將預設封鎖 Training 與 Agent,Search 則預設允許。若爬蟲同時用於 Search 和 Training,規則會採用所有用途中的最嚴格限制,因此 Googlebot、Applebot 與 BingBot 等多用途爬蟲,可能在網站管理者封鎖 Training 時一併遭到封鎖;現有客戶可在期限前選擇不採用這項預設變更。企業方案另提供 BotBase,這是一個可搜尋的已知機器人與代理程式資料庫,讓管理者依分類或個別爬蟲建立安全性規則。
Cloudflare 同時提出內容使用程度的三層設定:`immediate` 代表只能互動、不得儲存或重用;`reference` 代表可建立索引、摘錄並連回原站;`full` 則允許摘要與完整重製。這些偏好可透過 robots.txt(網站根目錄中供自動化爬蟲讀取的規則檔)裡新增的 `use` 欄位表達,但本身仍不是強制封鎖機制。Cloudflare 也會追蹤爬蟲是否遵守承諾,濫用 Content Signals 的機器人可能失去 Verified(已驗證)資格;此外,公司正測試以 `Forwarded` 標頭傳遞代理程式背後的實際操作者,建立可延伸但也可能排除匿名使用者的「傳遞式信任」。
Hacker News 上的討論對這套方案抱持複雜態度。許多人認為它本質上仍接近君子協定:robots.txt、內容訊號與爬蟲自我分類都缺乏外部強制力,網站也很難技術性地區分「允許閱讀與搜尋索引」和「禁止訓練」。不少人更在意 Cloudflare 先前宣傳的按次付費爬取計畫,指出申請後長期沒有回音,認為真正有價值的是讓 AI 爬蟲直接付費,而不是再增加管理選項。
Googlebot 是另一項爭議焦點。討論者指出,真正的 Googlebot 通常相對克制,但偽造 User-Agent(使用者代理程式)十分普遍;也有人分享 Google 爬蟲造成網站負載過高,卻因網站需要搜尋曝光而難以完全封鎖的經驗。部分留言認為 Google 將搜尋與 Gemini 訓練共用爬蟲,等於迫使網站在曝光和內容保護之間二選一;也有意見認為 Cloudflare 同時提供建立 AI 代理程式的基礎設施、又替網站封鎖代理程式,可能讓自身平台獲得不對等優勢。
支持者則認為 Cloudflare 並非「兩面下注」,而是在全面開放與全面封鎖之間提供依用途、內容使用方式與信任程度調整的中間路線。批評者擔心 Cloudflare 替超過兩成網站設定預設規則,實際上會影響整體網路流量,卻未經網際網路工程任務組(IETF)等多方共同制定;另有人提醒 CAPTCHA、瀏覽器指紋與 Anubis 等工作量證明(Proof of Work,要求客戶端先消耗計算資源)的防爬措施,可能誤傷使用隱私工具的真人,且未必能長期阻擋具備大量資源的自動化爬蟲。
👥 72 則討論、評論 💬
https://news.ycombinator.com/item?id=49052564