隨着對用於 AI 模型的精確數據的需求不斷增長,互聯網上正在展開一場不斷升級的戰鬥。各公司正在採取措施保護其數據免受 AI 網絡爬蟲的攻擊,OpenAI 的 GPTBot 和 Common Crawl 的 CCBot 面臨越來越大的反對。最近的數據顯示,目前有超過 250 個領先網站屏蔽了 GPTBot,而近 14% 的最受歡迎的網站也禁止了 CCBot,影響了 AI 訓練重要信息的可用性。
針對人工智能網絡爬蟲的鬥爭愈演愈烈
在數據驅動決策和人工智能主導的時代,網絡爬蟲機器人既是必備工具,也是爭議的焦點。上個月,OpenAI 推出了 GPTBot,其設計遵循了數十年曆史的 robots.txt 協議,允許網站表達其不被爬取的願望。最初,前 1,000 個網站中約有 70 個實施了針對 GPTBot 的攔截,其中包括亞馬遜和 Tumblr 等互聯網巨頭。
Originality.ai 的最新發現揭示了形勢的重大轉變。在短短三週的時間內,屏蔽 GPTBot 的知名網站數量已激增至 250 多個。這份綜合名單包括 Pinterest、Vimeo、GrubHub、Indeed、Apartments.com、The Guardian、Live Science、USA Today、NPR、CBS News、NBC News、CNBC、The New Yorker、People 等知名平臺,以及赫斯特和康泰納仕出版的所有刊物。甚至連 weather.com 也加入了保護其內容免受 AI 爬蟲攻擊的行列。
數據可訪問性的挑戰
這波網絡爬蟲封鎖浪潮背後的推動力在於,準確的數據在訓練強大的生成式人工智能模型(如 OpenAI 的 GPT-4)方面發揮着關鍵作用。這些模型嚴重依賴大量文本數據,其中大部分來自互聯網,儘管其中大部分受版權保護或歸特定實體所有。近年來,人們對這種做法的認識激增,導致了大量法律糾紛和政府出臺新法規的可能性。
與此同時,許多公司正在採取措施保護其用戶生成內容和在線活動。通過更新服務條款和用戶政策,科技公司正在主張他們有權訪問和使用用戶數據用於人工智能項目和培訓目的。這種方法的轉變代表了數據保護和主權的更廣泛趨勢,公司越來越多地尋求控制其數據的使用方式,尤其是人工智能驅動的實體。
CCBot 是另一個被封鎖的目標
雖然 GPTBot 因與 OpenAI 和 GPT-4 模型的關聯而備受關注,但 Common Crawl 使用的另一個網絡爬蟲 CCBot 也面臨着阻力。總部位於歐洲的組織 Common Crawl 多年來一直在收集大量網絡數據,包括受版權保護的內容,並將其組織起來用作 Meta 的 Llama 等大型語言模型的訓練數據。
截至 9 月底,Originality.ai 的數據顯示,在 1,000 個最受歡迎的網站中,近 14% 已實施針對 CCBot 的屏蔽。其中包括亞馬遜、Vimeo、Masterclass、凱利藍皮書、紐約時報、紐約客和大西洋月刊等。值得注意的是,許多屏蔽 CCBot 的網站也將限制範圍擴大到 GPTBot,這表明保護數據免受 AI 網絡爬蟲攻擊的趨勢日益增長,無論其隸屬關係如何。
尋求保護數據的公司與尋求培訓材料的 AI 網絡爬蟲之間的鬥爭持續加劇。越來越多的網站屏蔽 GPTBot 和 CCBot,這凸顯了在 AI 驅動的世界中數據可訪問性和控制性日益重要。隨着法律和監管審查的不斷加強,數據利用和數據保護之間的平衡仍然是企業和 AI 開發人員面臨的關鍵挑戰。
