home / notes / crawler log surprises
Note
看了三個月的 AI 爬蟲日誌,三件跟我想的不一樣的事
我原本以為爬蟲日誌會告訴我「誰對我有興趣」。它其實更常告訴我「我的網站以前長什麼樣子」。
這篇寫的是我在自己資料裡看到什麼、原本以為是什麼。如果你要找的是「怎麼從日誌辨識 AI 爬蟲」的操作方法,那是另一件事,我把它寫在 topcc.me 的技術指南。
一、請求量最大的那一支,最抓不到東西
| 爬蟲 | 請求數 | 取得內容(HTTP 200) |
|---|---|---|
Bytespider | 4,152 | 33.2% |
Amazonbot | 3,971 | 52.6% |
Meta-ExternalAgent | 2,297 | 80.0% |
ClaudeBot | 2,225 | 65.3% |
ChatGPT-User | 864 | 91.4% |
OAI-SearchBot | 809 | 81.0% |
我原本的直覺是請求量代表興趣程度。但排第一的 Bytespider 有三分之二的請求什麼都沒拿到,而排第五的 ChatGPT-User 幾乎每次都拿到。
差別在於它們怎麼決定要抓什麼。ChatGPT-User 抓的是使用者當下貼出來的網址——那些網址剛剛才被人看過,所以存在。Bytespider 是自主探索,而它記得的路徑有一大半是我很久以前的網站結構。
所以這張表其實在講我自己:200 率低不是爬蟲的問題,是我改過網址而沒有留轉址。我一開始把它讀成「爬蟲品質」,讀錯了。
二、有一支來了 27 次,一次都沒拿到東西
cohere-ai 在 2026-09-06 第一次出現,到 09-08 為止 27 次請求,200 率 0%。
它抓的路徑目前一條都不存在。對一個第一次來訪的爬蟲來說,這代表它拿到的網址不是從我的網站上找到的——而是來自別的地方(外部連結、既有語料、或某份過期的清單)。
這件事的實際意義:新爬蟲出現時,它對你的第一印象可能完全建立在你的舊網站上。我沒辦法控制它從哪裡拿到那些網址,但我可以決定那些網址現在回什麼。
三、有一支安靜地消失了
| 爬蟲 | 最後一次出現 | 這 82 天的總數 |
|---|---|---|
anthropic-ai | 2026-08-02 | 369 |
Google-Extended | 2026-08-16 | 399 |
Diffbot | 2026-07-26 | 294(只在 7 月中下旬密集出現一週) |
anthropic-ai 是一個極短的 UA,字串裡連網址都沒有。它在 8 月初之後就沒再出現,而同期間 ClaudeBot、Claude-User、Claude-SearchBot 三支都還在跑。看起來像是舊識別字被新的系列取代了。
我不能從自己的日誌證明這件事——我只能觀察到「不再出現」,不能觀察到「為什麼」。這是單站觀測的天花板。
值得記下來的是:爬蟲清單會過期。如果我在 7 月寫死一份 UA 比對清單,它現在會漏掉 8 月才開始出現的
cohere-ai,同時還在比對一個已經不來的 anthropic-ai。我改變的判讀方式
- 請求量單獨看沒有意義,一定要配狀態碼。「來了很多次」和「拿到很多內容」是兩件事。
- 200 率低先檢討自己的轉址,不要先怪爬蟲。
- 爬蟲來過不等於 AI 會用你的內容。日誌能回答「有沒有來」和「有沒有拿到」,回答不了「有沒有被寫進回答裡」——那需要完全不同的量測,而那個量測本身也會壞掉(前車之鑑)。