kirin.ceo

home / notes / comparing across a ruler change

Note

換了尺之後,前後的數字還能比嗎?

我換掉了量測用的模型。我自己站上的數字前後一樣。這件事比數字變動更容易讓人誤判。

日期
2026-08-27 更換量測模型
資料集
shell.fans 自有站台的 AI 能見度探測,每平台每次 22 題
方法
模型更換前後各三次執行的比較
限制
樣本小(22 題)。本文的結論是關於「可比性」的推理,不是關於任何一個模型表現優劣的結論

情況

前一篇寫到我的探測有一個平台整批失敗,原因是所用的模型退役了。修復方式是換成另一個模型。

換完之後我做的第一件事,是去看數字有沒有跳動。

shell.fans 自有站台,模型更換前後(每次 22 題)
日期OpenAI 側使用的模型提及品牌引用官網
2026-08-12gpt-4o-mini-search-preview4 / 223 / 22
2026-08-17gpt-4o-mini-search-preview4 / 223 / 22
2026-08-24(整批失敗)
2026-08-31gpt-5-search-api4 / 223 / 22
2026-09-07gpt-5-search-api4 / 223 / 22

一模一樣。換尺前後,我的網站在這組題目上的表現完全沒有變動。我第一個念頭是「太好了,可比性沒問題,趨勢線可以接起來」。

然後我去看了是哪 4 題

這一步本來應該在下結論之前做。我做的時候已經打算寫「量測可比」了。

2026-09-07,shell.fans 自有站台,22 題的完整結果。提及數兩個平台完全相同;引用數 Anthropic 側 2、OpenAI 側 3
問題類型題數提及品牌引用官網
問句裡含品牌名
「ShellFans 是什麼公司?」之類
44 / 42–3 / 4
問句裡不含品牌名
「台灣做 AEO 的公司推薦」之類
180 / 180 / 18

命中的永遠是同樣那 4 題,而那 4 題的共同點是問句裡已經寫出了我的名字

所以那個「穩定」根本不是量測穩定。4/22 這個數字完全由「有幾題直接問我」決定,而題組是固定的,所以它當然不會動。換模型不會改變它,換網站內容也不太會改變它——它量的不是 AI 對我的認識,是我自己出的題目。

為什麼這不代表兩把尺一樣

一、這個指標對我想量的東西沒有解析度

我想知道的是「AI 在不被提示的情況下會不會講到我」。而我的 22 題裡有 4 題直接把答案寫在問題裡,18 題的結果全部是 0。

一個永遠回傳 4 的量測,跟兩把尺等不等價無關——它對兩把尺都不敏感。穩定不是精確,可能只是遲鈍。

二、真正該看的數字是 0 / 18

把品牌題拿掉之後,兩個平台、兩個模型、五次執行,非品牌題的提及率與引用率都是 0。這個 0 才是有資訊量的:它說明在「台灣做 AEO 的公司推薦」這類問題上,AI 完全不會想到我。

而 0 也有 0 的問題——它同樣沒有解析度。從 0 到 0,我看不出任何進展,直到某一次跳成 1。在那之前,所有努力在這個指標上都長得一模一樣。

三、同一時期我還改了別的東西

題組數量在這段期間調整過,網站內容也在改。就算數字有變動,我也無法把變動歸因到單一原因。這是自己既是實驗者又是被量測對象時的固有問題。

我實際採取的做法

  1. 在資料裡標記換尺的時間點,而不是只寫在筆記裡。任何跨越 2026-08-27 的比較,都要顯示這條線。
  2. 不把跨越換尺點的兩段畫成同一條趨勢線。畫成兩段,中間斷開。這在視覺上很醜,但醜是正確的——它們本來就不是同一個量測。
  3. 把「換了什麼」寫進每一筆觀測,而不是依賴事後回憶或設定檔的歷史版本。

這件事的一般形式

任何自動化量測都會遇到換尺的問題,只是 AI 相關的量測遇到得特別頻繁——模型改版、退役、行為調整的節奏比傳統 API 快得多。

我現在的預設立場是:只要量測條件變過,就假設前後不可比,除非我能說出為什麼可比。反過來的預設(假設可比,除非證明不可比)會讓錯誤的趨勢線活很久,因為沒有人會去挑戰一條看起來很順的線。

但這次真正的收穫不是換尺。是我在檢查可比性的時候,意外發現那個指標本來就沒在量我以為它在量的東西。如果那天數字有跳動,我大概會忙著解釋跳動的原因,而不會去拆開看那 4 題是哪 4 題。

一個混在一起的比率(4/22)會把兩個性質完全不同的子集合藏起來。拆開之後是 4/4 和 0/18,兩個都很清楚,合起來的 18% 什麼也沒說。這跟前一篇的問題是同一個形狀:摘要會吃掉訊號。