為什麼你的 AI 應用總是「差不多對」?聊聊信賴度校準

上線一個 AI 功能時,最常見的坑不是模型不聰明,而是它明明 80% 的情況靠譜,你卻不知道剩下 20% 什麼時候會翻車。今天講一個被低估的工程概念:信賴度校準(calibration)。

專屬插圖
為什麼你的 AI 應用總是「差不多對」?聊聊信賴度校準

為什麼你的 AI 應用總是「差不多對」?聊聊信賴度校準

上線一個 AI 功能時,最常見的坑不是模型不聰明,而是它明明 80% 的情況靠譜,你卻不知道剩下 20% 什麼時候會翻車。今天講一個被低估的工程概念:信賴度校準(calibration)。

模型說的「把握很大」,到底有多大

大型語言模型生成的文字本身不帶機率標籤,但你可以通过幾條路徑拿到可信度訊號:

1. **logprobs**:讓模型回傳每個 token 的對數機率。答案一致性高時,關鍵 token 的機率分佈往往集中。

2. **self-consistency**:同一個問題問 5 次,答案一致率本身就是訊號。三次以上一致,才值得展示給使用者;意見分裂,就該走人工兜底。

3. **驗證器交叉檢查**:用另一個更便宜的模型,或是規則引擎(數值範圍、正規表示式、知識庫匹配)去複核主模型的輸出。

以一個工單分類功能為例。模型給每張工單打一個類別加自評分。上線後你不需要只看準確率,而是畫一張圖:橫軸是模型說的信賴度區間(比如 0.8-0.9),縱軸是該區間裡的實際正確率。理想情況是兩條線重疊——說 0.85 的,就真的對 85%。如果模型在 0.8 區間實際只對 60%,說明它過度自信,你在它最「自信」的地方栽的跟頭最多。

三個能直接上手的做法

**第一,設定信賴度閾值,而不是全域信任。** 閾值 0.8 以上直接入庫,0.5-0.8 進人工審核佇列,0.5 以下打回重跑或拒答。閾值不用拍腦袋:拿 200 筆歷史標註資料,把閾值從 0.5 到 0.95 掃一遍,畫出「自動化比例 vs 錯誤率」曲線,選業務能接受的那個拐點。

**第二,高信賴也要抽檢。** 每週從自動通過的樣本裡隨機抽 3%,人工複核。這一步專門捕捉「系統性自信的錯誤」——某類新出現的工單讓模型全給了 0.9,抽檢能在一週內發現,等客訴爆發再發現就晚了。

**第三,把校準資料留檔。** 每次評估記三樣:模型版本、信賴度、最終對錯。攢夠幾千筆,你就有了自己的校準曲線,換模型、改 prompt、調溫度時,一眼能看出這次改動讓模型變得更誠實還是更膨脹。

什麼時候該放棄校準,直接換方案

如果某類任務的錯誤成本極高(醫療判斷、資金操作),信賴度閾值只是止血帶,不是根治。這時正確的做法是收窄任務邊界:不追求一個模型覆蓋所有場景,而是用規則先分診,模型只處理其中 60% 能穩定做好的部分,其餘明確轉人工。承認模型的邊界,比調參讓「85% 變 88%」回報大得多。

一個具體的落地清單

如果你下週就想動手,按這個順序做:

1. **先埋點,再優化。** 在生產日誌裡記下每次請求的模型輸出和對應的信賴度訊號(一致率或驗證器結果)。沒有這層資料,後面所有調參都是猜。

2. **攢 200 筆標註。** 讓業務方按「對/錯」給最近兩週的線上樣本打标,成本大約半天。

3. **畫第一張校準圖。** 分成 10 個信賴度桶,各算實際正確率,肉眼就能看出模型是過度自信(曲線偏右)還是過度保守(偏左)。

4. **設閾值、開抽檢。** 按業務錯誤預算定閾值,抽檢 3% 進審核佇列,週報裡只看兩個數:自動通過率、抽檢錯誤率。

整套流程不需要 ML 平台,一張表格加幾個腳本就夠。校準的價值不在演算法,在於它把「模型靠不靠譜」從感覺變成了每週能複查的指標。願意花這一週時間的團隊,AI 功能才能從 demo 走向生產。

留言區

歡迎分享你的想法!

發表留言

0/500

載入留言中…