如果一個小朋友明明答對了,系統卻有九成機率判他錯,你會先懷疑 AI,還是先懷疑自己的產品規格?
我以前以為,AI 最可怕的錯是「答錯」,後來才知道,答錯不可怕,真正可怕的是「很有自信地答錯,而且全隊都沒發現」
這篇講一個我們最近踩到的雷
Demo 很漂亮,然後呢
我們在做一個給國小高年級學生用的 AI 閱讀平台,其中一個功能是這樣:學生在紙本學習單上圈答案,拍照上傳,AI 自動把每一題讀出來、批改、給回饋
Demo 的時候很漂亮,每一題都讀得出來,題號、題目、答案都對得起來,大家看了都點頭
但前陣子我自己認真去翻資料,翻到背脊發涼
有一個「語詞應用」的題型(簡單講,就是給學生一組詞語,讓他選最適合題目的那一個),學生圈的答案,系統 91% 都判錯,51 課裡有 50 課中招
也就是說,不是某一張學習單出錯,是這個題型幾乎整批都錯
而且工程師平常用來自動檢查功能有沒有壞掉的那些測試,全都顯示通過,沒有任何錯誤訊息,沒有人發現
不是 AI 笨,是我們自己有兩份標準答案
怎麼會這樣?
學習單上印給學生看的,是一張「字母對詞語」的對照表,A 是「揚帆啟航」、B 是「股票」、C 是「節衣縮食」,學生圈 A,意思就是揚帆啟航
可是我們程式裡,不是拿這張表去對,而是拿另一份「按順序排好的詞語清單」去算,而那份清單的排序,跟學習單上印的根本不一樣
結果就是:學生圈 A(揚帆啟航),系統卻拿「股票」去比,一個圈對的小朋友,被判成錯的
我把前五個字母拉出來看,A 到 E 全錯,沒有一個對
關鍵不在 AI,在我們自己 — 我們有兩份「標準答案」,而且從來沒講清楚哪一份才算數
是說,我們自己都搞不清楚哪份是對的,怎麼能怪 AI 猜錯
真正讓我發涼的,是它為什麼沒被抓到
技術上的錯不難修,但 bug 本身不是最麻煩的地方
「哪一份才是真相」這個決定,其實有人在某次會議上講過,但它只活在會議記錄裡、活在某個人的腦袋裡、活在散落各處的文件裡,沒有任何一個地方,明確寫下「這個欄位,才是唯一的標準答案」
我認真數了一下,光是「這個功能該怎麼運作」的規格,就散在七個地方:產品文件、會議記錄、程式註解、待辦清單、聊天訊息⋯⋯
於是換另一個 AI 上場(我們開發時拿來幫忙寫程式的那個),它要動這段程式的時候,要嘛把七份全吞進去然後挑錯重點,要嘛漏掉關鍵的那一份
我們直覺以為,餵 AI 越多資料、context 越完整,它會越準,但實際剛好相反,當「真相」本身散落又互相矛盾,你餵得越多,它越容易很有自信地挑到錯的那一份
我做的事:逼自己把模糊講清楚
所以我做了一件事,把規格「模組化」,講白話就是三件事:
第一,每個功能只留一份「人話版」的真相文件,清楚寫明哪個欄位才算數、什麼能改、什麼不能改
第二,同一份真相,再寫成一個會自己跑的測試,讓電腦去檢查程式有沒有照規格做,對不上就亮紅燈,不是靠人去記
第三,AI 要動這段程式之前,先讀這一小份,而不是把整個產品文件吞下去
我拿那個 91% 的 bug 當第一個白老鼠,寫完第一份這樣的「規格測試」跑下去,它立刻把 51 課、91% 的錯誤量化出來
本來我們以為只是「某幾課怪怪的」,結果一跑,是系統性的,整片都中
真正的教訓,其實跟技術無關
AI 產品最大的風險,從來不是「AI 會犯錯」,而是「你的團隊從來沒把『什麼才是對的』講清楚,卻期待 AI 自己猜對」
而且這件事有時效性 — 半年後團隊換了一批人,那份「哪個才是真相」如果只活在某個人腦袋裡,新來的人,還有 AI,會一模一樣再踩一次
所以我們現在做的,與其說是「治理 AI」,不如說是「逼我們自己,把當初模糊帶過的決定,補寫清楚」
AI 比較像一面照妖鏡,它照出來的,其實是我們本來就沒想清楚的地方
你現在打開自己的產品文件,找得到那一份「唯一的標準答案」嗎?還是它其實只活在某個人的腦袋裡?
下次 AI 給你一個很有自信的答案,也許該先問的不是「AI 對不對」,而是「我們自己,到底講清楚了沒」
