AI 最可怕的不是答錯,是很有自信地答錯 — 我們 91% 判錯卻全隊沒發現
AI 落地實戰·6 分鐘

AI 最可怕的不是答錯,是很有自信地答錯 — 我們 91% 判錯卻全隊沒發現

我們做了一個 AI 批改學生作答的功能,Demo 很漂亮,後來才發現它把 91% 的答案判錯,測試還全綠、沒人發現,問題不在 AI,在我們自己從來沒把『什麼才算對』講清楚

Y
Young Tsai

如果一個小朋友明明答對了,系統卻有九成機率判他錯,你會先懷疑 AI,還是先懷疑自己的產品規格?

我以前以為,AI 最可怕的錯是「答錯」,後來才知道,答錯不可怕,真正可怕的是「很有自信地答錯,而且全隊都沒發現」

這篇講一個我們最近踩到的雷


Demo 很漂亮,然後呢

我們在做一個給國小高年級學生用的 AI 閱讀平台,其中一個功能是這樣:學生在紙本學習單上圈答案,拍照上傳,AI 自動把每一題讀出來、批改、給回饋

Demo 的時候很漂亮,每一題都讀得出來,題號、題目、答案都對得起來,大家看了都點頭

但前陣子我自己認真去翻資料,翻到背脊發涼

有一個「語詞應用」的題型(簡單講,就是給學生一組詞語,讓他選最適合題目的那一個),學生圈的答案,系統 91% 都判錯,51 課裡有 50 課中招

也就是說,不是某一張學習單出錯,是這個題型幾乎整批都錯

而且工程師平常用來自動檢查功能有沒有壞掉的那些測試,全都顯示通過,沒有任何錯誤訊息,沒有人發現


不是 AI 笨,是我們自己有兩份標準答案

怎麼會這樣?

學習單上印給學生看的,是一張「字母對詞語」的對照表,A 是「揚帆啟航」、B 是「股票」、C 是「節衣縮食」,學生圈 A,意思就是揚帆啟航

可是我們程式裡,不是拿這張表去對,而是拿另一份「按順序排好的詞語清單」去算,而那份清單的排序,跟學習單上印的根本不一樣

結果就是:學生圈 A(揚帆啟航),系統卻拿「股票」去比,一個圈對的小朋友,被判成錯的

我把前五個字母拉出來看,A 到 E 全錯,沒有一個對

關鍵不在 AI,在我們自己 — 我們有兩份「標準答案」,而且從來沒講清楚哪一份才算數

是說,我們自己都搞不清楚哪份是對的,怎麼能怪 AI 猜錯


真正讓我發涼的,是它為什麼沒被抓到

技術上的錯不難修,但 bug 本身不是最麻煩的地方

「哪一份才是真相」這個決定,其實有人在某次會議上講過,但它只活在會議記錄裡、活在某個人的腦袋裡、活在散落各處的文件裡,沒有任何一個地方,明確寫下「這個欄位,才是唯一的標準答案」

我認真數了一下,光是「這個功能該怎麼運作」的規格,就散在七個地方:產品文件、會議記錄、程式註解、待辦清單、聊天訊息⋯⋯

於是換另一個 AI 上場(我們開發時拿來幫忙寫程式的那個),它要動這段程式的時候,要嘛把七份全吞進去然後挑錯重點,要嘛漏掉關鍵的那一份

我們直覺以為,餵 AI 越多資料、context 越完整,它會越準,但實際剛好相反,當「真相」本身散落又互相矛盾,你餵得越多,它越容易很有自信地挑到錯的那一份


我做的事:逼自己把模糊講清楚

所以我做了一件事,把規格「模組化」,講白話就是三件事:

第一,每個功能只留一份「人話版」的真相文件,清楚寫明哪個欄位才算數、什麼能改、什麼不能改

第二,同一份真相,再寫成一個會自己跑的測試,讓電腦去檢查程式有沒有照規格做,對不上就亮紅燈,不是靠人去記

第三,AI 要動這段程式之前,先讀這一小份,而不是把整個產品文件吞下去

我拿那個 91% 的 bug 當第一個白老鼠,寫完第一份這樣的「規格測試」跑下去,它立刻把 51 課、91% 的錯誤量化出來

本來我們以為只是「某幾課怪怪的」,結果一跑,是系統性的,整片都中


真正的教訓,其實跟技術無關

AI 產品最大的風險,從來不是「AI 會犯錯」,而是「你的團隊從來沒把『什麼才是對的』講清楚,卻期待 AI 自己猜對」

而且這件事有時效性 — 半年後團隊換了一批人,那份「哪個才是真相」如果只活在某個人腦袋裡,新來的人,還有 AI,會一模一樣再踩一次

所以我們現在做的,與其說是「治理 AI」,不如說是「逼我們自己,把當初模糊帶過的決定,補寫清楚」

AI 比較像一面照妖鏡,它照出來的,其實是我們本來就沒想清楚的地方


你現在打開自己的產品文件,找得到那一份「唯一的標準答案」嗎?還是它其實只活在某個人的腦袋裡?

下次 AI 給你一個很有自信的答案,也許該先問的不是「AI 對不對」,而是「我們自己,到底講清楚了沒」

AI產品規格教育科技踩雷