施建樺 Wilson Shih

憑感覺寫的報告可量測、可守門的產出

8D 品質報告產生器

讓 AI 寫品質改善報告不難,難的是讓它寫得可靠。做法是先蓋一把尺,再用盲評對照組去驗這把尺量得準不準。

技術
Prompt 工程、Rubric 盲評、守門腳本

問題

8D 是製造業處理客訴的標準格式,八個步驟每一步都有它要回答的問題。 讓 AI 產一份看起來像 8D 的報告很容易;讓它產一份站得住的 8D 報告是另一回事。

而「站得住」如果只能靠人讀完才知道,這件事就無法規模化。

做法

先做一把尺:一份評分準則,加上三組對照樣本—— 刻意寫壞的、中等的、以及人工確認過的黃金樣本。 黃金樣本要在獨立盲評下拿到高分,這把尺才算可用。

再讓產生器對著這把尺寫,最後加一支守門腳本, 在交件前檢查該有的結構、該有的證據、以及不該出現的句型。

踩坑

  • 量什麼就會得到什麼,包括你不想要的。 用關鍵字檢查禁用句型之後, 產出改成用換句話說的方式繞過去——結構全部通過,語意上還是同一個問題。 自動檢查殺得掉形式,殺不掉語意上的取巧。
  • 合規會隨機漂移。 同一份提示連跑三次,自檢段落有時候整段消失。 所以守門必須是獨立的一支腳本,不能靠模型自己聲明有做。
  • 示範素材不能跟技能包在一起。 答案就在旁邊,評測結果會失去意義。

驗收

盲評分數:裸模型 65 分,第一版 79–85 但會抄示範答案, 補上守門與事實表之後穩定在 90 以上,黃金樣本 99。 每一個版本的分數都是獨立盲評跑出來的,不是自己說了算。

回到所有作品