- 情境
- prompt 要求模型「evidence 直接從描述複製,不改寫、不總結」,但小模型不一定聽話。而「模型說了算」不能當結論。
- 做法
- 程式機械地驗證引文是否真的逐字出現在職缺原文,結果寫進資料庫欄位(1 逐字/0 找不到/NULL 不適用),報告對 0 標記警示。比對規則刻意設計:去掉全形空白、轉小寫、剝掉引號才比;引文切成多片段時全部片段都要找到才算逐字。
- 結果
- 實測 Lv.1 以上的 1,434 筆判定中有 537 筆引文非原文,比例 37.4%。這個數字同時是我不對外引用等級統計的理由:我自己設的門檻是 Cohen's κ 未過 0.61 前不引用,而金標準至今還是 0 筆。
- 邊界
- 這個檢查的能力邊界要主動說出來:0 是「很可能被改寫或編造」,而 1 也只代表「字面存在」,不保證引用的段落真的支持該判定。
NOTE · · 應用於 JobRadar 職缺整理工具
把模型的引文變成可機械檢查的欄位
prompt 要求逐字引用,小模型不一定聽話。量了 1,434 筆,37.4% 的引文不是原文。
看這篇筆記應用的作品
這篇筆記的實際應用

JobRadar 職缺整理工具
每天整理求職平台的新職缺,協助比較工作要求與 AI 技能需求。
看個案研究 →