比較 AI 工具的中文輸出,不能只問「讀起來順不順」。一段文句可能很流暢,卻混用地區詞、漏掉限制,甚至把推測寫成事實。較公平的方法是先固定任務與樣本,再用可觀察指標盲評,讓團隊能說明差異出在哪裡。
建立五項四級評分
| 面向 | 零分 | 四分 |
|---|---|---|
| 事實準確 | 關鍵資訊錯誤 | 全部可由材料核對 |
| 指令遵循 | 忽略格式或禁項 | 逐項符合限制 |
| 中文自然度 | 語序生硬且混用詞彙 | 符合指定地區與讀者 |
| 完整性 | 漏掉主要任務 | 涵蓋必要內容 |
| 可追溯性 | 無法找到依據 | 重要句均能定位來源 |
每個分數都要附一段具體證據,例如「摘要把五月誤寫成三月」,而不是「感覺普通」。研究與法規類任務可將正確性、可追溯性權重提高;社群草稿則可增加語氣和格式比重。
準備不偏向品牌的測試包
選三種素材:乾淨且完整的日常資料、含矛盾或缺漏的邊界資料、帶有表格或專有名詞的複雜資料。對所有工具使用完全相同的提示,開新對話並關閉可能影響結果的舊脈絡。保存日期、模型名稱、設定、原始輸出與耗時,但評審看到的版本先移除品牌。
兩人盲評與歧見處理
- 甲、乙分別評分,不先討論。
- 相差兩級以上的項目標為歧見。
- 回到原素材找可觀察證據。
- 若評分規則含糊,先補充範例,再重評全部工具。
不要只挑最好的一次。每個任務至少重跑數次,並把失敗輸出保留下來。此處的目的不是產生統計學保證,而是降低單次運氣和品牌偏見。
示例:把客服說明改寫成繁體中文
假設任務要求保留退款期限、不得新增承諾、使用臺灣常用詞,並輸出三段。評審先逐字核對期限,再查看「視頻/影片」「信息/資訊」等地區用詞,最後檢查段落數。若答案文筆漂亮卻把「工作日」改成「日曆日」,正確性應判低分,不能由自然度抵銷。
把結果用於決策
以任務權重計算總分,同時列出不可容許錯誤。高風險任務只要出現未標示的虛構來源,即使平均分高也應停止試行。完成評量後,回到 AI 工具選型框架檢查成本與資料控制;品質分數只回答「產出如何」,不能代替完整決策。
- 已固定提示與輸入。
- 已去除品牌再評分。
- 每分都有文字證據。
- 已記錄版本與日期。
- 已定義一票否決錯誤。
用校準題減少評審落差
正式評量前,先挑一份明顯合格、一份介於兩級之間和一份明顯失敗的輸出。兩位評審各自打分,再討論每個級別的可觀察證據。例如自然度三級代表只有少量不影響理解的地區用詞,二級則代表需要多處改寫。把討論結果寫進評分指南,之後再開始盲測。
若評審仍常出現差距,可能不是人太主觀,而是指標同時混入多個概念。可以把「完整且正確」拆成完整性與正確性,避免一個分數無法說明錯在哪裡。每次更新規則,都應用舊輸出回測,確保新版分數沒有悄悄改變原先門檻。
報告最低應包含什麼
報告列出任務說明、測試素材版本、提示文字、輸出、評分者、分數理由與不可容許錯誤。總分圖只能放在摘要,不能取代原始證據。若某功能未測或某方案無法取得,明確寫「未測」,不要以零分暗示能力一定較差。
完成後保留少量固定題作為回歸測試。工具改版、資料政策改變或團隊任務變更時重跑,才能知道結論是否仍有效。評分表的成果不是漂亮排名,而是一套讓新同事也能重現的判斷方式。