這個 AI 有沒有真正解決問題,而且能不能被信任、被驗證、被持續使用?
這其實也符合目前 AI 評估逐漸從「模型能力」走向「整體系統可信度」的方向。NIST 的 AI RMF 就把有效性、可靠性、安全、資安、透明、可解釋、隱私、公平等列為可信任 AI 的核心面向。
我會特別看 8 項能力
| 評審最該看 | 核心問題 |
|---|---|
| 1. 問題定義能力 | 為什麼一定要用 AI?不用 AI 行不行? |
| 2. 資料能力 | 資料從哪裡來?品質如何?是否足以支撐 AI? |
| 3. AI 實際能力 | AI 到底做了什麼?不是把「自動化」包裝成 AI |
| 4. 成效驗證能力 | 怎麼證明比原來的方法好?有沒有量化指標? |
| 5. 幻覺與錯誤控制 | AI 答錯怎麼辦?能不能辨識自己不知道? |
| 6. 人機協作能力 | 哪些事情交給 AI?哪些一定要人判斷? |
| 7. 資安與治理能力 | 個資、機敏資料、權限、模型安全、稽核怎麼處理? |
| 8. 落地與持續運作能力 | 做完 PoC 之後,誰使用、誰維護、誰負責? |
其中,我認為**「成效驗證」會越來越重要**。NIST 近期也特別發展 TEVV(Test, Evaluation, Verification and Validation)框架,用來評估 AI 在真實環境中的影響與結果,而不是只看展示效果。
如果我是評審,我會追問 5 個問題
① 你到底解決了什麼問題?
不要先告訴我:
「我們導入生成式 AI、大語言模型、Agent……」
先告訴我:
原來的痛點是什麼?
例如:
「公務人員每天花 3 小時整理資料。」
那麼 AI 專案應該回答:
能不能從 3 小時降低到 30 分鐘?
這才是「AI 能力」。
② 為什麼非 AI 不可?
這個問題非常重要。
如果只是:
OCR → 分類 → 搜尋 → 統計 → 報表
其實不一定需要 AI。
真正好的 AI 案件,應該能說明:
傳統資訊系統做不到的地方,AI 解決了什麼?
這也是我認為評審最容易被「AI 名詞」帶偏的地方。
③ AI 答錯怎麼辦?
這是我會特別關注的。
因為生成式 AI 最大的問題之一,不是「不會回答」,而是:
它可能很有自信地回答錯誤答案。
NIST 的生成式 AI 風險框架也特別談到 confabulation(生成錯誤資訊)以及人員過度依賴 AI 的 automation bias。
所以評審可以直接問:
「你們的 AI 如果答錯,誰會發現?」
再問:
「發現之前,這個錯誤會造成什麼影響?」
這兩個問題,往往比問「你們用什麼模型?」更有價值。
④ 你怎麼證明它有效?
不能只展示:
「看!AI 可以產生一份漂亮的報告。」
應該要求:
導入前 → 導入後
例如:
- 處理時間:120 分鐘 → 25 分鐘
- 人工錯誤率:8% → 2%
- 查詢時間:30 分鐘 → 3 分鐘
- 人工案件量:100 件 → 300 件
- 使用者滿意度:70% → 90%
更重要的是要說明:
這些數字怎麼測出來的?
NIST 也強調 AI 的 validity、accuracy、robustness、reliability 應透過測試與持續監測來確認。
⑤ AI 出問題,誰負責?
這其實是政府 AI 專案非常重要的一題。
AI 可以協助:
搜尋 → 分析 → 建議 → 預測 → 產生內容
但最後的:
決策 → 責任 → 授權
不能模糊。
所以我會問:
「AI 的建議與最後決策之間,人的角色在哪裡?」
這就是 Human-in-the-loop。
我會把 AI 評審能力濃縮成一句話
不是看 AI 有多會,而是看「問題、資料、模型、驗證、風險、人」能不能連成一條完整的鏈。
甚至可以形成一個我很適合拿來做你「AI 評審委員」課程的六層模型:
問題 → 資料 → AI → 驗證 → 治理 → 價值
其中最容易被忽略的是兩端:
前端的「問題」
以及
後端的「價值」。
中間即使模型再漂亮,如果問題選錯、資料不足、沒有驗證、沒有人負責,最後仍然只是一次漂亮的 AI 展示。
而你過去常提到的那個觀點,我覺得其實非常適合當成評審的核心原則:
「AI 不是目的,資料也不是目的;真正的目的,是利用資料與 AI 解決問題。」
再往前一步,可以變成:
好的 AI 專案,不是把 AI 放進工作裡,而是重新思考:這個工作為什麼要這樣做。
這會比單純評估「模型準確率多少、用了哪個 LLM」更接近真正的AI 評審能力。