AI 有沒有真正解決問題

 

這個 AI 有沒有真正解決問題,而且能不能被信任、被驗證、被持續使用?

這其實也符合目前 AI 評估逐漸從「模型能力」走向「整體系統可信度」的方向。NIST 的 AI RMF 就把有效性、可靠性、安全、資安、透明、可解釋、隱私、公平等列為可信任 AI 的核心面向。

我會特別看 8 項能力

評審最該看 核心問題
1. 問題定義能力 為什麼一定要用 AI?不用 AI 行不行?
2. 資料能力 資料從哪裡來?品質如何?是否足以支撐 AI?
3. AI 實際能力 AI 到底做了什麼?不是把「自動化」包裝成 AI
4. 成效驗證能力 怎麼證明比原來的方法好?有沒有量化指標?
5. 幻覺與錯誤控制 AI 答錯怎麼辦?能不能辨識自己不知道?
6. 人機協作能力 哪些事情交給 AI?哪些一定要人判斷?
7. 資安與治理能力 個資、機敏資料、權限、模型安全、稽核怎麼處理?
8. 落地與持續運作能力 做完 PoC 之後,誰使用、誰維護、誰負責?

其中,我認為**「成效驗證」會越來越重要**。NIST 近期也特別發展 TEVV(Test, Evaluation, Verification and Validation)框架,用來評估 AI 在真實環境中的影響與結果,而不是只看展示效果。


如果我是評審,我會追問 5 個問題

① 你到底解決了什麼問題?

不要先告訴我:

「我們導入生成式 AI、大語言模型、Agent……」

先告訴我:

原來的痛點是什麼?

例如:

「公務人員每天花 3 小時整理資料。」

那麼 AI 專案應該回答:

能不能從 3 小時降低到 30 分鐘?

這才是「AI 能力」。


② 為什麼非 AI 不可?

這個問題非常重要。

如果只是:

OCR → 分類 → 搜尋 → 統計 → 報表

其實不一定需要 AI。

真正好的 AI 案件,應該能說明:

傳統資訊系統做不到的地方,AI 解決了什麼?

這也是我認為評審最容易被「AI 名詞」帶偏的地方。


③ AI 答錯怎麼辦?

這是我會特別關注的。

因為生成式 AI 最大的問題之一,不是「不會回答」,而是:

它可能很有自信地回答錯誤答案。

NIST 的生成式 AI 風險框架也特別談到 confabulation(生成錯誤資訊)以及人員過度依賴 AI 的 automation bias。

所以評審可以直接問:

「你們的 AI 如果答錯,誰會發現?」

再問:

「發現之前,這個錯誤會造成什麼影響?」

這兩個問題,往往比問「你們用什麼模型?」更有價值。


④ 你怎麼證明它有效?

不能只展示:

「看!AI 可以產生一份漂亮的報告。」

應該要求:

導入前 → 導入後

例如:

  • 處理時間:120 分鐘 → 25 分鐘
  • 人工錯誤率:8% → 2%
  • 查詢時間:30 分鐘 → 3 分鐘
  • 人工案件量:100 件 → 300 件
  • 使用者滿意度:70% → 90%

更重要的是要說明:

這些數字怎麼測出來的?

NIST 也強調 AI 的 validity、accuracy、robustness、reliability 應透過測試與持續監測來確認。


⑤ AI 出問題,誰負責?

這其實是政府 AI 專案非常重要的一題。

AI 可以協助:

搜尋 → 分析 → 建議 → 預測 → 產生內容

但最後的:

決策 → 責任 → 授權

不能模糊。

所以我會問:

「AI 的建議與最後決策之間,人的角色在哪裡?」

這就是 Human-in-the-loop。


我會把 AI 評審能力濃縮成一句話

不是看 AI 有多會,而是看「問題、資料、模型、驗證、風險、人」能不能連成一條完整的鏈。

甚至可以形成一個我很適合拿來做你「AI 評審委員」課程的六層模型:

問題 → 資料 → AI → 驗證 → 治理 → 價值

其中最容易被忽略的是兩端:

前端的「問題」
以及
後端的「價值」

中間即使模型再漂亮,如果問題選錯、資料不足、沒有驗證、沒有人負責,最後仍然只是一次漂亮的 AI 展示。

而你過去常提到的那個觀點,我覺得其實非常適合當成評審的核心原則:

「AI 不是目的,資料也不是目的;真正的目的,是利用資料與 AI 解決問題。」

再往前一步,可以變成:

好的 AI 專案,不是把 AI 放進工作裡,而是重新思考:這個工作為什麼要這樣做。

這會比單純評估「模型準確率多少、用了哪個 LLM」更接近真正的AI 評審能力