Leadership - 2026-10-09 - 6 分鐘閱讀

第一個 AI 試點:三種部門流程怎麼選

用客服、業務與營運三個合成情境選第一個 AI 試點:確認資料範圍與人工接手,附可複製評估表,並把核對與返工算進人工基準。

GovernanceWorkflowSMB

第一個 AI 試點,最好挑一件結果查得到對錯、錯了有人接手的小工作。先把「客服、業務、營運都可以用 AI」拆成具體任務,選案才有依據。

客服可能要找一段可引用的退貨政策;業務可能要把拜訪紀錄整理成待辦;營運可能要找出表單缺欄。三者都能演示生成結果,但能演示不代表適合先導入。選哪一個,要看來源能不能用,以及結果錯了由誰確認、怎麼收回。

我常看到的情況是,導入的起點比選流程更早。老闆想導入 AI,卻不確定從哪裡開始;員工則常分成三種:已經自己付錢在用的、等公司買帳號的,以及覺得 AI 幫不上忙的。這三種人對試點的期待不同,也會影響第一步該找誰、從哪些資料開始。

下面是一套建議的選案方法,附三個合成情境。人物、資料與判斷都是為了說明方法而設定,沒有企業實測結果,也不承諾節省比例。

先過必要條件,再比較候選

不要先給每個部門一個加權總分。總分很容易掩蓋一個還沒補好的缺口:例如結果很好看,卻沒有人負責核對。

每個候選先寫清楚五件事:

  1. 工作邊界。 一次輸入是什麼,預期交出什麼?這件事是否反覆發生?「協助客服」太廣;「根據核准政策,產出一則待核對的退貨回覆草稿」才是可測範圍。
  2. 資料與來源。 測試能用哪些資料、允許用到哪裡?誰負責政策的版本與適用範圍?未確認的真實客戶資料先不要放進測試;可以先準備合成資料。
  3. 責任與接手。 誰檢查輸出,誰決定送出或執行?來源缺答、資料不全或遇到例外時,交給誰處理?
  4. 可檢查的結果。 怎樣算對,怎樣算需要返工?客服草稿要能對回政策,業務待辦要能對回紀錄,表單缺欄要能對回欄位規則。
  5. 可撤回的動作。 起步範圍能否停在草稿、建議或待確認清單?外寄、承諾或寫入正式系統,都要另設人工確認。

這五項是本文提出的最低檢查條件,並非經企業樣本驗證的通用標準。具體流程若涉及不同的錯誤代價,仍要加上自己的條件。

資料範圍尚未確認,可以先研究或用合成資料演示;這不等於已經能開始真實流程試點。如果回答的來源還不清楚,先補來源;換一個更強的模型也補不上這個缺口。

第一批試用者,先找誰

我會先找已經自己付錢在用 AI 的人。試點從他們開始,不必先花力氣說服人去用。

但這個選擇有兩個代價,要先講清楚。

第一,他們試得順,不代表等帳號的人和覺得幫不上忙的人也會順。試點結果只能說明這群人的情況。

第二,自己付費的帳號不在公司管理範圍內。試點開始前,先問清楚他們已經把哪些公司資料放進個人工具;試點本身則改用公司確認過的帳號與資料範圍。

三個部門,放進同一張表

以下案例全部是合成示例。表中的負責人、來源與可用範圍是設定條件;沒有任何實際工時或成功率。

比較項目客服政策查詢業務拜訪整理營運表單核對
小任務根據核准政策,寫回覆草稿將拜訪紀錄整理成待辦草稿找出缺欄與欄位矛盾
輸入/輸出合成政策與問題 → 附來源、版本的草稿合成紀錄 → 待辦與待確認欄位合成表單 → 異常清單
資料與來源狀態合成資料可用,已指定政策負責人;政策有版本及適用範圍真實客戶資料的可用範圍及負責人尚未確認合成表單可用,欄位規則明確
核對與接手人工對回政策;缺答、版本不清、例外時接手人工對回紀錄;不替客戶補承諾或推定待辦人工核對異常;無法用規則判定的項目另處理
可撤回範圍只產草稿,人工核准後才送出只產草稿,不自動寄信或更新客戶系統只列異常,不直接改原資料
固定規則替代可先比較政策搜尋加人工寫稿可先比較固定筆記模板必填、格式與欄位關係先用規則檢查
人工基準未知,待記錄未知,待記錄未知,待記錄
本例下一步選為小範圍草稿試點先補兩項缺口;目前只做合成演示先量規則檢查與人工核對;有非結構例外再評估模型

本例選客服,是因為設定中已有可核對的來源、負責人及草稿邊界。這不是「企業應該先做客服」的結論。換成政策版本混亂、沒有人接手的客服流程,選案結果也要跟著改。

業務在本例暫緩,是因為資料範圍與責任還沒確認,並不是這類工作不能用 AI。營運的資料與欄位規則也已具備,暫不選它是因為另一個問題:固定規則可能已經足夠。先看現有規則能處理到哪裡,再判斷模型處理非結構例外是否值得。

若三個候選都缺必要條件,這次選案的結果可以是「先補缺口」。不必為了啟動試點而選出一個贏家。

試點前,先留下人工做法的基準

三個案例的人工基準都寫未知,因為示例不能代替測量。開始真實流程試點前,記錄同一範圍工作的人工做法,再與輔助後的做法比較。

每筆至少保留工作類型、輸入範圍、完成標準、操作者與核對者,並把下面四項分開記錄。

  • 人工基準的實際工作時間與結果。
  • 輔助後的資料準備、操作、核對、返工與該筆維護時間。
  • 模型等待時間,以及這段等待是否真的占用人的工作時間。
  • 一次性的設定、共用資料整理與工具維護。另列總投入;若要分攤到每筆,說明分攤方法,避免重複計入。

比較要包括已放棄或需要人工接手的工作,不能只挑成功草稿。品質也要一起看完成標準是否和原本相同,以及錯誤有沒有拖到更晚、才被別人發現。如果快了,卻把核對工作推給其他同事,還不能算省工。

同一人先做人工、再做輔助版本,可能因為已看過輸入而更快。不同難度的工作也不能直接混算。可行時使用可比工作並交錯順序,保留樣本數與差異;小樣本的結果只支持該次試點,不直接推算全年 ROI。

驗收,要包括不回答與交接

對客服草稿而言,驗收至少包括:引用能對回正確政策與版本、適用範圍正確、缺答時不補造規定,以及需要人工處理時交出明確原因。先列正常、缺資訊、版本更新、例外及不適用範圍的案例,再保留實際輸出與核對結果。

這裡是在設計檢查條件,尚未執行模型測試。即使模型能通過合成測試,也不能直接當成真實流程成效。合成測試適合找明顯缺口;真實試點還要看資料、工作分布與人工核對成本。

Anthropic 的 agent 評測說明區分了測試任務(task)、一次試跑(trial)、評分與結果(outcome)。其中 outcome 指試跑結束時環境的實際狀態,例如資料庫裡真的有那筆機票預訂;agent 在對話裡說「已訂好」不算。草稿試點不是 agent 任務,但可以借用同一個提醒。寫出一份回覆只是輸出;通過核對、能交給下一位處理,才符合事先約定的完成條件。這篇來源並未驗證本文的三部門選案方法。

下面四條停止條件,第一條最優先。碰到任何一條,都先停下該範圍再查原因。

  1. 資料越界。 資料用到不該用的地方,例如試點碰到超出已確認範圍的資料。
  2. 沒有來源的肯定答覆。 預定範圍要求回答有來源支持,卻出現來源撐不住的肯定答覆。
  3. 繞過人工核准。 輸出沒經過核准就送出或執行。
  4. 品質不達標。 達不到事先約定的品質條件時,不靠更快的時間抵銷。

把評估表填成一頁

每個流程填一張,未知就寫未知。這張表用來暴露缺口與記錄選案理由,不算加權總分。

欄位要填的內容
流程與範圍部門、反覆發生的小任務、這次不處理的範圍
輸入/輸出資料形式、預期成果、完成標準
資料可用範圍合成/真實資料;允許用途與尚未確認項
員工現有使用誰已自費使用、用哪些工具、放過哪些公司資料
來源負責人版本、適用範圍、更新責任;誰核准輸出、誰處理例外
人工基準實際分鐘、樣本數;還沒量就寫未知
輸出核對判定正確與返工的方法
錯誤與接手缺答、例外、錯誤的處理與負責人
可撤回動作草稿如何撤回;執行前的人工確認
固定規則替代搜尋、模板、公式或規則能否先完成
未補條件尚缺的資料、責任、基準或測試
試點範圍與理由這次做什麼、為什麼先做、何時停止(可引用上面四條停止條件,或自訂)
狀態研究/合成演示/真實試點;是否已有結果

若資料可用範圍難以確認,可以接著看企業 AI 導入的資料與檢索。若草稿下一步會變成外寄或寫入,先對照寫入、外寄與人工核准補好動作邊界。

比起馬上找一個流程開始做,先把這張表填完更重要。你可以把三個候選填進這張表,再檢查選案理由是否仍然成立。若使用後願意分享,最有用的回報是:哪個必要條件卡住了、哪種例外改變了選案,以及實際核對工作是否符合原先預期。請只提供可公開、去識別的描述,不必附真實客戶資料。

正在做類似的東西?

我協助團隊交付 AI 原生系統——架構、可治理的自主性,以及支撐它們的證據紀律。一次對話就能看出合不合適。

洽談合作