Leadership - 2026-10-09 - 6 分鐘閱讀
第一個 AI 試點:三種部門流程怎麼選
用客服、業務與營運三個合成情境選第一個 AI 試點:確認資料範圍與人工接手,附可複製評估表,並把核對與返工算進人工基準。
第一個 AI 試點,最好挑一件結果查得到對錯、錯了有人接手的小工作。先把「客服、業務、營運都可以用 AI」拆成具體任務,選案才有依據。
客服可能要找一段可引用的退貨政策;業務可能要把拜訪紀錄整理成待辦;營運可能要找出表單缺欄。三者都能演示生成結果,但能演示不代表適合先導入。選哪一個,要看來源能不能用,以及結果錯了由誰確認、怎麼收回。
我常看到的情況是,導入的起點比選流程更早。老闆想導入 AI,卻不確定從哪裡開始;員工則常分成三種:已經自己付錢在用的、等公司買帳號的,以及覺得 AI 幫不上忙的。這三種人對試點的期待不同,也會影響第一步該找誰、從哪些資料開始。
下面是一套建議的選案方法,附三個合成情境。人物、資料與判斷都是為了說明方法而設定,沒有企業實測結果,也不承諾節省比例。
先過必要條件,再比較候選
不要先給每個部門一個加權總分。總分很容易掩蓋一個還沒補好的缺口:例如結果很好看,卻沒有人負責核對。
每個候選先寫清楚五件事:
- 工作邊界。 一次輸入是什麼,預期交出什麼?這件事是否反覆發生?「協助客服」太廣;「根據核准政策,產出一則待核對的退貨回覆草稿」才是可測範圍。
- 資料與來源。 測試能用哪些資料、允許用到哪裡?誰負責政策的版本與適用範圍?未確認的真實客戶資料先不要放進測試;可以先準備合成資料。
- 責任與接手。 誰檢查輸出,誰決定送出或執行?來源缺答、資料不全或遇到例外時,交給誰處理?
- 可檢查的結果。 怎樣算對,怎樣算需要返工?客服草稿要能對回政策,業務待辦要能對回紀錄,表單缺欄要能對回欄位規則。
- 可撤回的動作。 起步範圍能否停在草稿、建議或待確認清單?外寄、承諾或寫入正式系統,都要另設人工確認。
這五項是本文提出的最低檢查條件,並非經企業樣本驗證的通用標準。具體流程若涉及不同的錯誤代價,仍要加上自己的條件。
資料範圍尚未確認,可以先研究或用合成資料演示;這不等於已經能開始真實流程試點。如果回答的來源還不清楚,先補來源;換一個更強的模型也補不上這個缺口。
第一批試用者,先找誰
我會先找已經自己付錢在用 AI 的人。試點從他們開始,不必先花力氣說服人去用。
但這個選擇有兩個代價,要先講清楚。
第一,他們試得順,不代表等帳號的人和覺得幫不上忙的人也會順。試點結果只能說明這群人的情況。
第二,自己付費的帳號不在公司管理範圍內。試點開始前,先問清楚他們已經把哪些公司資料放進個人工具;試點本身則改用公司確認過的帳號與資料範圍。
三個部門,放進同一張表
以下案例全部是合成示例。表中的負責人、來源與可用範圍是設定條件;沒有任何實際工時或成功率。
| 比較項目 | 客服政策查詢 | 業務拜訪整理 | 營運表單核對 |
|---|---|---|---|
| 小任務 | 根據核准政策,寫回覆草稿 | 將拜訪紀錄整理成待辦草稿 | 找出缺欄與欄位矛盾 |
| 輸入/輸出 | 合成政策與問題 → 附來源、版本的草稿 | 合成紀錄 → 待辦與待確認欄位 | 合成表單 → 異常清單 |
| 資料與來源狀態 | 合成資料可用,已指定政策負責人;政策有版本及適用範圍 | 真實客戶資料的可用範圍及負責人尚未確認 | 合成表單可用,欄位規則明確 |
| 核對與接手 | 人工對回政策;缺答、版本不清、例外時接手 | 人工對回紀錄;不替客戶補承諾或推定待辦 | 人工核對異常;無法用規則判定的項目另處理 |
| 可撤回範圍 | 只產草稿,人工核准後才送出 | 只產草稿,不自動寄信或更新客戶系統 | 只列異常,不直接改原資料 |
| 固定規則替代 | 可先比較政策搜尋加人工寫稿 | 可先比較固定筆記模板 | 必填、格式與欄位關係先用規則檢查 |
| 人工基準 | 未知,待記錄 | 未知,待記錄 | 未知,待記錄 |
| 本例下一步 | 選為小範圍草稿試點 | 先補兩項缺口;目前只做合成演示 | 先量規則檢查與人工核對;有非結構例外再評估模型 |
本例選客服,是因為設定中已有可核對的來源、負責人及草稿邊界。這不是「企業應該先做客服」的結論。換成政策版本混亂、沒有人接手的客服流程,選案結果也要跟著改。
業務在本例暫緩,是因為資料範圍與責任還沒確認,並不是這類工作不能用 AI。營運的資料與欄位規則也已具備,暫不選它是因為另一個問題:固定規則可能已經足夠。先看現有規則能處理到哪裡,再判斷模型處理非結構例外是否值得。
若三個候選都缺必要條件,這次選案的結果可以是「先補缺口」。不必為了啟動試點而選出一個贏家。
試點前,先留下人工做法的基準
三個案例的人工基準都寫未知,因為示例不能代替測量。開始真實流程試點前,記錄同一範圍工作的人工做法,再與輔助後的做法比較。
每筆至少保留工作類型、輸入範圍、完成標準、操作者與核對者,並把下面四項分開記錄。
- 人工基準的實際工作時間與結果。
- 輔助後的資料準備、操作、核對、返工與該筆維護時間。
- 模型等待時間,以及這段等待是否真的占用人的工作時間。
- 一次性的設定、共用資料整理與工具維護。另列總投入;若要分攤到每筆,說明分攤方法,避免重複計入。
比較要包括已放棄或需要人工接手的工作,不能只挑成功草稿。品質也要一起看完成標準是否和原本相同,以及錯誤有沒有拖到更晚、才被別人發現。如果快了,卻把核對工作推給其他同事,還不能算省工。
同一人先做人工、再做輔助版本,可能因為已看過輸入而更快。不同難度的工作也不能直接混算。可行時使用可比工作並交錯順序,保留樣本數與差異;小樣本的結果只支持該次試點,不直接推算全年 ROI。
驗收,要包括不回答與交接
對客服草稿而言,驗收至少包括:引用能對回正確政策與版本、適用範圍正確、缺答時不補造規定,以及需要人工處理時交出明確原因。先列正常、缺資訊、版本更新、例外及不適用範圍的案例,再保留實際輸出與核對結果。
這裡是在設計檢查條件,尚未執行模型測試。即使模型能通過合成測試,也不能直接當成真實流程成效。合成測試適合找明顯缺口;真實試點還要看資料、工作分布與人工核對成本。
Anthropic 的 agent 評測說明區分了測試任務(task)、一次試跑(trial)、評分與結果(outcome)。其中 outcome 指試跑結束時環境的實際狀態,例如資料庫裡真的有那筆機票預訂;agent 在對話裡說「已訂好」不算。草稿試點不是 agent 任務,但可以借用同一個提醒。寫出一份回覆只是輸出;通過核對、能交給下一位處理,才符合事先約定的完成條件。這篇來源並未驗證本文的三部門選案方法。
下面四條停止條件,第一條最優先。碰到任何一條,都先停下該範圍再查原因。
- 資料越界。 資料用到不該用的地方,例如試點碰到超出已確認範圍的資料。
- 沒有來源的肯定答覆。 預定範圍要求回答有來源支持,卻出現來源撐不住的肯定答覆。
- 繞過人工核准。 輸出沒經過核准就送出或執行。
- 品質不達標。 達不到事先約定的品質條件時,不靠更快的時間抵銷。
把評估表填成一頁
每個流程填一張,未知就寫未知。這張表用來暴露缺口與記錄選案理由,不算加權總分。
| 欄位 | 要填的內容 |
|---|---|
| 流程與範圍 | 部門、反覆發生的小任務、這次不處理的範圍 |
| 輸入/輸出 | 資料形式、預期成果、完成標準 |
| 資料可用範圍 | 合成/真實資料;允許用途與尚未確認項 |
| 員工現有使用 | 誰已自費使用、用哪些工具、放過哪些公司資料 |
| 來源負責人 | 版本、適用範圍、更新責任;誰核准輸出、誰處理例外 |
| 人工基準 | 實際分鐘、樣本數;還沒量就寫未知 |
| 輸出核對 | 判定正確與返工的方法 |
| 錯誤與接手 | 缺答、例外、錯誤的處理與負責人 |
| 可撤回動作 | 草稿如何撤回;執行前的人工確認 |
| 固定規則替代 | 搜尋、模板、公式或規則能否先完成 |
| 未補條件 | 尚缺的資料、責任、基準或測試 |
| 試點範圍與理由 | 這次做什麼、為什麼先做、何時停止(可引用上面四條停止條件,或自訂) |
| 狀態 | 研究/合成演示/真實試點;是否已有結果 |
若資料可用範圍難以確認,可以接著看企業 AI 導入的資料與檢索。若草稿下一步會變成外寄或寫入,先對照寫入、外寄與人工核准補好動作邊界。
比起馬上找一個流程開始做,先把這張表填完更重要。你可以把三個候選填進這張表,再檢查選案理由是否仍然成立。若使用後願意分享,最有用的回報是:哪個必要條件卡住了、哪種例外改變了選案,以及實際核對工作是否符合原先預期。請只提供可公開、去識別的描述,不必附真實客戶資料。