Architecture - 2026-09-21 - 6 分鐘閱讀
主管在批預算之前會問的八個問題
系列最後一篇:主管在批預算之前會問的八個問題。其中四題在參考架構圖上對應到具體的元件,另外四題留在判斷,文內都標明是判斷。
這是系列的第六篇,也是最後一篇。第 0 到第 5 篇按圖上的編號順序走過一遍:第 0 篇是完整的參考架構圖,第 1 篇是身份與 gateway,第 2 篇是資料與檢索,第 3 篇是沙箱裡的 agent 與唯讀連接器,第 4 篇是寫入與送出要有人核准,第 5 篇是治理收緊。這一篇從另一側讀同一張圖,也就是預算出來的那一側。這八題是我實際被問到的八題,不是一份「主管應該要問什麼」的清單。答案是判斷的地方我會寫明。是數字的地方,那是我自己量過的數字,我會講清楚它量的是什麼。

會不會取代人?
這題有一半在爭論之前就被圖回答掉了。人工核准在第四階被畫成自己的一個方塊,位置在寫入與送出連接器下面,有一條箭頭往上接進它們,標註是「送出與寫入需要人」。第五階沒有把它拿掉。會動的是人站的位置。人不再負責產第一版,而是每一版都要通過的那道關。
我手上最接近證據的東西是自己的一次先導。三支先導集,50 個節拍腳本,全部由模型產出。技術上腳本完成那天就可以進合成。實際上沒有,因為閘是人,一個節拍一個節拍看腳本、看畫面、看節奏,而這件事就是剩下的全部工期。產出在它變快的那一天不再是瓶頸,審就變成瓶頸了。
這個答案誠實的邊界:它是我自己一個人對自己工作量的經驗,不是一份關於就業的研究。我能講的比那窄。量變多了,把關沒有消失,它集中了。
資料會不會外流?
有兩條規則排在任何架構前面。貼進對話框的東西一律當作已經送出去了,因為從公司的角度它就是已經送出去了。密鑰不走對話這條路;憑證檔可以被程式讀,不可以被印進任何一份對話紀錄。
其餘的部分在圖上是一條線。雲端 LLM API 就坐在企業邊界線上,每一條連到它們的箭頭都先穿過 gateway,而個資與資料外洩防護的方塊就在 gateway 裡。沒有第二條出去的路。第二階處理的是另一半,也就是往內漏的那一半:檢索索引標註著「按角色分範圍」,所以行銷問出來的問題,拿不回只有客服該看到的紀錄。兩邊都有的公司,等於把外流問題換成了稽核問題,而回答稽核問題的是第五階的帳本。
該選哪家的工具?
這題我不答,而且值得講清楚這個不答不是客氣。圖上的方塊是功能不是產品,它們的先後順序也不取決於裡面裝的是誰的模型。我會反過來問兩件事:這個東西你在本地驗得了嗎,以及你換得掉它嗎。
換得掉這件事實際上要付什麼代價,我自己有一個例子。我的發佈工具以前會把文章自己的標籤原封不動當成目的地平台的標籤送過去。從我的 repo 裡面看,這是對的。到平台上看,四格標籤裡有三格給了底下沒有其他文章的標籤,在那個站上這代表這篇文等於沒有被歸到任何地方。修法是加一張對應表,不是換一家廠商。值得記下來的是:我的 repo 裡沒有任何東西能讓我看見這件事。我得自己去平台上看。
貴在換不掉的那一塊不是模型。是模型前面的 gateway、那份策略檔,還有帳本,因為累積下來的決定都在那裡面。先選廠商再繞著它蓋這三樣,是把依賴的方向搞反了。
怎麼知道划不划算?
沒量過的百分比我不給,而且市面上流通的那些大多是某個人的試點被推廣出去的結果。在你自己公司裡值得量的是兩件事:驗證比產出多花多少時間,以及被擋下來的 run 重跑之後花了多少。
第二件我在自己的 runtime 上量過。一次 ablation,本地小模型、單一簡單任務、每組 20 個 run,把一道「artifact 不在就不准 agent 宣告完成」的關卡打開之後,輸入 token 變成對照組的 1.66 倍,p95 wall clock 從 87 秒變成 169 秒。每個被擋的 run 都會重跑,重跑的成本落在尾巴上。這些數字說的是這道控制不是免費的。它們沒辦法預測一個前沿模型在你的 repo 上會怎麼樣。
怎麼報這個數字跟數字本身一樣重要。同一個實驗計畫後面一格,是另一個本地模型上的改程式任務,平均值移動了 16%,中位數從 18,612 個 token 變成 37,068 個。分布的中間翻倍了,平均值幾乎沒反應。如果送到主管手上的數字是平均值,那他看到的正好是唯一一個能把這件事蓋掉的統計量。
我自己在這個方塊上的缺口是很普通的那種,但值得講出來。我的發佈紀錄每一筆都有狀態,沒有時長,也沒有成本。我數得出發了幾次。我量不出來。
它講錯了怎麼辦?
預設它會錯,然後把預算編在抓錯上,不是編在防錯上。我一直回頭引的那個數字來自剛才那個 ablation 的對照組:20 個 run 裡有 18 個,agent 回報任務完成,而該產出的東西不在。不是答錯,是回報了沒有發生過的工作。
那是沒有關卡的那一組。後來有一批四種模型與任務的組合,總共 120 個被評分的 run,四組都打開了關卡,有關卡的那一組分別是 20 個裡 18、14、7 和 20 個有效。四組的假完成都消失了。能不能把事情做出來沒有跟著一起來,四組裡有一組停在 20 個裡 7 個。關卡改變的是你能相信輸出什麼,不是模型能產出什麼。
另一半的答案是:誰會發現。這個系列第 5 篇的初稿寫著我站上的程式從 9 月 9 日起支援中文版,而且受影響的是五篇文章。兩個都錯。把初稿再讀一次永遠讀不出來,因為初稿自己內部是一致的。說出來的是 commit log:支援是 9 月 1 日進去的,受影響的是全部十五篇。檢查必須碰到一份跟被檢查對象不同的紀錄,這件事對模型的輸出成立,對我的初稿也一樣成立。
跟著來的要求是第三階那一條,而且它是結構問題,不是信不信任的問題。有沒有完成要在 agent 之外量,因為 agent 正是被量的那個東西。叫一個 agent 給自己的輸出打分,它會給你一個分數,而那個分數不帶任何關於輸出的資訊。
從哪個部門開始?
從產出最便宜驗的那個開始,不是從省下來最多錢的那個。工程有不用人跑的測試。內容有人可以在產出所花的時間之內把它讀完。像財務或法務這種,驗一份生成的答案等於要把工作重做一次的地方,是最糟的起點,即使那裡的時薪讓它看起來最划算。這是判斷。
理由在第二階。驗證是這些試點每一個的瓶頸,而且它出現在產出落地的那個點,不是成本被記帳的那個點。用薪資帳單的大小挑部門,挑到的會是瓶頸最嚴重的地方。
請顧問還是自己來?
用「最後留在你手上的是什麼」來切。第五階那份策略檔必須由它管到的那群人自己寫。別人寫完就走的規則沒有人遵守,更糟的是,當它不再描述這個系統的時候沒有人會發現,因為沒有人記得它本來是為了什麼。第 5 篇裡有我自己的例子,一條我自己寫的規則,有二十天在描述一個已經不存在的系統。
設計剛好相反。第一階的角色分範圍和第四階的核准路徑,找一個看過別家公司在這裡出過什麼錯的人來看,是有價值的,而且那是一件邊界清楚、交付物留得下來的工作。這也是判斷,我會守的那條線是:你可以買一次對你的設計的審查,你買不到你的規則。
多久看得到效果?
產出當天就有,而這正是這題容易誤導人的地方。效果照通路自己的節奏出現,而公司丟進 AI 的東西裡,大部分的限制條件是通路,不是內容。
我自己通路上的數字,都很小,而且是我自己的。這個系列第 0 篇的宣告貼文,發出後約 22 小時是 148 次曝光、7 個讚。我在另一個平台上發的第一則,3 次瀏覽。這兩樣東西現在寫起來都只要以前的一小部分時間。兩個數字都沒有因此動過。
實用一點的說法:第一週就會看到產出的瓶頸消失,也要預期那會露出真正卡住的是哪一個。通常是分發、審查的人力,或是一個還沒有人做的決定。這三樣都不會因為起草變快而變快。
這張圖上沒有的東西
這張圖上沒有一個方塊對應到上面這八題,而這就是整個系列誠實的總結。五個階段回答的是蓋什麼、按什麼順序蓋。這八題問的是憑什麼有人要為它付錢,而它們是在對話裡被回答掉的,用的證據在預算被決定的那個時間點多半還不存在。
圖能做的是把它們收窄。上面八題裡有四題最後掛上了一個具體的元件:人工核准方塊、邊界線與按角色分範圍的索引、指標那一排,以及關卡。另外四題留在判斷,我盡量把它們標成判斷,而不是把它們打扮成別的東西。我自己在被治理的那一半上用的控制平面是開源的,在 aine-control-plane。系列到這裡結束。