1. 先說結論:值得讀,但只能把它當成框架
OpenAI 於 2026 年 7 月 14 日發布〈How to manage AI investments in the agentic era〉,主張企業不應只追蹤 token 價格、席次或使用量,而要觀察每一美元產生多少有用工作。文章的價值,在於把成本、模型效率、Agent 治理、workflow 複利與容量配置放進同一套管理順序。
它最適合被當成管理層與實作團隊的共同檢查表:目前花費流向哪裡、任務有沒有真正完成、哪些失敗需要人工補救、Agent 能做哪些動作,以及下一筆預算應投資模型呼叫,還是投資資料、評估、連接器與流程設計。
但這仍是 AI 供應商提出的投資觀點。供應商有充分動機強調長期價值與擴張路徑,因此本文加入獨立研究與風險框架交叉檢查,不把原文的五步驟直接視為已被證明的 ROI 結論。
- 推薦對象:負責 AI 預算、內部自動化、Agent 平台、QA 或流程治理的人。
- 不適合的讀法:看到模型單價下降,就假設整體 workflow 必然更便宜。
- 正確的讀法:把每一步改寫成可量測、可驗收、可停止的實驗問題。
2. 把原文五步驟翻成可以執行的投資問題
原文提出五個步驟:看清使用量與支出、以成果 ROI 評估模型效率、在進階 workflow 擴張前先治理、投資能產生複利的流程,以及讓容量跟著已證明的需求走。真正落地時,每一步都應對應一個能回答「繼續、修正或停止」的問題。
- 可見性:能否把每次模型、工具、重試與人工覆核歸屬到特定 workflow?
- 成果 ROI:是否先定義完成條件,再比較通過率、週期、品質與完整成本?
- 治理:Agent 的資料、工具、權限、核准點、日誌與回滾是否明確?
- 複利:這次投入是否留下可重用的評分規則、資料、連接器與失敗知識?
- 容量:是否有連續真實需求與穩定品質,足以支持保留量、專用容量或更高權限?
從 AI 使用量走到擴張決策
FIGURE 01 / FLOW依 workflow 歸屬模型、工具、重試與人工成本
以預先寫好的 rubric 判斷是否通過驗收
限制資料、權限、核准、日誌與回滾
保存測試集、失敗分類、上下文與連接器
連續多批任務穩定後才增加容量或自主性
3. 為什麼使用量、速度感與自我感受都不能直接等於 ROI
實證研究顯示,AI 的效果高度依賴任務、使用者經驗與既有流程。NBER 對 5,179 名客服人員的研究發現,生成式 AI 平均提高每小時解決案件數 14%,新手與低技能群體提升較大,但資深與高技能群體效果很小。另一項涵蓋 66 家企業、7,137 名知識工作者的實驗中,實際使用工具的人每週少花約兩小時處理電子郵件,卻沒有觀察到任務數量或組成明顯改變。
軟體開發的證據同樣不一致。METR 在 2025 年對熟悉自己專案的資深開源開發者進行隨機試驗,當時的 AI 工具使完成時間增加 19%;METR 於 2026 年更新研究設計時指出,較新的工具可能已有改善,但因參與者選擇偏誤,目前訊號不足以精確估計效果。
DORA 的 2025 研究則顯示,AI 採用很普遍,許多人主觀認為生產力提高;然而生成時間的節省常被轉移到稽核與驗證,而且較高採用率同時與交付吞吐量和不穩定性增加相關。這些結果共同提醒:登入次數、產出數量與「感覺更快」只能描述活動,不能證明可接受成果變多。
容易誤導的活動指標,與較接近價值的成果指標
FIGURE 02 / MATRIX| 項目 | 較好的替代指標 | 必要的品質條件 |
|---|---|---|
| 活躍使用者 | 通過驗收的任務數 | 同一 rubric、同一任務範圍 |
| token/對話數 | 每項可接受成果完整成本 | 包含重試、工具與人工覆核 |
| 生成內容數 | 一次通過率與返工率 | 不可犧牲正確性與可追溯性 |
| 自陳節省時間 | 端到端週期與實際工時 | 和無 AI 基準組或歷史基準比較 |
| 模型榜單分數 | 真實任務集通過率 | 由領域審查者判斷可否採用 |
4. 用「每項可接受成果成本」重建 ROI
最實用的計量單位不是一次 inference,而是一項事先定義、通過驗收且不需要重大返工的成果。FinOps 的每次推論成本可協助追蹤基礎設施效率,但商業判斷還要把它往上連到任務成果;否則便宜的呼叫如果伴隨更多重試、低品質輸出或人工修正,總成本仍可能上升。
可接受成果應具備三個條件:完成標準在執行前已寫清楚、審查者能依同一 rubric 判斷、輸入與證據足以回溯。完整 workflow 成本則至少包含模型、工具、儲存與運算、失敗嘗試、等待時間、人工覆核、返工、監控,以及資料與安全控制。
核心公式可以寫成:每項可接受成果成本 = 完整 workflow 成本 ÷ 通過驗收的成果數。若要計算淨價值,再以避免的人工時間、縮短的週期、降低的錯誤或風險損失,扣除完整成本。無法估值的高風險項目,也應以硬性門檻處理,而不是強行換算成金額。
- 分子:模型+工具+基礎設施+重試+人工覆核+返工+治理與事故成本。
- 分母:真正通過驗收、可以交付或被下游採用的成果。
- 比較基準:同一批任務在無 AI、舊流程或替代方案下的成本、品質與週期。
完整成本常不只在模型費用
FIGURE 03 / BAR5. 先建立 workflow 帳本,再談高階 dashboard
一開始不需要昂貴平台。只要每個任務都有識別碼、基準時間、模型與工具成本、嘗試次數、人工覆核分鐘數、是否通過、失敗原因與能否複用,就能回答多數投資問題。關鍵是以任務為單位串起成本與結果,而不是把帳單、日誌與品質報表分散在不同系統。
建議先追蹤 30 至 50 個具有代表性的任務,並保留相同任務的無 AI 基準。資料量雖小,但只要抽樣規則、rubric 與審查方式一致,就比整體 token 曲線更能指出價值在哪裡流失。
NBER 對 AI 經濟衡量的研究也主張採用更細緻、任務導向與成果導向的方法,因為流程與品質變化通常不會完整反映在傳統產出數字中。
6. HIS/QA 實例:AI 分類回歸失敗是否值得擴張
假設 HIS 自動回歸每週產生 200 筆失敗紀錄,人工需要閱讀截圖、request/response、Selenium log 與既有缺陷,再判斷是產品缺陷、測試腳本、環境、資料或已知問題。這類任務輸入相對明確、結果可由資深測試人員覆核,適合先做低權限的影子模式實驗。
示意試驗可抽 50 筆歷史失敗:無 AI 基準為每筆 6 分鐘;AI 先提出分類、信心與證據連結,審查者只接受符合 rubric 的結果。若 43 筆一次通過、7 筆轉人工,模型與工具共 NT$120,覆核 95 分鐘、返工 35 分鐘,以內部人力成本 NT$600/小時計算,完整成本為 NT$1,420,每項可接受成果約 NT$33;無 AI 基準為 NT$3,000。這只是算式示範,真正決策仍要以自己的資料重跑。
醫療資訊情境不能只看平均節省。病人識別資料不得進入未核准服務;重大缺陷、帳務、醫囑與病安相關分類不可因 AI 高信心就自動關閉。若關鍵嚴重度出現一筆漏判、證據不可回溯,或審查負擔持續上升,就應停止擴張並回到人工流程。
- 輸入:去識別化的測試資料、失敗 log、畫面截圖、需求與已知缺陷索引。
- 輸出 rubric:分類正確、證據可點回、不得臆測根因、低信心必須轉人工。
- 試行權限:唯讀、不得修改測試碼、不得關閉缺陷、不得操作正式環境。
- 示意擴張門檻:連續三批一次通過率達 90%、關鍵漏判為零、完整成本低於基準且全數可追溯。
7. 擴張前的治理不是文件工作,而是 workflow 的必要成本
Agent 一旦能讀取內部資料、呼叫工具、修改狀態或跨系統執行,風險就不再只來自回答內容。OpenAI 原文要求在擴張前釐清可用上下文、工具、動作、人工核准與容量控制;NIST 的生成式 AI 風險管理 Profile 則提供跨產業的生命週期風險框架,提醒組織把可信度要求放進設計、開發、使用與評估。
實作上應從最小權限開始:先唯讀、再有限寫入;使用短效憑證與環境隔離;保存 prompt、模型版本、工具參數、輸入來源、輸出、人工決定與最終結果;在資料外傳、正式寫入、關閉缺陷、通知外部人員或變更醫療流程前設人工核准。
治理也必須可量測。追蹤多少執行觸發人工介入、多少權限請求被拒絕、是否有敏感資料命中、能否在指定時間內回滾,以及事件後能否重建完整軌跡。若這些控制尚未證明有效,增加使用量只是在放大未知風險。
- 資料邊界:允許哪些資料、保存多久、是否去識別、是否可送往外部模型。
- 動作邊界:哪些工具唯讀、哪些需要核准、哪些永遠禁止自動執行。
- 容量邊界:單次預算、重試上限、速率限制、並行數與熔斷條件。
- 復原邊界:人工中止、交易補償、版本回滾、事故通報與證據保存。
8. 真正能複利的不是某次答案,而是可重用的流程資產
原文所說的複利 workflow,不應被理解成讓 Agent 自動跑得更久。能累積價值的,是每次執行都改善下一次成功率、縮短整合時間或降低風險的資產:明確任務定義、黃金測試集、rubric、結構化上下文、連接器、權限模板、失敗分類、監控與審查回饋。
這也解釋為何有些團隊即使模型成本下降,ROI 仍沒有改善:每次工作都從空白 prompt 開始、輸入格式不一致、審查意見沒有回流、工具整合是一次性腳本,導致錯誤與人工修正無法累積成組織能力。
DORA 的研究把 AI 描述為組織能力的放大器。高品質文件、快速回饋、使用者導向、鬆耦合架構與健康資料平台,會讓 AI 的效益更容易出現;反之,混亂的流程會被更快地放大。
一次性使用與可複利 workflow 的差別
FIGURE 04 / MATRIX| 項目 | 一次性使用 | 可複利 workflow | 可檢查證據 |
|---|---|---|---|
| 任務定義 | 每次重新描述 | 固定 schema 與完成條件 | 版本化規格與 rubric |
| 資料 | 臨時貼入內容 | 受治理的上下文與索引 | 來源、版本與存取紀錄 |
| 品質 | 看起來合理 | 固定 eval 與抽樣覆核 | 通過率、返工率與錯誤類型 |
| 整合 | 單次複製貼上 | 穩定連接器與權限模板 | 工具成功率與稽核軌跡 |
| 學習 | 錯誤留在聊天紀錄 | 失敗分類與回饋進入下一版 | 版本前後的同組任務比較 |
9. 閱讀時必須保留的反方證據與限制
OpenAI 的文章提供一套合理的管理順序,但沒有證明所有 Agent workflow 都會產生正向回報。現有研究同時存在顯著正向、有限改變與負向結果,差異往往來自任務是否清楚、使用者是否熟悉領域、品質如何驗收,以及流程是否把省下的時間轉成新的稽核負擔。
OpenAI 的 GDPval 嘗試以真實職業交付物衡量模型表現,方向比單純考題更接近工作成果;不過官方也承認目前評估偏一次性,尚未完整涵蓋多輪澄清、修訂、模糊需求與真實協作。模型能在基準上完成任務,不等於組織已建立低成本、低風險、可持續的工作流程。
因此投資評估應至少保留三個對照:無 AI 基準、不同模型或流程版本、以及事後真實結果。不要只挑成功案例,也不要把早期負向研究永久外推到更新工具;正確做法是用固定任務集持續重測,清楚標示樣本、假設與不確定性。
- 供應商文章:適合產生假設,不適合單獨證明採購或擴張。
- 基準測試:適合比較能力,不一定反映整合、審查與營運成本。
- 自我回報:能描述體感,但應以實際週期、品質與工作量交叉驗證。
- 單次平均:可能掩蓋不同資歷、任務與風險等級的巨大差異。
10. 一個可直接執行的 30 天投資驗證計畫
最穩健的做法不是先買更多席次,而是用一個窄 workflow 完成四週證據循環。選擇高頻、輸入清楚、可回放且可由領域人員驗收的任務,例如 QA 失敗分類、需求到測試條件整理、內部文件檢索或固定格式報表初稿。
第 1 週建立無 AI 基準與 30 至 50 筆固定任務集,寫好 rubric、資料邊界與停止條件。第 2 週採影子模式,AI 只提出建議、不影響正式狀態;記錄完整成本與失敗分類。第 3 週在低風險範圍有限上線,加入人工核准、權限與回滾測試。第 4 週比較基準、檢查不同任務與人員的效果,再決定擴張、修正或停止。
示意 Go 門檻可以是:連續三批任務達到預先設定的一次通過率、關鍵錯誤為零、每項可接受成果成本低於基準、端到端週期縮短至少 20%、來源與操作軌跡完整。門檻應依風險調整;醫療、財務與正式資料寫入不能以平均效率抵銷重大錯誤。
- 繼續投資:品質穩定、成本下降、審查負擔可控,且留下可重用資產。
- 先修正:有局部效益,但錯誤集中在可辨識的資料、提示、工具或權限問題。
- 停止或回滾:關鍵錯誤、敏感資料風險、不可追溯、返工增加,或成果成本高於基準。
- 擴大容量:只在需求已證明且治理、監控與回滾都通過演練後進行。