1. 先釐清來源:兩支影片不是兩份獨立證據
這兩個連結應合併閱讀,而不是相互背書。它們處理的是同一場黃仁勳與 LangChain 創辦人 Harrison Chase 的對談:一支為中文整理,另一支為 LangChain 原始版本。
核心命題集中在同一組問題:模型之外的 Harness 是否會成為企業 AI 的主要工程層、企業為何需要可控制的開放代理系統,以及前沿模型與專用代理如何分工。本文把影片當成待評論的主張來源,再用 LangChain、NVIDIA、NIST 與 OWASP 文件檢查其技術邊界。
影片來源一(中文整理版):https://youtu.be/vxcpXXpG-yA?si=3B6oqmWuGUEPD8qG
影片來源二(LangChain 原始版):https://youtu.be/Yy3JH6dDugc?si=AvaeDZ4MlI02FBkI
2. Harness 是企業執行層,不是新的模型別名
模型負責產生判斷,Harness 負責把判斷限制在可用、可觀察且可治理的工作環境。沒有後者,模型仍只是能輸入與輸出內容的元件。
LangChain 的定義很直接:Agent = Model + Harness。Harness 包含系統提示、工具與技能說明、檔案系統或沙箱、子代理與模型路由、重試、壓縮、延續執行及其他 Middleware。企業真正部署的不是一個模型名稱,而是這整套執行系統。
NemoClaw 藍圖把概念拆成三層:Nemotron 3 Ultra 提供模型能力,Deep Agents 提供規劃、工具、記憶與任務執行,OpenShell 提供隔離與政策控制。這個分層比「選哪個 LLM」更接近正式環境的架構問題。
企業代理系統的四個責任層
FIGURE 01 / MATRIX| 項目 | 主要責任 | 可累積資產 | 典型失敗 |
|---|---|---|---|
| 模型 | 推理、生成、選擇下一步 | 模型能力與專業調校 | 能力不足、幻覺、長程狀態不穩 |
| Harness | 工具、規劃、重試、路由與流程 | 工作語意、工具契約、執行策略 | 迴圈、錯用工具、上下文位置錯誤 |
| Context | 提供資料、記憶、規則與歷史 | 組織知識、案例、操作紀錄 | 資訊過期、污染、權限越界 |
| Runtime | 隔離、身分、網路、憑證與稽核 | 政策、批准、Trace 與事故紀錄 | 過度授權、外洩、不可回復動作 |
3. 黃仁勳說對的部分:企業差異會沉澱在模型之外
通用模型會持續進步,也會被更多供應商提供;企業每天怎麼工作、何時例外、誰能批准與如何驗收,才是競爭者最難複製的部分。
LangChain 把記憶、工作流程、Trace、評測資料、Harness 設定與調校資料列為企業專有知識,這個判斷合理。兩家公司即使使用同一模型,也會因工具契約、失敗案例、批准制度與回復策略不同,得到完全不同的可靠度。
因此,Harness 可以成為新的應用層,卻不是單獨存在的護城河。套件與 Prompt 容易複製;經過實際事故、回歸測試與組織例外累積而成的執行規則,才會形成持久差異。
黃仁勳提出的雙軌路線也比「全面改用開放模型」務實:先用前沿模型快速探索尚未定型的任務,等工作邊界與評測成熟後,再為高頻、穩定且成本敏感的流程打造專用代理。
哪些資產容易複製,哪些會形成企業差異
FIGURE 02 / MATRIX| 項目 | 可攜性 | 模仿難度 | 管理重點 |
|---|---|---|---|
| 模型 API | 高 | 低 | 價格、延遲、能力與供應商風險 |
| Harness 套件 | 高 | 中 | 版本、工具介面與可觀測性 |
| 評測與 Trace | 中 | 高 | 真實失敗、回歸與品質門檻 |
| 流程例外與權限 | 低 | 高 | 責任、批准、稽核與事故處置 |
4. 0.86 與 10 倍成本很有價值,但不能當成採購結論
LangChain 的結果證明 Harness 配適能顯著改變同一模型的代理表現,也證明開放模型可能逼近前沿模型;它沒有證明任何企業工作都能以十分之一成本完成。
官方資料顯示,調校後的 Nemotron 3 Ultra 在 Deep Agents suite 最佳分數為 0.86,Opus 4.8 最佳為 0.87;整套測試成本約為 4.48 美元與 43.48 美元。這是明確、可討論的工程訊號,但仍是 LangChain 與 NVIDIA 合作情境下的供應商評測。
數字只計該測試的推論經濟性。企業還要支付 GPU 或託管容量、整合、資料管線、監控、沙箱、身分系統、評測維護、故障重試、人工覆核與升級成本。工作失敗一次需要十分鐘人工返工時,token 單價通常不是主要支出。
兩份技術文件都要求分析 Trace、一次修改一個變因、多次執行並檢查回歸。LangChain 也承認 Harness 有上限:工具與上下文失配可以修,模型本身缺少的長程能力不能靠多一段 Prompt 補出來。
這組 Benchmark 能證明什麼
FIGURE 03 / MATRIX| 項目 | 能支持的判斷 | 不能直接推論 | 企業補測項目 |
|---|---|---|---|
| 品質 0.86 對 0.87 | 特定代理任務接近 | 所有領域品質等價 | 自家任務成功率、失敗類型、人工返工 |
| 成本 4.48 對 43.48 美元 | 該套件推論成本較低 | 總持有成本低 10 倍 | 基礎設施、人力、重試、治理與尖峰容量 |
| Harness 調校有效 | 鷹架配適會影響分數 | Prompt 能補齊模型能力 | 多次試驗、跨任務回歸與長期漂移 |
5. 開放代表可控與可攜,不代表自動安全
開放堆疊的優勢是企業可以看見、修改與自行部署關鍵層;代價是更多營運與安全責任不再由單一 API 供應商承擔。
模型權重、Harness 與 Runtime 可控,能降低單一供應商鎖定,也讓資料位置、工具權限與政策更貼近組織需求。但企業必須自行處理版本修補、模型來源、套件供應鏈、憑證、推論容量、監控與事件應變。
OpenShell 提供核心級隔離、YAML 政策、檔案與網路控制;其官方說明仍明確提醒隔離只能降低風險,設定錯誤、惡意工具、Prompt Injection 與未授權動作不會因此消失。開放性提高可檢視性,安全性仍取決於政策與執行。
NIST 已把代理身分與授權列為標準工作重點。代理需要專屬身分、最小權限、短效憑證、用途限制與可稽核紀錄;不能借用一般使用者的廣泛權限,再期待模型自行克制。
開放代理堆疊的交換條件
FIGURE 04 / MATRIX| 項目 | 企業得到 | 企業承擔 | 最低控制 |
|---|---|---|---|
| 模型 | 部署與調校彈性 | 容量、修補與模型治理 | 來源驗證、版本鎖定、退版 |
| Harness | 流程與工具可修改 | 回歸、Trace 與相容性 | 固定評測集、變更審查 |
| Runtime | 資料與政策邊界可控 | 沙箱、網路、憑證與事故 | 預設拒絕、最小權限、完整稽核 |
6. 把流程寫成 Harness,本質上是在把組織政策變成可執行系統
傳統流程文件容許人員用經驗補齊模糊處;代理會把每個未定義的例外放大成執行分歧。流程代理化之前,企業必須先把責任與邊界寫清楚。
一個可營運的 Harness 不只列出步驟,還要定義輸入 Schema、可用工具、資料範圍、成功條件、停止條件、重試上限、批准人、回復方式與稽核欄位。這些內容其實就是可執行的組織政策。
適合專用化的流程具有穩定目標、可重現輸入、可測量輸出與有限例外。需求每天改變、責任歸屬不清或成功只能靠主管感覺判定的工作,先交給前沿模型做建議與探索,比直接提高自主權安全。
OWASP 的 2026 年案例顯示,代理一旦具備刪除或變更權限,錯誤理解就可能直接成為事故。刪除、傳送、付款、發布與權限調整應由程式化政策攔截,不能只在 Prompt 中寫一句「先詢問」。
流程升級為專用代理前的五道門
FIGURE 05 / FLOW目標、輸入、工具與禁止事項可明確描述
有正常、邊界、失敗與對抗案例
專屬身分、最小資料與最少工具
高影響動作可攔截、確認與撤銷
監測成功率、返工、成本與新失敗
7. HIS 與高風險流程應從唯讀代理開始
醫療資訊系統可利用代理減少查詢、比對與測試整理工作,但病歷、醫囑、申報、付款與權限異動不應直接接受模型輸出。
第一階段適合讓代理查閱已授權資料、整理病歷差異、產生測試案例、比對 API 回應或標記可能異常,結果只作為人員判讀材料。這類任務可保留完整 Trace,又不會因單次誤判改變正式資料。
第二階段才考慮建立草稿或準備交易,並由 Schema、欄位範圍、身分、業務規則與人工覆核共同驗證。即使按下批准,真正的寫入也應經既有服務層與交易控制,而不是讓代理直接操作資料庫。
無人覆核的自主寫入只適用於影響低、可完整回復且經長期評測證明穩定的動作。涉及病人安全、金流、申報責任或存取權限時,代理應維持建議者或受控操作者角色。
HIS 代理的分級權限
FIGURE 06 / MATRIX| 項目 | 代理角色 | 必要控制 | 上線條件 |
|---|---|---|---|
| 唯讀查詢與比對 | 研究助理 | 資料範圍、去識別、Trace | 固定評測與人工抽查 |
| 產生草稿 | 建議者 | Schema、來源標示、人工確認 | 錯誤不影響正式資料 |
| 可回復寫入 | 受控操作者 | 批准、交易、冪等與 Rollback | 小流量、告警與責任人 |
| 高影響或不可逆動作 | 不得自治 | 確定性規則與雙重覆核 | 維持人類決策與既有管制 |
8. 可採用的企業路線:前沿模型探索,專用代理量產,確定性系統守門
企業不需要在封閉與開放模型之間選邊。更合理的分工,是依工作成熟度、流量、風險與控制需求選擇不同層級。
需求模糊、案例不足或能力上限未知時,先用前沿模型建立可行性與評測資料。任務穩定且重複量高時,再比較開放模型、專用 Harness 與自管 Runtime 是否能降低單位成本並提高控制。
任何涉及特權或不可逆結果的流程,都保留在確定性程式、政策引擎與人類批准之後。代理負責整理、規劃與提出動作,系統負責判斷它有沒有資格執行。
「公司建立在 Harness 上」可以成立,但前提不是代理取代流程,而是流程被重新實作成可測量、可限制、可追蹤與可回復的系統。沒有這些條件,Harness 只是把既有混亂自動化得更快。