AIRun · Blog
← 全部文章

Claude 5 情境工程新規則:80% 系統提示被刪掉之後

2026-07-26 · J董 👁 110 人看過 🤖 101 AI 爬蟲命中
AI 新知情境工程Claude 5prompt 設計開放權重 AI

Claude 5 情境工程新規則:80% 系統提示被刪掉之後

系統提示——每次對話前先塞給 AI 的那段固定指令——刪掉超過八成,編碼評測沒有可測量的退步。這是 Anthropic 對 Claude Code 給 Opus 5、Fable 5 用的設定動的手。你去年精心堆疊的那份長 prompt,現在很可能是純成本。

先把時間點講清楚:Anthropic 在 2026 年 7 月 24 日發布《The new rules of context engineering for Claude 5 generation models》,這是官方針對 Opus 5、Fable 5 這類新一代模型給出的情境工程指南。本文寫於 7 月 26 日,也就是官方指南出爐的第三天。官方親自出面說「請把你的舊設定拆掉」,這件事本身就是訊號。

Claude 5 世代模型的情境工程規則跟以前有什麼不一樣?

核心改變是:從「用規則綁住模型」改成「讓模型用判斷力」。Anthropic 明說他們為 Opus 5、Fable 5 這類模型移除了 Claude Code 系統提示中超過 80% 的內容,而在自家編碼評測上沒有可測量的損失(來源)。

官方這一節的標題是 unhobbling,直譯近似「鬆綁」——官方本身沒有給這個詞逐字定義,這裡只取字面意思。他們的檢討是:過去在系統提示、CLAUDE.md 和 skills(CLAUDE.md 是 Claude Code 用來存放專案設定與記憶的檔案,skills 則是可掛載的功能模組)裡對 Claude Code 施加了過多約束,而那些約束當初是為了守住最壞情況(例如亂刪檔案)才設的。舊模型撐不住,只能接受這個取捨;新模型有更好的判斷力,護欄就成了多餘的負擔。

什麼是情境工程?跟提示詞是同一件事嗎?

不同。提示詞是你這次打字送出的那句話;情境工程(context engineering)處理的是模型這次收到的全部材料——系統提示、Skills、CLAUDE.md 檔案、記憶,以及其他來源組裝起來的東西。官方的定義就是這樣拆的。

關鍵差別在官方那句話裡:情境會跨很多次請求重複使用,所以它沒辦法像單次提示那樣具體。你得在完全不知道使用者下一句會問什麼的前提下,先把通用指引寫定。難度也在這——而且隨著模型自身能力演進,昨天正確的通用指引今天可能就是錯的。

對台灣中小企業來說,這件事的對應物很具體:你的客服機器人的「角色設定」、內部知識庫查詢的「系統指令」、業務助理的「回覆守則」,那些一次寫好、之後每一通對話都會被塞進去的文字,全部都是情境工程的管轄範圍。

為什麼規則寫得越細,效果反而越差?

因為規則之間會打架,而消化衝突要花模型的力氣。Anthropic 讀自己內部的 Claude Code 使用紀錄時發現,同一個請求裡同時出現互相矛盾的訊息,例如系統提示一邊寫「適度保留文件說明」,一邊寫「不要加註解」——系統提示、skills 和使用者請求彼此衝突。

官方的描述很誠實:Claude 通常還是能推敲出使用者的真正意圖並給出對的答案,但它必須先更謹慎地想過這些重疊與矛盾的訊息,才能決定要做什麼。這段思考不是免費的,你按 token 付錢,還付了延遲。

更麻煩的是絕對化的禁令。官方舉的舊系統提示原文包括「程式碼中預設不寫註解」「絕不寫多段式 docstring 或多行註解區塊,最多一行」。這種寫法對某些情況就是錯的:使用者可能有自己的偏好,特別複雜的程式碼本來就需要多行說明。新版的寫法改成描述目標——「寫出讀起來像周圍程式碼的程式碼:對齊它的註解密度、命名與慣用寫法」。從一條禁令,變成一個判準。

官方文中還列出另一條「以前給範例、現在……」的對照條目,該段落的具體建議請直接看原文

舊寫法和新寫法差在哪?一張表看完

面向舊模型時代做法Claude 5 世代做法你會感受到的差別
指令性質給絕對規則、給禁令給判準,讓模型判斷邊緣情況不再被規則寫死成錯的
系統提示長度越長越安全官方實測砍掉逾 80% 無損每次請求的固定成本下降
矛盾指令堆著就好,模型會挑視為明確的效能負債模型少花力氣消化衝突
記憶與知識全部塞進 CLAUDE.md分流到 memory、artifacts、skills情境依需要時載入
檢查方式靠人讀、靠感覺Claude Code 用 /doctor 檢查有官方基準可對照

最後一列值得展開。Anthropic 說他們已把這批最佳實踐放進 claude doctor,在 Claude Code 中用 /doctor 指令來 rightsize 你的 skills 和 CLAUDE.md 檔案。這是官方目前公開指名的檢查入口。

另外,官方也點出 Claude Code 現在有更多工具可用:過去 Claude 主要依賴 CLAUDE.md 當作記憶、資訊與指引的來源,現在有了 memory、artifacts、skills,模型可以自己建立跨工作階段載入與共享情境的方式。所以「什麼都寫進一個大檔案」這個習慣,本身就已經過時。

我怎麼知道自己的設定是不是「過胖」?

用三個問題自測,每一題都能在十分鐘內驗證:

  1. 有沒有互相矛盾的句子? 把你的系統提示整份印出來,找「一律」「絕不」「務必」這幾個詞,逐條問:有沒有另一條規則在同一情況下要求相反的事。
  2. 每條規則當初防的是什麼? 如果答案是「怕它亂講話」「怕它格式跑掉」,先刪掉、實測十筆真實對話,比較品質。刪了沒變差,就是純成本。
  3. 這條規則是判準還是禁令? 禁令改判準。「不准講價格」改成「價格一律引用官方定價頁的數字,沒有依據就說明需另行報價」——後者在你沒想到的情況下依然成立。

這不是叫你把所有守則都拿掉。碰到錢、法律責任、客戶承諾的動作,該擋還是要擋,那些屬於治理問題,跟效能無關。要刪的是那些「怕模型笨」而設的補丁。

開放權重模型的「Kubernetes 時刻」跟這件事有什麼關係?

同一週還有第二個訊號。Mesosphere 共同創辦人 Tobi Knaup 在 2026 年 7 月 25 日發表的文章中主張,開放權重 AI 正在經歷它的 Kubernetes 時刻。

他的親身經歷是這樣:2013 年他共同創辦 Mesosphere,基於 Apache Mesos 做 DC/OS 並商業化,成長多年後被 Kubernetes 顛覆。他把教訓收在一句話上——一旦一個人人都能客製的開放平台成為產業重心,沒有任何單一廠商追得上圍繞它的整體創新速度。他特別註明,這個教訓的重點不在「開源永遠會贏」這種口號。

他點出的當下規模:Hugging Face 已託管超過 200 萬個公開模型,圍繞 Qwen、Gemma 這類熱門模型家族,開發者持續產出各種衍生成果。至於各家開放權重模型與封閉前沿的評測數字比較,我們手上沒有可查證的來源,這裡不轉述。

作者自己承認類比不完美:Kubernetes 貢獻者能檢視與修改真正的原始碼、改良能回流上游,模型的 fine-tune 通常做不到;「開源模型」多數其實是「開放權重」,訓練資料與完整訓練流程並未公開,不符合 OSI 對開源 AI 的定義。這些差異是真的。

兩件事疊在一起指向同一個方向:模型層正在快速流動,你綁在模型層上的那套設定,保鮮期比你想的短。

這對台灣中小企業意味著什麼?

意味著你手上那套跑了半年的 AI 流程,該定期體檢了,而且體檢時該動的手是刪。

多數台灣中小企業導入 AI 的路徑很像:找了個懂的人寫一套 prompt,跑起來還行,之後每次出包就在後面補一條規則。半年後那份系統提示變成一份補丁史,沒人敢動,因為不知道哪條在撐著。這種結構在舊模型上是必要之惡,在 Claude 5 世代模型上是三重浪費——多付 token、多等延遲、還把模型的判斷力綁住。

三個具體判斷:

第一,不要為了省錢先跳去便宜模型,先把情境瘦身。 砍掉冗長的系統提示是零風險降本,換模型是要重測全部流程的工程。順序搞反會很痛。

第二,開放權重值得評估,但別急著搬家。 開放權重讓自架成為真選項,尤其在資料不能外流的產業。自架真正的成本落在硬體、維運,以及誰半夜起來處理。先問清楚公司有沒有那個人。

第三,把「AI 設定」當成程式碼管理。 有版本、有變更紀錄、有回歸測試(哪怕只是十筆固定的真實問題)。做不到這件事,你就沒有能力在模型換代時安全地改設定,只能永遠往上疊補丁。

這個月該照什麼順序盤點手上的 AI 流程?

按「出錯的代價」排,不按「用得多不多」排。

優先序流程類型出錯代價本次該做的事建議節奏
1對外客服/自動回覆直接傷客戶信任找出矛盾指令、把禁令改判準本週
2報價/合約相關輔助金錢與法律風險保留人工閘門,只瘦身非決策指令本週
3內部知識庫查詢決策依據失真檢查情境有沒有塞爆、拆分載入兩週內
4行銷內容生成品牌調性走樣把範例改成判準,保留聲音描述兩週內
5內部雜務自動化直接大砍系統提示,實測比對有空再說

實作上建議這樣跑:每條流程準備 10 筆真實歷史對話當回歸測試集,先記錄現況輸出,再砍設定,再比對。沒有這個對照組,你的「有沒有變差」只是感覺。

如果你正在盤點自己網站與內容在 AI 引擎裡的可見度,AIRUN 的 AEO 頁面有我們實際在跑的做法可以參考。

我的立場

這波改變對中小企業是好消息,而且是那種「動手就有、不動就沒有」的好消息。Anthropic 公開自己刪掉 80% 系統提示還沒變差,等於官方認證了一件事:這個產業過去兩年累積的 prompt 工程知識,有很大一塊是為了服侍當時模型的缺陷,而那些缺陷正在消失。

該做的事很無聊也很清楚:把你的 AI 設定翻出來,刪掉互相打架的句子,把絕對禁令改寫成判準,留下真正該擋的治理閘門,然後用真實案例測一遍。做這件事的公司這個月會拿到更便宜、更準的輸出;不做的公司會繼續按月付費,養一份沒人敢動的補丁史。

模型會繼續換代,這件事沒有終點。與其猜下一代什麼時候來,不如把「定期體檢 AI 設定」變成你公司每季固定要做的一件事。

常見問題

Q:Claude 5 世代的情境工程規則,最大的改變是什麼?

A:護欄拆掉,改由模型自己判斷。Anthropic 在 2026 年 7 月 24 日的官方文章說明,他們為 Opus 5、Fable 5 這類新一代模型移除了 Claude Code 系統提示中超過 80% 的內容,編碼評測沒有可測量的損失。原因是舊規則多半為了防止舊模型出包而設,新模型已能靠周邊情境自行判斷。

Q:情境工程和提示詞(prompt)有什麼不同?

A:提示詞是你這一次輸入的那句話;情境是模型這一次收到的全部材料,包含系統提示、Skills、CLAUDE.md、記憶等來源。官方的說法是:情境會跨很多次請求重複使用,所以它不能像單次提示那樣具體。這也是情境工程比寫提示詞難的地方——你要在不知道使用者會問什麼的前提下,先把通用指引寫好。

Q:我的舊 prompt 要全部重寫嗎?

A:不用全部重寫,要先刪。優先處理互相矛盾的指令,官方舉的例子是系統提示同時出現「適度保留文件」和「不要寫註解」,模型得先花力氣想該聽誰。刪掉衝突項、刪掉為了防呆而設的絕對禁令,把剩下的規則改寫成描述目標的句子,再實測輸出品質有沒有變差。

Q:Claude Code 有工具可以檢查我的設定太肥嗎?

A:有。Anthropic 表示已把這批最佳實踐放進 claude doctor,在 Claude Code 裡輸入 /doctor 就會針對你的 skills 與 CLAUDE.md 檔案做 rightsize 建議。這是官方目前公開指名的檢查入口,其他自動化清理工具官方未公布。

Q:開放權重模型現在能取代封閉模型了嗎?

A:手上沒有可查證的公開評測能支撐「全面取代」的說法,未經證實的排名我們也不轉述。可以確定的是生態規模:Tobi Knaup 指出 Hugging Face 已託管超過 200 萬個公開模型,圍繞 Qwen、Gemma 這類熱門家族的衍生開發持續累積。合理做法是把開放權重當成第二供應商評估,先跑壓力測試再談搬家。

Q:中小企業現在最該做的一件事是什麼?

A:把公司裡已經在營運的 AI 流程列出來,標上「錯了會有多痛」,從最痛的那條開始檢查它的系統提示有沒有互相打架。多數公司卡住的原因是指令堆了半年沒人整理,模型每一次都在替你消化這堆垃圾,而你按 token 付錢。


AIRUN 對抗式創業體檢 AgentFlow Solutions(双云行銷試運行)