SWE-2 值不值得用?Cognition 新編程模型效能與成本拆解
SWE-2 值不值得用?Cognition 新編程模型的效能與成本拆解
結論先講:SWE-2 在成熟的基準測試上逼近前沿,在最新的難題測試上還差一半。省下的 64% 成本是真的,但省得值不值得,看你的任務有多難。
Cognition(AI 工程師產品 Devin 的開發商)在 2026 年 9 月 10 日發布 SWE-2,官方說法是「推進效能與成本的柏拉圖前緣」(Pareto frontier,指在多個互相衝突的目標之間,找不到能同時更好的那條邊界線)。本文發稿於 9 月 11 日,Hacker News 上的討論串已累積 407 分、172 則留言,質疑聲量不小。
這篇把官方數字、社群質疑、以及台灣中小企業該怎麼判斷,一次拆給你看。
Cognition 的 SWE-2 到底是什麼?
SWE-2 是 Cognition 自家訓練的編程模型,2026 年 9 月 10 日發布,目前只在 Devin Desktop 與 CLI 上線,官方說正在推向 Devin Web 與 Fusion。
關鍵細節在底座。根據官方部落格,SWE-2 是從 Kimi K3 這顆 2.8 兆參數(parameter,模型內部可調整的權重數量,通常愈多代表容量愈大)的模型做後訓練(post-training,在別人練好的基礎模型上再加工)而來。Kimi K3 本身已經做過大量的 agentic coding 強化學習(RL,讓模型在可驗證的任務上反覆嘗試、按結果給分來改進),Cognition 在上面再做一輪 RL,多拿了 5 到 6 分。
技術上最值得記的一點:Cognition 說他們首次把 RL 擴展到「數兆參數」規模,而且用單一次訓練同時涵蓋所有 reasoning effort 等級(推理力度,medium/high/max 這種讓你在速度與品質之間換檔的設定)。過去要一個等級練一次,現在一次搞定,整條成本—效能曲線一起往上推。
行為面的改變也很具體。同樣在 FrontierCode 1.1 Main 這組測試上,SWE-2 medium 的平均步數是 53 步,SWE-1.7 是 127 步:分數更高、步數少 58%、平均成本低 81%。官方未在本文引用段落公布「第幾步開始動手改程式碼」的具體步數。
白話講:上一代太謹慎,看完整個專案才敢動手;這一代判斷力變好,知道哪些檔案根本不用看。
SWE-2 跟 Fable 5.1、GPT-6 Astra 比,數字怎麼看?
官方公布四組基準測試,SWE-2 在兩組贏、兩組明顯落後。以下是官方表格的完整數字:
| 基準測試 | SWE-2 | Kimi K3 | Grok 4.6 | Fable 5.1 | GPT-5.6 Sol | GPT-6 Astra | SWE-1.7 |
|---|---|---|---|---|---|---|---|
| FrontierCode 1.1 Main | 50.0% | 44.2% | 48.0% | 50.9% | 47.5% | 53.3% | 42.0% |
| DeepSWE 1.1 | 73.0% | 68.5% | 67.5% | 67.4% | 72.7% | 74.1% | 37.7% |
| Terminal-Bench 2.1 | 92.8% | 88.3% | 88.4% | 91.4% | 88.8% | 89.9% | 81.5% |
| Terminal-Bench 4 | 27.3% | 21.5% | 20.3% | 55.8% | 37.3% | 57.9% | 7.6% |
(數據來源:Cognition 官方部落格,2026 年 9 月 10 日。Terminal-Bench 是測模型在終端機環境實際完成任務的基準測試。)
讀這張表要分兩層看。
第一層,官方主打的那條線。 FrontierCode 1.1 Main 上 SWE-2 拿 50.0%,Fable 5.1 是 50.9%,只差 0.9 個百分點,而 Cognition 說成本低 64%。對上 GPT-6 Astra 的 53.3%,差 3.3 分,成本是四分之一。Terminal-Bench 2.1 更漂亮,92.8% 是全表最高,贏過 Fable 5.1 的 91.4% 和 Astra 的 89.9%。
第二層,官方沒有主打的那條線。 Terminal-Bench 4 上,SWE-2 只有 27.3%,Fable 5.1 是 55.8%,GPT-6 Astra 是 57.9%。差距超過一倍,不只是幾分之差。連 GPT-5.6 Sol 的 37.3% 都比它高出 10 個百分點。
同一顆模型,在一組測試上全場第一,在另一組上只有前段班的一半。這個落差本身就是這次發布最重要的資訊。
為什麼 Terminal-Bench 4 的 27.3% 比 92.8% 更值得看?
因為 92.8% 那組測試已經飽和,27.3% 那組還沒有。分數集中在 88% 到 92% 之間的測試,區分不出模型好壞;分數散布在 20% 到 58% 之間的測試才有鑑別度。
Hacker News 上這正是爭論焦點。有留言者(帳號 postalcoder)直接說,Terminal-Bench 2.1 與 Terminal-Bench 4 之間的巨大落差,可以解讀成「這顆模型對沒見過的新問題泛化得多好」,更白話的版本是「這顆模型被 benchmark 餵了多少」(benchmaxxing,為了衝榜單分數而針對性優化,實際能力沒有等比提升)。該留言者指出 Terminal-Bench 4 發布於該討論串前幾週。
反方(帳號 mediaman)的反駁也成立:Terminal-Bench 2.1 已經飽和,Terminal-Bench 4 沒有,GPT-5.6 Sol 同樣是 2.1 高分、4 低分,不能只挑 SWE-2 來罵。這個反駁有官方數據撐腰——Sol 在 2.1 是 88.8%、在 4 是 37.3%,確實也掉。
兩邊都有道理,但結論該落在哪裡?我的判斷:飽和測試的名次沒有決策價值,未飽和測試的落差才有。
SWE-2 的 Terminal-Bench 4 分數是 27.3%,Fable 5.1 是 55.8%。就算承認所有模型在新測試上都會掉,掉到別人的一半仍然是一個需要解釋的事實,而官方部落格沒有解釋。它把這個數字放進表格(誠實),但整篇文章的敘事線是 FrontierCode 與 DeepSWE(選擇性)。
對你的實務意義很直接:例行任務(改 bug、加測試、重構既有模組)用 SWE-2 大概夠用,這類任務接近已飽和測試的難度分布;沒人做過的難題(陌生架構、模糊需求、跨系統整合),資料顯示它還沒到前沿模型的水準。
SWE-2 便宜 64%,真的比較划算嗎?
要看你怎麼定義划算。成本優勢是真的,但這裡有三個條件會反轉答案。
先講清楚一件事:官方未公布每 token 的絕對定價。 所有成本數字都是 Cognition 自己給的相對比較——比 Fable 5.1 低 64%、是 GPT-6 Astra 的四分之一、比自家 SWE-1.7 低 81%。這些是廠商自報數字,發布當天沒有第三方複現。
| 判斷維度 | SWE-2 | 前沿模型(Fable 5.1/GPT-6 Astra) |
|---|---|---|
| 成熟任務效能 | 逼近,FrontierCode 差 0.9–3.3 分 | 略高 |
| 新難題效能(TB4) | 27.3%,約一半 | 55.8%/57.9% |
| 成本(廠商自報) | 低 64%,或四分之一 | 基準 |
| 取得方式 | 目前只在 Devin 產品線 | 多家平台、API 可直連 |
| 換模型的自由度 | 由 Cognition 決定 | 你自己決定 |
第三列那個「取得方式」,是多數人會漏看的關鍵。
你買不到 SWE-2,你買的是 Devin。 官方只說 SWE-2 在 Devin Desktop 與 CLI 上線,並推向 Devin Web 與 Fusion。所以「便宜 64%」是綁在一個產品訂閱裡的內部成本結構改善,你拿不去跟別家模型比單價。這筆錢省下來多少會回到你口袋、多少留在 Cognition,來源沒講。
換算成一句可執行的判斷:如果你的團隊已經在用 Devin,SWE-2 上線是純加分,例行任務會更快更省,直接用。如果你還在挑工具,「便宜 64%」不該是你的選擇理由——你選的是整個 Devin 產品與它背後那條你看不到的模型供應鏈。
Cognition 自己練模型,代表什麼趨勢?
代表「AI 工具商」與「AI 模型商」的界線正在消失,而且消失的方向對客戶不利。
Cognition 原本的定位是產品公司:拿別人的模型,包成一個會自己寫程式的 agent。現在他們自己做後訓練,練出一顆逼近前沿的模型。這件事的意義在控制權轉移,而非技術炫技——當產品公司自己握有模型,它就能隨時決定你的工具底下跑的是哪顆腦。
但這條鏈還有第二段,而且更值得注意:Cognition 自己也不是從零開始練的。 SWE-2 的底座是 Kimi K3,一顆別人家的 2.8 兆參數模型。所以一個 Devin 使用者,距離真正的模型權重隔著兩層——Cognition 一層,Kimi K3 的開發方一層。
這不是在說 Cognition 做錯什麼。用強大的開源或第三方底座做垂直後訓練,是目前小團隊追上前沿最務實的路徑,官方部落格也大方寫出來了。問題在於使用者端的認知:你以為你買了一個工具,實際上你買進了一條你完全看不見的供應鏈,而鏈上任何一環換掉,你的工作流品質就會在某個週二早上無預警改變。
這對台灣中小企業意味著什麼?
意味著你評估 AI coding 工具時,要多問一個以前不會問的問題:底下那顆模型是誰的,換掉的時候會通知我嗎?
台灣中小企業導入 AI coding agent,常見的決策方式是看 demo、看價格、看有沒有中文支援。這套在工具與模型分離的時代堪用,現在不夠了。SWE-2 這件事告訴你:工具商可以在不改變產品名稱、不改變訂閱價格的情況下,把底層模型整顆換掉。你的程式碼品質、成本結構、甚至輸出風格,都會跟著變,而你沒有投票權。
具體要做的三件事:
一、簽約前問清楚三個問題。 底層用哪家模型?更換時會不會事前通知?有沒有讓我留在舊模型的選項?願意白紙黑字寫的廠商,跟支支吾吾的廠商,風險等級差很多。這三題問出口不花你一毛錢。
二、輸出可攜性優先於功能豐富度。 選工具時,優先確認它產出的東西(程式碼、設定檔、文件)是標準格式、能直接帶走。綁定愈深,未來換工具的成本愈高,而模型換代的速度只會更快。帳很難看:訂閱費省下的那一點,只要被迫重做一次整套流程,人力成本就吃回去了。
三、不要用單一工具跑所有任務難度。 從這次的數據學一個判斷框架:例行任務用便宜的、難題用貴的。SWE-2 在成熟測試上逼近前沿、在新難題上只有一半,這個形狀是所有「性價比路線」模型的共同特徵,不只 SWE-2 這樣。把任務分級,比把工具統一,省得多。
還有一個更根本的心態調整。當你把 AI coding agent 當黑盒子買單,你實際上是在外包一項核心能力,卻沒有對應的治理機制。中小企業資源有限,不可能自己練模型,但至少要知道自己站在供應鏈的哪一格。
如果你想把這套「先問清楚、再簽約」的判斷流程,套用到自家的 AI 工具採購上,AIRUN 的 AEO 服務在做的就是這件事:把模糊的技術決策,拆成老闆看得懂、問得出口的具體問題。
那這次發布該怎麼定調?
SWE-2 是一次紮實的工程成果,也是一次有選擇性的行銷發布。兩件事同時成立。
紮實的部分:從 2.8 兆參數的第三方底座做 RL 後訓練,多拿 5 到 6 分,步數砍 58%、成本砍 81%,還把所有 reasoning effort 等級壓進單次訓練。這些是真功夫,官方技術細節寫得比多數廠商透明。
選擇性的部分:主打飽和測試的第一名,把未飽和測試的一半分數放進表格但不展開。這是產業慣例,算不上造假,但你要自己把眼睛移到第四列。
我的定調:SWE-2 值得例行任務用,不值得為它換掉整套工具鏈。 它證明的是:小公司能用第三方底座,在特定任務上做到夠好,而且便宜很多。這對使用者是好消息——選擇變多、價格往下。但同時也提高了你該做的功課:問清楚底層是誰、確認輸出帶得走、把任務分級配工具。
這三件事今天就能做,不用等下一顆模型發布。
常見問題
Q:SWE-2 跟 Claude、GPT-6 Astra 比起來哪個比較划算?
A:看任務難度。例行任務 SWE-2 划算——FrontierCode 只輸 Fable 5.1 零點九分、成本低 64%(廠商自報)。但新難題的 Terminal-Bench 4 上只有 27.3%,Fable 5.1 與 Astra 都超過 55%,差距逾一倍。官方未公布每 token 定價。
Q:SWE-2 要怎麼用?有開放 API 嗎?
A:官方公告只提到 SWE-2 於 2026 年 9 月 10 日在 Devin Desktop 與 CLI 上線,並正在推向 Devin Web 與 Fusion。來源沒有提到獨立 API 或對外授權,等於目前要用 SWE-2 就得買 Devin 這個產品,不能單獨取得模型。
Q:SWE-2 是 Cognition 從零開始訓練的嗎?
A:不是。官方寫明 SWE-2 是從 Kimi K3 做後訓練而來,那是一顆 2.8 兆參數、已經做過大量 agentic coding 強化學習的第三方模型。Cognition 的貢獻是在上面再做一輪 RL,多拿 5 到 6 分並大幅改善成本曲線。
Q:Terminal-Bench 2.1 拿 92.8% 全場最高,為什麼還被質疑?
A:因為該測試已飽和,多數前沿模型都落在 88% 到 92%,鑑別度低。Hacker News 上的質疑集中在 Terminal-Bench 4 只有 27.3%,兩者落差被解讀為泛化能力不足。反方認為 GPT-5.6 Sol 同樣從 88.8% 掉到 37.3%,不是 SWE-2 獨有的現象。
Q:中小企業現在該換用 Devin 嗎?
A:已經在用 Devin 的,SWE-2 上線是純加分,例行任務更快更省,直接用。還在挑工具的,不該把「便宜 64%」當選擇理由——你買的是整個產品與它背後的模型供應鏈。先問廠商換模型會不會通知、輸出能不能帶走,再決定。
Q:這件事對選 AI coding 工具的方法有什麼改變?
A:多一個必問題目:底層模型是誰的、換掉會不會通知、能不能留在舊版。工具商自己練模型後,可以在不改產品名與價格的前提下整顆換腦,你的程式碼品質與成本會跟著變。另外把任務分級——例行用便宜的、難題用貴的,比統一工具省得多。