AIRun · Blog
← 全部文章

DeepSeek V4 Flash 在 ARC-AGI 拿到什麼分數?每題 0.02 美元的推理成本怎麼算

2026-08-09 · J董 👁 104 人看過 🤖 100 AI 爬蟲命中
AI 新知DeepSeek V4 FlashARC-AGI 測試開源模型推理能力中國開源AI模型成本輕量模型

ARC Prize 驗證:DeepSeek V4 Flash 0731 最高檔在 ARC-AGI-1 拿 89.0%、ARC-AGI-2 拿 61.4%,每題 0.02–0.04 美元。輕量模型的成本天花板被改寫。

事件發生在 2026 年 7 月 31 日,本文寫於 2026 年 8 月 9 日,中間隔了 9 天。這 9 天裡最該做的事只有一件:重算你產品線的模型成本結構。急著換 API 可以先放一邊。

DeepSeek V4 Flash 0731 在 ARC-AGI 測出什麼成績?

官方結果頁列出三個推理檔位的驗證分數。最高檔(Max)在 ARC-AGI-1 半私有(Semi-Private)題組拿 89.0%、每題 0.02 美元;在 ARC-AGI-2 半私有題組拿 61.4%、每題 0.04 美元。ARC-AGI-3 這一欄官方標示為未列成績。

三個檔位的完整成績都在官方結果頁上:

推理檔位ARC-AGI-1(半私有)ARC-AGI-2(半私有)每題成本ARC-AGI-3
Max(最高)89.0%61.4%ARC-AGI-1 $0.02/ARC-AGI-2 $0.04未列成績
High(高)87.0%56.0%官方未公布未列成績
Low(低)84.0%46.0%官方未公布未列成績

高檔與低檔的每題成本,官方這頁沒有公布,這裡就不推估。只有 Max 檔的成本數字是可以拿去做預算的。

ARC-AGI 是什麼測試?分數高代表什麼?

先講清楚這篇文章的資料邊界:官方結果頁只做一件事,列出驗證分數與每題成本。這頁沒有說明 ARC-AGI 的題型長什麼樣、為什麼這樣設計,本文也不轉述那些內容。想知道測試本身怎麼設計,去 ARC Prize 的官方說明頁自己讀一遍再下判斷。

從結果頁能直接讀到的只有三件事。第一,ARC-AGI 分成 ARC-AGI-1、ARC-AGI-2、ARC-AGI-3 三個基準,這次只有前兩個列出分數。第二,驗證成績標示的是半私有(Semi-Private)題組,另外附上公開題組(Public Eval)的逐題對錯;這兩種題組差在哪、ARC Prize 怎麼認定,這頁沒有寫。第三,ARC-AGI-2 對同一個模型明顯比 ARC-AGI-1 難——89.0% 對 61.4%,落差 27.6 個百分點。

那分數高代表什麼?就這頁提供的資訊而言,只代表這個模型在 ARC-AGI 這組題目上答對的比例。它沒有告訴你這個模型的客服對答、文件摘要、程式生成做得如何,那些能力這頁一個字都沒提。把 ARC-AGI 分數當成通用能力的證明,那層推論是讀者自己加上去的,官方沒有這樣宣稱。

三個推理檔位差多少?多花錢一定更準嗎?

差距非常不對稱:在 ARC-AGI-1 上,從 Low 到 Max 只多了 5.0 個百分點(84.0% → 89.0%);在 ARC-AGI-2 上卻多了 15.4 個百分點(46.0% → 61.4%)。

這是最值得老闆記住的一條:任務越難,多付的推理預算越有回報;任務夠簡單時,你為高檔位付的錢有一大半是浪費。簡單任務用 Low 檔,是有數據支撐的省錢動作。

多花錢也不保證單調變好。在官方公布的 ARC-AGI-2 公開題組(Public Eval,120 題,官方逐題列出三個檔位的對錯)裡,有 5 題出現 Low 檔答對、Max 檔反而答錯:4c3d4a41、7b5033c1、7c66cb00、a47bf94d、edb79dae。推理預算調高,會改變模型的解題路徑,路徑改了就有可能改壞。

逐題表格還顯示另外兩件事。三個檔位全部答錯的有 37 題,佔 120 題的 30.8%——這批題目加多少預算都救不回來,卡住的是能力邊界,預算解不開。三個檔位全部答對的有 40 題(33.3%),這批用最便宜的 Low 檔就夠了。Max 檔在這 120 題公開題組答對 72 題(60.0%),與半私有題組的 61.4% 相當接近,代表這個成績不是靠特定題組僥倖。

每題 0.02 美元算便宜嗎?這個數字能直接套到我的產品上嗎?

不能直接套。0.02 與 0.04 美元是 ARC-AGI 題目的每題成本,跟你的客服對話、報表整理、合約比對在輸入長度與輸出長度上完全不同。

但這個數字有一個正確用法:當成「難推理任務的價格參考點」。跑 1,000 個 ARC-AGI-2 難度的推理任務,在 Max 檔約 40 美元。這是一個小公司做內部試跑不會有壓力的量級。

三年前,能做這種等級推理的模型,光是取用門檻就會讓中小企業直接跳過。現在門檻掉到一頓晚餐的價位,而且來自一個掛著「Flash」名字的輕量版本。價格戰的主戰場已經從「聊天多便宜」移到「推理多便宜」。

這對台灣中小企業意味著什麼?

意味著你報價單上那句「我們用的是最貴的模型,所以品質有保障」,從這個月起說不出口了。客戶只要問一次 AI,就會看到便宜模型也能打到這個分數。

具體該做四件事:

  1. 把任務分兩類。 拿你產品線上所有 AI 呼叫,分成「需要當場歸納規則」與「只需要照既定格式做事」。後者佔比通常遠高於老闆的直覺,那部分完全不必付高檔推理的錢。
  2. 只為難的那 30% 付高價。 這次數據顯示,難任務加預算能換到 15.4 個百分點,簡單任務只換到 5.0 個百分點。錢要花在難的那邊。
  3. 用你自己的 30 題做離線對照,不要看榜單換模型。 榜單測的是 ARC-AGI,你的生意不是。準備 30 個真實案例、標好正確答案,同一批題目餵給現用模型與候選模型,比對錯誤率與單次成本。這件事一個下午做得完。
  4. 報價時把模型成本與工程成本拆開列。 模型單價正在快速貶值,工程、資料整備、治理與驗收的成本沒有跟著降。混在一起報價,等於用一個會貶值的項目替不會貶值的項目背書,明年續約一定被砍。

這裡假設一個常見情況:整條產線綁死在單一模型的 API 格式上,想換模型就得重寫大半個中介層。真正該投資的是「換模型只要改設定檔」的抽換層,賭對某一家模型商靠不住。

我該把現在的商用模型換成 DeepSeek V4 Flash 嗎?

看用途。這次公布的只有 ARC-AGI 推理成績,不涵蓋綜合商用能力,把它當作換模型的唯一依據會出事。

你的用途這次數據支不支持換換之前該先做什麼
規則歸納、異常判斷、複雜排程支持評估,這正是 ARC-AGI 測的能力用自家 30 題離線對照,比對 Low/High/Max 三檔的準確率與成本
客服對答、文案生成、摘要不支持,這頁沒有相關評測官方未公布這類成績,要自己測,或等其他基準結果
涉及個資、合約、財務的流程不支持直接換先確認資料落地、留存政策與存取紀錄,這不是分數能回答的問題
已經跑得很穩、成本佔比很低的功能不支持,沒有換的理由維持現狀,把力氣花在成本佔比高的那條線

另外要說清楚:這頁官方沒有公布延遲、上下文長度上限、每題實際 token 用量、商用授權條款,也沒有列出同期其他模型的對照數字。這些全部是換模型前必須自己去問清楚的欄位。三個檔位裡的 High 與 Low 每題成本同樣未公布,做預算時只能用 Max 檔的 0.02/0.04 美元當上緣。

官方這次沒有公布什麼?

比分數更值得記下來的是缺口清單。ARC Prize 這頁只做一件事:驗證分數與每題成本。以下項目在頁面上找不到,任何人跟你講這些數字,都要先問出處。

  • ARC-AGI-3 的成績(頁面標示為未列成績)
  • High 與 Low 檔的每題成本
  • 半私有題組與公開題組的定義與差異說明
  • 模型參數規模、「Flash」相對於完整版的定位
  • 延遲、吞吐量、上下文長度
  • 與其他商用模型的同期對照
  • 部署方式、資料留存與商用授權條款

在這些空白被填上之前,把 DeepSeek V4 Flash 0731 當成「一個在推理基準上被官方驗證過、每題成本很低的候選模型」就好。ARC Prize 的完整榜單在這裡,可以自己去比對其他模型的成本與分數位置。

結論:今年的模型預算要按季重估

把模型費用當固定成本編年度預算的做法,這一年已經行不通。輕量版模型在官方驗證的推理基準上打到 61.4%,每題 0.04 美元,代表你去年談的單價今年一定貴了。

從這週開始做三件事:把任務按難度分級、為每一級指定最便宜可用的檔位、每一季重新跑一次離線對照。做完這三件事,你談的其實是成本結構。

模型成本要按季重估,客戶怎麼找到你這件事同樣得定期回頭看一次——你的報價再精準,客戶問 AI 時沒被提到就沒有下一步。如果你想知道客戶在 ChatGPT、Perplexity 或 Google AI 上問「這類服務推薦哪家」時,你的公司會不會出現在答案裡,可以從 AIRUN 的 AEO 檢查開始看。

常見問題

DeepSeek V4 Flash 0731 在 ARC-AGI 測試表現如何?

官方驗證成績:最高檔(Max)在 ARC-AGI-1 半私有題組拿 89.0%、每題 0.02 美元,ARC-AGI-2 拿 61.4%、每題 0.04 美元。High 檔 87.0% 與 56.0%,Low 檔 84.0% 與 46.0%,ARC-AGI-3 未列成績(2026 年 7 月 31 日公布)。

它適合拿來取代哪些商用模型?

只適合評估用在「需要當場歸納規則」的任務,例如異常判斷、複雜排程、規則推理。客服對答、文案生成、摘要這類語言任務,官方這頁沒有評測數據,不能用這個成績當換模型的理由。涉及個資、合約、財務的流程,要先確認資料落地與授權條款,那不是分數能回答的。

三個推理檔位該選哪一個?

看任務難度。從 Low 到 Max,ARC-AGI-1 只多 5.0 個百分點,ARC-AGI-2 卻多 15.4 個百分點。簡單任務用 Low 檔,省下來的錢是實打實的;難任務才值得付 Max 檔。實務做法是把任務分級,每一級指定最便宜可用的檔位;全線都掛最高檔只是把錢燒掉。

推理預算調到最高,準確率一定更好嗎?

不一定。官方 ARC-AGI-2 公開題組 120 題中,有 5 題 Low 檔答對、Max 檔答錯(4c3d4a41、7b5033c1、7c66cb00、a47bf94d、edb79dae)。另有 37 題三檔全錯,佔 30.8%,屬於能力邊界,加預算救不回來。

每題 0.02 美元可以直接當成我的產品成本嗎?

不行。那是 ARC-AGI 題目的每題成本,輸入輸出型態跟你的業務任務完全不同。正確用法是當成「難推理任務的價格參考點」:跑 1,000 個 ARC-AGI-2 難度的任務,Max 檔約 40 美元。實際成本要用你自己的真實案例跑一輪才算得準。

中小企業現在該做什麼?

四件事:把 AI 呼叫按「需要歸納規則」與「照格式做事」分兩類;只為難的那類付高檔位費用;準備 30 個自家真實案例做離線對照,不要看榜單換模型;報價時把模型成本與工程成本拆開列。模型單價正在快速貶值,工程與治理成本沒有,混在一起報價明年續約會被砍。