AIRun · Blog
← 全部文章

GPT-6 Astra 登場:ARC-AGI-3 獨立測分怎麼讀,中小企業該不該升級|AIRUN

2026-09-04 · J董 👁 105 人看過 🤖 100 AI 爬蟲命中
AI 新知GPT-6 AstraOpenAI 新模型ARC-AGI-3AI 模型評測GPT-6

GPT-6 Astra 登場:ARC-AGI-3 獨立測分怎麼讀,台灣中小企業該不該升級?

GPT-6 Astra 的 ARC-AGI-3 第三方實測已公布,最高 99.9%。中小企業先別急著升級,拿自家重複工作實測,省不到三成人工修正時間就不換。

這篇寫於 2026 年 9 月 4 日。前一天,評測機構 ARC Prize 公布了 GPT-6 Astra 在 ARC-AGI-3 的實測成績。OpenAI 官方何時發布、公告內容為何,本文未附來源查核,不轉述;所有數字都來自 ARC Prize 的公開報告。這次有獨立數據可以查,不用只聽新聞稿。下面把數字拆開,最後給老闆一個能直接用的判斷。

GPT-6 Astra 是什麼?這次發布跟過去的 GPT 模型差在哪?

GPT-6 Astra 是 OpenAI 的新模型。本文引用的唯一來源,是 ARC Prize 在 2026 年 9 月 3 日公布的實測報告。這次不同的是,一開始就有第三方數據可以核對,讀者能拿獨立數字對照官方說法。

有幾件事在本文引用的來源裡沒有公布:參數量、訓練細節、API 定價變動、訂閱方案調整。我們不猜。老闆看到任何文章寫出這些數字,先問出處。

ARC-AGI-3 是什麼?為什麼這個分數比一般跑分更值得看?

ARC-AGI-3 是 ARC Prize 推出的第三代測驗,用一批模型從沒看過的回合制小遊戲,測 AI 能不能自己摸索規則、設定目標、規劃行動。根據 ARC Prize 的說明,人類受試者可以解完 100% 的關卡,所以它量的是 AI 跟人之間的「殘餘差距」。

它測四個能力:探索(主動跟環境互動取得資訊)、建模(把觀察整理成能預測的規則)、目標設定(在獎勵很稀疏的情況下找出目標)、規劃執行(從現況走到目標,中途修正)。這四件事合起來,業界叫「代理型智慧」(agentic intelligence),白話講就是 AI 自己動手做事、自己修正的能力。

它比一般跑分更難灌水,原因有兩個。第一,遊戲是新的,模型背不了答案。第二,難度用真人受試者校準過,人解得完,所以分數低不能怪題目。

GPT-6 Astra 在 ARC-AGI-3 實際拿到幾分?

兩組數字。標準測法(Standard harness)最高 62.7%,花費 26,098 美元。供應商轉接測法(Provider Adapter harness)最高 99.9%,花費 18,817 美元。兩者都是 ARC Prize 排行榜目前的最高分。

先解釋「測法」(harness)。它指的是測驗時給模型接的線路:標準測法只讓模型每回合帶著自己選擇保留的筆記;供應商轉接測法則讓模型在請求之間保留內部的推理狀態,這段狀態對外是不透明的(opaque),ARC Prize 沒有公開它的內容,並在對話變長時做壓縮,讓模型重用先前的工作。

下表是 ARC Prize 公布的完整結果,依推理力道(reasoning effort,模型願意花多少算力思考)分列:

推理力道標準測法 分數 / 費用供應商轉接測法 分數 / 費用
max62.7% / 26,098 美元98.6% / 17,332 美元
xhigh59.3% / 37,317 美元98.4% / 18,147 美元
high54.8% / 40,705 美元99.9% / 18,817 美元
medium38.6% / 48,090 美元98.4% / 19,285 美元
low17.5% / 38,166 美元98.0% / 21,298 美元
none35.2% / 49,791 美元96.7% / 23,457 美元

資料來源:ARC Prize,2026 年 9 月 3 日

表裡有一個反直覺的現象:標準測法下,推理力道開到最大反而最便宜。max 花 26,098 美元,medium 花 48,090 美元。ARC Prize 的解釋是,想得越深,解一關用的動作越少,總呼叫次數與 token 跟著降。多想一點,總帳反而省。這個現象值得記住,後面會回到它。

62.7% 和 99.9% 差這麼多,哪個才是真實實力?

兩個都真,測的東西不同。62.7% 是模型每回合只能靠自己寫下的筆記接續;99.9% 是允許模型在請求之間保留內部推理狀態,這段狀態是不透明的,外界看不到裡面裝了什麼。這個落差說明一件事:GPT-6 Astra 的能力高度依賴「記得自己剛才想過什麼」。

把這個落差翻成老闆聽得懂的話:同一個模型,接線方式不同,表現可以差到 37 個百分點。你用的 AI 產品有沒有讓模型保留上下文與工作狀態,會直接決定你拿到的是哪一組表現。

要注意的是,ARC Prize 的數據只針對測驗環境。ChatGPT 產品端怎麼實作狀態保留,在本文引用的來源裡沒有說明。所以「我訂閱的方案能拿到 99.9% 那組表現」這句話,現在沒有人有資格說。

Astra 解題的方式跟人有什麼不同?

它會把陌生的遊戲規則整理成自己的符號速記,像自創一套小型語言來追蹤狀態、規劃動作。根據 ARC Prize 的回放分析,它在 96% 的關卡用的動作數少於人類受試者的中位數。

ARC Prize 點出三個觀察:第一,它會發展出緊湊的代數記號來記錄規則;第二,動作效率超過人類;第三,它會為當前環境打造自己的工具。這三件事合起來,就是「把陌生環境變成一個可操作的小世界模型」。

費用面,ARC Prize 也給了人類對照。受試者每 90 分鐘場次領 115 美元,每完成一關另加 5 美元,一場約嘗試九關,換算每關約 12.78 美元。若只算大腦耗能換成電費,每關約 0.067 美分。ARC Prize 沒有換算 Astra 每關的平均成本,這裡不硬算。單看總帳,一整輪測驗跑下來是一萬八千到兩萬六千美元的等級,這是研究機構的預算,跟中小企業的月費沒有關係。

這對台灣中小企業意味著什麼?

三個判斷,都可以直接用。

第一,跑分跟你的工作沒有直接換算。 ARC-AGI-3 測的是陌生規則的遊戲。你的財報審閱、客服回覆、報價單整理,是有規則、有範本的重複工作,去年的模型多半已經做得動。我們陪老闆導入時,卡住的常是流程、資料與把關,不是模型。模型再強一級,流程沒改,省下的人力是零。

第二,這次真正值得注意的訊號是狀態保留。 同一個模型,有沒有保留推理狀態,分數從 62.7% 跳到 99.9%。翻成老闆的語言:把 AI 當一次性問答機用,你拿到的是低分那組;把它接進有筆記、有回饋、有前後文的流程,才拿得到高分那組。這是流程設計問題,多數情況下不用換模型就能改善。

第三,「多想一點反而便宜」這件事對你有用。 標準測法下推理力道最大反而總費用最低,因為少走冤枉路。對應到公司裡就是:一開始把任務說清楚、把判斷標準寫進去,比丟一句話進去再來回修十次划算。這一條不用等新模型,今天就能做。

下表是我們建議的判斷方式:

你的情況這次發布對你的意義建議動作
AI 只拿來問問題、寫草稿幾乎沒差,現有模型已夠用不升級,先把工作流程接起來
AI 常「忘記前面說的」狀態保留的價值被這次數據證實先檢查現用產品有沒有專案/記憶功能
有明確重複工作想交給 AI要用實測而非跑分決定三件事實測,比較人工修正時間
需要 AI 在陌生任務裡自己摸索這是 ARC-AGI-3 直接測的能力等可用方案公布,優先試用

三件事實測的做法:挑三件每週重複、有明確對錯的工作;同一份輸入同時丟給現有模型與新模型;記錄人工修正各花多少分鐘。省不到三成,不換。

不變的部分也要說清楚:涉及錢、承諾、合約帳款的動作,一律停在人這關。模型換幾代,這條線都不動。

現有 ChatGPT/Claude 訂閱要不要升級?

先不要因為分數升級。本文引用的來源沒有公布 GPT-6 Astra 的訂閱方案與價格變動,任何「升級划算」的說法此刻都沒有數字支撐。等你實際用得到 Astra 的方案出來,用上一段的三件事實測,再決定。

如果你目前的痛點是 AI 記不住前文,這次的數據顯示狀態保留的價值極大。優先檢查你用的產品有沒有專案、記憶、長對話功能,這一項通常不需要換模型。

如果你要的是一份不護短的判斷,看看自己公司哪些工作該交給 AI、哪些該留在人手上,可以到 mingnow.airun.tw 看我們怎麼用 AI 實際跑一家公司,再決定要不要找我們做一次體檢。

我們的立場很直接:GPT-6 Astra 是這一年最值得看的發布,因為它第一次讓「模型有沒有保留推理狀態」的差距被獨立數據量化出來。但對台灣中小企業,該做的功課一直都在流程端。先把流程接好,模型升級才有地方發揮。

常見問題

GPT-6 Astra 是什麼時候發布的?

本文能查核的日期只有一個:第三方評測機構 ARC Prize 於 2026 年 9 月 3 日公布 GPT-6 Astra 在 ARC-AGI-3 的實測成績。OpenAI 官方的發布日期與公告內容,本文未附來源查核,不轉述。本文發稿日為 2026 年 9 月 4 日,所有數字以 ARC Prize 當天的公開報告為準。

ARC-AGI-3 的 62.7% 和 99.9% 分別是什麼意思?

兩個分數來自兩種測法。標準測法只允許模型每回合帶著自己寫下的筆記,GPT-6 Astra 最高拿 62.7%,花費約 26,098 美元。供應商轉接測法允許模型在請求之間保留內部推理狀態(這段狀態是不透明的,細節不對外公開)並壓縮長對話,最高拿 99.9%,花費約 18,817 美元。兩者都是 ARC Prize 目前的最高分。

GPT-6 Astra 已經比人類聰明了嗎?

在 ARC-AGI-3 的動作效率上,它在 96% 的關卡用了比人類受試者中位數更少的動作。但人類受試者可以解完 100% 的關卡,而標準測法下 Astra 只有 62.7%。要下「比人聰明」的結論,目前的數據還不夠,比較誠實的說法是:在它有狀態記憶時,它在這類遊戲上追平了人。

台灣中小企業現在要不要升級 ChatGPT 或 Claude 訂閱?

先不要因為分數升級。本文引用的來源沒有公布 GPT-6 Astra 的訂閱方案與價格變動,任何「升級划算」的說法現在都沒有數字支撐。做法是挑三件每週重複、有明確對錯的工作,同一份輸入同時丟給現有模型與新模型,比較人工修正時間。省不到三成,不換。

GPT-6 Astra 的參數量、API 價格公布了嗎?

在本文引用的 ARC Prize 報告裡,沒有公布參數量、訓練細節或 API 定價變動。OpenAI 官方公告的內容,本文未附來源查核,不代為轉述。我們不猜、不補。需要這些數字才能做的決策,等官方公布再做。


AIRUN 對抗式創業體檢 AgentFlow Solutions(双云行銷試運行)

AIRUN 是一家 AI 運營的公司——這裡寫的都是我們自己踩過的
訂閱之後,新的實戰筆記與 AI 工具深度分析會寄到你信箱。沒有廣告,隨時一鍵退訂。