AIRun · Blog
← 全部文章

開源模型便宜 100 倍,檢索任務追平 GPT-5.6 Sol:4B 小模型後訓練實測

2026-08-07 · J董 👁 104 人看過 🤖 100 AI 爬蟲命中
AI 新知開源模型RL 後訓練AI 降本中小企業 AI檢索

一個 4B 開源小模型經 RL 後訓練,在檢索任務上追平 GPT-5.6 Sol,成本低約 100 倍。這個結論只在這類特定任務上成立。

下面拆的是這件事的實測細節、費用怎麼算、以及你手上那批客服對話與產品文件到底夠不夠用。

這件事什麼時候發生、是誰做的?

2026 年 8 月 5 日,資料庫服務商 Neon 與新創 Castform 共同發表一篇實測文章,說明他們如何用存在 Postgres 裡的既有資料,把一個 4B 參數的開源模型訓練到與 GPT-5.6 Sol 同等準確。文章發表後登上 Hacker News,累積 424 分、114 則討論。本文發稿日為 2026 年 8 月 7 日,距離事件兩天,後續是否有第三方複現,截至發稿尚未見到。

文章由 Pranav Aurora、Ying Hang Seah、Angel Pan 三人共同署名,其中 Ying Hang Seah 是 Castform 共同創辦人。他在文中的說法很直接:多數團隊最好的訓練資料就躺在自己的資料庫裡,卡住的是把原始資料變成可用訓練集這件苦工,以及讓 agent 大規模讀寫搜尋所需的基礎設施。

這裡先解釋一個詞。4B 指模型有約 40 億個參數,屬於小型模型;GPT-5.6 Sol 的參數規模官方未公布,本文不做規模比較。開源權重(open-weights) 指模型的權重檔可以下載、自己部署、自己微調,不必透過原廠 API。

一個 4B 開源小模型憑什麼追平 GPT-5.6 Sol?

關鍵在於任務被縮小了。這顆模型只負責「在你的語料裡把答案找出來」,不負責通用推理。Neon 把好用的 agent 拆成兩塊能力:Context(有沒有工具找到對的資料)與 Model(模型知不知道該搜什麼)。Neon 的 Lakebase Search 解決前者,Castform 解決後者。

要看懂為什麼現在才有人做這件事,得先看檢索這條路怎麼走過來的。Neon 文中把演進分成兩段:

約 2022 年,整個產業押注在嵌入檢索(embedding search)——把文字轉成向量、比對相似度找出最接近的段落。當時每一家資料庫商都加了向量功能,pgvector 是 Neon 下載量最高的擴充套件。工程師手工搭 RAG 管線,本質上就是一次相似度搜尋。

約 2025 年,agent 開始普及,開發者做多跳搜尋(multi-hop),把大問題拆成小問題。檢索從「一次搜完」變成 agentic retrieval——模型會規劃、會迴圈式地搜很多次。問題是每跑一輪迴圈,就多打一次前緣模型的 API。

代價寫在 Neon 文章裡:一次典型的多輪搜尋請求,用 gpt-5.6-sol 端到端約需 10 秒、約 0.03 美元。Neon 用的形容詞是「慢到、貴到不可行」。

小型開源權重模型的成本約為前者的百分之一,但開箱即用的能力落後閉源 API 模型。RL 後訓練就是用來補這段落差的。Neon 的結論寫得很收斂,值得原樣引述:在搜尋這類特定任務上,後訓練過的開源模型可以匹敵甚至擊敗前緣模型,而每次請求的成本低上好幾個數量級。

注意這句話的邊界——「特定任務」四個字是整篇文章的前提,拿掉它就是誤讀。

什麼是 RL 後訓練?跟 RAG、微調差在哪?

RL 後訓練(強化學習後訓練)是讓模型透過反覆試誤、被打分數,學會把一件事做好的訓練方式。 它需要三個零件,Neon 列得很清楚:

零件白話說明客服搜尋場景的例子
任務(task)你要模型完成什麼回答使用者的產品問題
環境(environment)模型能動用的工具一個能搜你全部文件的搜尋工具
獎勵函數(reward function)怎麼判斷做得好不好答案跟正確答案是否一致

三個零件到齊,訓練就是一個試誤迴圈:模型拿工具嘗試任務,獎勵函數給分,回饋訊號引導模型一步步爬向更好的表現。文中把每一次嘗試稱為一次 rollout(模型完整跑一遍任務的過程)。

跟另外兩種常見做法擺在一起看比較清楚:

  • RAG/向量檢索:不動模型,只在提問時把相關段落塞進提示詞。改一次資料立刻生效,但模型不會因此變聰明。
  • 監督式微調(SFT):拿現成的正確答案餵給模型模仿。需要人工標註,且模型只學會模仿答案,學不到「該怎麼搜」。
  • RL 後訓練:模型自己在環境裡試錯,學的是決策過程——先搜什麼、要不要再搜一次、什麼時候可以停。

真正卡住多數公司的,是把原始文件變成資料集這道苦工。Neon 直說:多數公司沒有現成乾淨的任務與獎勵函數資料集。企業手上有的是大量私有資料——內部文件、產品紀錄、支援文章、客戶互動紀錄、wiki、營運資料庫——這些資料裡有 agent 需要的知識,但要變成能訓練的資料集,通常得砸下大量資料工程與人工標註。

於是團隊放棄後訓練的理由永遠是那兩句:「我們沒有訓練資料」「微調太難,我們沒有那個基礎設施」。

Castform 的產品定位就是把這兩句話消掉:把既有語料自動轉成訓練任務,再代管整個 RL 迴圈。Neon 文中寫的目標是讓後訓練變得跟寫提示詞一樣好上手,開發者不必碰 GPU 的機器學習內部細節。

一份差旅規範怎麼變成訓練題

Neon 給的範例很具體,直接看:

階段內容
原始文件(來自你的資料)透過 Navan 訂的火車票由 GitLab 差旅卡支付;火車須為標準車廂,並於 14 天前訂票
正確答案(從資料推得)火車須為標準車廂,且需提前 14 天訂票
問題(合成生成)在 Navan 訂火車行程時,我需要提前多久預訂、應該選哪一種座位等級?

這就是整套機制的核心動作:把你已經寫好的規範,反過來生成一堆使用者會問的問題。有了問答配對,再指定 agent 能用哪些工具、獎勵函數要獎勵什麼,訓練就能跑起來。

實際跑訓練時,Castform 的管線全程接在 Neon 上:原始文件存在 Neon 的 Postgres;合成資料生成階段用 lakebase_textlakebase_vector 寫入訓練任務;RL 訓練的每一次 rollout,搜尋工具呼叫都打 Neon 上的 Lakebase Search;上線推論時,最終模型用的是同一個搜尋工具呼叫。

最後這點是工程上最值錢的細節——訓練環境與正式環境用同一套檢索工具,模型學到的搜尋策略才不會一上線就失準。

便宜 100 倍,實際省下多少錢?

用 Neon 給的兩個數字往下推:每次多輪檢索請求 0.03 美元,開源小模型約為百分之一。

每日查詢量前緣模型年成本(推算)後訓練小模型年成本(推算)年差額
200 次約 2,190 美元約 22 美元約 2,168 美元
1,000 次約 10,950 美元約 110 美元約 10,840 美元
5,000 次約 54,750 美元約 548 美元約 54,200 美元

這張表是我方依 Neon 公布的單次成本線性推算,只算推論費用。訓練一次要多少錢、模型多久要重訓一次、自架 GPU 或用代管服務的月費,官方文章都未公布——這三筆才是決定你划不划算的變數,別跳過。

延遲同樣值得看。10 秒的等待放進一個客服對話框,等待感會被放大,體驗直接崩掉。小模型的推論延遲文中未給具體秒數,但參數規模與生成速度的關係是明確的,這一項改善通常比省錢更早被使用者感受到。

前緣模型 API、開源小模型後訓練、純向量檢索,怎麼選?

比較項直接呼叫前緣模型 API開源小模型 + RL 後訓練純向量檢索(RAG)
單次多輪檢索成本約 0.03 美元(Neon 實測)約前者的 1/100幾乎只有嵌入與資料庫費用
端到端延遲約 10 秒(Neon 實測)官方未公布秒數,理論上顯著較低最快,單次查詢
特定任務準確度基準線後訓練後可追平(Neon 實測,檢索任務)遇到需要多步推理的問題會漏
前期投入幾乎零,接 API 就跑需備語料、定義獎勵函數、跑訓練需建索引與切段策略
資料要求語料裡必須真的有答案語料品質決定一切
任務更動時改提示詞即可可能要重訓重建索引
適用範圍通用,什麼都能問只在被訓練的那類任務上強事實查找

選法很簡單:任務窄、量大、規則穩定,走後訓練;任務雜、量小、規則常改,留在前緣模型 API。 純 RAG 是前兩條路共同的地基——Neon 的架構裡,後訓練的模型上線後照樣要呼叫搜尋工具。

Hacker News 上的討論補了一層有用的分類。工程師 softwaredoug 把 agentic search 的實作歸成三類:一是把檢索本身做好,Hornet、MixedBread、LightOn 等團隊在 late interaction(延後交互,一種在比對階段才做細粒度計算的檢索技術)上都有進展;二是靠更聰明的外層框架,用生成器加評估器互相檢查,檢索本身可能只是 grep,代價是模型不斷迴圈燒掉大量 token;三是直接訓練一顆專攻檢索的模型,Neon 這篇屬於第三類,同路線的還有 SID.ai 與 Glean 的 Waldo 模型。

這條資訊比原文更有價值——這是 2026 年整年都在發生的一條技術路線,不只一家新創在走

這對台灣中小企業意味著什麼?

意味著「AI 越貴越好」這個假設,在客服問答與內部文件搜尋這兩個場景上,可以正式撤掉了。

我的判斷分三層說。

第一,你手上最值錢的 AI 資產,是你過去累積的客服對話紀錄與產品文件。 Neon 列的企業資料清單——內部文件、產品紀錄、支援文章、客戶互動、wiki、營運資料庫——台灣中小企業一樣不缺,只是散在 LINE 官方帳號、Excel、Google 雲端硬碟和某個離職同事的信箱裡。真正的門檻在於這批資料還沒被集中、還沒被整理成「問題—答案」的形式。今天就能開始做,不用等任何工具成熟。

第二,別急著跳去自架模型。 對每天查詢量在三位數以下的公司,照上面那張表推算,一年省下的推論費用大約在兩千美元上下,而導入一套後訓練流程要吃掉的工程時間,價值通常遠高於這個數。kumama 在 Hacker News 留言自稱是 Castform 創辦人,身分未經第三方查證,但發言與 Castform 官方定位一致。他提到的合適場景偏向高流量客服、詐欺偵測這一類——共通點是量體大到「準確度多 2%」就能換回可觀金額(來源摘錄在此截斷,未列出更多場景)。你要先確認自己在不在這條線上。

第三,這條路的真正紅利是延遲與可控性,省錢只是附帶。 一個查詢從 10 秒顯著縮短(官方未公布小模型的具體秒數),客服對話的完成率會直接改變;模型跑在你自己可控的環境裡,客戶資料不必往外送,這對做醫療、法務、財務相關業務的公司是硬需求。

有一個反面意見必須放進來,因為它有道理。Hacker News 上 benjiro29 的質疑是:專用模型很少真的贏過強大的通用模型,而且如果一個任務重複到值得專門訓練,你多半應該直接寫一支程式處理,再把清理好的資料交給主模型。這個質疑對相當比例的中小企業場景是成立的——你的「AI 客服」如果八成問題是「出貨了沒」「怎麼退貨」,那用一張表和一段查詢邏輯就解決了。

先做這道排除題,再談後訓練。

中小企業要用便宜的開源AI模型做客服搜尋,該怎麼開始?

照這個順序做,前兩步不花錢,第三步之後才需要決定要不要投入。

第一步:量出現況。 打開你的 API 帳單,算出客服問答與內部搜尋這兩件事每個月花多少錢、每天幾次查詢、平均回應幾秒、使用者中途放棄的比例多少。沒有這組數字,後面所有決策都是憑感覺。

第二步:把語料集中。 把過去一年的客服對話、產品說明、退換貨規則、FAQ、內部 SOP 集中到一個地方,任何能全文搜尋的資料庫都可以。這一步的檢核標準只有一個:隨機抽 20 個真實客戶問題,人工在這批資料裡能不能找到答案。 找不到代表資料缺,先補資料。

第三步:先跑純檢索版本。 用最便宜的方式接一個搜尋加生成的流程,量準確率。這一步就能解決的問題,別再往下走。

第四步:判斷值不值得後訓練。 三個條件同時成立才往下:查詢量大到年省金額有意義、任務規則半年以上不會大改、純檢索版本的準確率卡在你不能接受的水準。

第五步:定義獎勵函數。 這是整件事最需要人腦的部分,也最常被低估。你要能明確說出「什麼叫答對」——是文字吻合、是客戶沒有再追問、還是沒有升級給真人客服。獎勵函數定歪,模型就會學歪,而且學得非常有效率。

第六步:小範圍上線、雙軌比對。 新模型跟原本的流程平行跑一段時間,比準確率、比延遲、比升級率,數字贏了再全量切換。

如果你不確定自己卡在哪一步,先從第一步做起。做完第一步,答案通常自己會浮出來。

關於企業內部知識怎麼整理成 AI 能用的形式,我們在 AEO 方法拆解 寫過完整的一份,同一套邏輯用在對外內容與對內檢索上是通的;實際跑起來長什麼樣,可以到 https://mingnow.airun.tw 看。

什麼情況下你不該做後訓練?

直接列,符合任何一條就先別做:

  • 查詢量太小。 年省金額低於工程投入,這是純虧。
  • 規則能寫成程式。 查訂單、算運費、對庫存,寫 SQL 比訓練模型準確一百倍也便宜一百倍。
  • 內容週週在變。 訓練完就過期,你會陷在無止境的重訓迴圈裡。
  • 語料裡沒有答案。 模型不會無中生有,這是最常見的失敗原因。
  • 你還沒有評估基準。 沒有一組固定的測試題與正確答案,你根本不知道訓練有沒有變好。

最後補一句不用花錢的:在你的量體撐不起訓練成本之前,把提示詞磨利仍然是投報率最高的那一手。後訓練處理的是規模化之後的單位成本,提示詞處理的是現在就答不好,順序別顛倒。

結論:這條路成立,但門票是你的資料

2026 年 8 月這次實測把一件事講清楚了:在檢索這種邊界明確的任務上,花最多錢訂最貴的模型已經不是唯一解。一個 4B 的開源模型用你自己的資料練過,可以做到同樣準,成本差 100 倍。

但門票不是預算,是資料。你有沒有把三年的客服對話留下來、有沒有把產品規則寫成文件、有沒有能力說清楚「什麼叫答對」——這三件事決定你能不能上車,而且沒有任何一家廠商能替你做。

這週就從第一步開始:打開帳單,量出你現在到底花多少錢、等多少秒。這個數字會告訴你要不要走這條路。

常見問題

4B 開源模型真的能贏 GPT-5.6 Sol 嗎?

在檢索這一項任務上,Neon 與 Castform 的實測說一個 4B 開源模型經過 RL 後訓練,可以做到與 GPT-5.6 Sol 同等準確。這是單一任務的結論,不代表這顆模型在寫作、推理、寫程式上追得上前緣模型。把它當成一個被磨利的專用零件來用。

便宜 100 倍是怎麼算的?

Neon 文中給了兩個數字:一次多輪檢索請求用 gpt-5.6-sol 端到端約 10 秒、約 0.03 美元;小型開源權重模型的推論成本約為前者的百分之一。依此推算,每天 1,000 次查詢,前緣模型一年約 1 萬美元,後訓練小模型一年約 100 美元。訓練與維運成本官方未公布,實際差距要自己試算。

我公司資料很亂,還能做後訓練嗎?

資料亂是常態。RL 後訓練需要三樣東西:任務、環境、獎勵函數,多數公司缺的是把原始文件變成「問題—正確答案」配對的那道工。Castform 的做法是從既有語料自動生成問答任務。你要先確認的是資料裡真的有答案,如果連人翻文件都找不到答案,模型也學不出來。

後訓練跟 RAG 可以只選一個嗎?

不能。RL 後訓練訓練的是模型「怎麼搜、搜幾次、什麼時候停」的決策能力,檢索工具本身還是要有。Neon 的架構裡,訓練時每一次試誤用的搜尋工具,跟上線後用的是同一個。先把檢索基礎建好,後訓練才有東西可練。

什麼情況下不該做後訓練?

三種情況。查詢量低到省下的 API 費用不夠付工程時間;任務規則明確到寫成程式碼就解決;任務內容還在每週變動,訓練完就過期。Hacker News 討論串裡也有工程師直指,重複性高到值得專門訓練的任務,往往直接寫程式更划算——這個質疑是對的,要先排除。

台灣中小企業現在該做什麼?

先做兩件不用花錢的事。第一,量出你現在每個月在客服問答與內部搜尋上燒掉多少 API 費用、平均回應幾秒。第二,把過去一年的客服對話與產品文件集中到一個可搜尋的地方。這兩件事無論你最後選哪條路都用得上,而且是後訓練唯一真正的門檻。