開源模型便宜 100 倍,檢索任務追平 GPT-5.6 Sol:4B 小模型後訓練實測
一個 4B 開源小模型經 RL 後訓練,在檢索任務上追平 GPT-5.6 Sol,成本低約 100 倍。這個結論只在這類特定任務上成立。
下面拆的是這件事的實測細節、費用怎麼算、以及你手上那批客服對話與產品文件到底夠不夠用。
這件事什麼時候發生、是誰做的?
2026 年 8 月 5 日,資料庫服務商 Neon 與新創 Castform 共同發表一篇實測文章,說明他們如何用存在 Postgres 裡的既有資料,把一個 4B 參數的開源模型訓練到與 GPT-5.6 Sol 同等準確。文章發表後登上 Hacker News,累積 424 分、114 則討論。本文發稿日為 2026 年 8 月 7 日,距離事件兩天,後續是否有第三方複現,截至發稿尚未見到。
文章由 Pranav Aurora、Ying Hang Seah、Angel Pan 三人共同署名,其中 Ying Hang Seah 是 Castform 共同創辦人。他在文中的說法很直接:多數團隊最好的訓練資料就躺在自己的資料庫裡,卡住的是把原始資料變成可用訓練集這件苦工,以及讓 agent 大規模讀寫搜尋所需的基礎設施。
這裡先解釋一個詞。4B 指模型有約 40 億個參數,屬於小型模型;GPT-5.6 Sol 的參數規模官方未公布,本文不做規模比較。開源權重(open-weights) 指模型的權重檔可以下載、自己部署、自己微調,不必透過原廠 API。
一個 4B 開源小模型憑什麼追平 GPT-5.6 Sol?
關鍵在於任務被縮小了。這顆模型只負責「在你的語料裡把答案找出來」,不負責通用推理。Neon 把好用的 agent 拆成兩塊能力:Context(有沒有工具找到對的資料)與 Model(模型知不知道該搜什麼)。Neon 的 Lakebase Search 解決前者,Castform 解決後者。
要看懂為什麼現在才有人做這件事,得先看檢索這條路怎麼走過來的。Neon 文中把演進分成兩段:
約 2022 年,整個產業押注在嵌入檢索(embedding search)——把文字轉成向量、比對相似度找出最接近的段落。當時每一家資料庫商都加了向量功能,pgvector 是 Neon 下載量最高的擴充套件。工程師手工搭 RAG 管線,本質上就是一次相似度搜尋。
約 2025 年,agent 開始普及,開發者做多跳搜尋(multi-hop),把大問題拆成小問題。檢索從「一次搜完」變成 agentic retrieval——模型會規劃、會迴圈式地搜很多次。問題是每跑一輪迴圈,就多打一次前緣模型的 API。
代價寫在 Neon 文章裡:一次典型的多輪搜尋請求,用 gpt-5.6-sol 端到端約需 10 秒、約 0.03 美元。Neon 用的形容詞是「慢到、貴到不可行」。
小型開源權重模型的成本約為前者的百分之一,但開箱即用的能力落後閉源 API 模型。RL 後訓練就是用來補這段落差的。Neon 的結論寫得很收斂,值得原樣引述:在搜尋這類特定任務上,後訓練過的開源模型可以匹敵甚至擊敗前緣模型,而每次請求的成本低上好幾個數量級。
注意這句話的邊界——「特定任務」四個字是整篇文章的前提,拿掉它就是誤讀。
什麼是 RL 後訓練?跟 RAG、微調差在哪?
RL 後訓練(強化學習後訓練)是讓模型透過反覆試誤、被打分數,學會把一件事做好的訓練方式。 它需要三個零件,Neon 列得很清楚:
| 零件 | 白話說明 | 客服搜尋場景的例子 |
|---|---|---|
| 任務(task) | 你要模型完成什麼 | 回答使用者的產品問題 |
| 環境(environment) | 模型能動用的工具 | 一個能搜你全部文件的搜尋工具 |
| 獎勵函數(reward function) | 怎麼判斷做得好不好 | 答案跟正確答案是否一致 |
三個零件到齊,訓練就是一個試誤迴圈:模型拿工具嘗試任務,獎勵函數給分,回饋訊號引導模型一步步爬向更好的表現。文中把每一次嘗試稱為一次 rollout(模型完整跑一遍任務的過程)。
跟另外兩種常見做法擺在一起看比較清楚:
- RAG/向量檢索:不動模型,只在提問時把相關段落塞進提示詞。改一次資料立刻生效,但模型不會因此變聰明。
- 監督式微調(SFT):拿現成的正確答案餵給模型模仿。需要人工標註,且模型只學會模仿答案,學不到「該怎麼搜」。
- RL 後訓練:模型自己在環境裡試錯,學的是決策過程——先搜什麼、要不要再搜一次、什麼時候可以停。
真正卡住多數公司的,是把原始文件變成資料集這道苦工。Neon 直說:多數公司沒有現成乾淨的任務與獎勵函數資料集。企業手上有的是大量私有資料——內部文件、產品紀錄、支援文章、客戶互動紀錄、wiki、營運資料庫——這些資料裡有 agent 需要的知識,但要變成能訓練的資料集,通常得砸下大量資料工程與人工標註。
於是團隊放棄後訓練的理由永遠是那兩句:「我們沒有訓練資料」「微調太難,我們沒有那個基礎設施」。
Castform 的產品定位就是把這兩句話消掉:把既有語料自動轉成訓練任務,再代管整個 RL 迴圈。Neon 文中寫的目標是讓後訓練變得跟寫提示詞一樣好上手,開發者不必碰 GPU 的機器學習內部細節。
一份差旅規範怎麼變成訓練題
Neon 給的範例很具體,直接看:
| 階段 | 內容 |
|---|---|
| 原始文件(來自你的資料) | 透過 Navan 訂的火車票由 GitLab 差旅卡支付;火車須為標準車廂,並於 14 天前訂票 |
| 正確答案(從資料推得) | 火車須為標準車廂,且需提前 14 天訂票 |
| 問題(合成生成) | 在 Navan 訂火車行程時,我需要提前多久預訂、應該選哪一種座位等級? |
這就是整套機制的核心動作:把你已經寫好的規範,反過來生成一堆使用者會問的問題。有了問答配對,再指定 agent 能用哪些工具、獎勵函數要獎勵什麼,訓練就能跑起來。
實際跑訓練時,Castform 的管線全程接在 Neon 上:原始文件存在 Neon 的 Postgres;合成資料生成階段用 lakebase_text 與 lakebase_vector 寫入訓練任務;RL 訓練的每一次 rollout,搜尋工具呼叫都打 Neon 上的 Lakebase Search;上線推論時,最終模型用的是同一個搜尋工具呼叫。
最後這點是工程上最值錢的細節——訓練環境與正式環境用同一套檢索工具,模型學到的搜尋策略才不會一上線就失準。
便宜 100 倍,實際省下多少錢?
用 Neon 給的兩個數字往下推:每次多輪檢索請求 0.03 美元,開源小模型約為百分之一。
| 每日查詢量 | 前緣模型年成本(推算) | 後訓練小模型年成本(推算) | 年差額 |
|---|---|---|---|
| 200 次 | 約 2,190 美元 | 約 22 美元 | 約 2,168 美元 |
| 1,000 次 | 約 10,950 美元 | 約 110 美元 | 約 10,840 美元 |
| 5,000 次 | 約 54,750 美元 | 約 548 美元 | 約 54,200 美元 |
這張表是我方依 Neon 公布的單次成本線性推算,只算推論費用。訓練一次要多少錢、模型多久要重訓一次、自架 GPU 或用代管服務的月費,官方文章都未公布——這三筆才是決定你划不划算的變數,別跳過。
延遲同樣值得看。10 秒的等待放進一個客服對話框,等待感會被放大,體驗直接崩掉。小模型的推論延遲文中未給具體秒數,但參數規模與生成速度的關係是明確的,這一項改善通常比省錢更早被使用者感受到。
前緣模型 API、開源小模型後訓練、純向量檢索,怎麼選?
| 比較項 | 直接呼叫前緣模型 API | 開源小模型 + RL 後訓練 | 純向量檢索(RAG) |
|---|---|---|---|
| 單次多輪檢索成本 | 約 0.03 美元(Neon 實測) | 約前者的 1/100 | 幾乎只有嵌入與資料庫費用 |
| 端到端延遲 | 約 10 秒(Neon 實測) | 官方未公布秒數,理論上顯著較低 | 最快,單次查詢 |
| 特定任務準確度 | 基準線 | 後訓練後可追平(Neon 實測,檢索任務) | 遇到需要多步推理的問題會漏 |
| 前期投入 | 幾乎零,接 API 就跑 | 需備語料、定義獎勵函數、跑訓練 | 需建索引與切段策略 |
| 資料要求 | 無 | 語料裡必須真的有答案 | 語料品質決定一切 |
| 任務更動時 | 改提示詞即可 | 可能要重訓 | 重建索引 |
| 適用範圍 | 通用,什麼都能問 | 只在被訓練的那類任務上強 | 事實查找 |
選法很簡單:任務窄、量大、規則穩定,走後訓練;任務雜、量小、規則常改,留在前緣模型 API。 純 RAG 是前兩條路共同的地基——Neon 的架構裡,後訓練的模型上線後照樣要呼叫搜尋工具。
Hacker News 上的討論補了一層有用的分類。工程師 softwaredoug 把 agentic search 的實作歸成三類:一是把檢索本身做好,Hornet、MixedBread、LightOn 等團隊在 late interaction(延後交互,一種在比對階段才做細粒度計算的檢索技術)上都有進展;二是靠更聰明的外層框架,用生成器加評估器互相檢查,檢索本身可能只是 grep,代價是模型不斷迴圈燒掉大量 token;三是直接訓練一顆專攻檢索的模型,Neon 這篇屬於第三類,同路線的還有 SID.ai 與 Glean 的 Waldo 模型。
這條資訊比原文更有價值——這是 2026 年整年都在發生的一條技術路線,不只一家新創在走。
這對台灣中小企業意味著什麼?
意味著「AI 越貴越好」這個假設,在客服問答與內部文件搜尋這兩個場景上,可以正式撤掉了。
我的判斷分三層說。
第一,你手上最值錢的 AI 資產,是你過去累積的客服對話紀錄與產品文件。 Neon 列的企業資料清單——內部文件、產品紀錄、支援文章、客戶互動、wiki、營運資料庫——台灣中小企業一樣不缺,只是散在 LINE 官方帳號、Excel、Google 雲端硬碟和某個離職同事的信箱裡。真正的門檻在於這批資料還沒被集中、還沒被整理成「問題—答案」的形式。今天就能開始做,不用等任何工具成熟。
第二,別急著跳去自架模型。 對每天查詢量在三位數以下的公司,照上面那張表推算,一年省下的推論費用大約在兩千美元上下,而導入一套後訓練流程要吃掉的工程時間,價值通常遠高於這個數。kumama 在 Hacker News 留言自稱是 Castform 創辦人,身分未經第三方查證,但發言與 Castform 官方定位一致。他提到的合適場景偏向高流量客服、詐欺偵測這一類——共通點是量體大到「準確度多 2%」就能換回可觀金額(來源摘錄在此截斷,未列出更多場景)。你要先確認自己在不在這條線上。
第三,這條路的真正紅利是延遲與可控性,省錢只是附帶。 一個查詢從 10 秒顯著縮短(官方未公布小模型的具體秒數),客服對話的完成率會直接改變;模型跑在你自己可控的環境裡,客戶資料不必往外送,這對做醫療、法務、財務相關業務的公司是硬需求。
有一個反面意見必須放進來,因為它有道理。Hacker News 上 benjiro29 的質疑是:專用模型很少真的贏過強大的通用模型,而且如果一個任務重複到值得專門訓練,你多半應該直接寫一支程式處理,再把清理好的資料交給主模型。這個質疑對相當比例的中小企業場景是成立的——你的「AI 客服」如果八成問題是「出貨了沒」「怎麼退貨」,那用一張表和一段查詢邏輯就解決了。
先做這道排除題,再談後訓練。
中小企業要用便宜的開源AI模型做客服搜尋,該怎麼開始?
照這個順序做,前兩步不花錢,第三步之後才需要決定要不要投入。
第一步:量出現況。 打開你的 API 帳單,算出客服問答與內部搜尋這兩件事每個月花多少錢、每天幾次查詢、平均回應幾秒、使用者中途放棄的比例多少。沒有這組數字,後面所有決策都是憑感覺。
第二步:把語料集中。 把過去一年的客服對話、產品說明、退換貨規則、FAQ、內部 SOP 集中到一個地方,任何能全文搜尋的資料庫都可以。這一步的檢核標準只有一個:隨機抽 20 個真實客戶問題,人工在這批資料裡能不能找到答案。 找不到代表資料缺,先補資料。
第三步:先跑純檢索版本。 用最便宜的方式接一個搜尋加生成的流程,量準確率。這一步就能解決的問題,別再往下走。
第四步:判斷值不值得後訓練。 三個條件同時成立才往下:查詢量大到年省金額有意義、任務規則半年以上不會大改、純檢索版本的準確率卡在你不能接受的水準。
第五步:定義獎勵函數。 這是整件事最需要人腦的部分,也最常被低估。你要能明確說出「什麼叫答對」——是文字吻合、是客戶沒有再追問、還是沒有升級給真人客服。獎勵函數定歪,模型就會學歪,而且學得非常有效率。
第六步:小範圍上線、雙軌比對。 新模型跟原本的流程平行跑一段時間,比準確率、比延遲、比升級率,數字贏了再全量切換。
如果你不確定自己卡在哪一步,先從第一步做起。做完第一步,答案通常自己會浮出來。
關於企業內部知識怎麼整理成 AI 能用的形式,我們在 AEO 方法拆解 寫過完整的一份,同一套邏輯用在對外內容與對內檢索上是通的;實際跑起來長什麼樣,可以到 https://mingnow.airun.tw 看。
什麼情況下你不該做後訓練?
直接列,符合任何一條就先別做:
- 查詢量太小。 年省金額低於工程投入,這是純虧。
- 規則能寫成程式。 查訂單、算運費、對庫存,寫 SQL 比訓練模型準確一百倍也便宜一百倍。
- 內容週週在變。 訓練完就過期,你會陷在無止境的重訓迴圈裡。
- 語料裡沒有答案。 模型不會無中生有,這是最常見的失敗原因。
- 你還沒有評估基準。 沒有一組固定的測試題與正確答案,你根本不知道訓練有沒有變好。
最後補一句不用花錢的:在你的量體撐不起訓練成本之前,把提示詞磨利仍然是投報率最高的那一手。後訓練處理的是規模化之後的單位成本,提示詞處理的是現在就答不好,順序別顛倒。
結論:這條路成立,但門票是你的資料
2026 年 8 月這次實測把一件事講清楚了:在檢索這種邊界明確的任務上,花最多錢訂最貴的模型已經不是唯一解。一個 4B 的開源模型用你自己的資料練過,可以做到同樣準,成本差 100 倍。
但門票不是預算,是資料。你有沒有把三年的客服對話留下來、有沒有把產品規則寫成文件、有沒有能力說清楚「什麼叫答對」——這三件事決定你能不能上車,而且沒有任何一家廠商能替你做。
這週就從第一步開始:打開帳單,量出你現在到底花多少錢、等多少秒。這個數字會告訴你要不要走這條路。
常見問題
4B 開源模型真的能贏 GPT-5.6 Sol 嗎?
在檢索這一項任務上,Neon 與 Castform 的實測說一個 4B 開源模型經過 RL 後訓練,可以做到與 GPT-5.6 Sol 同等準確。這是單一任務的結論,不代表這顆模型在寫作、推理、寫程式上追得上前緣模型。把它當成一個被磨利的專用零件來用。
便宜 100 倍是怎麼算的?
Neon 文中給了兩個數字:一次多輪檢索請求用 gpt-5.6-sol 端到端約 10 秒、約 0.03 美元;小型開源權重模型的推論成本約為前者的百分之一。依此推算,每天 1,000 次查詢,前緣模型一年約 1 萬美元,後訓練小模型一年約 100 美元。訓練與維運成本官方未公布,實際差距要自己試算。
我公司資料很亂,還能做後訓練嗎?
資料亂是常態。RL 後訓練需要三樣東西:任務、環境、獎勵函數,多數公司缺的是把原始文件變成「問題—正確答案」配對的那道工。Castform 的做法是從既有語料自動生成問答任務。你要先確認的是資料裡真的有答案,如果連人翻文件都找不到答案,模型也學不出來。
後訓練跟 RAG 可以只選一個嗎?
不能。RL 後訓練訓練的是模型「怎麼搜、搜幾次、什麼時候停」的決策能力,檢索工具本身還是要有。Neon 的架構裡,訓練時每一次試誤用的搜尋工具,跟上線後用的是同一個。先把檢索基礎建好,後訓練才有東西可練。
什麼情況下不該做後訓練?
三種情況。查詢量低到省下的 API 費用不夠付工程時間;任務規則明確到寫成程式碼就解決;任務內容還在每週變動,訓練完就過期。Hacker News 討論串裡也有工程師直指,重複性高到值得專門訓練的任務,往往直接寫程式更划算——這個質疑是對的,要先排除。
台灣中小企業現在該做什麼?
先做兩件不用花錢的事。第一,量出你現在每個月在客服問答與內部搜尋上燒掉多少 API 費用、平均回應幾秒。第二,把過去一年的客服對話與產品文件集中到一個可搜尋的地方。這兩件事無論你最後選哪條路都用得上,而且是後訓練唯一真正的門檻。