AIRun · Blog
← 全部文章

Kimi-K3 開源上架 HuggingFace:2.8 兆參數,台灣老闆現在該測嗎?

2026-07-28 · J董 👁 105 人看過 🤖 100 AI 爬蟲命中
AI 新知開源模型Kimi-K3HuggingFace開放權重推論APIMoonshot AI

Kimi-K3 開源上架 HuggingFace:2.8 兆參數,台灣老闆現在該測嗎?

Kimi-K3 今天就能用。Moonshot AI 釋出開放權重,Telnyx 推論 API 同步上架,開個 API key 就能打,輸入每百萬 token 2.70 美元。

規格先擺著:2.8 兆總參數、104B 啟動參數、100 萬 token 上下文、原生看圖看影片。這件事有兩個時間點要分清楚。模型權重公開在 Hugging Face 的 moonshotai/Kimi-K3 模型卡,社群按讚數已累積到 6.48k;而第三方推論商 Telnyx 的上線公告日期標的是 2026 年 7 月 28 日,也就是本文發稿當天。我們觀察,權重公開跟「有人幫你架好、開個 API key 就能打」,中間通常隔幾週到幾個月,這是本站的產業觀察,兩份來源都沒有給出統計。這次幾乎同步發生。

這代表 Kimi-K3 跳過了實驗室展示品的階段,直接進入可採購狀態。以下把規格、價格、成績單一項一項拆開,最後給台灣中小企業一份一週能跑完的評估流程。

Kimi-K3 是什麼?一句話說完

Kimi-K3 是 Moonshot AI 的開放權重(open-weight,指把訓練完成的模型參數檔公開讓人下載自行部署)原生多模態 agentic 模型,總參數 2.8 兆,官方自述為「世界第一個開放的 3 兆參數級模型」,上下文視窗 1,048,576 tokens(Hugging Face 模型卡)。

拆開三個關鍵詞:

原生多模態,指同一個模型直接理解文字、圖片、影片,不必外掛一顆獨立的視覺轉換模組。Telnyx 的公告寫得更白:「多模態推理,不需要分離的 vision adapter」。

agentic,指模型被設計成能自己連續操作工具、跑長任務,而不只是一問一答。模型卡列的能力範圍包括長時程程式開發、在大型程式庫裡導航、調度終端機工具,官方點名的應用甚至涵蓋 GPU kernel 最佳化、編譯器開發與晶片設計。

開放權重,指參數檔可下載,授權條款是 Moonshot 自訂的「Kimi K3 License」。這跟 MIT、Apache 那種標準開源授權屬於不同的東西,後面單獨開一節談。

2.8 兆參數是什麼概念?規格拆給你看

2.8 兆是總參數,但每次回答問題實際動用的只有 104B——約占總量的 3.7%。這是 MoE(Mixture-of-Experts,混合專家:模型內部分成很多組「專家」,每次只叫醒其中幾組來幹活)架構的核心特性。

Kimi-K3 的稀疏度拉得很極端:896 個專家中每個 token 只選 16 個,約 1.8%。模型卡稱這套 Stable LatentMoE 框架帶來相對 Kimi K2「約 2.5 倍的整體擴展效率提升」。

主要規格整理如下,全部出自官方模型卡

規格項數值對使用者的意義
總參數2.8T知識容量的上限
啟動參數104B每次推論的實際計算量,決定速度與成本
層數93(其中 1 層 dense)深度
注意力組成69 層 KDA + 24 層 Gated MLA新架構,長文處理效率的來源
專家數/每 token 選用896 / 16(另有 2 個共享專家)稀疏度約 1.8%
上下文長度1,048,576 tokens一次能吃整包程式庫或整年文件
詞彙表160K多語言覆蓋
視覺編碼器MoonViT-V2,401M 參數原生看圖看影片
量化MXFP4 權重/MXFP8 激活(量化感知訓練)部署時的記憶體足跡設計
激活函數SiTU-GLU架構細節

注意力層那一行值得多看一眼。KDA(Kimi Delta Attention)與 AttnRes(Attention Residuals)是這一代的架構賭注,93 層裡有 69 層用 KDA。長上下文能不能撐住穩定表現,通常就是卡在注意力機制的設計上。Telnyx 在公告裡直接背書「穩定的長上下文表現」(stable long-context performance),這是服務商願意掛在自家 release note 上的話,有一定分量。

模型卡並未公布最低硬體需求。以 2.8T 總參數的量級判斷,自架屬於資料中心級多卡叢集的工程,不是一台工作站插兩張卡的事。

現在就能用嗎?要花多少錢?

能用,而且價格是公開的。Telnyx Inference API 已把模型 ID moonshotai/Kimi-K3 上架,跑在 Telnyx 自有 GPU 基礎設施上,走 OpenAI 相容 API(意思是你原本打 OpenAI 的程式碼,改個 endpoint 跟 model 名稱就能轉過來)。

官方公布的價格

Token 類型每百萬 token 價格(美元)
快取輸入(Cached Input)0.27
輸入(Input)2.70
輸出(Output)13.50

這張表有兩個訊號要讀出來。

輸出是輸入的 5 倍價。 意思是「叫它讀很多、寫很少」的任務便宜,「叫它寫很多」的任務貴。合約審查、資料萃取、文件分類這類讀多寫少的工作,成本結構對你有利;長篇內容生成則要另外算帳。

快取輸入只要正常輸入的十分之一。 Telnyx 說明 prompt caching 是預設開啟的自動前綴快取(重複的提示詞開頭會被快取重用)。實務上這代表:把公司規範、產品資料這種每次都要塞的固定內容放在提示詞最前面,第二次之後那段就從 2.70 掉到 0.27。這對「同一套系統提示打幾千次」的自動化流程,是十倍價差。

算個實際的帳。假設你跑一個文件處理流程,單月消耗 100 萬 token 輸入 + 20 萬 token 輸出。沒有快取時:輸入 1 × 2.70 = 2.70 美元,輸出 0.2 × 13.50 = 2.70 美元,合計 5.40 美元。若其中八成輸入命中快取,輸入部分變成 0.8 × 0.27 + 0.2 × 2.70 = 0.216 + 0.54 = 0.756 美元,輸出不變仍是 2.70 美元,總計約 3.46 美元。這種量級的錢,對中小企業的驗證階段幾乎沒有阻力。

Telnyx 同時列出三項生產環境會用到的功能:可調推理強度(low / high / max 三檔,用算力換思考深度)、function calling 與 JSON schema 約束輸出、動態工具載入。這些是把模型接進自家流程的必要零件,缺一項就得自己補一層工程。

模型 ID 是 moonshotai/Kimi-K3,與既有的 Kimi K2.6、GLM-5.2-FP8、MiniMax M3 並列在同一個 API 上——換模型只要換字串。這件事本身,比 K3 的任何一項評測分數都重要,理由稍後說。

Kimi-K3 的成績單,真的追上閉源模型了嗎?

有輸有贏。官方模型卡列出的評測橫跨推理、程式、agentic、視覺四大類,挑幾項對企業實際有意義的來看(數據全部出自 Hugging Face 模型卡,Kimi K3 為 max 推理強度):

評測項目Kimi K3Claude Fable 5GPT-5.6 SolGLM-5.2
GPQA Diamond(研究所級知識)93.592.694.191.2
Terminal-Bench 2.1(終端機操作)88.388.088.882.7
FrontierSWE(前沿軟體工程)81.286.671.367.3
SWE-Marathon(長時程開發)42.035.039.013.0
BrowseComp(網頁檢索)91.288.090.4
MCPMark-Verified(工具協定)94.587.492.9
OSWorld-Verified(電腦操作)84.885.083.0
OfficeQA Pro(辦公文件問答)63.369.963.241.4

本表為節選四欄。官方模型卡另列 Claude Opus 4.8 與 GPT-5.5 兩欄,完整六模型對照見官方模型卡

讀法:K3 在「長時間自己跑、要連續調度工具」這類 agentic 任務上表現突出——SWE-Marathon 42.0 是全場最高,MCPMark-Verified 94.5 也是;但在單點硬程式能力(FrontierSWE 81.2 對 86.6)與辦公文件問答(63.3 對 69.9)落後 Claude Fable 5。

值得注意的是 GLM-5.2 那一欄。同場另一支模型,在 SWE-Marathon 只拿 13.0,K3 是 42.0(GLM-5.2 的授權與開放狀態,兩份來源都未載明,這裡只比評測分數)。這個差距說明模型並不是一個均質的集合,拿一支的表現去推論另一支,會判斷錯誤。

必須講清楚的前提:這些數字由 Moonshot AI 自行發布,目前沒有第三方獨立複現。Telnyx 的說法是 K3「在程式、推理與 agentic 知識工作的評測上與 Anthropic、OpenAI 的閉源前沿模型競爭」,這是服務商自己的判斷,不等於中立第三方的獨立驗證。

評測表的正確用途,是拿來決定「先測哪一類任務」。直接拿它下採購決定,太早。

「開源」兩個字,這裡到底代表什麼?

代表權重可下載,不代表授權無限制。模型卡明列 License 為「kimi-k3」——Moonshot AI 自訂的授權條款,跟 MIT、Apache 2.0 這類已被法務界熟悉的標準開源授權不同。官方描述是「以 Kimi K3 License 釋出完整模型權重,讓前沿智慧可公開用於研究、部署與進一步創新」。

這件事的實務意義:

能不能商用、有沒有使用者數量門檻、要不要標示出處、輸出內容的權利歸屬——這些條款細節必須自己讀過原文,不能套用對「開源」兩個字的直覺理解。權重公開跟授權自由,是兩件獨立的事。

這一點不為潑冷水。開放權重本身已經解決了中小企業最痛的兩件事:不必等官方公布定價、不必被單一供應商鎖死。但採購合約要簽之前,授權條款交給法務讀完,是基本動作。

三種用法前期投入資料落地上手時間適合誰
自行下載權重部署高(多卡叢集+維運人力)完全自控數週以上有硬性資料不出境要求、且用量大到攤得平的公司
用 Telnyx 等第三方推論商 API極低(API key 即可)資料進第三方 GPU當天絕大多數中小企業的驗證與生產階段
等官方直營服務未知未知沒有時間壓力的觀望者

第三欄的「當天」不是形容詞。OpenAI 相容 API 的意思就是既有程式碼改兩行參數。

這對台灣中小企業意味著什麼?

意味著「前沿級模型太貴、用不起」這個藉口,這一輪失效了。

過去兩年,台灣中小企業導入 AI 最常見的卡點有三個:頂級模型單價高、資料不敢送出去、供應商漲價無從抵抗。Kimi-K3 這次上架的方式,同時鬆動了三個。

第一,價格帶下移,而且下移得很兇。 輸入每百萬 token 2.70 美元、快取輸入 0.27 美元,這個數字讓「把整份文件丟進去問」從奢侈品變成日常操作。100 萬 token 的上下文視窗配上這個價格,你可以省掉整套 RAG(先切檔、建向量索引、再檢索)工程——那層工程過去是導入成本裡最貴、最容易做壞、最需要專人維護的部分。

第二,議價權回到買方。 這才是這則消息真正的價值。同一個 Telnyx Inference API 上,Kimi K3、Kimi K2.6、GLM-5.2-FP8、MiniMax M3 並列,換模型只是換一個字串。當你的系統架在 OpenAI 相容介面上、模型名稱是設定檔裡的一個變數,任何一家供應商調價或斷供,你的切換成本接近零。這是台灣中小企業第一次在 AI 採購上握有實質的替換籌碼。

我們的判斷很直接:現在該做的事不是選一個模型,是把系統寫成「模型可換」的樣子。 抽象層做對了,之後每一次開放權重模型上架,你都自動吃到紅利;抽象層沒做,你就是換一次供應商重寫一次程式。

第三,時間窗口不確定,所以現在動手。 各地對開放權重 AI 的監管方向仍在變動中,本文引用的兩份來源都沒有公布任何具體法規或時程,我們也不編造。但可以確定的是:權重已經在 Hugging Face 上,現在下載、現在測、現在把評估結論寫下來,這幾件事的成本是幾天工時加不到十美元的 API 費用。等到局勢明朗再開始評估,你損失的是六個月的學習曲線。

有一件事要說在前面:不要因為它便宜就把它擺在錯的位置。 從評測表看,K3 的強項在長時程 agentic 任務——連續跑幾小時、自己調工具、自己導航大型程式庫。這對應到中小企業的場景是內部流程自動化、文件批次處理、程式庫維護。至於高風險的對外承諾、報價、合約條款,任何模型都該停在人這關。這與模型能力無關,屬於治理設計的範圍。

一週內怎麼測完、怎麼決定?

給一份可以照著跑的流程。目標放在用 Kimi-K3 當試劑,測出你們公司哪個流程真的能自動化;「評估 Kimi-K3」只是副產品。

第 1 天:挑題目。 從公司裡找三個「重複、有明確對錯、目前由人做」的任務。合約條款比對、進貨單資料萃取、客服信件分類都是好起點。每個任務準備 20 筆歷史資料,人工標好正確答案。這 20 筆答案就是你的評測集,比任何公開 benchmark 都準。

第 2 天:接上去。 申請 Telnyx Inference 的存取,模型 ID 填 moonshotai/Kimi-K3。OpenAI 相容介面代表你可以直接沿用現成的 SDK。把系統提示裡的固定內容(公司規範、格式範例)擺在最前面,讓 prompt caching 生效。

第 3–4 天:跑三檔推理強度。 low、high、max 各跑一輪那 20 筆題目,記錄正確率與花費。多數企業流程用 low 就夠,別預設要開 max——那是拿錢換思考深度,只有難題值得。

第 5 天:算單位成本。 把「處理一筆的 token 花費」乘上你的月處理量,跟現在的人工成本比。這個數字如果差不到三倍,這個流程先別自動化,去找差十倍的那個。

第 6 天:換一支模型重跑。 同一份程式碼、同一份題目,把 model 換成 Kimi K2.6 或 GLM-5.2-FP8 再跑一次。這一步要驗證的是你的抽象層真的能換模型,比誰強反而次要。換不動,就是你的架構有問題,該先修的是架構。

第 7 天:寫結論。 三個任務裡通常只有一個值得做下去。把那一個做完、上線、跑起來,剩下兩個歸檔。

整套流程的現金支出,以前面算過的價格結構估,多半落在個位數美元。真正的成本是那 60 筆人工標註的答案——那也正是唯一會留在公司裡、換幾次模型都還有用的資產。

結論:這一輪的贏家是把架構寫對的人

Kimi-K3 是一支好模型,2.8 兆參數、100 萬上下文、原生多模態、agentic 任務評測領先,而且上架第一天就能用、價格公開、跑在 Telnyx 自有的 GPU 基礎設施上。這些條件加起來,值得台灣中小企業花一週認真測。

但把賭注押在單一模型上是錯的。開放權重模型的發布節奏已經快到「你的評估報告寫完,下一支就上架了」。真正該建立的能力有三樣:一套能在一週內完成模型評估的內部流程、一份自己標註的評測題目、一層讓���型名稱變成設定值的程式架構。這三樣東西備齊,每一次新模型上架對你都是純利多。

沒備齊,你就永遠在追新聞。

這一週該做的事,前一節已經寫成七天的流程,照著跑就行。如果你需要的是把這套判斷接進實際的內容與獲客流程,可以看看我們在 AIRUN 怎麼做——同一套邏輯,換個題目而已。

常見問題

Kimi-K3 是免費的嗎?

模型權重可以從 Hugging Face 下載,Moonshot AI 以「Kimi K3 License」釋出,不是傳統的 MIT 或 Apache 授權,實際使用條款要自己讀過模型卡。權重免下載不等於免成本:你得自己出 GPU 跟維運人力。若走 Telnyx 這類第三方推論 API,是按 token 計費,輸入每百萬 token 2.70 美元、輸出 13.50 美元。

Kimi-K3 跟 Kimi K2 差在哪?

官方模型卡指出 K3 換了架構:建立在 Kimi Delta Attention(KDA)與 Attention Residuals(AttnRes)之上,並用 Stable LatentMoE 框架把稀疏度拉高到 896 個專家中啟動 16 個,宣稱整體擴展效率比 Kimi K2 提升約 2.5 倍。此外 K3 是原生多模態,同一個模型直接吃文字、圖片與影片,上下文視窗 1,048,576 tokens。

2.8 兆參數,我自己的伺服器架得起來嗎?

極可能架不起來。K3 總參數 2.8 兆、單次推論啟動 104B,官方以 MXFP4 權重/MXFP8 激活的量化感知訓練釋出,但模型卡並未公布最低硬體需求。以這個量級判斷,這是資料中心級多卡叢集的規模,不是一台工作站的事。中小企業的合理路徑是先用第三方推論 API 驗證價值,自架留給有硬性資料落地要求且算得過帳的情況。

Kimi-K3 的能力真的贏過 Claude、GPT 嗎?

有輸有贏,不能一句話蓋章。以官方模型卡列出的評測,K3 在 SWE-Marathon(42.0)、BrowseComp(91.2)、MCPMark-Verified(94.5)領先同場對手;但在 FrontierSWE(81.2 對 Claude Fable 5 的 86.6)、DeepSWE、OfficeQA Pro 等項目落後。這些數字由 Moonshot AI 自行發布,尚無第三方複現。真正該信的是你自己那份題目的實測結果。

導入 Kimi-K3 有沒有資安或政策風險?

先講清楚前提:官方模型卡與 Telnyx 公告都沒有載明 Moonshot AI 的公司註冊地,本文不替它下定性。風險分三層看。技術層:權重下載到自己環境跑,資料不出境。服務層:透過 Telnyx 這類第三方推論商的 API 呼叫,資料進的是 Telnyx 的 GPU,合約對象也是 Telnyx。政策層:各地對開放權重模型的監管方向仍在變動,兩份來源都未公布任何具體法規時程。實務建議是先跑不含個資的內部題目,把採購綁在可換模型的抽象層上。

100 萬 token 上下文可以拿來做什麼?

上下文視窗是模型一次能「同時看到」的資料量。1,048,576 tokens 這個量級,Telnyx 的說明點名三個場景:整包程式庫分析、長文件處理、多輪 agent 工作階段。對中小企業,最有感的是把整份合約集、整年報價紀錄或整套產品手冊一次丟進去問,不必先切檔、建索引,省掉一整層 RAG 工程。


本文事實依據:Hugging Face — moonshotai/Kimi-K3 模型卡Telnyx Release Notes — Kimi K3 Now Available on Telnyx Inference(2026 年 7 月 28 日)。文中未標註來源的判斷屬本站觀點。

AIRUN 對抗式創業體檢 AgentFlow Solutions(双云行銷試運行)