Moonshot 七月中發表了新的開源模型 Kimi K3,月底放上 Hugging Face 可以下載。總參數 2.8T,每次實際啟用 104B,context 一百萬。
開源模型發表的時候通常會附一張跟閉源模型的比較表。K3 這張比的對象是 Claude Fable 5 跟 GPT-5.6 Sol,下面用到的數字都來自 Moonshot README 裡的對照表,表上所有模型都跑 max 設定。
對照表上的位置
表分成四塊:推理與知識、寫程式、agent 任務、視覺。
整體的方向一致。對上 Sol,K3 多數列領先;對上 Fable 5,多數列落後。位置大致就在兩者之間,比較靠近 Sol。
有意思的是 Moonshot 的講法比這張表保守。官方部落格上只說 K3 的整體表現仍然落在 Fable 5 跟 Sol 後面,達到的是 frontier level,把兩家並列放在前面。但表上 K3 對 Sol 是多數列領先的。
這份文件裡還有一列容易被跳過的 Kimi Code Bench 2.0。Kimi Code Bench 2.0 是 Moonshot 自家使用的 benchmark,K3 拿 72.9,Fable 5 是 76.9。同樣也可以拿來參考,但是評分細節我們可能就不知道了。
不過整體排名我們大概能看出 K3 落在哪一區,可是還不夠拿來直接判定工具好壞。比較值得關注的是它贏在哪幾列、又輸在哪幾項。
輸贏的比較
下面這幾項是差距比較明顯的,分數都取自同一張對照表:
| Benchmark | 測什麼 | Kimi K3 | Claude Fable 5 | GPT-5.6 Sol |
|---|---|---|---|---|
| SWE-Marathon | 長流程程式任務 | 42.0 | 35.0 | 39.0 |
| MCPMark | 工具操作 | 94.5 | 87.4 | 92.9 |
| BrowseComp | 網頁搜尋 | 91.2 | 88.0 | 90.4 |
| AA-LCR | 長上下文 | 74.7 | 70.0 | 73.7 |
| CritPt | 物理推理 | 23.4 | 28.6 | 32.3 |
| HLE-Full | 研究級問答 | 43.5 | 53.3 | 44.5 |
先看 SWE-Marathon。K3 是 42.0,Fable 5 拿 35.0,Sol 是 39.0。
這波是長時間、多回合的任務。題目不會跑一輪就結束,模型得要根據前一輪的結果繼續接著往下改,而且任務拖得愈長,前面留下來的資訊就愈重要。
換成平常會碰到的工作,大概是把整個 repo 的 lint 修過一遍,或者讀完幾十份文件再整理成一張表。每一個步驟和任務單獨處理都不難,難的是好幾個步驟加在一起後,是否還能完成任務不走歪。
同個方向上還有三個分數,括號裡是 Fable 5 跟 Sol。長上下文的 AA-LCR 是 74.7(70.0、73.7),工具操作的 MCPMark 94.5(87.4、92.9),BrowseComp 91.2(88.0、90.4)。
這四項來自不同的 benchmark 家族,題目長相也不一樣,可是排出來的順序一樣。共通的地方是任務都要撐得久、中間要記得前面發生過什麼,而且多半得接外部工具。K3 比較好的地方大多在這個類別。
相較之下,輸的地方集中在推理與知識。
CritPt 是 K3 23.4、Fable 5 28.6、Sol 32.3;HLE-Full 是 K3 43.5、Fable 5 53.3、Sol 44.5。兩列的對手還不一樣,CritPt 對兩邊都輸,HLE-Full 主要輸給 Fable 5,跟 Sol 只差一分。
這個差別呈現的資訊不只是分數高低。如果是較長流程的題目跑不好、跑不出來還能多跑幾輪、多給一點上下文、多接不同工具慢慢補回來;但推理補不了。上下文再長、工具再多,模型想不出來就是想不出來,能力到哪就是在哪。
價格
價格則是個重要的關注點。
| 模型 | input(每 100 萬 token) | output | cache |
|---|---|---|---|
| Kimi K3 | $3 | $15 | $0.3 |
| GPT-5.6 Sol | $5 | $30 | 有,本篇未查 |
| Claude Fable 5 | $10 | $50 | 有,本篇未查 |
K3 的數字取自 Artificial Analysis 的模型頁。換算下來大約是 Fable 5 的三分之一、Sol 的六成。同樣一筆預算,改用 K3 可以跑到 1.7 到 3.3 倍的量,這就讓開發有不同的使用和想像空間。
cache 的 0.3 美元只有一般 input 價的十分之一。如果流程會反覆讀同一批文件,第二次之後就是按這個價算,跑得愈久差距愈明顯。
輸出速度也有提供。K3 是 34.9 tok/s,在 101 個模型裡排第 57。這個速度吐一千個 token 大概要半分鐘,單次問答就感覺得到了,流程變長更明顯,任務跑上幾十輪,等待時間會顯著的變長。
可以交給它的任務
照這張表,我們可以看出 K3 適合的任務有幾個共通點:流程可以長、中間要回頭看前面做過什麼、還有去接外部工具的任務。
長流程的程式修改、資料整理,還有串 MCP 或別的工具的自動化,大致都在這個範圍。這類工作本來就要跑很多輪,三倍的價差會一路累積下去。
推理上的題目就是另一回事。如果需要推論到答案、而且要有效率的答對,Fable 5 跟 Sol 都領先不少。便宜換到的很可能就是弱一點的答案。
所以工作類型較多元的話,也不用只挑一個模型。長流程交給 K3,難題留給 Fable 5 或 Sol,可以有很多不同的搭配和嘗試。
寫在最後,模型的發展很快,說不定改天 Gemini 又彎道超車,幾個月後又是不同的世界,我們該做的就是保持彈性和學習的心態,有甚麼想討論的歡迎聯絡~
