Hugging Face 或 Ollama 的模型列表上,名字後面幾乎都有個數字+英文:20b、120b、235B、671B,往下看其他的還會看到 2.8T。B 是 billion,十億;T 是 trillion,一兆。這個參數,也就是模型訓練完之後留下來的權重。
TL;DR: 模型名字裡的 7B、70B 是參數量,B 代表十億。參數量最先決定和影響的是記憶體:一個參數佔幾個 bytes,兩者相乘就是要吃掉的空間。名字裡若出現兩個數字,例如 Qwen3-235B-A22B這種,前面的是總參數,後面則是每個 token 實際啟用的參數。
這個數字代表什麼
訓練模型就是反覆調整內部的權重,訓練停下來以後權重固定,存成檔案,那就是你按下下載鍵時拿到的東西。參數量講的則是這些權重總共有幾個。7B 的模型,裡面有七十億個這樣的數字;像是讀你的問題、決定下一個 token,用到的都是它們。所以它會比較像規格表上的容量欄位,代表的是體積。
換算成記憶體
權重要整個載進記憶體才算得動,佔多少空間看兩件事:有幾個參數,以及每個參數用什麼格式存。常見的 bf16 格式,每個參數兩個 bytes。gpt-oss-20b 有 21B 個參數,乘以 2 是 42GB,可以看的出來一般家用顯卡的顯示記憶體不會到這種規格。不過 OpenAI 的 model card 上寫的是 run within 16GB of memory,中間差了將近三倍。差在格式:MoE 那部分的權重改用位元數更少的 MXFP4 存,每個參數佔的空間掉到 bf16 的四分之一附近,42GB 就縮到十幾 GB。
可以發現同一份 model card 上的 gpt-oss-120b 差距更大。117B 個參數照剛才的乘法是 234GB,得好幾張卡才裝得下,官方寫的卻是 fit into a single 80GB GPU。所以看到參數量,大概也要順便看一下是用什麼格式存的:同樣一份權重換個量化格式,要準備的記憶體可以差到四倍。從 Ollama 之類的地方下載,預設拿到的多半已經量化過,檔案大小會比「參數量乘以二」小上不少。
名字裡的兩個數字
Qwen3-235B-A22B 這種名字看起來跟一般不太一樣,拆開來看是兩個數字並排:235B 是總參數,A22B 的 22B 是每個 token 實際啟用(activated)的參數。官方規格上直接列了出來,Number of Parameters: 235B in total and 22B activated。會分成兩個數字,是因為 MoE(混合專家)把權重切成很多組,算一個 token 只挑其中幾組來用。DeepSeek-V3 是 671B 總參數、每個 token 啟用 37B;gpt-oss-120b 是 117B 配 5.1B;Kimi K3 更大,總參數 2.8T,每次啟用 104B。
兩個數字各管一件事。總參數決定你要準備多少記憶體,因為權重全部都得放進去,這次用不用得到都一樣;啟用參數決定每個 token 實際要算多少乘法,也就是速度和運算成本。所以 671B 的 DeepSeek-V3 在記憶體上就是 671B 的模型,在運算量上比較接近 37B。想在自己機器上跑的話,主要也是看前面那個數字。
參數量和能力的關係
至於好不好用,參數量大概看不出來。同一個系列裡,大的通常比小的強;不過跨系列、跨世代比較就沒那麼準,訓練資料、訓練時間、後續調校造成的差距,常常大過參數量本身。Kimi K3 的對照表就是例子,2.8T 的總參數沒有讓它每一列都領先,長流程的任務贏,推理的題目輸。
另外,名字上的數字本身就已經是四捨五入過的。gpt-oss-20b 的參數量是 21B,gpt-oss-120b 是 117B。
這篇的參數量都是照各家 model card 抄下來的,也算是個簡易的分享,沒有討論太多深入的話題。記憶體那幾筆資料是估算,實際跑起來還要再加上 context 跟其他開銷,不會這麼剛好;可能有錯,發現的話會盡快修改~

