<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/" xmlns:dc="http://purl.org/dc/elements/1.1/">
  <channel>
    <title>MoE on KbWen Blog</title>
    <link>https://www.kbwen.com/tags/moe/</link>
    <description>KbWen is a practical technology blog about AI systems, machine learning, Python, data engineering, and software development.</description>
    <generator>Hugo</generator>
    <language>zh-tw</language>
    <image>
      <url>https://www.kbwen.com/images/og-default.png</url>
      <title>KbWen Blog</title>
      <link>https://www.kbwen.com/</link>
    </image>
    
    <lastBuildDate>Fri, 14 Aug 2026 11:00:00 +0800</lastBuildDate><atom:link href="https://www.kbwen.com/tags/moe/index.xml" rel="self" type="application/rss+xml" />
    <item>
      <title>7B、70B 是什麼意思？看懂模型名字裡的參數量</title>
      <link>https://www.kbwen.com/what-does-7b-mean-model-parameters/</link>
      <pubDate>Fri, 14 Aug 2026 11:00:00 +0800</pubDate><dc:creator>KbWen</dc:creator>
      <guid>https://www.kbwen.com/what-does-7b-mean-model-parameters/</guid>
      <description>模型的 7B、70B、235B 講的是參數量，B 就是十億。這篇說明參數量代表什麼、怎麼換算，以及 Qwen3-235B-A22B 這種寫法裡的兩個數字又各自代表什麼。</description>
      <content:encoded><![CDATA[<p>Hugging Face 或 Ollama 的模型列表上，名字後面幾乎都有個數字+英文：20b、120b、235B、671B，往下看其他的還會看到 2.8T。B 是 billion，十億；T 是 trillion，一兆。這個參數，也就是模型訓練完之後留下來的權重。</p>
<blockquote>
<p><strong>TL;DR：</strong> 模型名字裡的 7B、70B 是參數量，B 代表十億。參數量最先決定和影響的是記憶體：一個參數佔幾個 bytes，兩者相乘就是要吃掉的空間。名字裡若出現兩個數字，例如 Qwen3-235B-A22B這種，前面的是總參數，後面則是每個 token 實際啟用的參數。</p>
</blockquote>
<h2 id="這個數字代表什麼">這個數字代表什麼</h2>
<p>訓練模型就是反覆調整內部的權重，訓練停下來以後權重固定，存成檔案，那就是你按下下載鍵時拿到的東西。參數量講的則是這些權重總共有幾個。7B 的模型，裡面有七十億個這樣的數字；像是讀你的問題、決定下一個 <a href="/what-is-token-in-llm/">token</a>，用到的都是它們。所以它會比較像規格表上的容量欄位，代表的是體積。</p>
<h2 id="換算成記憶體">換算成記憶體</h2>
<p>權重要整個載進記憶體才算得動，佔多少空間看兩件事：有幾個參數，以及每個參數用什麼格式存。常見的 bf16 格式，每個參數兩個 bytes。gpt-oss-20b 有 21B 個參數，乘以 2 是 42GB，可以看的出來一般家用顯卡的顯示記憶體不會到這種規格。不過 OpenAI 的 model card 上寫的是 <a href="https://huggingface.co/openai/gpt-oss-120b">run within 16GB of memory</a>，中間差了將近三倍。差在格式：MoE 那部分的權重改用位元數更少的 MXFP4 存，每個參數佔的空間掉到 bf16 的四分之一附近，42GB 就縮到十幾 GB。</p>
<p>可以發現同一份 model card 上的 gpt-oss-120b 差距更大。117B 個參數照剛才的乘法是 234GB，得好幾張卡才裝得下，官方寫的卻是 fit into a single 80GB GPU。所以看到參數量，大概也要順便看一下是用什麼格式存的：同樣一份權重換個量化格式，要準備的記憶體可以差到四倍。從 Ollama 之類的地方下載，預設拿到的多半已經量化過，檔案大小會比「參數量乘以二」小上不少。</p>
<h2 id="名字裡的兩個數字">名字裡的兩個數字</h2>
<p>Qwen3-235B-A22B 這種名字看起來跟一般不太一樣，拆開來看是兩個數字並排：235B 是總參數，A22B 的 22B 是每個 token 實際啟用（activated）的參數。官方規格上直接列了出來，<a href="https://huggingface.co/Qwen/Qwen3-235B-A22B-Instruct-2507">Number of Parameters: 235B in total and 22B activated</a>。會分成兩個數字，是因為 MoE（混合專家）把權重切成很多組，算一個 token 只挑其中幾組來用。<a href="https://huggingface.co/deepseek-ai/DeepSeek-V3">DeepSeek-V3</a> 是 671B 總參數、每個 token 啟用 37B；gpt-oss-120b 是 117B 配 5.1B；<a href="/kimi-k3-vs-fable-5-gpt-5-6-sol/">Kimi K3</a> 更大，總參數 2.8T，每次啟用 104B。</p>
<p>兩個數字各管一件事。總參數決定你要準備多少記憶體，因為權重全部都得放進去，這次用不用得到都一樣；啟用參數決定每個 token 實際要算多少乘法，也就是速度和運算成本。所以 671B 的 DeepSeek-V3 在記憶體上就是 671B 的模型，在運算量上比較接近 37B。想在自己機器上跑的話，主要也是看前面那個數字。</p>
<h2 id="參數量和能力的關係">參數量和能力的關係</h2>
<p>至於好不好用，參數量大概看不出來。同一個系列裡，大的通常比小的強；不過跨系列、跨世代比較就沒那麼準，訓練資料、訓練時間、後續調校造成的差距，常常大過參數量本身。Kimi K3 的對照表就是例子，2.8T 的總參數沒有讓它每一列都領先，長流程的任務贏，推理的題目輸。</p>
<p>另外，名字上的數字本身就已經是四捨五入過的。gpt-oss-20b 的參數量是 21B，gpt-oss-120b 是 117B。</p>
<p>這篇的參數量都是照各家 model card 抄下來的，也算是個簡易的分享，沒有討論太多深入的話題。記憶體那幾筆資料是估算，實際跑起來還要再加上 context 跟其他開銷，不會這麼剛好；可能有錯，發現的話會盡快修改～</p>
]]></content:encoded>
    </item>
    
  </channel>
</rss>
