AI MUNINN

模型解剖室

MODEL ANATOMY
MIXTURE OF EXPERTS

全模型 30.53B 參數 61.06 GBBF16 權重

拖曳旋轉 · 滾輪縮放
完整模型 · 48 層
權重區塊示例顏色:資料流/啟用 expert你正在查看

先展開所有層,再進入第 1 層。方塊大小為結構示意。

示例 A · 琥珀金

    編號、比例與顏色為教學樣本,未載入真實 Router 權重;顏色只幫你分辨 A/B/C。

    合併之後,資料往哪裡走?

    「播放本層」會重播目前路徑;點圖中的「下一層 Attention」或這裡的「下一層」,畫面會往下移動一層。最後一個按鈕直接跳到出口。動畫速度不代表實際耗時。

    每一層的完整順序,以及兩次 Norm 的位置

    現在看的是一個主幹層的功能分區,數字只計本層;Input、Final Norm 與 Output 在層外。下一層有另一套自己的權重。

    1. 保留輸入 → Norm 1 → Attention → +① 加回保留的輸入

    結構與資料來源

    區塊是權重的功能分區

    流動訊號是 activation(中間資料)。路由與動畫為教學模擬,速度不代表推論耗時;BF16 大小只計權重,採十進位 GB。

    先看懂這張圖

    模型,是一大組學會了怎麼計算的數字。

    你輸入的文字先變成數字,經過一層層處理,最後得到下一個文字片段的分數。選出一個片段後,再繼續生成下一個,答案就這樣逐段出現。

    藍色等固定區塊是學過的權重,代表不同功能。

    發亮流線是本次計算傳遞的中間資料;依示例變色的小方塊標出選中的 expert。匯流處另有「加權合併」運算節點,本身沒有專屬權重。

    紫色表示你正在查看的區域,和模型選哪個 expert 是兩件事。

    Token · 文字小片段
    模型讀寫文字的單位,可能是字、字的一部分或符號,不一定等於一個中文字或一個單字。
    權重/參數 · 學到的數字
    訓練會調整這些數字;一般生成文字時,用它們來計算,不會每回答一句就重新訓練。
    Activation · 這次算出的資料
    運算途中產生的數字,會隨輸入與所在層改變。流線上移動的是這些資料,不是權重被搬走。
    層 · 接力處理的一站
    每一層接收上一層的結果,再用自己學到的權重加工。點開完整模型會先看見所有層,再定位到第 1 層的功能分區。
    MoE · 每次選一部分來算
    每層有許多 expert,每個 token 只選其中幾個。數量依模型而異;若有 shared expert,它每次都會參與。沒選到的仍屬於模型;省下部分計算,不等於不需要存放它們的權重。
    BF16 與 GB · 權重有多大
    BF16 是儲存數字的格式,每個參數用 2 bytes。1B=十億個參數,BF16 約占 2 GB。這裡只算權重;真正執行還需要額外空間。

    方塊大小、路由選擇與流動速度都是教學示意,不是真實推論紀錄。模型不是有固定專長的人類團隊。