Discussion about this post

User's avatar
Dylan Oh | Robot Economy's avatar

感謝在市場不好的時候還堅持更新!

這邊想稍稍補充關於MoE那邊的解釋,希望可以 add on 一些 value。

其實MoE 本身很多模型都有在用,可是他們在工程方面優化到了極致。這邊我儘量說得白話一些:

它把模型做得很大(2.8兆的參數量),然後像文章說的只是激活專家模組。可是把模型做得這麼大,如何有效選擇哪一個專家模組來回答本身就是一個難題,可能會導致系統的不穩定。Moonshot 用了一個叫 quantile balancing 的技術,你可以想像成一套更均衡的分配規則,增加專家調度的穩定性,讓這麼大的模型在實際運作時還是能保持可靠的表現。

他們本身還優化了處理超長上下文的能力,開發了自己的 attention 機制(跟其他大多數用的 單一transformer 不同)。Transformer attention 的話,上下文的長度和對記憶體的需求都是平方級增長的。然後他們在處理上下文的時候,會需要把前面處理過的關鍵資訊都收進 KV cache,上下文越長,就會吃記憶體,也會把速度拖慢。Kimi K3 用了 Moonshot 自己開發的 Kimi Delta Attention 機制。比起前面的 transformer,他們用的是混合式的 attention 設計,它試圖在「理解上下文的準確度」和「計算效率」之間取得平衡。透過改變計算的方式,它讓模型在面對極長的內容時,不需要每次都把前面全部資訊重新計算一遍,而是能用更有效率的方式進行累積更新。

然後還有一點很重要的,工程往往都要在資源極度匱乏的時候才可以取得巨大的進化。晶片出口限制反而催生出了更強的技術,所以,某種程度上算是因禍得福吧。

27 more comments...

No posts

Ready for more?