人類 發達集團董事長
來源:財經刊物   發佈於 2026-09-22 14:56

DeepSeek大模型再暴衝 2兆參數訓練中、下一步挑戰8兆

鉅亨網編輯林羿君 綜合報導2026-09-22 12:19


AI新聞摘要
  • 1.梁文鋒向投資人透露,DeepSeek正訓練2兆參數模型,後續還計畫開發8兆參數模型
  • 2.DeepSeek現有旗艦V4-Pro總參數1.6兆、每Token啟用49億參數;Kimi K3總參數2.8兆
  • 3.DeepSeek今年7月完成逾人民幣500億元融資、估值破500億美元,閉門會議並嚴格防資訊外洩
DeepSeek執行長梁文鋒近日向投資人透露,公司正積極訓練一款參數規模達2兆的模型,後續更計畫開發8兆參數模型。若計畫順利推進,DeepSeek新模型的參數規模將遠超現有主流大型語言模型。



DeepSeek大模型再暴衝 2兆參數訓練中、下一步挑戰8兆。(圖:shutterstock)



據《ChainCatcher》報導,DeepSeek目前旗艦模型V4-Pro總參數量為1.6兆個,每個Token啟用49億個參數。該模型已採取開源模式,成為DeepSeek現階段布局大型模型市場的主力產品。



放眼目前已公開參數規模的大型語言模型,月之暗面(Moonshot AI)旗下Kimi K3總參數量已達2.8兆個。Kimi K3採用混合專家模型(MoE)架構,每個Token僅啟用其中1040億個參數,以兼顧模型容量與運算效率。

相較之下,DeepSeek規劃中的8兆參數模型,整體規模將接近Kimi K3的3倍。

除了揭露模型開發藍圖,DeepSeek也持續獲得資本市場支持。該公司今年7月完成逾人民幣500億元融資,估值突破500億美元,顯示投資人對其技術發展與大型模型布局抱持高度期待。

消息人士透露,梁文鋒是在周日舉行的一場閉門線下會議中,向投資人說明上述計畫。DeepSeek要求與會投資人親赴公司位於北京或杭州的辦公室參與,梁文鋒本人則以線上方式出席。

為避免重演首次融資期間的資訊外洩事件,DeepSeek此次採取嚴格保密措施,要求投資人在會議期間交出手機、其他電子設備及隨身包袋,現場僅提供紙筆記錄。

此舉也反映DeepSeek對新模型開發進度與後續技術規畫保持高度謹慎。

評論 請先 登錄註冊