DeepSeek-V2是由幻方量化旗下的AI公司——深度求索(DeepSeek)研发的开源MoE大模型,于2024年5月发布。[1][2]
DeepSeek-V2采用Transformer架构,[2]引入MLA(Multi-head Latent Attention)架构, 大幅减少了计算量和推理显存。[3]该模型性能达GPT-4级别,且开源、可免费商用。[4]DeepSeek-V2以236B总参数、21B激活,大致可以达到70B~110B Dense的模型能力。[5] DeepSeek-V2的API接口价格为每百万tokens输入1元、输出2元(32K上下文)。[6]
历史沿革
2024年5月,幻方量化旗下的AI公司深度求索(DeepSeek)发布第二代MoE(专家模型)DeepSeek-V2。[1][2]同年12月10日,DeepSeek官方公众号发布博文,宣布DeepSeek-V2系列收官。[7]