本发明涉及油气勘探,具体涉及一种基于clip大语言模型的碳酸盐岩薄片鉴定智能生成方法。
背景技术:
1、岩石薄片是地球物理学和油气科学领域中分析孔隙结构的重要工具,以往岩石薄片鉴定主要采用图像分析结合专家经验的方法,该方法存在工作量大、效率低且易受专家经验影响等缺点。同时,碳酸盐岩在油气勘探中扮演着重要角色,该类岩石内蕴含着大量的油气资源。但是,由于碳酸盐岩结构组成成分复杂,增加了其岩石薄片鉴定的难度,所以针对碳酸盐岩石薄片鉴定方法开展研究尤为重要。
2、随着深度学习及多模态智能领域的发展,多类数据信息交互给岩石薄片鉴定提供了新方向。目前,国内外关于岩石薄片智能鉴定的研究还是在图像分类的基础上,该类方法为监督学习,即模型训练前需要确定岩石薄片类型,该方法难以适用于碳酸盐岩薄片等复杂岩性的鉴定中。同时,目前针对岩石薄片的鉴定仍停留在类别鉴定,仅能根据岩石薄片图像判断岩石薄片类型,无法生成一段完整的岩石薄片鉴定报告。
技术实现思路
1、为了解决上述现有技术的不足,本发明提出了一种基于clip大语言模型的碳酸盐岩薄片鉴定智能生成方法,基于岩石薄片图像生成无监督文本,实现了对复杂岩性岩石薄片的快速鉴定,有利于快速且准确地获取岩石薄片的岩性、组成成分和构造类型,为复杂岩性储层的勘探开发提供了依据。
2、本发明采用以下的技术方案:
3、一种基于clip大语言模型的碳酸盐岩薄片鉴定智能生成方法,具体包括以下步骤:
4、步骤1,获取多张碳酸盐岩薄片图像,确定各碳酸盐岩薄片图像所对应的鉴定文本并进行模板化处理,生成碳酸盐岩文本库并得到多个样本数据,利用样本数据构建包括训练集、验证集和测试集的岩石薄片鉴定文本生成数据集;
5、步骤2,基于clip大语言模型构建碳酸盐岩薄片鉴定文本生成模型;
6、步骤3,利用训练集中的样本数据训练碳酸盐岩薄片鉴定文本生成模型,得到训练后的碳酸盐岩薄片鉴定文本生成模型后,再利用验证集中的训练样本验证碳酸盐岩薄片鉴定文本生成模型;
7、步骤4,从测试集中随机选取碳酸盐岩薄片图像输入至验证后的碳酸盐岩薄片鉴定文本生成模型中,利用验证后的碳酸盐岩薄片鉴定文本生成模型生成各碳酸盐岩薄片所对应的鉴定文本,得到岩石薄片鉴定报告。
8、优选地,所述步骤1中,包括以下步骤:
9、步骤1.1,在碳酸盐岩储层中获取多张碳酸盐岩薄片图像,确定各碳酸盐岩薄片图像所对应的鉴定文本后,对各鉴定文本进行模板化处理,仅保留鉴定文本中的岩性、组成成分和构造类型,得到多个标记有模板化处理后鉴定文本的图像样本,并利用从各鉴定文本中提取的岩性、组成成分和构造类型建立碳酸盐岩文本库;
10、步骤1.2,将各图像样本作为样本数据,确定各样本数据的编号后,将样本数据随机分配至训练集、验证集和测试集中,构建岩石薄片鉴定文本生成数据库。
11、优选地,所述训练集、验证集和测试集中样本数据的数量比为6:3:1。
12、优选地,所述碳酸盐岩薄片鉴定文本生成模型基于clip大语言模型构建,包括两个图像编码器、两个文本编码器和一个文本生成器;
13、所述两个图像编码器为第一图像编码器和第二图像编码器,第一图像编码器和第二图像编码器的结构相同,由四个下采样模块和一个全连接层依次连接而成,用于将碳酸盐岩薄片图像转换为图像特征向量;
14、所述下采样模块包括依次连接的卷积层、平均池化层、激活函数层和归一化层,其中,所述卷积层用于进行二维卷积运算,卷积层中卷积核的大小为5×5、步长为2、充填为1,所述平均池化层用于进行平均二维池化,所述激活函数层内设置有relu函数,所述归一化层用于进行归一化处理;
15、所述两个文本编码器为第一文本编码器和第二文本编码器,第一文本编码器和第二文本编码器的结构相同且基于transformer网络构建,由位置编码层、三个结构相同的自注意力机制模块和全连接层依次连接而成,用于将碳酸盐岩薄片图像的鉴定文本转换为文本特征向量;
16、所述位置编码层用于对鉴定文本中的文本词赋予数值生成文本特征向量;所述自注意力机制模块内设置有自注意力机制层和归一化层,其中,自注意力机制层用于根据鉴定文本中各文本词的重要性确定各文本词的权重,归一化层用于进行归一化处理;
17、所述图像编码器和文本编码器中的全连接层均用于调整特征向量的维度,使得图像编码器所输出图像特征向量的维度与文本编码器所输出文本特征向量的维度相同;
18、所述文本生成器用于按照预设的文本模板随机生成鉴定文本,所述文本模板包括重要词和提示词,重要词根据碳酸盐岩文本库随机生成,提示词为预设的文本内容。
19、优选地,当岩石薄片鉴定文本生成数据集中的样本数据输入至碳酸盐岩薄片鉴定文本生成模型时,所述样本数据中的碳酸盐岩薄片图像分别输入至第一图像编码器和第二图像编码器中,输入至第一图像编码器中的碳酸盐岩薄片图像经第一图像编码器处理得到碳酸盐岩薄片图像所对应的图像特征向量,同时,所述样本数据中的鉴定文本输入至第一文本编码器中,经第一文本编码器处理得到鉴定文本所对应的文本特征向量;
20、将第一图像编码器输出的图像特征向量与第一文本编码器输出的文本特征向量进行特征投影,通过计算各投影位置处特征向量的余弦相似度,生成原始相似度矩阵;
21、输入至第二图像编码器中的碳酸盐岩薄片图像经第二图像编码器处理得到碳酸盐岩薄片图像所对应的图像特征向量,同时,根据预设的文本模板,利用文本生成器生成鉴定文本并输入至第二文本编码器中,碳酸盐岩薄片图像的鉴定文本经第二文本编码器处理转换为文本特征向量;
22、将第二图像编码器输出的图像特征向量与第二文本编码器输出的文本特征向量进行特征投影,通过计算各投影位置处特征向量的余弦相似度,得到生成相似度矩阵;
23、对原始相似度矩阵和生成相似度矩阵进行标签硬化处理后,计算原始相似度矩阵和生成相似度矩阵之间的损失函数值。
24、优选地,所述自注意力机制层中所采用的自注意力机制为:
25、
26、式中,attention(·)为注意力机制,q为查询向量,k为相关性向量,v为被查询信息向量;softmax(·)为归一化指数函数,t为转置矩阵,dk为相关性向量的根号方差。
27、优选地,所述余弦相似度计算公式为:
28、
29、
30、式中,i为碳酸盐岩薄片图像的序号,li为输入至第一图像编码器的第i个碳酸盐岩薄片图像,xi为输入至第二图像编码器的第i个碳酸盐岩薄片图像,tj为第j个原始鉴定文本所对应的文本特征向量,yj为第j个生成鉴定文本所对应的文本特征向量,ci,j为碳酸盐岩薄片图像所对应的图像特征向量与原始鉴定文本之间的余弦相似度,di,j为碳酸盐岩薄片图像所对应的图像特征向量与文本生成器所生成鉴定文本之间的余弦相似度;
31、所述标签硬化处理过程中,以碳酸盐岩薄片图像所对应的正确的鉴定文本作为正样本,以碳酸盐岩薄片图像所对应的错误的鉴定文本作为负样本,基于softmax函数处理原始相似度矩阵和生成相似度矩阵,通过标签硬化处理增大正样本与负样本之间的相似度差异;
32、所述softmax函数为:
33、
34、
35、式中,e(i,j)为标签硬化处理后的原始相似度矩阵,p(i,j)为标签硬化处理后的生成相似度矩阵,n为样本数据的总数。
36、优选地,所述损失函数设置为交叉熵函数,如公式(6)所示:
37、
38、式中,loss为损失函数值。
39、优选地,所述步骤3中,包括以下步骤:
40、步骤3.1,设置碳酸盐岩薄片鉴定文本生成模型的超参数、训练批次和预设损失函数值,预设文本模板的提示词;
41、步骤3.2,根据训练批次从训练集中随机抽取多个样本数据输入至碳酸盐岩薄片鉴定文本生成模型中,训练碳酸盐岩薄片鉴定文本生成模型生成鉴定文本,每次训练过程中基于碳酸盐岩薄片鉴定文本生成模型标签硬化处理后的原始相似度矩阵和生成相似度矩阵计算损失函数值;
42、步骤3.3,将计算得到的损失函数值与预设损失函数值进行比较,若计算得到的损失函数值大于预设损失函数值,则调整碳酸盐岩薄片鉴定文本生成模型的超参数,返回步骤3.2中继续训练碳酸盐岩薄片鉴定文本生成模型,否则,停止对碳酸盐岩薄片鉴定文本生成模型的训练,进入步骤3.4中;
43、步骤3.4,从验证集中随机抽取多个样本数据输入至训练后的碳酸盐岩薄片鉴定文本生成模型中生成鉴定文本,获取碳酸盐岩薄片鉴定文本生成模型的损失函数值,若碳酸盐岩薄片鉴定文本生成模型的损失函数值大于预设损失函数值,则返回步骤3.2中,否则,则进入步骤3.5中;
44、步骤3.5,停止对碳酸盐岩薄片鉴定文本生成模型的验证,得到验证后的碳酸盐岩薄片鉴定文本生成模型。
45、本发明具有如下有益效果:
46、本发明提出了一种基于clip大语言模型的碳酸盐岩薄片鉴定智能生成方法,基于clip大语言模型构建碳酸盐岩薄片鉴定文本生成模型,利用训练验证后的碳酸盐岩薄片鉴定文本生成模型生成鉴定文本,相比于传统的岩石薄片文本生成模型仅能对岩石的单一类别进行识别,本发明所构建的碳酸盐岩薄片鉴定文本生成模型实现了对岩石薄片中岩性、组成成分和构造类型的多因素识别,具有丰富的文本生成能力,实现了对岩石薄片信息快速且准确的获取。
47、同时,本发明所构建的碳酸盐岩薄片鉴定文本生成模型具有零样本学习功能,通过调用配套设置的碳酸盐岩文本库,能够适用于原始鉴定文本未出现的结果,通过对岩石薄片图像的无监督文本生成,实现了对岩石薄片图像中岩性、组成成分和构造类型的准确获取,为复杂岩性储层的勘探开发提供了依据。
1.一种基于clip大语言模型的碳酸盐岩薄片鉴定智能生成方法,其特征在于,具体包括以下步骤:
2.根据权利要求1所述的基于clip大语言模型的碳酸盐岩薄片鉴定智能生成方法,其特征在于,所述步骤1中,包括以下步骤:
3.根据权利要求2所述的基于clip大语言模型的碳酸盐岩薄片鉴定智能生成方法,其特征在于,所述训练集、验证集和测试集中样本数据的数量比为6:3:1。
4.根据权利要求1所述的基于clip大语言模型的碳酸盐岩薄片鉴定智能生成方法,其特征在于,所述碳酸盐岩薄片鉴定文本生成模型基于clip大语言模型构建,包括两个图像编码器、两个文本编码器和一个文本生成器;
5.根据权利要求4所述的基于clip大语言模型的碳酸盐岩薄片鉴定智能生成方法,其特征在于,当岩石薄片鉴定文本生成数据集中的样本数据输入至碳酸盐岩薄片鉴定文本生成模型时,所述样本数据中的碳酸盐岩薄片图像分别输入至第一图像编码器和第二图像编码器中,输入至第一图像编码器中的碳酸盐岩薄片图像经第一图像编码器处理得到碳酸盐岩薄片图像所对应的图像特征向量,同时,所述样本数据中的鉴定文本输入至第一文本编码器中,经第一文本编码器处理得到鉴定文本所对应的文本特征向量;
6.根据权利要求4所述的基于clip大语言模型的碳酸盐岩薄片鉴定智能生成方法,其特征在于,所述自注意力机制层中所采用的自注意力机制为:
7.根据权利要求5所述的基于clip大语言模型的碳酸盐岩薄片鉴定智能生成方法,其特征在于,所述余弦相似度计算公式为:
8.根据权利要求7所述的基于clip大语言模型的碳酸盐岩薄片鉴定智能生成方法,其特征在于,所述损失函数设置为交叉熵函数,如公式(6)所示:
9.根据权利要求1所述的基于clip大语言模型的碳酸盐岩薄片鉴定智能生成方法,其特征在于,所述步骤3中,包括以下步骤:
