用于自动调用拷贝数改变的方法和系统与流程

专利检索2026-08-29  12


本公开内容一般性地涉及用于分析基因组谱分析数据的方法和系统,并且更具体地涉及使用基因组谱分析数据用于自动调用拷贝数改变的方法和系统。


背景技术:

1、结构变体(structural variant,sv)是通常包含长度为至少50个碱基对(basepair,bp)的改变的大的基因组改变(mahmoud,et al.(2019),“structural variantcalling:the long and the short of it”,genome biology 20:246)。这些大的基因组改变可分为缺失、重复、插入、倒位和易位,并描述了dna获得、丢失或重排的不同组合。

2、拷贝数改变(copy number alteration,cna)(也称为拷贝数变异(copy numbervariation,cnv))是大的结构变体的亚型,主要包含缺失或重复,并且可涵盖长度为多至50万个核苷酸的改变。体细胞拷贝数变异(cnv)在多种癌症的发展中发挥着至关重要的作用(samadian,et al.(2018),“bamgineer:introduction of simulated allele-specificcopy number variants into exome and targeted sequence data sets”,plos computbiol.14(3):e1006080)。下一代测序(next-generation sequencing,ngs)方法的发展使得算法的发展能够从多种测序数据集(包括外显子组和靶向序列数据)中计算性地推断cna谱。

3、然而,基于测序数据用于检测和调用cna的现有方法可能需要配对的正常样品或用于测序覆盖度归一化的过程匹配的对照,可能需要对测序数据进行大量的手动处理(curation),可能容易受到例如样品污染引入的错误的影响,和/或可能无法很好地处理染色体x上发生的小缺失和/或cna事件的cna检测和调用。因此,仍然需要用于自动调用cna的改进方法。


技术实现思路

1、本文中公开了用于自动调用拷贝数改变(cna)的方法和系统,其提供对拷贝数改变的更准确的检测并且不需要覆盖度归一化样品或序列数据的手动处理。具体地,所描述的方法和系统使用:(i)使用“正常组”方法的覆盖度归一化程序,其提供考虑性别的染色体x序列读出数据的适当归一化,(ii)基于修剪精确线性时间(pruned exact linear time,pelt)方法的分割,所述修剪精确线性时间(pelt)方法被定制为使用覆盖率数据的特定转换并扩展到考虑样品污染,(iii)基于异常snp谱(使用碱基替换噪声模型和拷贝数模型谱鉴定污染信号确定的)的迭代样品污染检测方法,(iv)新的基于确定所有局部最优拷贝数模型配置和模型的优先级(例如,与序列读出数据最一致并且生物学上合理的拷贝数模型)的拷贝数模型确定方法,和/或(v)基于特定拷贝数模型和对未明确包含在总体拷贝数模型中的另外的改变的扫描二者来自动调用cna。

2、本文中公开了包括以下的方法:提供从来自对象的样品获得的多个核酸分子;将一个或更多个衔接子连接到来自多个核酸分子的一个或更多个核酸分子上;对来自多个核酸分子的一个或更多个经连接的核酸分子进行扩增;从所扩增的核酸分子中捕获经扩增的核酸分子;通过测序仪对所捕获的核酸分子进行测序以获得代表经捕获的核酸分子的多个序列读出,其中多个测序读出中的一个或更多个与样品中一个或更多个亚基因组区间内的一个或更多个基因座重叠;在一个或更多个处理器处接收多个序列读出的序列读出数据,以及基于所述序列读出数据:使用一个或更多个处理器确定样品的倍性、一个或更多个亚基因组区间内的一个或更多个基因座的覆盖率数据、等位基因分数数据、分割数据和拷贝数模型;使用一个或更多个处理器基于分割数据鉴定多个区段;使用一个或更多个处理器基于至少覆盖率数据、等位基因分数数据、分割数据和拷贝数模型确定多个区段的拷贝数;使用一个或更多个处理器基于多个区段中的相应区段的拷贝数,检测一个或更多个基因座中的基因座的扩增或缺失的存在;以及基于检测到的一个或更多个基因座的扩增和缺失调用一个或更多个基因座的拷贝数改变(cna)。

3、在一些实施方案中,所述方法还包括合并针对一个或更多个基因座中的基因座检测到的任何重复扩增和缺失。在一些实施方案中,拷贝数模型基于覆盖率数据和等位基因分数数据来预测一个或更多个基因座的拷贝数。在一些实施方案中,覆盖率数据还包含与一个或更多个基因座相关的单核苷酸多态性(single nucleotide polymorphism,snp)和内含子的覆盖率数据。在一些实施方案中,拷贝数模型还预测样品的样品纯度和倍性。在一些实施方案中,拷贝数模型还输出分割数据。在一些实施方案中,当相应区段的拷贝数大于或等于样品的倍性时,检测到扩增。在一些实施方案中,缺失的检测包括确定相应区段中的一个或更多个基因座的纯合缺失。在一些实施方案中,缺失的检测包括确定相应区段中的一个或更多个基因座的杂合缺失。在一些实施方案中,缺失的检测包括确定相应区段中的一个或更多个基因座的部分缺失。在一些实施方案中,对象被怀疑患有疾病或确定患有疾病。在一些实施方案中,疾病是癌症。在一些实施方案中,所述方法用于常规测试。在一些实施方案中,所述方法用于产前测试。在一些实施方案中,所述方法还包括从对象收集样品。在一些实施方案中,样品包含组织活检样品、液体活检样品或正常对照。在一些实施方案中,样品是组织活检样品并且包含骨髓。在一些实施方案中,样品是液体活检样品并且包含血液、血浆、脑脊液、痰、粪便、尿液或唾液。在一些实施方案中,样品是液体活检样品并且包含循环肿瘤细胞(circulating tumor cell,ctc)。在一些实施方案中,样品是液体活检样品并且包含无细胞dna(cell-free dna,cfdna)、循环肿瘤dna(circulating tumor dna,ctdna),或其任意组合。在一些实施方案中,多个核酸分子包含肿瘤核酸分子与非肿瘤核酸分子的混合物。在一些实施方案中,肿瘤核酸分子来源于异质组织活检样品的肿瘤部分,并且非肿瘤核酸分子来源于异质组织活检样品的正常部分。在一些实施方案中,样品包含液体活检样品,并且其中肿瘤核酸分子来源于液体活检样品的循环肿瘤dna(ctdna)部分,且非肿瘤核酸分子来源于液体活检样品的非肿瘤无细胞dna(cfdna)部分。在一些实施方案中,一个或更多个衔接子包含扩增引物、流动池衔接子序列、底物衔接子序列或样品索引序列。在一些实施方案中,所捕获的核酸分子通过与一个或更多个诱饵分子杂交而从所扩增的核酸分子中捕获。在一些实施方案中,一个或更多个诱饵分子包含一个或更多个核酸分子,每个核酸分子包含与所捕获的核酸分子的区域互补的区域。在一些实施方案中,对核酸分子进行扩增包括进行聚合酶链反应(polymerase chain reaction,pcr)扩增技术、非pcr扩增技术或等温扩增技术。在一些实施方案中,测序包括使用大规模平行测序(massivelyparallel sequencing,mps)技术、全基因组测序(whole genome sequencing,wgs)、全外显子组测序、靶向测序、直接测序或sanger测序技术。在一些实施方案中,测序包括大规模平行测序,并且大规模平行测序技术包括下一代测序(ngs)。在一些实施方案中,下一代测序(ngs)包括配对末端测序。在一些实施方案中,测序仪包括下一代测序仪。在一些实施方案中,所述方法还包括由一个或更多个处理器生成指示所调用的拷贝数改变的报告。在一些实施方案中,所述方法还包括向健康护理提供者传输报告。在一些实施方案中,报告经由计算机网络或对等连接传输。

4、本文还公开了用于自动调用拷贝数改变的方法,其包括:在一个或更多个处理器处接收与来自对象的样品中一个或更多个亚基因组区间内的一个或更多个基因座重叠的多个序列读出的序列读出数据,以及基于所述序列读出数据:确定样品的倍性、一个或更多个亚基因组区间内的一个或更多个基因座的覆盖率数据、等位基因分数数据、分割数据和拷贝数模型;使用一个或更多个处理器基于分割数据鉴定多个区段;使用一个或更多个处理器基于至少覆盖率数据、等位基因分数数据、分割数据和拷贝数模型确定多个区段的拷贝数;使用一个或更多个处理器基于多个区段中的相应区段的拷贝数,检测一个或更多个基因座中的基因座的扩增或缺失的存在;以及基于检测到的一个或更多个基因座的扩增和缺失调用一个或更多个基因座的拷贝数改变(cna)。

5、在一些实施方案中,所述方法还包括合并针对一个或更多个基因座中的基因座检测到的任何重复扩增和缺失。在一些实施方案中,所述方法还包括生成包含一个或更多个基因座的所调用的拷贝数改变的报告。在一些实施方案中,所述方法还包括基于一个或更多个基因座的所调用的拷贝数改变生成对象的基因组谱。

6、在一些实施方案中,覆盖率数据通过以下确定:将与样品和对照样品中一个或更多个亚基因组区间内的一个或更多个基因座重叠的多个序列读出与参考基因组进行比对,以及确定与样品和对照样品中一个或更多个亚基因组区间内的一个或更多个基因座中的每一个重叠的序列读出的数目。在一些实施方案中,对照样品是配对的正常样品、过程匹配的对照样品、或正常对照样品组。

7、在一些实施方案中,等位基因分数数据通过以下确定:将与样品中一个或更多个亚基因组区间内的一个或更多个基因座重叠的多个序列读出与参考基因组进行比对,检测存在于一个或更多个基因座中的基因座处的等位基因的数目,以及确定存在于该基因座处的至少一个等位基因的等位基因分数。

8、在一些实施方案中,分割数据通过以下生成:将与样品中一个或更多个亚基因组区间内的一个或更多个基因座重叠的多个序列读出与参考基因组进行比对,以及使用修剪精确线性时间(pelt)方法处理比对的序列读出数据、覆盖率数据和等位基因分数数据以确定说明(account)比对序列读出数据所需的区段的数目,其中每个区段具有相同的拷贝数。

9、在一些实施方案中,拷贝数模型基于覆盖率数据和等位基因分数数据来预测一个或更多个基因座的拷贝数。在一些实施方案中,覆盖率数据还包含与一个或更多个基因座相关的单核苷酸多态性(snp)和内含子的覆盖率数据。在一些实施方案中,拷贝数模型还预测样品的样品纯度和倍性。在一些实施方案中,拷贝数模型还输出分割数据。在一些实施方案中,样品的倍性具有1至8范围内的值。

10、在一些实施方案中,当相应区段的拷贝数大于或等于样品的倍性时,检测到扩增。在一些实施方案中,当相应区段的拷贝数大于或等于样品的倍性加第一预定值时,检测到扩增。在一些实施方案中,第一预定值为2至500范围内的值。在一些实施方案中,第一预定值为2至10范围内的值。

11、在一些实施方案中,当相应区段的拷贝数大于或等于样品的倍性加第二预定值并且基因座是第一预定义基因座组的成员时,检测到扩增。在一些实施方案中,第二预定值为0至500范围内的值。在一些实施方案中,第二预定值为2至10范围内的值。在一些实施方案中,第一预定义基因座组包含一个或更多个可成药基因靶基因座、预后基因座、癌基因基因座,或其任意组合。在一些实施方案中,第一预定义基因座组包含ar和erbb2基因座。

12、在一些实施方案中,缺失的检测包括确定相应区段中的一个或更多个基因座的纯合缺失。在一些实施方案中,纯合缺失通过确定给定基因座的总拷贝数来检测,所述给定基因座的总拷贝数等于该基因座处的第一等位基因和第二等位基因的拷贝数的总和。在一些实施方案中,第一等位基因是主要等位基因并且第二等位基因是次要等位基因。在一些实施方案中,如果给定基因座的总拷贝数等于第三预定值,则调用纯合缺失。在一些实施方案中,第三预定值为约零。

13、在一些实施方案中,缺失的检测包括确定相应区段中的一个或更多个基因座的杂合缺失。在一些实施方案中,如果给定基因座处的第一等位基因的拷贝数等于第四预定值,并且给定基因座处的第二等位基因的拷贝数不等于第四预定值,则调用杂合缺失。在一些实施方案中,第四预定值为约零。在一些实施方案中,第一等位基因是主要等位基因并且第二等位基因是次要等位基因。

14、在一些实施方案中,缺失的检测包括确定相应区段中的一个或更多个基因座的部分缺失。在一些实施方案中,如果相邻基因座、单核苷酸多态性(snp)和内含子的log2比率(log2 ratio,l2r)与该基因座的log2比率显著不同,并且给定基因座的log2比率与非相邻基因座、单核苷酸多态性(snp)和内含子的l2r分布显著不同,则调用给定基因座的部分缺失。

15、在一些实施方案中,所调用的cna用于在对象中诊断疾病或确认疾病的诊断。在一些实施方案中,疾病是癌症。在一些实施方案中,所述方法还包括基于所调用的cna选择施用于对象的癌症治疗。在一些实施方案中,所述方法还包括基于所调用的cna确定施用于对象的癌症治疗的有效量。在一些实施方案中,所述方法还包括基于所调用的cna向对象施用癌症治疗。在一些实施方案中,癌症治疗包含化学治疗、放射治疗、免疫治疗、靶向治疗或手术。在一些实施方案中,癌症为b细胞癌(多发性骨髓瘤)、黑素瘤、乳腺癌、肺癌、支气管癌、结直肠癌、前列腺癌、胰腺癌、胃癌、卵巢癌、膀胱癌、脑癌、中枢神经系统癌、周围神经系统癌、食管癌、宫颈癌、子宫癌、子宫内膜癌、口腔癌、咽癌、肝癌、肾癌、睾丸癌、胆道癌、小肠癌、阑尾癌、唾液腺癌、甲状腺癌、肾上腺癌、骨肉瘤、软骨肉瘤、血液学组织癌、腺癌、炎性肌成纤维细胞瘤、胃肠道间质瘤(gastrointestinal stromal tumor,gist)、结肠癌、多发性骨髓瘤(multiple myeloma,mm)、骨髓增生异常综合征(myelodysplastic syndrome,mds)、骨髓增殖性病症(myeloproliferative disorder,mpd)、急性淋巴细胞白血病(acutelymphocytic leukemia,all)、急性髓细胞白血病(acute myelocytic leukemia,aml)、慢性髓细胞白血病(chronic myelocytic leukemia,cml)、慢性淋巴细胞白血病(chroniclymphocytic leukemia,cll)、真性红细胞增多症、霍奇金淋巴瘤(hodgkin lymphoma)、非霍奇金淋巴瘤(non-hodgkin lymphoma,nhl)、软组织肉瘤、纤维肉瘤、黏液肉瘤、脂肪肉瘤、成骨肉瘤、脊索瘤、血管肉瘤、内皮肉瘤、淋巴管肉瘤、淋巴管内皮肉瘤、滑膜瘤、间皮瘤、尤因肿瘤(ewing’s tumor)、平滑肌肉瘤、横纹肌肉瘤、鳞状细胞癌、基底细胞癌、腺癌、汗腺癌、皮脂腺癌、乳头状癌、乳头状腺癌、髓样癌、支气管源性癌、肾细胞癌、肝癌、胆管癌、绒毛膜癌、精原细胞瘤、胚胎癌、维尔姆斯瘤(wilms’tumor)、膀胱癌、上皮癌、神经胶质瘤、星形细胞瘤、髓母细胞瘤、颅咽管瘤、室管膜瘤、松果体瘤、血管母细胞瘤、听神经瘤、少突胶质细胞瘤、脑膜瘤、神经母细胞瘤、视网膜母细胞瘤、滤泡性淋巴瘤、弥漫大b细胞淋巴瘤、套细胞淋巴瘤、肝细胞癌、甲状腺癌、胃癌、头颈癌、小细胞癌、原发性血小板增多症、原因不明性髓样化生、高嗜酸性粒细胞增多综合征、系统性肥大细胞增多症、常见高嗜酸性粒细胞增多症、慢性嗜酸性粒细胞白血病、神经内分泌癌、或类癌瘤。

16、在一些实施方案中,所述一个或更多个基因座包含10至20个基因座、10至40个基因座、10至60个基因座、10至80个基因座、10至100个基因座、10至150个基因座、10至200个基因座、10至250个基因座、10至300个基因座、10至350个基因座、10至400个基因座、10至450个基因座、10至500个基因座、20至40个基因座、20至60个基因座、20至80个基因座、20至100个基因座、20至150个基因座、20至200个基因座、20至250个基因座、20至300个基因座、20至350个基因座、20至400个基因座、20至500个基因座、40至60个基因座、40至80个基因座、40至100个基因座、40至150个基因座、40至200个基因座、40至250个基因座、40至300个基因座、40至350个基因座、40至400个基因座、40至500个基因座、60至80个基因座、60至100个基因座、60至150个基因座、60至200个基因座、60至250个基因座、60至300个基因座、60至350个基因座、60至400个基因座、60至500个基因座、80至100个基因座、80至150个基因座、80至200个基因座、80至250个基因座、80至300个基因座、80至350个基因座、80至400个基因座、80至500个基因座、100至150个基因座、100至200个基因座、100至250个基因座、100至300个基因座、100至350个基因座、100至400个基因座、100至500个基因座、150至200个基因座、150至250个基因座、150至300个基因座、150至350个基因座、150至400个基因座、150至500个基因座、200至250个基因座、200至300个基因座、200至350个基因座、200至400个基因座、200至500个基因座、250至300个基因座、250至350个基因座、250至400个基因座、250至500个基因座、300至350个基因座、300至400个基因座、300至500个基因座、350至400个基因座、350至500个基因座或400至500个基因座。

17、本文中公开了用于诊断疾病的方法,所述方法包括:基于检测来自对象的样品中一个或更多个亚基因组区间内的一个或更多个基因座的拷贝数改变(cna),诊断对象患有该疾病,其中检测到的cna是根据本文中公开的任何方法确定的。

18、本文中公开了选择癌症治疗的方法,所述方法包括:响应于检测来自对象的样品中一个或更多个亚基因组区间内的一个或更多个基因座的拷贝数改变(cna),选择用于对象的癌症治疗,其中检测到的cna是根据本文中公开的任何方法确定的。

19、本文中公开了在对象中治疗癌症的方法,其包括:响应于检测来自对象的样品中一个或更多个亚基因组区间内的一个或更多个基因座的拷贝数改变(cna),向对象施用有效量的癌症治疗,其中检测到的cna是根据本文中公开的任何方法确定的。

20、本文中公开了用于在对象中监测肿瘤进展或复发的方法,所述方法包括:根据本文中公开的任何方法,检测在第一时间点从对象获得的第一样品中一个或更多个亚基因组区间内的一个或更多个基因座的拷贝数改变(cna);检测在第二时间点从对象获得的第二样品中一个或更多个亚基因组区间内的一个或更多个基因座的拷贝数改变(cna);以及将在第一样品中检测到的cna与在第二样品中检测到的cna进行比较,从而监测肿瘤进展或复发。在一些实施方案中,第二样品中cna的检测是根据本文中公开的任何方法确定的。在一些实施方案中,所述方法还包括响应于肿瘤进展而调整抗癌治疗。在一些实施方案中,所述方法还包括响应于肿瘤进展而调整抗癌治疗的剂量或选择不同的抗癌治疗。在一些实施方案中,所述方法还包括向对象施用经调整的抗癌治疗。在一些实施方案中,所述第一时间点是在向对象施用抗癌治疗之前,并且其中所述第二时间点是在向对象施用抗癌治疗之后。在一些实施方案中,对象患有癌症、处于患有癌症的风险中、正在针对癌症进行常规测试或被怀疑患有癌症。在一些实施方案中,癌症为实体瘤。在一些实施方案中,癌症为血液学癌症。在一些实施方案中,抗癌治疗包含化学治疗、放射治疗、免疫治疗、靶向治疗或手术。

21、在一些实施方案中,本文中公开的任何方法还包括确定一个或更多个亚基因组区间内的一个或更多个基因座的所调用的cna,并且应用所调用的cna作为与样品相关的诊断值。在一些实施方案中,本文中公开的任何方法还包括基于一个或更多个基因座的所调用的cna生成对象的基因组谱。在一些实施方案中,对象的基因组谱还包含来自以下的结果:全面基因组谱分析(comprehensive genomic profiling,cgp)测试、基因表达谱分析测试、癌症热点组测试、dna甲基化测试、dna片段化测试、rna片段化测试,或其任意组合。在一些实施方案中,对象的基因组谱还包含来自基于核酸测序的测试的结果。在一些实施方案中,所述方法还包括基于所生成的基因组谱选择抗癌剂、向对象施用抗癌剂或向对象施加抗癌治疗。

22、在一些实施方案中,使用任何公开的方法对样品中一个或更多个亚基因组区间内的一个或更多个基因座的cna的检测用于为对象做出建议的治疗决定。在一些实施方案中,对样品中一个或更多个亚基因组区间内的一个或更多个基因座的cna的检测用于向对象施加或施用治疗。

23、本文中公开了系统,其包含:一个或更多个处理器;以及与一个或更多个处理器通信耦合并被配置为存储指令的存储器,当所述指令由一个或更多个处理器执行时,使得系统:接收与来自对象的样品中一个或更多个亚基因组区间内的一个或更多个基因座重叠的多个序列读出的序列读出数据,以及基于所述序列读出数据:确定样品的倍性、一个或更多个亚基因组区间内的一个或更多个基因座的覆盖率数据、等位基因分数数据、分割数据和拷贝数模型;基于分割数据鉴定多个区段;基于至少覆盖率数据、等位基因分数数据、分割数据和拷贝数模型确定多个区段的拷贝数;基于多个区段中的相应区段的拷贝数检测一个或更多个基因座中的基因座的扩增或缺失的存在;以及基于检测到的一个或更多个基因座的扩增和缺失调用所述一个或更多个基因座的拷贝数改变(cna)。

24、本文中还公开了存储一个或更多个程序的非暂态计算机可读存储介质,所述一个或更多个程序包含指令,所述指令当由系统的一个或更多个处理器执行时,使得系统:接收与来自对象的样品中一个或更多个亚基因组区间内的一个或更多个基因座重叠的多个序列读出的序列读出数据,以及基于所述序列读出数据:确定样品的倍性、一个或更多个亚基因组区间内的一个或更多个基因座的覆盖率数据、等位基因分数数据、分割数据和拷贝数模型;基于分割数据鉴定多个区段;基于至少覆盖率数据、等位基因分数数据、分割数据和拷贝数模型确定多个区段的拷贝数;基于多个区段中的相应区段的拷贝数检测一个或更多个基因座中的基因座的扩增或缺失的存在;以及基于检测到的一个或更多个基因座的扩增和缺失调用所述一个或更多个基因座的拷贝数改变(cna)。

25、通过引用并入

26、本说明书中提及的所有出版物、专利和专利申请都通过引用整体以如同每个单独的出版物、专利或专利申请被具体地和单独地指明通过引用整体并入本文中一样的相同程度并入本文中。在本文中的术语与并入的引用中的术语存在冲突的情况下,则以本文中的术语为准。


技术特征:

1.用于自动调用拷贝数改变的方法,其包括:

2.权利要求1所述的方法,其还包括合并针对所述一个或更多个基因座中的基因座检测到的任何重复扩增和缺失。

3.权利要求1所述的方法,其还包括生成包含所述一个或更多个基因座的所调用的拷贝数改变的报告。

4.权利要求1所述的方法,其还包括基于所述一个或更多个基因座的所调用的拷贝数改变生成所述对象的基因组谱。

5.权利要求1所述的方法,其中所述覆盖率数据通过以下确定:将与所述样品和对照样品中一个或更多个亚基因组区间内的一个或更多个基因座重叠的多个序列读出与参考基因组进行比对,以及确定与所述样品和所述对照样品中所述一个或更多个亚基因组区间内的一个或更多个基因座中的每一个重叠的序列读出的数目。

6.权利要求5所述的方法,其中所述对照样品是配对的正常样品、过程匹配的对照样品、或正常对照样品组。

7.权利要求1所述的方法,其中所述等位基因分数数据通过以下确定:将与所述样品中一个或更多个亚基因组区间内的一个或更多个基因座重叠的多个序列读出与参考基因组进行比对,检测存在于所述一个或更多个基因座中的基因座处的等位基因的数目,以及确定存在于所述基因座处的至少一个等位基因的等位基因分数。

8.权利要求1所述的方法,其中所述分割数据通过以下产生:

9.权利要求1所述的方法,其中所述拷贝数模型基于所述覆盖率数据和等位基因分数数据来预测所述一个或更多个基因座的拷贝数。

10.权利要求9所述的方法,其中所述覆盖率数据还包含与所述一个或更多个基因座相关的单核苷酸多态性(snp)和内含子的覆盖率数据。

11.权利要求9所述的方法,其中所述拷贝数模型还预测所述样品的样品纯度和倍性。

12.权利要求9所述的方法,其中所述拷贝数模型还输出所述分割数据。

13.权利要求1所述的方法,其中所述样品的倍性具有1至8范围内的值。

14.权利要求1所述的方法,其中当所述相应区段的拷贝数大于或等于所述样品的倍性时,检测到扩增。

15.权利要求14所述的方法,其中当所述相应区段的拷贝数大于或等于所述样品的倍性加第一预定值时,检测到扩增。

16.权利要求15所述的方法,其中所述第一预定值为2至500范围内的值。

17.权利要求15所述的方法,其中所述第一预定值为2至10范围内的值。

18.权利要求14所述的方法,其中当所述相应区段的拷贝数大于或等于所述样品的倍性加第二预定值并且所述基因座是第一预定义基因座组的成员时,检测到扩增。

19.权利要求18所述的方法,其中所述第二预定值为0至500范围内的值。

20.权利要求18所述的方法,其中所述第二预定值为2至10范围内的值。

21.权利要求18所述的方法,其中所述第一预定义基因座组包含一个或更多个可成药基因靶基因座、预后基因座、癌基因基因座,或其任意组合。

22.权利要求21所述的方法,其中所述第一预定义基因座组包含ar和erbb2基因座。

23.权利要求1所述的方法,其中缺失的检测包括鉴定相应区段中的一个或更多个基因座的纯合缺失。

24.权利要求23所述的方法,其中纯合缺失通过确定给定基因座的总拷贝数来检测,所述给定基因座的总拷贝数等于所述基因座处的第一等位基因和第二等位基因的拷贝数的总和。

25.权利要求24所述的方法,其中所述第一等位基因是主要等位基因并且所述第二等位基因是次要等位基因。

26.权利要求24所述的方法,其中如果给定基因座的总拷贝数等于第三预定值,则调用纯合缺失。

27.权利要求26所述的方法,其中所述第三预定值为约零。

28.权利要求1所述的方法,其中缺失的检测包括鉴定相应区段中的一个或更多个基因座的杂合缺失。

29.权利要求28所述的方法,其中如果给定基因座处的第一等位基因的拷贝数等于第四预定值,并且所述给定基因座处的第二等位基因的拷贝数不等于所述第四预定值,则调用杂合缺失。

30.权利要求29所述的方法,其中所述第四预定值为约零。

31.权利要求29所述的方法,其中所述第一等位基因是主要等位基因并且所述第二等位基因是次要等位基因。

32.权利要求1所述的方法,其中缺失的检测包括鉴定相应区段中的一个或更多个基因座的部分缺失。

33.权利要求32所述的方法,其中如果相邻基因座、单核苷酸多态性(snp)和内含子的log2比率(l2r)与所述基因座的log2比率显著不同,并且给定基因座的log2比率与非相邻基因座、单核苷酸多态性(snp)和内含子的l2r分布显著不同,则调用所述给定基因座的部分缺失。

34.权利要求1所述的方法,其还包括在调用所述一个或更多个基因座的拷贝数改变之前执行质量控制程序。

35.权利要求34所述的方法,其中执行所述质量控制程序以评估所述序列读出数据的质量。

36.权利要求34所述的方法,其中执行所述质量控制程序以评估拷贝数模型的成功收敛。

37.权利要求34所述的方法,其中执行所述质量控制程序以评估所述一个或更多个基因座的cna调用的可靠性。

38.权利要求1所述的方法,其中所调用的cna用于在所述对象中诊断疾病或确认疾病的诊断。

39.权利要求38所述的方法,其中所述疾病是癌症。


技术总结
描述了用于自动调用拷贝数改变(CNA)的方法和系统。所述方法和系统利用来自对象的样品中一个或更多个亚基因组区间内的一个或更多个基因座的基于测序的覆盖率数据、等位基因分数数据、分割数据和拷贝数模型数据来检测基因座的扩增和缺失,并应用多个阈值和过滤程序以在不需要过程匹配的对照和手动处理测序数据的同时提供具有改善的可靠性的CNA的自动调用。

技术研发人员:伯纳德·芬德勒,杰森·D·休斯
受保护的技术使用者:基金会医学公司
技术研发日:
技术公布日:2024/5/29
转载请注明原文地址:https://win.8miu.com/read-1167335.html

最新回复(0)