本发明涉及计算机,尤其涉及一种基于计算机的辅助翻译方法及系统。
背景技术:
1、近年来,随着全球化的发展和信息技术的不断进步,各种语言之间的交流和沟通越来越频繁和紧密,在这种背景下,翻译作为一项重要的语言服务,被广泛应用于国际贸易、文化交流、学术交流等领域。
2、然而,传统的人工翻译在进行翻译时,存在时间成本高、效率低、精度不高的问题,严重制约了翻译行业的发展和应用。
3、因此,为解决人工翻译成本高、时间长的问题,特提出本发明。
技术实现思路
1、为了现有技术存在的上述技术缺陷,本发明提供了一种基于计算机的辅助翻译方法及系统,可以有效解决背景技术中的问题。
2、为了解决上述技术问题,本发明提供的技术方案具体如下:
3、本发明实施例公开了一种基于计算机的辅助翻译方法,包括以下步骤:
4、将原始语料和目标语料分为训练集和测试集,并对训练集和测试集内的原始语料及目标语料分别进行初步处理,获得双语词表t;
5、构建翻译模型,以训练集为训练样本并基于双语词表t对翻译模型进行训练;
6、根据训练集和测试集的困惑度,对翻译模型的参数进行优化调整;
7、将待翻译的源语言文本输入至翻译模型中,输出第一翻译结果;
8、对第一翻译结果进行后处理操作,得到最终翻译结果。
9、在上述任一方案中优选的是,所述将原始语料和目标语料分为训练集和测试集,并对训练集和测试集内的原始语料及目标语料分别进行初步处理,获得双语词表t,包括以下步骤:
10、将原始文本进行分词和词性标注,得到源语言单词序列x1,x2,…,xn和相应的词性标注pos1,pos2,…,posn;
11、对目标语言文本进行分词和词性标注,得到单词序列y1,y2,…,ym和相应的词性标注pos1′,pos2′,…,posn′;
12、对源语言和目标语言的词性标注结果进行去重,得到去重后的源语言词性标签集合pos={pos1,pos2,…,posk}和目标语言词性标签集合pos′={pos1′,pos2′,…,posk′};
13、基于去重后的词性标签,在源语言和目标语言的分词序列中寻找具有相同词性的词汇对(xi,yi),并将其添加到双语词表t中;
14、对于t中的每个词汇对(xi,yi),添加相应的词性标签对(posi,posj′)。
15、在上述任一方案中优选的是,所述构建翻译模型,以训练集为训练样本并基于双语词表t对翻译模型进行训练,包括以下步骤:
16、初始化翻译模型的参数θ,所述参数θ包括翻译概率 p( y j| x i)、调序概率 p( a j| a j-1, m, n)以及词汇翻译概率 p( v j| t i),其中,翻译概率 p( y j| x i)为给定源语言单词 x i时翻译为目标语言单词 y j的概率;调序概率 p( a j| a j-1, m, n)为在给定前一个目标单词的位置 a j-1,以及源语言和目标语言句子长度m和n的条件下,当前目标单词目标语言单词 y j出现在位置 a j的概率;词汇翻译概率 p( v j| t i)表示给定源语言词性 t i时,翻译为目标语言单词 v j的概率;
17、根据语料库内的双语句对,计算翻译概率 p( y j| x i)和调序概率 p( a j| a j-1, m, n);
18、根据双语词表t和语料库,估计源语言单词 t i和目标语言单词 v j之间的词汇翻译概率 p( v j| t i)。
19、在上述任一方案中优选的是,所述根据语料库内的双语句对,计算翻译概率 p( y j| x i)和调序概率 p( a j| a j-1, m, n),包括:
20、计算给定源语言短语的情况下,翻译为目标语言短语的概率;
21、从源语言中提取出和目标语言中相似的短语,并转换为目标语言短语;
22、计算目标语言短语的位置和源语言短语的位置之间的调序概率。
23、在上述任一方案中优选的是,所述从源语言中提取出和目标语言中相似的短语,并转换为目标语言短语,包括:
24、计算从源语言位置i开始至目标语言位置j结束的最佳翻译结果;
25、根据所述最佳翻译结果得到源语言中与目标语言中相似的短。
26、在上述任一方案中优选的是,所述根据双语词表t和语料库,估计源语言单词 t i和目标语言单词 v j之间的词汇翻译概率概率 p( v j| t i),包括:
27、通过公式:
28、,计算概率 p( v j| t i),其中,count( t i, v j)为源语言短语 t i和目标语言短语 v j在双语语料库中共同出现的次数,表示给定的源语言短语 t i,它与所有可能的目标语言短语 v’共同出现的次数之和, t i和 v j分别表示特定的源语言短语和特定的目标语言短语, v’表示目标语言中所有可能的短语,这里的求和遍历了所有这些可能的短语。
29、在上述任一方案中优选的是,所述根据训练集和测试集的困惑度,对翻译模型的参数进行优化调整,包括以下步骤:
30、通过公式:,计算训练集和测试集的困惑度指标 cl,其中,n为测试集的句子数量, x i为第i个源语言句子, y i为第i个目标语言句子, p( y i| x i)为翻译模型预测出的目标语言句子 与真实目标语言句子 y i之间的交叉熵;
31、以最小化翻译模型在训练集上的困惑度指标为优化目标,初始化翻译模型的参数θ;
32、对于每一个训练样本(xi,yi),计算困惑度指标关于每个参数的偏导数;
33、根据困惑度指标关于每个参数的偏导数方向和学习率,更新模型的参数,直至达到优化目标。
34、在上述任一方案中优选的是,所述将待翻译的源语言文本输入至翻译模型中,输出第一翻译结果,包括以下步骤:
35、将待翻译的源语言文本输入至翻译模型中,计算翻译概率、调序概率和词汇翻译概率;
36、从源语言句子中选择第一个单词e1,并找到与其翻译概率最高的目标语言单词f1;
37、将f1作为首个翻译结果,并将其加到目标语言句子中;
38、在源语言句子中寻找与目标语言句子中刚刚加入的f1匹配得最好的源语言短语,并翻译为目标语言短语,加入到目标语言句子中,重复操作,直至所有的源语言短语都被翻译为目标语言短语。
39、在上述任一方案中优选的是,所述对第一翻译结果进行后处理操作,得到最终翻译结果,包括:
40、对第一翻译结果中的内容进行去重,并将无实际意义的字符进行过滤,以保留有效内容;
41、对翻译结果中的每个单词进行词性标注;
42、对翻译结果进行解码以还原其原意;
43、对翻译结果中的常见错误或不合理的翻译进行修正;
44、将经过修正处理后的翻译结果输出至用户。
45、第二方面,一种基于计算机的辅助翻译系统,所述系统包括:
46、获取模块,用于将原始语料和目标语料分为训练集和测试集,并对训练集和测试集内的原始语料及目标语料分别进行初步处理,获得双语词表t;
47、构建模块,用于构建翻译模型,以训练集为训练样本并基于双语词表t对翻译模型进行训练;
48、调整模块,用于根据训练集和测试集的困惑度,对翻译模型的参数进行优化调整;
49、输入模块,用于将待翻译的源语言文本输入至翻译模型中,输出第一翻译结果;
50、生成模块,用于对第一翻译结果进行后处理操作,得到最终翻译结果。
51、与现有技术相比,本发明的有益效果:
52、本发明所提供的基于计算机的辅助翻译方法及系统,在翻译过程中可以通过构建翻译模型、自动训练模型、自动调整模型参数以及后处理等操作,大幅提高翻译质量和准确率,避免语言难度、表达方式、文化背景等原因导致的翻译偏差和错误,同时,采用本发明所提供的方法可以有效降低人工翻译的成本和时间,提高工作效率和质量。
1.一种基于计算机的辅助翻译方法,其特征在于:包括以下步骤:
2.根据权利要求1所述的基于计算机的辅助翻译方法,其特征在于:所述将原始语料和目标语料分为训练集和测试集,并对训练集和测试集内的原始语料及目标语料分别进行初步处理,获得双语词表t,包括以下步骤:
3.根据权利要求2所述的基于计算机的辅助翻译方法,其特征在于:所述构建翻译模型,以训练集为训练样本并基于双语词表t对翻译模型进行训练,包括以下步骤:
4.根据权利要求3所述的基于计算机的辅助翻译方法,其特征在于:所述根据语料库内的双语句对,计算翻译概率p(yj|xi)和调序概率p(aj|aj-1,m,n),包括:
5.根据权利要求4所述的基于计算机的辅助翻译方法,其特征在于:所述从源语言中提取出和目标语言中相似的短语,并转换为目标语言短语,包括:
6.根据权利要求5所述的基于计算机的辅助翻译方法,其特征在于:所述根据双语词表t和语料库,估计源语言单词ti和目标语言单词vj之间的词汇翻译概率p(vj|ti),包括:
7.根据权利要求6所述的基于计算机的辅助翻译方法,其特征在于:所述根据训练集和测试集的困惑度,对翻译模型的参数进行优化调整,包括以下步骤:
8.根据权利要求7所述的基于计算机的辅助翻译方法,其特征在于:所述将待翻译的源语言文本输入至翻译模型中,输出第一翻译结果,包括以下步骤:
9.根据权利要求8所述的基于计算机的辅助翻译方法,其特征在于:所述对第一翻译结果进行后处理操作,得到最终翻译结果,包括:
10.一种基于计算机的辅助翻译系统,其特征在于:所述系统包括:
