期刊专题

10.3969/j.issn.1000-386x.2021.10.049

基于改进的N-gram模型和知识库的文本查错算法

引用
针对语音识别引擎识别后文本容易发生散串错误和同音字错误,提出一种基于改进的N-gram模型和专业术语查错知识库的查错算法.采用Witten-Bell平滑算法解决N-gram模型训练过程中数据稀疏问题,并对N-gram模型增加权重分配,增强模型对散串错误的查错率.针对铁路特殊用语规定和同音字错误,构建一种适应关键字的专业术语查错知识库,实现知识库的自动更新.经过实验对比,该算法查错确率为87.9%,相比通用的N-gram查错模型提高52.8百分点.该算法的提出为后续的纠错以及语音识别准确率的提高奠定了基础,并对铁路车务系统语音识别技术的应用具有重要意义.

N-gram模型;铁路车务标准用语;散串错误;专业术语查错知识库;同音字错误

38

TP391(计算技术、计算机技术)

中国铁路总公司科技研究开发计划重点项目;甘肃省工业交通自动化工程技术研究中心2019年开放基金项目

2021-10-18(万方平台首次上网日期,不代表论文的发表时间)

共7页

310-315,320

相关文献
评论
暂无封面信息
查看本期封面目录

计算机应用与软件

1000-386X

31-1260/TP

38

2021,38(10)

相关作者
相关机构

专业内容知识聚合服务平台

国家重点研发计划“现代服务业共性关键技术研发及应用示范”重点专项“4.8专业内容知识聚合服务技术研发与创新服务示范”

国家重点研发计划资助 课题编号:2019YFB1406304
National Key R&D Program of China Grant No. 2019YFB1406304

©天津万方数据有限公司 津ICP备20003920号-1

信息网络传播视听节目许可证 许可证号:0108284

网络出版服务许可证:(总)网出证(京)字096号

违法和不良信息举报电话:4000115888    举报邮箱:problem@wanfangdata.com.cn

举报专区:https://www.12377.cn/

客服邮箱:op@wanfangdata.com.cn

打开万方数据APP,体验更流畅