苏州大学自然语言课题组提出DISC 轻量解码干预模块。该模块不需要重新训练模型仅在推理阶段引入字音、字形相似度即可对任意主流中文拼写纠错CSC模型做增强有效缓解模型过纠错问题在多个公开数据集上刷新性能指标为学术文稿、OCR 识别文本、ASR 转写文本纠错提供低成本的增强方案数据智能与...。一、研究背景中文拼写纠错的现实痛点中文拼写纠错CSC旨在检测并修正文本中的错字。中文错误大多来源于输入法打字、OCR 扫描识别、语音转写错误字符往往和正确字符存在字音或者字形相似。传统工作普遍使用混淆集来刻画形近、音近字但是混淆集存在明显短板一是混淆集字符对的筛选高度依赖人工经验二是混淆集只有 “是 / 否” 二元关系没有细粒度相似度分数无法区分字符之间混淆程度的高低。面向学术稿件智能审核的文鉴智检平台对中文拼写纠错能力有很强的业务需求。平台需要批量处理学位论文、期刊投稿稿件稿件中的错字多来自作者输入法输入、PDF‑OCR 识别转换大量是形近、音近类错误。平台已集成多款主流 CSC 纠错模型但现有模型普遍存在过纠错问题经常擅自修改原本正确的文字给稿件审核带来干扰。直接重新训练整套纠错模型成本高昂业务上迫切需要一种无需重新训练、可以直接挂载在已有模型上的增强插件。现有的 BERT 类纠错模型在训练集上效果尚可但跨域泛化能力有限容易为了语句通顺把原文的词替换成语义通顺但字形字音完全无关的字偏离原文语义。传统混淆集的方案域迁移能力差换一个业务数据集效果就会大幅波动很难直接落地到文鉴智检这类多领域学术文档场景。二、核心技术DISC 即插即用解码干预模块DISC 核心创新点不改动模型训练流程仅推理阶段干预字符预测概率分布作为外挂插件兼容 ReaLiSe、SCOPE、ReLM 等几乎全部主流 CSC 模型不需要重新微调权重接入代价极低。整体思路拿到基础 CSC 模型输出的每个位置字符概率分布结合字音相似度与字形相似度对候选字符打分做加权修正公式\(Score(x,i,y)p(y|x,i)\alpha × Sim(x_i,y)\) 其中\(Sim(x_i,y)\)是原始字符与候选字符综合相似度\(\alpha\)为超参数论文统一设置\(\alpha1.1\)。相似度由拼音相似度和字形相似度加权融合\(Sim(c_1,c_2)\beta × Sim^P(c_1,c_2)(1-\beta) × Sim^G(c_1,c_2)\) 实验最优\(\beta0.7\)代表字音信息权重更高。字音相似度\(Sim^P\)获取两个汉字全部拼音计算拼音字符串的莱文斯坦编辑距离多音字枚举全部拼音取最大相似度不考虑声调贴合拼音输入法真实出错场景。字形相似度\(Sim^G\)融合四重维度计算四角号码、结构感知四角号码、笔画序列编辑距离、笔画最长公共子序列。兼顾汉字四角外形、偏旁部首结构、手写笔画细节多维度刻画字形相似程度。为了解决域外数据集上 DISC 容易过度保留原字符、召回率下降的缺陷论文还提出复制惩罚copy‑punishment策略适当降低原字符的预测分数平衡精确率与召回率。工作流程如上图编码器得到文本表征基础 CSC 解码器输出原始字符概率DISC 模块读取预计算好的字符相似度矩阵修改概率分布提升与原字符音 / 形相近候选字得分再选出最终输出字符。字符相似度可以线下全部预计算完成推理阶段只做查表几乎不增加计算负担。实验表明接入 DISC 后模型解码速度仅增加 1%‑14%推理效率损失很小。三、实验结果分析实验使用 SIGHAN13/14/15 传统学习者数据集同时使用更贴近真实文本的 ECSpell法律、医疗、公文、LEMON七大真实领域数据集对比 SOTA 纠错模型同时和 GPT‑3.5、GPT‑4 大模型做横向对比。通用数据集 SIGHAN将 DISC 挂载到 ReaLiSe、SCOPE、ReLM 之后全部模型 F1 指标稳定上涨并且False Positive RateFPR过纠错率显著下降减少把正确句子改错的现象。其中 ReLMDISC 在 SIGHAN15 纠错 F1 达到 81.4超过原版 ReLM 1.2 个点。跨域真实数据集 ECSpell、LEMON在没有训练数据的域外 LEMON 数据集ReLMDISC 平均 F1 提升 3.1精确率提升非常明显充分证明模块的跨域适配能力。在医疗、法律等垂直领域DISC 均带来稳定增益。消融实验对比传统硬约束混淆集传统混淆集性能不稳定在部分数据集甚至会掉点DISC 使用连续相似度分数效果显著优于二元混淆集方案。字音、字形缺一不可去掉任意一部分相似度性能下降字音贡献权重高于字形但字形信息不可缺少。参数扫描\(\alpha\)增大精确率提升、召回下降\(\beta0.7\)综合效果最优。案例直观效果例 1 输入肌肉酸痛是运动过读导致的。原版 ReLM 错误把 “读” 改成语义通顺但音形无关的 “少”加入 DISC 后优先选择同音形近的 “度”得到正确修改。例 2 输入浓荫蔽空郁郁苍苍原文没有错误。原版模型错误把 “空” 修改为 “日”DISC 提高原字符得分模型保留原句避免过纠错。四、讨论优势与局限优势即插即用、零训练成本不需要重新训练模型已有业务系统可以直接接入适合文鉴智检这类已经上线、不希望大规模重训模型的工业平台。抑制过纠错通过音形相似度引导模型优先选择和原字符相近的候选避免模型只看语义通顺就随意篡改原文。跨域鲁棒性好在没有见过的领域文本依然能够带来稳定收益。开销极低字符相似度线下预计算推理仅查表速度损失很小。局限性DISC 侧重处理单字符替换类错别字不处理漏字、多字增删字符错误可以和 C2EC 这类支持增删纠错的框架组合使用。在极度缺少域内数据时会出现召回下降需要搭配复制惩罚策略做权衡。当前主要面向中文向日韩等其他文字迁移还需要重新设计相似度计算规则。五、总结DISC 不重新设计完整纠错网络而是走推理阶段后增强的路线跳出传统混淆集 “非 0 即 1” 的硬约束用连续可计算的字音字形相似度做概率干预。它不需要重新训练直接为现有 CSC 模型带来性能增益有效降低中文拼写纠错的落地成本。该相关技术已经成功运用于文鉴智检平台aiyu-tech.com在学术文档审核、OCR 稿件处理等工业场景可以直接把 DISC 作为外挂增强层挂载在已有的纠错模型之上在不改动原有训练流程的前提下降低过纠错率提升形近、音近错字的识别修正效果。该工作为中文纠错提供一种轻量化工程解决方案也为后续 NLP 解码侧插件式增强提供新的思路。