任务 01
n=484+10.34 pp完美修正率
V3.095.59%
V2.085.25%
四项部署核心指标保留双版本绝对值对比,下方八项指标账本完整呈现样本加权结果。V3.0 在提升纠错质量的同时,进一步降低漏报与误报。
评测口径:V2.0 与 V3.0 使用同一任务定义;三组高难度样本共 4,408 条(n=484 / 991 / 2933),按样本量加权。漏报率与误报率越低越好,其余六项指标越高越好。
三组评测任务的完美修正率均超过 93%,相对 V2.0 的提升稳定在 +9.10 至 +10.60 个百分点,并非由单一优势样本集拉动。
V3.0 聚焦高标准发布场景中的隐蔽错误、上下文依赖、密集行业术语,以及不必要修改同样会带来生产风险的内容流程。
评测集围绕高标准内容流程中的上下文型难例重构,不以常规错别字检出作为主要能力边界。
完美修正率提升 9.50 个百分点,进一步增强模型给出可由编辑直接采用之修正的能力。
漏报显著下降,误报同步收窄,帮助审校团队集中注意力,并稳定接入发布前质量审核流程。
在全部数据集与指标的直接对比中,V3.0 赢下 47 项中的 43 项;按样本量加权的 8 项综合指标全部优于 V2.0。
优势覆盖检出、修正、精度、召回与最终修正质量,呈现整套系统能力的同步提升。
三组独立样本集共形成 39 项对比,V3.0 在其中 35 项领先。
按样本量完成综合加权后,V3.0 在全部八项指标上领先。
言澜 V3.0 现已全面上线,支持政企客户部署与私有化环境,并可适配机构专有术语及既有审核流程。