把 V3.0 与 V2.0,放回同一把标尺。
四项部署指标给出两个版本的实测值,下方八项指标按样本量加权汇总。V3.0 纠得更准,漏报和误报也更低。
评测方法:V2.0 与 V3.0 用同一套任务定义;三组高难度样本共 4,408 条(n=484 / 991 / 2933),按样本量加权。漏报率与误报率越低越好,其余六项指标越高越好。
最大的提升,在三组任务上同时成立。
三组任务的完美修正率都超过 93%,比 V2.0 高 +9.10 到 +10.60 个百分点。三组提升幅度接近——提升是系统性的,不是单点偶然。
任务 02
n=991任务 03
n=2,933围绕内容发布前的最后一道质量关重构。
V3.0 对付的是发布前最难查的那类错误:藏得深的、要结合上下文才能发现的、行业术语密集的。这类内容错不起——改错一处,有时比漏改更麻烦。
更高难度的评测标准
评测集换成了发布流程里真正难查的上下文类错误,不再拿常规错别字检出率当主要指标。
更多可直接采用的修正
完美修正率提升 9.50 个百分点——它不只指出哪里错了,还给出能直接用的改法。
更克制的告警控制
漏报明显少了,误报也更少。审校团队不必再应付无效告警,可以直接把它接进发布前的审核流程。
赢得的不止一两项指标。
全部数据集、全部指标放在一起比:47 项直接对比,V3.0 胜出 43 项;按样本量加权的 8 项综合指标,全部优于 V2.0。
91.5% 的实测对比,V3.0 胜出。
从发现错误到给出修正,每个环节的指标都更好。
三组独立样本集共形成 39 项对比,V3.0 在其中 35 项领先。
按样本量综合加权后,V3.0 在全部八项指标上领先。
部署到你们的发布流程里。
言澜 V3.0 现已上线,支持私有化部署,也能接入机构自己的术语表和既有审核流程。
更新后的发布前校对工作台
8 月前端更新通过 Yanlan-expand 提供词组级差异展示,并配合富文本与音频字幕复核。下方交互工作台展示词组标记、原文配图与逐项复核流程。
富文本校对,结合原有排版复核
富文本工作台保留标题、图片与段落排版,在文稿中标注需要复核的表达。审校人员可以粘贴内容或上传 .docx 文档,结合图文版式查看修改建议。

音频与字幕,双轨分别复核
音视频工作台将音轨转写与字幕轨的建议分别展示,通过带时间戳的片段关联媒体位置。审校人员可以在同一工作台核对语音内容与画面字幕,逐项查看问题来源和处理状态。


