言安是运行时的 AI 安全系统。主模型参数保持不变,言安读取回答生成过程中的运行信号,对尚未放行的输出决定放行还是截停。哪些内容越界、报警多严,由你的业务口径与阈值决定;托管 API 与私有化一体机两种交付形态共用同一套内核。
三道锁都在查,也都可能漏
今天的检查大多落在三个位置:先审提问,再拿词表逐个核对,最后审已经写完的回答。三个位置各自有效,也各有各的盲区。
先审提问
入口只看得到提问本身,看不到后面几百个字会写成什么。伪装成写作、翻译或学术请求的提问,在入口处看起来完全正常,问题出现在回答的中段。
词表逐个核对
同一个违规意图有很多种写法:换语种、拆偏旁与拼音、用谐音、先与模型约定暗号、换一套角色设定、前两轮正常第三轮才提出真实意图。词表松了容易漏,紧了容易误拦。
审已完成的回答
整段说完再判断,用户可能已经看完。撤回一条已经显示在屏幕上的回答,代价落在服务方,而且撤不回已经被看见的部分。
三道锁共同的盲区
审稿的模型与生成的模型读的是同一份成稿,判断习惯也可能相近,同一处问题可能一起漏掉。要补上这一层,检查需要换一个依据——回答之外的运行信号。
检查跟着生成走,风险过线即刻截停
言安在回答生成的每一步都给出一次风险判断。风险分越过你设定的线,后续输出立刻停止,尚未放行的内容留在服务器,用户侧得到一条清楚的提示。每一步都有一次检查的机会,检查通过之后内容才到达用户屏幕。
截停之后,触发原因、当时的风险分与相关线索一并记录,供安全团队回看与复核。告警、暂停、转人工等处置方式按业务要求配置。
红盾判分,听澜读线索
两台引擎并行读取同一批运行信号。红盾给出可比较的风险分,听澜给出可阅读的词语线索;任一越过设定的线,都触发截停。
红盾 RedShield · 判分引擎
复用主模型已经算出的信号,在生成的每一步给出一个可比较的风险分。不要求模型再写一段审查意见,也不必另搭一套同等规模的生成式审查流程。
风险分越过阈值,后续输出停止,尚未放行的内容不再发出,触发原因同时入库。正常回答按原速继续。
听澜 TingLan · 线索引擎
回答本身可能措辞得体,内部仍会出现值得注意的词语线索。例如政务问答的回答里没有出现「住址」「电话」「身份证」,内部线索仍可提示这条回答是否触及他人隐私。
词语线索要结合上下文判断,读出线索并不等于证明意图。线索越过你设定的线,听澜同样立刻截停——风险内容在生成前就被拦下;线索连同上下文再交给人工复核,由人判断这条回答是否真的越界。
每生成一步,只增加一次固定开销的检查
每写一个字都让第二个模型把前文重读一遍,回答越长,重复的工作堆得越多。言安复用主模型已经算出的信号,每生成一步只做一次增量检查——回答变长,单次检查的新增开销保持恒定。
适配的训练成本约低两个数量级,行业口径变化时按需更新规则与配置,不必整套重做。客户验收看三个数:每千次请求的新增开销、回答增加的等待时间、现有资源能承受的请求量。
最值得评估言安的四类业务
运营自有大模型的机构
每一条对外回答都关系服务可用性与品牌风险,回答放行之前需要一道稳定的检查。
会接触个人资料的 AI 服务窗口
办理业务时涉及个人资料,隐私边界与舆情风险要在内容到达用户屏幕之前处理。
用户量大的消费级应用
话题多、规则多、检查量大,单次检查的开销直接决定长期运行成本。
会执行动作的智能体
能发消息、下单、修改数据,错误会变成真实动作。截停之外,执行前还需配合权限检查。
两种交付,一套内核
两种形态共用同一套言安内核。内部双引擎需要满足接入条件;对第三方闭源 API,通常按输入/输出检查的方式接入。
托管版 · API
直接调用言安服务,按用量计费。适合 POC 阶段与小流量起步,先在真实业务问题上确认效果。
私有化版 · 一体机
整套系统部署在你自己的环境,数据留在内网,包含适配与运维交接。一次性交付加年度服务。
四步上线,每一步都可以叫停
先小范围试用,再逐步放开。每一步都有明确的验收物,都可以随时停下来,也都看同样三个数:漏掉多少风险、误拦多少正常提问、多花多少时间和资源。
01 · 旁路试运行
只观察,不拦截,先看哪些回答会触发提醒。验收物:漏检与误伤对比报告。
02 · 按业务口径适配
按业务要求调整规则与阈值,减少漏检与误拦。验收物:贴合业务口径的专属版本。
03 · 打开实时拦截
先在小流量上开启截停,测试速度、用户提示与人工接手。验收物:上线阈值与应急预案。
04 · 全量与常态化
稳定之后扩大到全量,持续更新业务规则。验收物:全量运行与年度服务。
部署边界:装在哪里,读什么,谁来定
模型、数据和规则的控制权,始终在你手上。部署方式、日志范围与拦截方式写进交付方案。
主模型参数不改
主模型能力完整保留,言安按方案可停用或拆除。
只读信号,控制未放行的输出
言安读取运行信号,控制的是尚未发给用户的内容。
私有化部署,数据留内网
私有化版在你自己的环境运行,日志按约定保留在本地。
口径与阈值你来定
哪些内容越界、报警多严,由你的业务要求决定。
过程留档,可以审计
保存触发原因、相关线索与处理结果,供人工复核。
部署评估:你的技术团队需要确认的九件事
关注接入、运行成本与使用效果三条线;具体做法由言安封装在产品内。验收原则只有一条:用同一批业务问题,对比当前方案与言安,先确认检查效果,再比较速度、资源占用与费用。
接入条件
确认现有服务能否集成,并选择合适的接入方式。
运行成本
比较每千次请求的新增费用与资源占用。
等待时间
看回答增加的等待时间是否满足业务要求。
检查效果
分别看漏检与误拦,避免只看一个总分。
实时截停
确认风险过线后,尚未放行的内容能及时停住。
业务更新
口径更新之后,验证正常提问不受影响。
处理策略
明确告警、暂停与转人工的处置方式。
复核记录
约定记录什么、保留多久、谁能查看。
交付方式
托管 API 或私有化部署,按数据与合规条件选择。

