← 返回研究 AI 安全 · 推荐智能体 · EMNLP 2026 已录用

SafeGEO

当年竞价排名把莆田系医院推到患者面前;如今推荐入口换成 AI 助手,同样的故事会不会重演?SafeGEO 给出第一组系统测量。

arXiv
600推荐案例
22GEO 攻击变体
40,800物化样本
83.2%最高有害推荐提升
39.2%最高 Target@3 防御降幅

如今越来越多的购买决策,从向 AI 助手提一个问题开始:“哪款空气净化器值得买?”卖家们同样注意到了这一点——网页文案正越来越多地写给 AI 阅读,这种做法有个名字:生成式引擎优化(GEO,Generative Engine Optimization),相当于 AI 时代的 SEO(搜索引擎优化)。SafeGEO 要测量的问题随之而来:当一款有真实缺陷的商品把页面包装成“独立选购指南”,替用户做推荐的智能体能否守住判断?

用户提问“哪款空气净化器值得买?”检索到的网页证据被 GEO 改写的卖家来源推荐智能体没有这处改写有这处改写前三推荐 · 无 GEO前三推荐 · 有 GEO1商品 A1商品 B · 有缺陷2商品 C2商品 A3商品 D3商品 C有缺陷的商品 B 进不了前三商品 D 被挤出前三
据论文重绘。两种情况下智能体读到的候选集合完全相同;只改写一个卖家可控来源,就足以把有缺陷的商品送进前三,并把一款好商品挤出去。

当网页文案写给 AI 看

推荐智能体(代替用户检索、比较并给出建议的 AI 系统)正在成为电商与内容平台的新入口。它的判断依据是网上能读到的材料——商品页、评测、FAQ;其中商品页这类卖家可控来源(由卖家自己撰写的信息源),天然存在被优化甚至被操纵的动机。

十多年前的竞价排名时代,“平台被卖家优化、代价由用户承担”的剧本已经上演过一次:急于求医的患者,被推向出价最高而非医术最好的医院。如今入口从搜索框换成 AI 助手,同样的博弈换了一个战场——决定排名的不再是关键词出价,而是 AI 读到的“证据”。

GEO 本身并不必然有害:把页面写得更清楚,对人和 AI 都是好事。问题在于边界——当改写开始掩盖缺陷、伪造口碑、冒充“独立评测”时,智能体读到的证据就被系统性污染了。SafeGEO 是对这一风险的第一组受控测量:攻击能把推荐推离用户利益多远,现有防御又能挡回多少。

一个可控的测试场

SafeGEO 覆盖 6 类需要证据支撑的推荐垂直场景,包括 AI 会议转写工具、婴儿监视器、登机背包、空气净化器、降噪耳机和办公椅。每个案例固定候选商品、真实属性、非目标证据和隐藏效用标签(评测者掌握、模型看不到的商品真实优劣标注),只改写一个卖家可控来源——推荐结果的任何变化,都能干净地归因到这一处改写。

推荐案例600
平均候选商品数19.96
每案例 GEO 目标3
攻击变体22
总样本数40,800
评测指标Target@3、HCV@1、GT@3、uNDCG@5

基准统计。每个基础案例会展开为控制条件与攻击条件,保证推荐变化可以归因到单个被改写的卖家来源。

评测使用四个指标:Target@3(被攻击的缺陷商品进入前三推荐的比例)、HCV@1(缺陷商品占据推荐首位的比例)、GT@3(真正优质的商品仍留在前三的比例)和 uNDCG@5(前五推荐与用户真实效用的匹配程度)。40,800 个物化样本(同一案例在不同攻击条件下展开成的具体评测实例)保证每个条件都能两两对照。

基础案例 · 固定不变GEO 攻击构造实例物化与评测候选商品平均每案例 19.96 个卖家可控来源商品页 · 评测 · FAQ隐藏效用标签仅评测者掌握非目标证据完全不动600 个推荐案例① 抽取 3 个候选再从中选定 1 个 GEO 目标② 选 1 种攻击变体(共 22 种)原语级 · 层内 · 跨层 · 真实风格③ 只改写一个卖家来源全流程中唯一变化的部分每个样本只改一处,推荐变化因此可以干净归因物化评测实例600 个案例 × 68 种条件40,800 个样本评测指标Target@3HCV@1GT@3uNDCG@5效用标签对模型隐藏
据论文重绘。候选集合、隐藏效用标签与非目标证据全部固定,GEO 每次只改写一个目标商品的来源,推荐结果的任何变化都能归因到这一处改写。
条件平均源文本长度
No GEO3,911 [3,901, 3,921]
Truthful-rewrite3,905 [3,895, 3,915]
Avg. GEO, 22 variants3,925 [3,924, 3,926]

源文本长度控制。GEO 条件与控制条件长度接近,说明推荐偏移不是简单由更长上下文造成。

攻击能走多远

实验显示,GEO 攻击可以显著推动有缺陷目标商品进入推荐集。真实卖家页面风格的攻击尤其强:它们把错误适配、证据包装和显著性操控写成一篇看似可信的卖家材料,而非机械堆叠关键词。以 DeepSeek-V4-Flash 为例,无攻击时缺陷商品进入前三的比例只有 6.2%;换上“选择性对比笔记”式的真实风格攻击后,升至 82.3%。

相对真实改写控制条件的 Target@3 uplift(百分点)20406080A-only43.9U-only41.3C-only65.4R-only38.7E-only48.7S-only59.1M-only15.7内容层组合45.4认知框架组合49.1面向模型层组合17.0内容 + 认知框架49.1内容 + 面向模型21.5认知框架 + 面向模型25.9全栈诊断型26.3埋藏警示的 FAQ77.2口碑堆砌型页面75.7引用堆砌笔记77.2“独立选购指南”77.2错误适配清单71.9选择性对比笔记80.6面向 AI 的源文本72.8全栈真实风格76.3原语级层内组合跨层组合真实风格8 类真实风格的卖家页面攻击,单独就能带来 72–81 个百分点的提升。
据论文重绘,数值为近似值。22 类攻击变体相对真实改写控制条件的 Target@3 uplift。真实卖家页面风格的变体整体占优,说明“写成一篇连贯可信的材料”比机械堆叠操控原语更危险。
代表性真实风格 GEO 攻击结果(DeepSeek-V4-Flash)
SettingTarget@3ΔHCV@1ΔGT@3ΔuNDCG@5Δ
No GEO6.2--24.5--66.7--77.0--
Truthful-rewrite control4.6--23.0--67.7--78.8--
Caveat-buried FAQ77.5+72.976.2+53.257.7-10.066.3-12.5
Popularity-heavy profile71.2+66.671.4+48.457.6-10.167.3-11.5
Citation-padded note78.7+74.178.4+55.458.1-9.666.2-12.7
Independent buyer guide77.9+73.377.3+54.356.5-11.266.0-12.9
False-fit checklist79.1+74.678.4+55.457.7-9.966.1-12.7
Selective comparison note82.3+77.781.8+58.856.9-10.865.4-13.5
Avg. realistic72.6+68.073.4+50.457.7-10.066.9-11.9
真实风格变体会同时提高 Target@3 和 HCV@1,并降低 utility quality。

机制上,攻击的成败几乎完全取决于能否“劫持”智能体的引用:攻击越能把模型引用导向误导性内容,缺陷商品的排名就越高——二者的相关性达到 r=0.91。

20203030404050506060707080809090误导性 GEO 行的引用率(%)被攻击商品进入前三的比例(%)M-onlyC-only8 类真实风格攻击r = 0.91
据论文重绘,数值为近似值。每个点代表一类攻击变体。越能把智能体的引用导向误导性 GEO 行,被攻击商品的排名就越高;论文报告相关性达到 r = 0.91。

防御能挡回多少

简单防御有帮助,但不充分。防御性提示(在指令中明确要求警惕营销操纵)能降低有害推荐;证据拆解(evidence breakdown——要求智能体在最终排序前列明每条候选的证据支持、缺失或冲突)效果最强,在 Qwen3.6 27B 上把 Target@3 压低 39.2 个百分点。但即便最强的防御,也无法把推荐完全恢复到无攻击水平。

Target@3 降幅(百分点)· Gemma 4 31B IT覆盖最广、降幅最大L1防御提示L2理由陈述L3证据拆解L4上下文平衡L5指令过滤埋藏警示的 FAQ7.115.324.412.41.5口碑堆砌型页面8.615.326.216.91.6引用堆砌笔记6.414.921.68.70.2“独立选购指南”6.115.023.98.40.3错误适配清单12.013.235.2-1.81.4选择性对比笔记6.015.920.67.10.8面向 AI 的源文本37.914.938.931.34.7全栈真实风格36.815.446.79.27.2最好的一格也只有 46.7 个百分点,仍挡不住 76 个百分点的攻击。
据论文重绘。Gemma 4 31B IT 上的变体级防御效果:L3 证据拆解覆盖最广、降幅最大;提示级防御有用但不均匀,个别层甚至会帮到攻击。
同一批攻击实例上的防御效果(节选)
ModelMitigationTarget@3ΔHCV@1ΔGT@3ΔuNDCG@5Δ
Gemma 4 31B ITNo mitigation79.6--75.6--67.9--68.6--
Gemma 4 31B ITDefensive prompt64.5-15.160.8-14.869.3+1.372.6+4.0
Gemma 4 31B ITEvidence breakdown49.9-29.746.6-29.169.5+1.674.4+5.7
Qwen3.6 27BNo mitigation78.3--83.7--60.8--63.6--
Qwen3.6 27BDefensive prompt67.3-11.066.2-17.568.5+7.673.4+9.8
Qwen3.6 27BEvidence breakdown39.1-39.242.1-41.669.7+8.877.4+13.9
Devstral Small 2No mitigation90.9--90.7--47.9--59.2--
Devstral Small 2Evidence breakdown73.2-17.778.9-11.843.4-4.556.3-2.8
证据拆解在三个模型上一致领先:同一批攻击实例下,它是唯一稳定压低 Target@3 的防御层。

给智能体安全的提醒

把 GEO 风险具体化。从抽象的“可见度优化”落到推荐智能体如何选择商品。
评估卖家可控内容。关注真实推荐链路里容易被优化和操纵的信息源。
防御的天花板被量出来了。最强防御能压回攻击效果的大半;剩下挡不住的部分,正是下一代防线的设计起点。

研究资源

SafeGEO 已发表于 EMNLP 2026;评测设置与合作研究,欢迎直接与实验室联系。

arXiv 联系研究团队