Research · 研究

推动推理、代码与中文 AI 的边界。

我们围绕 AI 安全、智能编程、多模态评测、推理训练、低资源 NLP 与模型审计展开研究,并把每项成果写成兼顾研究者与普通读者的双语解读。


推理 · 代码 · 中文 AI更新于 2026 年 6 月
重点研究 · AI 安全

SafeGEO 测量推荐智能体如何被操纵,以及如何建立防线。

在真实推荐场景中系统评估搜索优化攻击与缓解方案,给出可复核的风险边界。

阅读研究解读
600推荐案例 22攻击变体 EMNLP2026
Milestones · 里程碑

从一篇 Spotlight,到一年五条研究线。

实验室走过三个阶段:2024 年首篇论文入选 NeurIPS SoLaR Spotlight,2025 年实验室成立并获 COLM 接收,2026 年五条研究线集中发布,其中两项进入 CCF-A 主会与 EMNLP。

  1. 01起点

    首篇论文入选 NeurIPS SoLaR Spotlight

    Report Cards 以自然语言为模型写出可核查的能力报告,并用对比准确率与 Card Elo 验证报告本身的可靠性。

    1. 12 月Report CardsNeurIPS SoLaR 2024
    查看 2024 年研究
  2. 02成立

    实验室成立,SEAM 发表于 COLM 2025

    同一道题以文字或图像呈现,模型答案常常不同。SEAM 在四个领域、9,600 次评测中量化 21 个模型的跨模态一致性。

    1. 6 月网景盛世 AI 实验室成立
    2. 8 月SEAMCOLM 2025
    3. 8 月Mobile-Agent-Bench项目启动
    查看 2025 年研究
  3. 03进行中

    五条研究线集中发布

    一年之内,研究从智能体评测延伸到推理训练、大师蒸馏与多语言数据集,其中两项进入 CCF-A 主会与 EMNLP。

    1. 2 月SWE-Bench MobileKDD 2026
    2. 3 月OasisSimp低资源句子简化数据集
    3. 3 月Grounded Chess Reasoning大师蒸馏
    4. 4 月ThinkTwice自我精修 RLVR
    5. 10 月SafeGEOEMNLP 2026
    查看 2026 年研究