Pangram,一家由斯坦福 AI 校友 Max Spero 和 Bradley Emi 创立的纽约初创公司,完成了由 Menlo Ventures 领投的 900 万美元 A 轮融资。这笔资金将用于支持面向平台的 API 以及一款每月 20 美元的 Chrome 扩展程序,该程序声称能以 99% 的准确率识别 AI 辅助文本——这一声明可能会重塑记者、学者和招聘人员验证真实性的方式。

AI 生成“垃圾内容”的激增

大语言模型现在正大规模地生成文章、社交媒体帖子甚至法律引用。结果是:低质量 SEO 垃圾信息、协同式虚假信息运动,以及一个人类对 AI 生成草稿进行润色的灰色地带。机构已经在做出反应。预印本服务器 arXiv 警告称,提交未经审核的 LLM 输出的作者可能会面临为期一年的禁令,法院也已开始制裁依赖 AI 生成的虚假引用的律师。区分人类与机器输出的压力日益增大,而 Pangram 则押注其技术可以成为默认的验证层。

合成镜像:基于每份文档的“孪生体”进行训练

Pangram 的旗舰模型 Pangram 4 使用了一种该公司称为“合成镜像”(synthetic mirroring)的方法。对于其训练集中数千万篇经过验证的人类撰写文档,团队都会利用前沿 LLM 生成一个对应的版本。这个合成孪生体在主题、长度和语气上与原件一致,但由 AI 生成。通过将这两个版本同时输入同一个神经网络,Pangram 教会模型识别 AI 生成文本中持续存在的细微统计特征,即使作者使用了旨在伪装机器输出的“AI 人性化”工具。

竞争对手依赖元数据或不可见的数字水印,而这些信息可以被剥离或忽略。Pangram 则专注于风格分析:即在模型的输出中保持一致的词汇选择、句子节奏和 Token 分布模式。根据公司的发布,在内部测试中,该系统识别 AI 辅助写作的准确率达到了 99%。

从 API 到浏览器:技术的落地场景

Pangram 将自己定位为基础设施,而非单一用途的应用。其 API 已经与 Substack 集成,在那里的新闻通讯会显示一个标签,标明 AI 生成内容的比例。早期采用者还包括问答平台 Quora、几所大学的写作中心以及需要验证候选人提交内容原创性的招聘机构。

对于个人用户,该初创公司提供了一款 Chrome 扩展程序,可以在 X、LinkedIn、Reddit 和 Medium 等网站上叠加“信息流健康评分”(feed health score)。该评分会分解模型认为的文本中人类与 AI 所占的百分比。订阅者每月支付 20 美元,即可获得实时标记功能,并能将可疑段落标记出来以供进一步审查。

质疑的声音

准确率声明不可避免地会引起审查。在“灰色地带”——即作者对模型生成的草稿进行编辑的情况下——检测 AI 辅助行为仍然是一个不断变化的目标。随着生成式模型的改进,Pangram 所依赖的风格差异可能会缩小,从而引发检测技术与规避技术之间的军备竞赛。批评者还警告称存在误报风险:将合法的真人作品标记为 AI 生成,可能会损害声誉,尤其是在利害关系重大的学术或法律语境下。

Pangram 承认了这一挑战,并指出随着新 LLM 的出现,它会利用新鲜的合成镜像不断重新训练其模型。然而,除了内部测试外,该公司尚未披露独立的基准测试结果,这使得更广泛的社区需要去验证那 99% 的数据。

值得关注的动向

接下来的几个月将揭示 Pangram 能否从试点集成转向更广泛的平台采用。关键指标包括:

  • API 合约的扩张,超出目前的早期合作伙伴名单。
  • 来自机构用户的反馈,关于误报率以及对编辑工作流的影响。
  • 来自 LLM 开发者的反应,他们可能会通过旨在更紧密模仿人类风格的模型更新来进行应对。
  • 监管动态,这可能会使 AI 检测工具成为某些出版物或学术提交的强制要求。

如果这家初创公司在保持低错误率的同时维持其检测优势,它可能会成为数字真实性的事实标准。如果不能,市场可能会分裂成各种竞争工具的拼凑体,每种工具都有其自身的权衡。

总结

Pangram 获得的 900 万美元注资为其检测策略注入了动力,该策略依托于一种双文档训练机制,声称能够实现近乎完美的 AI 辅助内容识别。其成功将取决于该方法能否在不断演进的语言模型中实现规模化应用,并赢得最需要它的平台和机构的信任。