OpenAI 宣布推出 textGrain 系统,用于标记其模型通过 API 接口生成的文本,但该功能默认仍处于关闭状态。如今,全球客户可以在受支持的模型上启用该功能,可选择在项目或组织层面启用,无需修改单个 API 请求。
该系统通过在文本中嵌入“统计信号”来实现标记:当多个词语选择在上下文中都合理时,系统会提高其中适合的词语相对于其他替代词的权重。当这些选择在足够长的文本中不断累积时,OpenAI 的检测器理论上就能识别出这种模式。
与 Anthropic 不同的选择
OpenAI 为 API 客户提供了比 Anthropic 8 月宣布的 Claude 模型方案更大的控制权。Anthropic 表示,标记将在受支持的模型上全球实施,并在模型层面生效,涵盖 Claude 产品、Claude Code 以及 API 使用,但没有说明开发者是否拥有类似的停用选项。
据 OpenAI 称,未来几周内,ChatGPT 和 Codex 在欧盟境内生成的符合条件的文本将开始自动应用标记,以响应《欧洲人工智能法案》的透明度要求。该公司尚未准确说明 Codex 中“符合条件的输出”具体指什么。
检测效果并非固定不变
OpenAI 表示,其检测器能够识别约 80% 的、长度为 200 个标记的已标记片段;在心理学等领域的 400 个标记片段中,这一比例上升至 95%,目标误报率为 1%。在数学等受限材料中,检测能力会下降,因为模型可用于选择词语的选项更少。
编辑文本也会明显削弱信号。在该公司的测试中,将一段 400 个标记的片段中 10% 的词语替换为同义词,会使检测率从约 92% 降至 66%;替换 25% 则会使检测率降至 17%。OpenAI 还警告称,较短的片段可能没有足够的材料来实现可靠检测。
代码是更困难的测试案例
OpenAI 承认,与普通散文相比,代码更难添加标记,因为语法和逻辑限制减少了下一个词语或符号的合理选择数量。该公司表示,已在 DeepSWE、AutomationBench 和 Terminal-Bench 测试中,对启用和禁用 textGrain 的 Astra 模型进行了比较,没有发现有意义的性能差异。但这些结果并不能证明,在代码经过修改或重新格式化后,识别已标记代码的可靠程度。
截至目前,启用 textGrain 的 API 客户不会自动获得检测工具。OpenAI 将检测器的初始访问权限限制给经过认可的研究机构和学术机构,用于研究文本来源与检测可靠性;与此同时,The New Stack 已向该公司询问有关 Codex 符合条件输出以及代码专属检测率的更多细节。
为什么这条新闻很重要?
对开发者而言,实际变化在于,文本标记成为一种可管理的选项,而不再是所有 API 输出都必须采用的行为。但已公布的数据表明,标记本身并不是决定性证据:缩短和编辑都会降低可检测性,而代码可能没有足够空间嵌入信号。因此,检测器的使用范围、访问权限,以及系统在实际代码上的表现,仍是悬而未决的问题。
新闻来源
The New Stack - Software Development
查看原始来源 ↗