独立研究
以及卓越的结果

这些同行评审研究使用真实世界的数据集和成熟的研究方法,对 Winston AI 的性能进行了独立评估。

University J.J.Strossmayer Osijek

《信息研究》对 Winston 和其他三款检测器在人类及 AI 创作的文本上进行了测试。Winston AI 在该研究的标准准确率表中记录了最高平均值:99%,领先于 Originality.ai (98%) 以及 ZeroGPT 和 Smodin (91%)。

阅读同行评审研究

Yale University

来自耶鲁大学、东北大学、香港中文大学和香港城市大学的研究人员使用 Winston AI 分析了超过 110 万份美国消费者投诉。

阅读同行评审研究

Penn State University

一项医学教育研究发现,Winston AI 能够清晰地将 AI 生成的住院医师申请个人陈述与经核实的人类写作区分开来,为其在真实学术环境中的准确性提供了独立证据。

阅读同行评审研究

重大模型更新

内部评估与独立验证是分开的。这些发布说明记录了更改内容、每个模型的评估方式,以及支持发布结果的数据集和指标。

模型 4.0 — Curia

Curia 是 Winston AI 最新发布的重大文本检测模型。我们发布的评估报告显示,在包含 10,000 个样本的英语数据集中,其总体分类准确率为 99.95%,在人类文本表现上更强,且在估算 AI 生成文本比例时的 R² 达到 0.9908。

Curia 模型

模型 3.0 — Luka

Luka 版本的发布记录了一个包含 10,000 篇文本的评估数据集,其中人类撰写和 AI 生成的内容各占一半。发布的结果显示,AI 检测准确率为 99.98%,人类检测准确率为 99.50%,总体分类准确率为 99.74%。

Luka 模型

准确性需要背景信息支持

  • 透明评估:我们公开评估数据集,以便可以直接检查基础样本和方法论。
  • 具有代表性的测试数据:我们的评估涵盖了广泛的 AI 模型、写作风格和人类撰写的内容,以更好地反映真实世界的使用情况。
  • 人工审核数据:我们发布的评估数据中的每个样本都经过人工审核,以确认其来源出处和分类。
  • 清晰的分类指南:我们发布了关于什么是 AI 生成内容以及什么是人类撰写内容的明确标准。
Winston AI detection result interface