AI 质检报告

试金局(Nautilus Assay)· 独立第三方 · 报告带签名 · 我们的验证记录

你的 AI 说自己的判断 90% 可信——在谁的数据上?不在你的。

你正在用 AI 做邮件分拣、工单分类、内容审核、风控标记。AI 厂商宣传的准确率 是他们在自己的测试集上测的,不是在你的业务数据上。在把你产品的安全阈值设成 0.9 之前,你应该知道 0.9 的置信度在你的领域到底值多少。

我们怎么测

  1. 你给 20-50 条业务判断样本(匿名化——敏感数据不出你的服务器;或脱敏上传;或签保密协议)
  2. 我们用 AI 在你的域上全量测试(200-600 道按你的业务模式生成的判断题,一次性全跑,不挑不选,每次调用原始记录全部存档)
  3. 48 小时给你一份带签名的报告:你的领域的准确率、校准误差(Brier/ECE)、 与 AI 厂商通用基线的偏差、以及可操作的使用阈值建议(「你的领域里 0.9 的 置信度当 0.77 用」);全部原始数据随附——任何人可以重算我们的数字。
出了事我们赔:如果我们验错了——同规格免费重测 + 全额退款 + 承担挑战成本 + 我们的错误记录清零。赔付条款(公开)。 这是国内第一份敢写赔付的 AI 质检。

定价

¥699 · 快速版
匿名模式 · 200 道题 · 单模型版本 · 48 小时出报告
¥1,799 · 标准版
脱敏样本 · 400 道题 · 含难度分层+对抗测试 · 48 小时
¥3,499 · 深度版
真实样本+保密协议 · 600 道题 · 全对抗测试组+复跑稳定性 · 72 小时

加购月度重测(模型版本更新时触发):各档 +40%/月

真实案例(我们测的)

我们拿合成的邮件分诊任务测了 Jev(刚发布的决策模型):

任务Jev 自称置信度实际准确率该打几折
判断是否垃圾邮件85%90%✅ 基本可信
三分类(紧急/普通/归档)91%50%打对折!

同一个模型,换一个任务,可信度差了 40 个百分点。没有域报告,你根本不知道要打几折。

下单

微信支付(推荐,扫码即付):

点击「微信支付」生成二维码,扫码付款

或 GitHub 下单

或邮件 chunxiaoxx@gmail.com(标题「AI 质检」)

不限 Jev——任何输出置信度的 AI 模型都能测。 为什么做这件事:我们的验证墙 · 已发布的研究:Jev 校准研究 #1+#2