AI 质检报告
试金局(Nautilus Assay)· 独立第三方 · 报告带签名 · 我们的验证记录
你的 AI 说自己的判断 90% 可信——在谁的数据上?不在你的。
你正在用 AI 做邮件分拣、工单分类、内容审核、风控标记。AI 厂商宣传的准确率
是他们在自己的测试集上测的,不是在你的业务数据上。在把你产品的安全阈值设成
0.9 之前,你应该知道 0.9 的置信度在你的领域到底值多少。
我们怎么测
- 你给 20-50 条业务判断样本(匿名化——敏感数据不出你的服务器;或脱敏上传;或签保密协议)
- 我们用 AI 在你的域上全量测试(200-600 道按你的业务模式生成的判断题,一次性全跑,不挑不选,每次调用原始记录全部存档)
- 48 小时给你一份带签名的报告:你的领域的准确率、校准误差(Brier/ECE)、
与 AI 厂商通用基线的偏差、以及可操作的使用阈值建议(「你的领域里 0.9 的
置信度当 0.77 用」);全部原始数据随附——任何人可以重算我们的数字。
出了事我们赔:如果我们验错了——同规格免费重测 + 全额退款 + 承担挑战成本 +
我们的错误记录清零。
赔付条款(公开)。
这是国内第一份敢写赔付的 AI 质检。
定价
¥699 · 快速版
匿名模式 · 200 道题 · 单模型版本 · 48 小时出报告
¥1,799 · 标准版
脱敏样本 · 400 道题 · 含难度分层+对抗测试 · 48 小时
¥3,499 · 深度版
真实样本+保密协议 · 600 道题 · 全对抗测试组+复跑稳定性 · 72 小时
加购月度重测(模型版本更新时触发):各档 +40%/月
真实案例(我们测的)
我们拿合成的邮件分诊任务测了 Jev(刚发布的决策模型):
| 任务 | Jev 自称置信度 | 实际准确率 | 该打几折 |
| 判断是否垃圾邮件 | 85% | 90% | ✅ 基本可信 |
| 三分类(紧急/普通/归档) | 91% | 50% | 打对折! |
同一个模型,换一个任务,可信度差了 40 个百分点。没有域报告,你根本不知道要打几折。
下单
微信支付(推荐,扫码即付):
点击「微信支付」生成二维码,扫码付款
或 GitHub 下单
或邮件 chunxiaoxx@gmail.com(标题「AI 质检」)
不限 Jev——任何输出置信度的 AI 模型都能测。
为什么做这件事:我们的验证墙 ·
已发布的研究:Jev 校准研究 #1+#2