EVALS · AI Product Quality

跨产品质量体系
评测驱动产品

把“模型看起来不错”,变成可复验的产品证据。

针对不同产品的失效方式,分别设计测试集与评分规则,通过失败归因、修复复测和 Release Gate,让评测真正进入产品迭代与发布决策。RiskLens 验证受控 Agent、证据链与人工决策闭环;Mental LEGOs 验证任务闭环、内容安全与表达质量。

PRIMARY EVIDENCE · TO B

RiskLens 风控透镜

以封存 B 卷、人工评分、独立复标和真实三角色产品链,验证 Agent 能否在证据与权限边界内完成风险调查。

受控 Agent证据链闭卷评测产品链验收
CROSS-PRODUCT PROOF · TO C

Mental LEGOs 心智乐高

以失效模式 Suite、真实模型调用、人工金标签和 Judge 校准,验证训练闭环、内容安全与表达质量。

任务闭环内容安全Judge 校准全量回归
RiskLens Evals 独立评测控制台总览
02 · Full Eval Console

打开完整 RiskLens Evals 控制台。

RiskLens Evals 将运行结果、案例轨迹、自动判定、人工评分记录组织在同一控制台,支持从版本表现追溯到单例失败原因。公开入口采用脱敏只读快照,与业务数据库及模型服务隔离。

评测总览案例详情人工评分记录方法与局限
打开完整 Eval 控制台 ↗
03 · Principles

用四大原则,
让评测真正落地并改变产品

从“结论可复核”到“驱动产品进化”的全链路评测准则。

01 · HARD EVIDENCE

用硬核数据说话

完整留存运行日志、工具轨迹、Token消耗、评分表及结果哈希,确保评测结论全程可追溯、可复验。

证据高于感觉,结论皆可复验
02 · ISOLATED ARENA

构建独立评测靶场

将评测的源码、数据、账号及基础设施与 Demo/UAT 彻底隔离;严格拦截失败运行与调试数据,防止污染验收环境。

先建独立环境,再谈评测成绩
03 · FROZEN GOLD

冻结金标准与评测判据

严格区分开发集与测试集。开发集用于定位调优,测试集一经封存仅作终验,严禁根据测试输出反向修补 Prompt、标准答案或规则。

标准事前冻结,运行杜绝回溯
04 · RELEASE GATE

让评测驱动产品迭代

构建“失败归因 → 缺陷修复 → 开发集回归 → 封存集复测 → 版本准入”闭环体系,不让评测沦为纸面报告。

评测把关准入,决策驱动发布
04 · RiskLens Flagship Evidence

20 个真实 Agent 案例,
不是 20 次漂亮演示。

7 个 dev 案例用于定位与调优,13 个封存 B 卷用于闭卷检验;自动检查与人工评分分别记录,失败结果不从分母中消失。

20/20Agent 案例已执行

7 DEV + 13 SEALED TEST

12/20最新自动通过

DEV 7 + B RETEST 5

863,796真实评测 Token

含失败尝试 · 不只计成功结果

263次Provider 调用

调用、停止与预算均留痕

01 · DEV开放开发集

发现通用问题,允许修改实现与 Prompt。

02 · SEALED B封存闭卷

不公开逐题内容,不按题调参。

03 · HUMAN SCORE人工五维评分

A—E 逐维理由、硬门槛与最终判断。

04 · RELABEL独立复标与裁决

第二位评分人独立判断,分歧进入裁决。

05 · Fix & Closed-book Retest

真正的提升,不看“修完能跑”,
看闭卷复测是否收敛。

首轮 B 卷暴露预算与收敛问题。修复只回到 dev 集解决通用原因,再以相同条件整体复测封存 B 卷。

B卷 CANDIDATE · 首轮

问题暴露

2026.09.21 · f33ca1c
2/13COMPLETED
0/13AUTO PASS
4.31MEAN SCORE
0/34GOLD EVIDENCE
→
B卷 CANDIDATE · 复测

通用修复后收敛

2026.09.22 · fd1c2f4
9/13COMPLETED
5/13AUTO PASS
7.92MEAN SCORE
14/34GOLD EVIDENCE
+7完成案例
+5自动通过
0 → 9人工通过
+41.18pp证据覆盖
−13.2%Token
FEATURED CASE · G005

零借款边界下的资金覆盖核查

一个失败案例如何推动数据语义、任务范围和重复调用控制同时修复。

失败接口空值被理解为数据不足;Agent 重复查询并扩大范围,最终以 conclude_limited 收束。
定位年报借款变动表可精确证明期末短期借款为 0;问题同时涉及数据完整性和目标漂移。
修复补齐来源归一化、目标传递和重复调用守卫,保留原始结构化 null,不用零值覆盖历史。
复测查询 4→1、重复 3→0、证据 0→2、finding 0→1,正确解释零分母导致比率不适用。
预算收敛终止类型语义校验
06 · Product-chain Acceptance

Benchmark 之外,
还要证明产品真的能交付。

Agent 单例评测回答“模型是否守规矩”;产品链验收回答“真实角色能否接手、复核、定稿和归档”。两条证据不能互相替代。

  1. 企业
  2. 数据
  3. 信号
  4. Agent
  5. 分析员
  6. 复核
  7. 报告

一条独立候选环境中的完整链

从公开财务数据进入系统开始,连续完成信号建项、两轮真实 Agent、人工提交、独立复核、报告定稿、支持企业邮件网关投递,完成 PDF/EML 不可篡改凭证归档。

133可追溯财务事实
2真实 Agent 轮次
7 / 3外发放行 / 门禁拦截
1正式报告归档闭环
07 · Cross-product Proof

跨场景工程化验证:
从 To B 风控到 To C 认知训练

Mental LEGOs 将同样的硬证据意识应用到认知训练产品:按失效模式组织评测,真实调用模型,并以规则、Judge 与人工金标签共同判断质量。

TO C · MENTAL LEGOs

任务闭环、内容安全与表达质量

8 个风险 Suite 覆盖教练纪律、训练闭环、提示注入、知识摄入、画像与语言外壳。每案例保存 JSONL、失败 ID、Token、耗时和 Judge 判审记录,评测结果直接推动诊断、提炼与变式判断优化。

8按失效模式组织的评测 Suite
525次真实模型调用
40条人工金标签
503万输入 Token
27.4万输出 Token
3h 26m全量评测时长
评测产物可复跑:规则评测、语义 Judge、金标签校准、逐例 JSONL 与汇总报告均有独立入口。
08 · Release Gate

评测的终点不是报告,
是产品能不能进入下一版。

失败样本只有进入下一轮的准入门,才真正产生产品价值。

01归因

区分产品、数据、Provider、策略与评测工具问题。

02通用修复

回到 dev 集解决机制问题,不按封存题逐例调参。

03开发集回归

确认修复没有破坏既有正确行为。

04封存集复测

相同预算和判据整体复测,保留前后结果。

05版本准入

达标才定档;未达标项成为明确边界。

评测的核心价值不是刷高分数,而是让每一次修复都有据可依,每一次发布都有清晰的质量归因。