数据来源
仅统计当前 App 中标记为 Golden Data 的 Item,包括人工标记和有效的自动认证;以当前生效的标记为准。源数据集已移除、但本地仍保留的 Golden Data 也计入统计;未标记和非 Golden 的 Item 不计入。
读取这些 Item 已保存的模型判定和 Reward 评测,包括人工改判后的分数。每个模型与 Thinking 配置、每道 Case 只取最新未删除的已保存结果,刷新统计不会发起模型请求。请求失败、Judge 异常和缺失分数单独展示,不记为答错,也不计入分母。
通过率如何计算
模型通过率 = 通过 Case 数 ÷ 有效评分 Case 数 × 100%
原始分数 ≥ 0.5 为通过
明细中的分数 = 原始分数 × 100(百分制)
每条 Case 等权。柱高统一使用 0–100% 刻度,柱内数字省略百分号。样本数量越少,成绩越容易受个别 Case 影响。
两种比较范围
各模型已测 Case:分别汇总各模型与 Thinking 配置的最新已保存 Case。不同柱子覆盖的题目数量和难度可能不同,百分比描述各自已测表现。
共同已测 Case:只计入所有所选模型与 Thinking 配置都有有效评分的同一数据集、同一 Item。切换测试集或增减配置时,重新计算交集和分组分数。历史记录的输入、规则或模型配置可能不同。
测试集汇总与重复评测
选择多个测试集时,将范围内 Case 一起计算,按 Case 等权。因此,Case 较多的测试集对总分影响更大;本图不采用「每个测试集权重相同」的计算方式。
每个模型与 Thinking 配置在每个 Case 上只取最新未删除的已保存结果,重复评测不会增加权重。最新结果异常时保留异常状态,不回退到旧评分。
如何查看明细
最多同时选择 10 个模型,同一模型按 Thinking 强度分柱展示(表格中为独立行),按各组通过率从高到低排列。模型旁的 Thinking 标签展示已固化的思考强度;历史记录首次恢复时,先读取模型选择参数,再读取已保存的实际模型请求,恢复后不随当前选择变化,悬停标签可查看来源。不同强度或思考预算分别计算通过率和 Case 数,点击后只展示对应组的明细。没有明确参数的 Case 单独保留,不显示 Thinking 标签,不推断或并入其他强度。悬停柱子可查看有效 Case 数、通过数量及测试集覆盖情况;点击柱子可查看逐条 Case 的真实分数和判定,也可切换为表格查看。点击 Case 会打开原数据集中的对应 Item。
默认自动展示当前测试集最近评测的最多 10 个模型,刷新时纳入新结果。手动选择和分享链接保留指定模型;有已测模型未展示时,筛选下方会提示,可切回自动展示。
分享链接保留当前测试集、模型及展示模式。下载截图导出当前图表或表格。