判定标准与方法论

基线版本 2026-09-v1 · 全部判定为规则化阈值,无人工主观打分

维度与权重

维度分 = 该维度下各测试得分均值(通过=100,可疑=60,未通过=10,参考项不计分); 综合分 = 维度加权平均。

测试项与阈值

维度测试项判定规则预计耗时
性能首字延迟与流式健康
连续 3 轮真实流式对话,测量首字输出时间(TTFT)与持续生成速度。
首字中位 <1.5s 通过;<4s 可疑;否则未通过。参考:官方直连通常 0.5~2s(受网络影响)。~25s
真实性协议与响应头指纹
检查响应头特征:限流头/openai版本头是否被中转剥离,server 指纹等。
参考信号:缺失限流头与版本头提示可能存在反代中转,仅与其他证据合并判断。~8s
能力工具调用合规检测
3 组场景:正确调用、该拒绝调用时拒绝、多参数 schema 严格性。
3/3 通过;2/3 可疑;≤1 未通过。~20s
能力针海长上下文召回
约 2.6 万字符(1.5~2 万 token 级)中文长文中 15%/50%/85% 三个深度位置各埋入随机口令,检验截断与遗忘。
3/3 通过;2/3 可疑;≤1 未通过。~60s
能力防降级与逻辑阶梯
8 级递进难度的逻辑/数学题(结果可精确校验),对照模型档位参考线,识别小模型冒充。
按档位参考线:旗舰≥7、中档≥5、轻量≥3 为通过;差 1 级可疑;更多未通过。~60s
真实性分词器指纹
对比追加固定文本前后的 usage.prompt_tokens 增量(模板开销互相抵消),与模型家族的公开分词特征比对。
落在家族参考区间=通过;偏离30%内=可疑;明显偏离=未通过(强信号)。无 usage 返回=协议不规范。~15s
真实性身份一致性与注入检测
三问自我身份 + 诱导复述系统提示词:检测池化代理答漏嘴、隐藏 system prompt 注入。
自称其他家族模型=未通过;检出注入标记=未通过;身份含糊=可疑;一致=通过。~20s
真实性确定性与混池检测
temperature=0 下同一问题重复 5 轮:数学答案应完全一致、文风应高度相似;漂移大=后端混池。
数学一致且文风相似度≥0.7=通过;≥0.45=可疑;明显漂移或数学不一致=未通过。~45s
真实性知识与截止指纹
5 道有确定答案的常识/时事题 + 1 个完全虚构的事件陷阱(真实模型应表示不知道)。
编造虚构事件=未通过(硬伤);常识≥4/5=通过;3/5=可疑;≤2=未通过。~35s
性能限流降速曲线
一次 400 数字长流式生成,分段统计 tokens/s:识别'前 200 token 快、后面偷偷降速'与伪流式缓冲。
后段/前段速率比≥0.5=通过;≥0.3=可疑;更低=未通过。首字时间占全程>90% 且一次性吐出=伪流式(可疑)。~90s
稳定性并发压力测试
8 路并行小请求,测 p50/p95 延迟与错误率,反映高峰期排队与后端池容量。
错误率≥20% 或 p95>15s=未通过;错误率≥10% 或 p95>8s=可疑;否则通过。~45s
能力多轮指令保持
6 轮对话:第 1 轮设定回答格式约束,中间 4 轮检验遵守,末轮检验对最初约定的召回。
≥5 分通过;4 分可疑;≤3 未通过。~40s
能力严格 JSON 可靠性
5 组不同结构的纯 JSON 输出任务(基础/数组/嵌套/布尔浮点/混合),解析+schema 双重校验。
5/5 通过;4/5 可疑;≤3 未通过。~35s
能力长输出完整性
要求生成 20 段结构化长文,检验 completion 长度、编号连续性与是否静默截断。
≥18/20 段且未截断=通过;≥10 段或 ≥800 tokens=可疑;更少或截断=未通过。~90s
合规审查强度指纹
8 个合法但有边缘感的正常问题(医疗/历史/金融合规等),对比官方模型常见拒答率。
拒答率<25%=通过;25~50%=可疑;≥50%=未通过。对比基线为预置参考数据。~60s

客观性声明