维度分 = 该维度下各测试得分均值(通过=100,可疑=60,未通过=10,参考项不计分); 综合分 = 维度加权平均。
| 维度 | 测试项 | 判定规则 | 预计耗时 |
|---|---|---|---|
| 性能 | 首字延迟与流式健康 连续 3 轮真实流式对话,测量首字输出时间(TTFT)与持续生成速度。 | 首字中位 <1.5s 通过;<4s 可疑;否则未通过。参考:官方直连通常 0.5~2s(受网络影响)。 | ~25s |
| 真实性 | 协议与响应头指纹 检查响应头特征:限流头/openai版本头是否被中转剥离,server 指纹等。 | 参考信号:缺失限流头与版本头提示可能存在反代中转,仅与其他证据合并判断。 | ~8s |
| 能力 | 工具调用合规检测 3 组场景:正确调用、该拒绝调用时拒绝、多参数 schema 严格性。 | 3/3 通过;2/3 可疑;≤1 未通过。 | ~20s |
| 能力 | 针海长上下文召回 约 2.6 万字符(1.5~2 万 token 级)中文长文中 15%/50%/85% 三个深度位置各埋入随机口令,检验截断与遗忘。 | 3/3 通过;2/3 可疑;≤1 未通过。 | ~60s |
| 能力 | 防降级与逻辑阶梯 8 级递进难度的逻辑/数学题(结果可精确校验),对照模型档位参考线,识别小模型冒充。 | 按档位参考线:旗舰≥7、中档≥5、轻量≥3 为通过;差 1 级可疑;更多未通过。 | ~60s |
| 真实性 | 分词器指纹 对比追加固定文本前后的 usage.prompt_tokens 增量(模板开销互相抵消),与模型家族的公开分词特征比对。 | 落在家族参考区间=通过;偏离30%内=可疑;明显偏离=未通过(强信号)。无 usage 返回=协议不规范。 | ~15s |
| 真实性 | 身份一致性与注入检测 三问自我身份 + 诱导复述系统提示词:检测池化代理答漏嘴、隐藏 system prompt 注入。 | 自称其他家族模型=未通过;检出注入标记=未通过;身份含糊=可疑;一致=通过。 | ~20s |
| 真实性 | 确定性与混池检测 temperature=0 下同一问题重复 5 轮:数学答案应完全一致、文风应高度相似;漂移大=后端混池。 | 数学一致且文风相似度≥0.7=通过;≥0.45=可疑;明显漂移或数学不一致=未通过。 | ~45s |
| 真实性 | 知识与截止指纹 5 道有确定答案的常识/时事题 + 1 个完全虚构的事件陷阱(真实模型应表示不知道)。 | 编造虚构事件=未通过(硬伤);常识≥4/5=通过;3/5=可疑;≤2=未通过。 | ~35s |
| 性能 | 限流降速曲线 一次 400 数字长流式生成,分段统计 tokens/s:识别'前 200 token 快、后面偷偷降速'与伪流式缓冲。 | 后段/前段速率比≥0.5=通过;≥0.3=可疑;更低=未通过。首字时间占全程>90% 且一次性吐出=伪流式(可疑)。 | ~90s |
| 稳定性 | 并发压力测试 8 路并行小请求,测 p50/p95 延迟与错误率,反映高峰期排队与后端池容量。 | 错误率≥20% 或 p95>15s=未通过;错误率≥10% 或 p95>8s=可疑;否则通过。 | ~45s |
| 能力 | 多轮指令保持 6 轮对话:第 1 轮设定回答格式约束,中间 4 轮检验遵守,末轮检验对最初约定的召回。 | ≥5 分通过;4 分可疑;≤3 未通过。 | ~40s |
| 能力 | 严格 JSON 可靠性 5 组不同结构的纯 JSON 输出任务(基础/数组/嵌套/布尔浮点/混合),解析+schema 双重校验。 | 5/5 通过;4/5 可疑;≤3 未通过。 | ~35s |
| 能力 | 长输出完整性 要求生成 20 段结构化长文,检验 completion 长度、编号连续性与是否静默截断。 | ≥18/20 段且未截断=通过;≥10 段或 ≥800 tokens=可疑;更少或截断=未通过。 | ~90s |
| 合规 | 审查强度指纹 8 个合法但有边缘感的正常问题(医疗/历史/金融合规等),对比官方模型常见拒答率。 | 拒答率<25%=通过;25~50%=可疑;≥50%=未通过。对比基线为预置参考数据。 | ~60s |