01
评测集管理
- 导入业务题库,或由语料平台生成
- 按场景、难度与题型打标签
- 固定版本,防止泄漏到训练数据
一个总分很难说明模型能否投入使用。场景覆盖、错误类型、回答依据与运行约束,需要放在一起判断。
从数据进入平台,到成果交给下游环节,每一层职责明确,并与阿拉丁 AI Stack 的其他产品打通。
输入
输出与下游
SCENARIO 01
有依据的选型报告,说明取舍而不只是一个总分。
SCENARIO 02
明确的上线质量门槛和待修复问题清单。
SCENARIO 03
定位到具体失败环节,指导提示词与工具改进。
SCENARIO 04
每次版本更新都有新旧对照记录。
以下按常见方案形态归纳一般特征,便于选型时对照。
| 对比维度 | 公开榜单参考 | 开源评测框架 | 阿拉丁综合评测平台 |
|---|---|---|---|
| 贴近企业业务 | 通用题目 | 需自建题库 | 业务测试集管理 |
| 评分方式 | 固定基准 | 以自动指标为主 | 规则 + 大模型裁判 + 人工复核 |
| 事实与引用核查 | 需自行开发 | 内置引用核对 | |
| 多模型并排对比 | 只看分数 | 需自行整理 | 同条件并排、盲评 |
| 问题归类与回归 | 通常需自建 | 失败样本沉淀回归集 | |
| 报告与决策支持 | 排行榜 | 需自行整理 | 可导出报告与问题清单 |
| 私有化与数据安全 | — | 可自部署 | 支持私有化部署 |
先明确目标与边界,再执行任务。以下是工作指导,实际界面和可用功能以部署版本为准。
把业务需求拆成可测试的任务,分别描述正常问题、边界问题与不应回答的问题。为每类任务设定判定标准和需要复核的人。
完成检查每个测试类别都有明确目的,标准能被不同评审者一致理解。
从真实场景整理测试样本,补充参考答案、必要依据和标签。将简单、复杂、歧义与信息不足的问题分别分组,并检查样本是否泄漏到训练资料。
完成检查测试样本覆盖预定场景,来源和版本可追溯。
固定模型版本、提示词、采样配置与知识库版本。对使用工具的任务,记录工具权限和返回结果;模型对比时保持这些条件一致。
完成检查对比结果来自相同条件,运行配置与输出均被保存。
按照既定规则检查输出,在需要时结合人工评审。把事实错误、无依据结论、格式偏差、越界回答与执行失败分开记录。
完成检查评分依据清晰;自动评分与人工判断不一致的样本已复核。
按场景总结表现与限制,为问题明确修复方向。将关键失败样本加入回归集,模型、提示词或知识库更新后再次执行同一组测试。
完成检查报告包括测试范围、环境、结果与限制,不把局部结论扩展为整体保证。
每一项实践都包含问题、操作路径与需要保留的成果,帮助团队把经验沉淀下来。
PRACTICE / 01
回答看起来流畅,但结论未必由企业资料支持。
为测试问题准备正确条款与可引用资料,并加入资料中没有答案的问题。
分别检查答案是否正确、引用是否相关、结论是否超出来源。
对于信息不足的问题,检查模型是否说明限制并提出必要澄清。
问答测试集、引用核对表、无依据回答问题清单
PRACTICE / 02
不同团队用不同问题体验模型,选型意见难以对齐。
共同选定代表性任务,固定测试样本和判定规则。
在相同运行条件下记录质量表现,并记录延迟与资源条件。
按场景比较结果和限制,说明取舍,不只依据一个综合分数。
模型对照报告、场景结论、运行条件说明
PRACTICE / 03
更新模型或提示词后,曾经修复的问题再次出现。
将已确认的问题整理为可复现的输入、预期行为和判断规则。
固定问题样本及所需知识、工具配置,建立回归集。
每次更新后运行回归集,对新旧结果差异进行复核和归档。
回归测试集、更新对照记录、待处理问题列表