01
多源数据接入
- PDF、Word、Excel、PPT、HTML、图片与扫描件
- 文件上传、对象存储与数据库同步
- 按批次登记来源、授权范围与版本
数据处理不只是删除无用字符。它还需要保留业务语境、明确使用边界,并让每一条语料能够追溯到原始来源。
从数据进入平台,到成果交给下游环节,每一层职责明确,并与阿拉丁 AI Stack 的其他产品打通。
输入
输出与下游
SCENARIO 01
可追溯到原文的知识库语料,检索结果引用当前有效条款。
SCENARIO 02
版本化的领域训练语料与可复查的处理记录。
SCENARIO 03
可直接用于 SFT 的指令数据集,覆盖更多真实问题。
SCENARIO 04
可重复使用的业务评测集,交给综合评测平台执行。
以下按常见方案形态归纳一般特征,便于选型时对照。
| 对比维度 | 人工 + 脚本处理 | 开源工具自建 | 阿拉丁语料预处理平台 |
|---|---|---|---|
| 复杂文档解析(表格 / 扫描件) | 依赖个人经验 | 需拼装多个组件 | OCR + 版面 + 表格还原 |
| 清洗、去重、脱敏算子 | 逐个编写脚本 | 算子分散,需二次开发 | 内置算子,可视化配置 |
| 流水线编排与复用 | 脚本难复用 | 以代码为主 | 拖拽编排,模板复用 |
| 质量检查与问题回流 | 人工抽查,难留痕 | 通常需自建 | 抽样质检与问题记录 |
| 数据版本与溯源 | 文件夹管理 | 需自行集成 | 规则、参数与版本绑定 |
| 与训练 / 评测衔接 | 需手动转换格式 | 直接输出到训练与评测 | |
| 上手门槛 | 高,需工程人员 | 中高,需持续维护 | 低,业务人员可参与 |
先明确目标与边界,再执行任务。以下是工作指导,实际界面和可用功能以部署版本为准。
先按业务主题或来源划分批次,为每批记录用途、负责人和访问范围。保留原始资料副本,处理后的内容单独管理。
完成检查同一批次中的资料用途一致,来源与版本能被查到。
先打开样本检查正文提取效果。将空白文件、损坏内容、重复版本与过期文档标记出来,决定修复、隔离或排除。
完成检查正文完整,表格与标题未丢失;被排除内容有原因记录。
依据资料类型处理页眉页脚、乱码和重复内容。对个人信息与业务敏感字段设置脱敏规则,再用一份样本验证规则是否误删正文。
完成检查敏感信息处理符合预定范围,关键术语、数值与单位仍被保留。
优先沿标题与段落切分;为片段保留文档标题、章节、来源和版本。对于表格与操作步骤,保持表头、单位和步骤顺序关联。
完成检查单个片段具备可理解的上下文,且可回到原始文档核对。
从不同来源抽样检查完整性、重复内容与脱敏结果。确认后固定处理规则和数据集版本,将质量问题与修订记录一并归档。
完成检查版本有明确用途与验收记录;后续检索、训练任务引用的是同一版本。
每一项实践都包含问题、操作路径与需要保留的成果,帮助团队把经验沉淀下来。
PRACTICE / 01
同一制度有多个修订版本,检索结果容易混用旧条款。
按制度编号建立清单,记录生效日期与当前有效版本。
将历史版本独立归档,为当前条款保留标题、章节与有效日期。
使用真实问题验证检索片段,检查答案是否引用当前有效条款。
有效制度清单、带版本的语料片段、检索核对记录
PRACTICE / 02
操作步骤被拆开后,模型可能忽略前置条件或安全提醒。
把前置条件、操作步骤和注意事项作为一个完整单元整理。
为包含表格的步骤关联表头、单位、设备或对象名称。
抽样复核步骤顺序,并请业务人员确认关键信息没有被切掉。
完整操作单元、表格上下文、业务复核清单
PRACTICE / 03
相同文档或近似样本同时进入训练集与验证集,结果可能失真。
在划分数据之前,先按来源与内容做重复检查。
将同源或近似样本归入同一分组,再划分训练与验证数据。
固定验证集版本,记录隔离规则,后续数据更新时重新检查。
数据划分规则、固定验证集、重复检查记录