阿拉丁Aladdin

CORPUS PREPARATION

大模型语料预处理平台

先把数据准备好,
再让模型开始学习。

围绕语料整理、清洗、结构化与质量检查,把分散的业务资料组织成可追溯、可复用的数据集,为知识检索与模型训练做好准备。

7+
类文档与数据格式
6
类内置处理算子
3
种输出:知识库 / 训练 / 评测
ALADDIN TOOLS01
大模型语料预处理平台概念插图
原始文档与业务资料版本化语料与质量记录
  1. 01资料整理
  2. 02清洗去重
  3. 03结构化切分
  4. 04质量检查
功能详解

覆盖完整工作链路的六大能力。

数据处理不只是删除无用字符。它还需要保留业务语境、明确使用边界,并让每一条语料能够追溯到原始来源。

01

多源数据接入

  • PDF、Word、Excel、PPT、HTML、图片与扫描件
  • 文件上传、对象存储与数据库同步
  • 按批次登记来源、授权范围与版本
02

智能文档解析

  • OCR 与版面分析,识别标题层级与段落
  • 表格结构还原,保留表头、单位与合并单元格
  • 提取目录、图片说明与页码等元数据
03

清洗与去重

  • 规则清洗:乱码、页眉页脚、模板化内容
  • 精确去重与近似去重(MinHash / SimHash)
  • 语言识别与质量打分,过滤低质内容
04

隐私与敏感信息处理

  • 识别身份证、手机号、银行卡等个人信息
  • 自定义业务敏感字段与词表
  • 掩码、替换或删除,支持抽样复核
05

结构化切分与数据增强

  • 按标题、语义或长度切分
  • 保留章节路径、来源与版本元数据
  • 基于大模型生成问答对、摘要与指令数据
06

质检与版本管理

  • 抽样质检与问题标注、回流修订
  • 处理规则、算子参数与数据集版本绑定
  • 导出为知识库、训练集或评测集格式
输入 / INPUT原始文档与业务资料
输出 / OUTPUT版本化语料与质量记录
产品架构

分层清晰,上下游衔接顺畅。

从数据进入平台,到成果交给下游环节,每一层职责明确,并与阿拉丁 AI Stack 的其他产品打通。

输入

  • 文档资料
  • 表格与数据库
  • 网页与系统导出
  • 图片与扫描件
大模型语料预处理平台
  1. 数据接入批次管理格式识别来源与授权登记
  2. 文档解析OCR版面分析表格还原元数据抽取
  3. 处理算子清洗去重脱敏切分质量打分数据增强
  4. 编排与质检可视化流水线抽样质检问题回流版本快照

输出与下游

  • 知识库语料→ 飞灵智能体 / RAG
  • 训练数据集→ 可视化训练平台
  • 评测数据集→ 综合评测平台
平台支撑任务调度算子管理权限与审计私有化部署
应用场景

从具体问题出发,看它怎么用。

SCENARIO 01

企业知识库建设

现状问题
制度、手册与合同散落在多个系统,版本混杂,问答时引用了过期条款。
怎么做
批量接入并解析章节与表格,按当前有效版本切分,为每个片段保留来源与生效日期。

可追溯到原文的知识库语料,检索结果引用当前有效条款。

SCENARIO 02

行业大模型训练语料

现状问题
行业资料体量大、格式杂,重复和低质内容多,直接训练效果不稳定。
怎么做
统一清洗、近似去重与质量打分,按领域过滤,并留出隔离的验证集。

版本化的领域训练语料与可复查的处理记录。

SCENARIO 03

指令微调数据构造

现状问题
人工编写问答对成本高,覆盖面窄,难以持续补充。
怎么做
基于业务文档自动生成问答与指令数据,再由业务人员抽样复核。

可直接用于 SFT 的指令数据集,覆盖更多真实问题。

SCENARIO 04

业务评测集构建

现状问题
缺少贴近业务的测试题,模型好不好全凭体验。
怎么做
从真实资料中抽取问题与参考答案,与训练数据隔离并固定版本。

可重复使用的业务评测集,交给综合评测平台执行。

方案对比

和常见做法比,差别在哪里。

以下按常见方案形态归纳一般特征,便于选型时对照。

对比维度人工 + 脚本处理开源工具自建阿拉丁语料预处理平台
复杂文档解析(表格 / 扫描件)依赖个人经验需拼装多个组件OCR + 版面 + 表格还原
清洗、去重、脱敏算子逐个编写脚本算子分散,需二次开发内置算子,可视化配置
流水线编排与复用脚本难复用以代码为主拖拽编排,模板复用
质量检查与问题回流人工抽查,难留痕通常需自建抽样质检与问题记录
数据版本与溯源文件夹管理需自行集成规则、参数与版本绑定
与训练 / 评测衔接需手动转换格式直接输出到训练与评测
上手门槛高,需工程人员中高,需持续维护低,业务人员可参与
支持 部分支持 / 需额外工作 不支持 / 需自建对比为常见方案的一般特征,具体以各产品实际版本为准。
服务手册

从准备到完成,一步步操作。

先明确目标与边界,再执行任务。以下是工作指导,实际界面和可用功能以部署版本为准。

  1. 01

    建立语料批次

    先按业务主题或来源划分批次,为每批记录用途、负责人和访问范围。保留原始资料副本,处理后的内容单独管理。

    完成检查同一批次中的资料用途一致,来源与版本能被查到。

  2. 02

    检查与整理原始内容

    先打开样本检查正文提取效果。将空白文件、损坏内容、重复版本与过期文档标记出来,决定修复、隔离或排除。

    完成检查正文完整,表格与标题未丢失;被排除内容有原因记录。

  3. 03

    配置清洗与脱敏规则

    依据资料类型处理页眉页脚、乱码和重复内容。对个人信息与业务敏感字段设置脱敏规则,再用一份样本验证规则是否误删正文。

    完成检查敏感信息处理符合预定范围,关键术语、数值与单位仍被保留。

  4. 04

    按业务结构切分

    优先沿标题与段落切分;为片段保留文档标题、章节、来源和版本。对于表格与操作步骤,保持表头、单位和步骤顺序关联。

    完成检查单个片段具备可理解的上下文,且可回到原始文档核对。

  5. 05

    验收并建立版本

    从不同来源抽样检查完整性、重复内容与脱敏结果。确认后固定处理规则和数据集版本,将质量问题与修订记录一并归档。

    完成检查版本有明确用途与验收记录;后续检索、训练任务引用的是同一版本。

最佳实践

从具体场景,找到可复用的方法。

每一项实践都包含问题、操作路径与需要保留的成果,帮助团队把经验沉淀下来。

PRACTICE / 01

把制度资料整理成知识库语料

同一制度有多个修订版本,检索结果容易混用旧条款。

  1. 1

    按制度编号建立清单,记录生效日期与当前有效版本。

  2. 2

    将历史版本独立归档,为当前条款保留标题、章节与有效日期。

  3. 3

    使用真实问题验证检索片段,检查答案是否引用当前有效条款。

建议保留的成果

有效制度清单、带版本的语料片段、检索核对记录

PRACTICE / 02

清洗操作手册时保留完整步骤

操作步骤被拆开后,模型可能忽略前置条件或安全提醒。

  1. 1

    把前置条件、操作步骤和注意事项作为一个完整单元整理。

  2. 2

    为包含表格的步骤关联表头、单位、设备或对象名称。

  3. 3

    抽样复核步骤顺序,并请业务人员确认关键信息没有被切掉。

建议保留的成果

完整操作单元、表格上下文、业务复核清单

PRACTICE / 03

为训练数据留出干净的验证集

相同文档或近似样本同时进入训练集与验证集,结果可能失真。

  1. 1

    在划分数据之前,先按来源与内容做重复检查。

  2. 2

    将同源或近似样本归入同一分组,再划分训练与验证数据。

  3. 3

    固定验证集版本,记录隔离规则,后续数据更新时重新检查。

建议保留的成果

数据划分规则、固定验证集、重复检查记录

把这条工作路径,带进你的业务。

结合你的数据、模型与运行环境,讨论产品适配、部署与实施安排。