什么是语料库?
如果把大语言模型比作一个学生,那么语料库(Corpus)就是它要读的所有「课本和图书馆」。语料库是指按照一定规则收集、整理并加工过的海量语言材料集合,可以是文本、代码,也可以扩展到图片、音频、视频等多模态数据。大模型之所以能聊天、写代码、做翻译,本质上是从这些语料中「学会」了语言的统计规律和世界知识。
通俗地说:语料库的质量和规模,直接决定了模型能力的上限。业内常说的「数据是 AI 的燃料」「语料是大模型的粮食」,指的就是这件事。
语料库是怎么运作的?
从原始数据到训练语料的流水线
大模型训练用的语料并不是简单地「抓网页」,而是要经过一条完整的加工流水线:
- 数据收集:从公开网页、书籍、论文、代码仓库、百科、问答社区等来源大规模采集原始数据。
- 数据清洗:去除广告、乱码、重复内容、低质量文本,这一步往往决定语料的「干净程度」。
- 去重与过滤:通过哈希、指纹等技术去掉重复样本,并用质量分类器筛除劣质内容。
- 格式化与配比:将数据统一为模型可读的格式,并按一定比例混合不同来源的数据,控制「营养均衡」。
- 标注与对齐:预训练之后,还会用人工标注的高质量「指令—回答」数据做微调和对齐(如 RLHF),让模型学会听懂人类指令。
通用语料 vs 专用语料
| 维度 | 通用语料 | 专用语料 |
|---|---|---|
| 来源 | 网页、百科、书籍、新闻等 | 医疗病历、法律文书、金融报告、代码库等 |
| 规模 | 极大(数万亿 token 级别) | 相对较小(百万至十亿级) |
| 作用 | 学习语言规律和通识知识 | 注入垂直领域能力和专业术语 |
| 典型用途 | 大模型预训练 | 领域微调、RAG 知识库 |
还有一个重要概念是 Token:模型读语料时会把文字切分成最小单元「词元」。常说的「某模型用了 15 万亿 token 训练」,就是它吃下的语料总量。
高质量中文语料的稀缺
全球互联网上英文内容占比远高于中文,且大量中文内容分散在社交平台、App 等封闭生态中,公开可爬取的高质量中文语料相对稀缺。这也是国产大模型团队投入大量精力建设自有中文语料体系、发展合成数据技术的重要原因。
代表性的大模型产品
语料库是「幕后粮食」,最终的呈现就是各家大模型产品。以下这些国产模型均可在国内直接访问使用:
- DeepSeek(深度求索):以低训练成本和高推理能力著称,其技术报告详细披露了预训练语料的构成思路,是国内开源模型的代表。
- Kimi(月之暗面):以长上下文处理见长,擅长阅读和总结超长文档。
- 豆包(字节跳动):面向大众的对话助手,依托海量中文内容生态,日常问答体验流畅。
- 通义千问(阿里巴巴):覆盖对话、编程、多模态,开源系列模型被广泛二次训练。
- 智谱 GLM(智谱 AI):清华系技术团队,开源 GLM 系列在学术和产业界应用广泛。
此外,在多模态生成领域,快手可灵专注视频生成、字节即梦覆盖图像与视频创作,它们背后同样依赖大规模图文、视频语料的训练。
语料库的应用场景
- 大模型预训练:万亿级通用语料奠定模型的通识基础。
- 领域微调:医疗、法律、金融企业用自有专业语料微调出垂直模型。
- 检索增强生成(RAG):企业把内部文档建成知识库语料,让模型「开卷考试」回答专业问题。
- 语音与多模态:语音识别、图像理解、视频生成同样依赖对应模态的标注语料。
- 评测基准:标准化的评测语料(Benchmark)用来横向比较不同模型的能力。
常见问题
1. 大模型的语料都是从哪来的?
主要来源包括:公开网页爬取数据、开源数据集(如维基百科、开源代码库)、公开书籍与论文、授权采购的版权内容,以及团队自建或用模型生成的合成数据。各家厂商的具体配比通常是商业机密,但会通过技术报告披露大致构成。
2. 语料越多模型就越聪明吗?
语料的「质」比「量」更关键。
研究普遍表明,在清洗后高质量数据上训练的模型,即使数据量小一些,效果也常常更好。当然,质量和数量要平衡——量太少学不满,质太差会「吃坏肚子」,让模型学到偏见和错误知识。
3. 用网络内容训练模型,版权和隐私怎么办?
这是行业持续争议的问题。目前的做法包括:遵守 robots 协议尊重网站意愿、对个人信息做脱敏去标识、与版权方合作授权采购、以及发展合成数据减少对原始数据的依赖。国内也已出台生成式 AI 相关管理办法,要求训练数据来源合法合规。
小结
语料库是大模型的「粮食」,决定了模型能长多壮。理解语料的来源、清洗和配比,就理解了 AI 能力差异的一大根源。对普通用户而言,选择 DeepSeek、Kimi、豆包、通义千问等国产模型体验即可;对从业者和企业来说,建设高质量的自有语料库,往往比追逐更大的模型更能带来实际价值。
辽公网安备21021102001760号