AI是如何训练的
没有人手工编写大语言模型的知识。下面这条流水线,把原始文本变成了强大的模型。
1. 数据收集
训练从庞大的数据集开始——书籍、文章、网站、代码——经过清洗和质量过滤。老规矩依然适用:数据质量比数据量更重要。
2. 预训练
模型通读数据,一遍又一遍地学习预测下一个词,重复数十亿次。在这个阶段,它吸收了语法、事实、推理模式,甚至数据中存在的一些偏见。预训练是最烧钱的一步,需要数千块专用芯片连续运行数周。
3. 微调
预训练之后,用较小规模、高质量的指令和优质回答数据集对模型进行调优,让它学会听从指令、乐于助人,而不只是续写文本。
4. 对齐(RLHF)
人工评审员给模型的回答打分排名,模型再被优化去偏好高分回答。这一步——基于人类反馈的强化学习——让助手变得礼貌、安全、真正有用,而不只是流利。
5. 评估
发布前,模型要在各项基准测试中接受检验:知识、推理、编程和安全性。训练永远不会真正结束:来自真实世界的反馈会持续改进下一个版本。
动手试试:提示词练习
训练一个模型需要一座数据中心,而训练你自己用好模型只需要五分钟。试试这几招:
- 具体明确。 不要说“总结一下”,而要说“用三条要点,为一位忙碌的房东总结这篇文章”。
- 提供上下文。 先贴背景,再提问题。你会发现回答质量大幅提升。
- 指定格式。 直接要表格、邮件草稿或要点列表——别接受你没要过的大段文字。
最好的练习方式,就是用一个真正的助手练手。 用我的邀请码试用 Muse →