分享
如何从零构建自己的 LLM:GPT 和 Claude 背后的 5 阶段完整流程
输入“/”快速插入内容
如何从零构建自己的 LLM:GPT 和 Claude 背后的 5 阶段完整流程
用户4242
用户4242
6月14日修改
原帖链接:
https://x.com/0xCodez/status/2058911661973454915
我拆解了大型语言模型到底是怎么构建出来的:ChatGPT、Claude 和 Gemini 背后的完整流程,并把它压缩成一张路线图。
收藏这篇,保存下来。
读完之后,你会理解从原始互联网文本到一个能像助手一样回答问题的模型,中间精确经历的五阶段路径。
关注我的 Substack,获取新的 AI 高价值信息:
movez.substack.com
这不是夸张。大多数人以为构建 LLM 的关键是架构。
这里最核心的一课是:架构反而是最不重要的部分。
关于 LLM,人人都相信的误解
问大多数人,如何构建一个像 Claude 这样的模型,他们会回答:“Transformer。”好像秘密就在神经网络设计里。
并不是。Transformer 架构基本已经标准化,而且公开发布。每个大实验室用的构件大体相同。
如果架构是护城河,那所有人早就拥有 GPT-4 了。
真正会重塑你理解的一句话是:在实践中,决定模型成败的是数据、评测和系统,而不是架构微调。最好的模型不只是被训练出来的。它们是被工程化出来的。
LLM 构建流程总览
所以这份指南围绕真正重要的事情展开。五个阶段。架构只是第一阶段里的一个脚注。剩下四个阶段,才是真实模型胜负所在。
01. 预训练:教会模型语言本身
一切都从一个看似简单、实则很深的目标开始:
预测下一个词。
这就是自回归语言建模。给定一串词,模型学习接下来会出现什么内容的概率分布。
只要在足够多文本上做这件事,模型就会吸收语法、事实和推理模式。不是因为有人显式教了它们,而是因为想要很好地预测下一个词,就必须掌握这些东西。
预训练:预测下一个词
分词是第一步
在模型看到文本之前,文本会先被切分成 token。标准方法是
Byte-Pair Encoding(BPE)
,它的逻辑会影响后续整个流程。
BPE 分词