分享
为什么今天造大模型的人,一半在学物理
输入“/”快速插入内容
为什么今天造大模型的人,一半在学物理
用户4242
用户4242
7月29日修改
🔗 原文链接:
https://mp.weixin.qq.com/s/PH0Sb-ZF...
原创 孟醒 孟醒 孟醒的笔记本
2026年7月29日 08:30 北京
最近半年,我认真聊过的200多位AI研究者, 我发现给过我最惊艳洞见的那些人,竟然有大半没正经学过AI —— 他们学的是物理。我拉五源的同事复过盘,发现这不是我的采样偏差,貌似放到全球范围依然成立。我们随便看三份简历。
第一位,斯坦福物理本科,普林斯顿生物物理博士。第二位,哈佛理论物理博士,在学术界做了十五年理论物理。第三位,斯坦福理论物理博士,研究量子引力和全息原理。
三个人后来凑在一起,训练了一个弱弱的聊天机器人。
第一位是 Dario Amodei,Anthropic 的 CEO。第二位是 Jared Kaplan,Anthropic 首席科学官,Scaling Laws 的主要作者——今天所有人敢往一个模型上砸几亿美金,靠的就是他那条曲线。第三位是 Sam McCandlish,Anthropic 首席架构师,现在负责预训练。
那个弱弱的聊天机器人叫 Claude。
这不是一家公司的特例。做 ImageNet 的李飞飞,普林斯顿物理本科。做出 PPO 的 John Schulman,Caltech 物理本科。今天图像生成的主流做法叫扩散模型,骨架是 Jascha Sohl-Dickstein 从非平衡热力学里抄来的。
2024 年的诺贝尔物理学奖,颁给了神经网络。同一年的化学奖,一半给了 AlphaFold。
这不太像一份 AI 名人录,更像一份物理系的就业报告。
最省事的解释是人才流动——物理不好找工作,聪明人往钱多的地方去。我一开始也这么想,后来改了主意。
因为同一段时间里,还发生了另一件更奇怪的事。
人类第一次造出了一个自己造得出来、却解释不了的东西。
大模型的每一行代码都是人写的,每一个算子都能拆开看。可是没有人能说清楚,几千亿个参数堆在一起之后,为什么会长出语法、知识、推理,甚至人格。
于是研究它的办法只剩下一种,就是研究石头、研究星星、研究蛋白质的那一种:观察、测量、归纳,猜一个理论,再回去验证。
一门工程学,正在变成一门自然科学。
所以不是物理学家挤进了 AI。是 AI 自己走到了物理的地盘上。
这件事有四十年的前史。
诺奖颁给神经网络的时候,很多人觉得是委员会在追热点凑数。其实不是。
想象一块磁铁。里面有无数根极小的磁针,每一根都很笨,只跟身边的邻居较劲。物理学家会给整块磁铁定义一个”能量”,然后系统会自己往能量低的地方滚。神奇的地方在于,这么笨的规则,在整体上会长出磁性这种从单根磁针身上完全看不出来的性质。
Hopfield 在 1982 年发现,神经网络可以套用同一套数学。神经元就是磁针,连接权重就是相互作用,网络”记住”一个东西,就是整个系统滚进了一个能量低谷。
所以神经网络最早的那套数学,是从磁铁身上抄来的,不是从计算机科学里长出来的。
四十年,从能量函数到 Scaling Laws,这条线几乎没断过。
这篇文章想讲的是这条线的另一头:它在今天为什么突然变得这么显眼。
01、我们造出了它,却只能像研究自然那样研究它
前不久我跟 Juntang Zhuang 聊天,他之前是 xAI 的预训练负责人,耶鲁生物医学工程博士——不是物理出身,所以下面这个说法不算自我美化。
他说,
大模型之所以像物理,是因为它卡在理论科学和实验科学的中间
。