分享
一个产品经理读完200篇AI论文后,看见了别人看不见的边界
输入“/”快速插入内容
一个产品经理读完200篇AI论文后,看见了别人看不见的边界
用户4242
用户4242
8月1日修改
🔗 原文链接:
https://mp.weixin.qq.com/s/jtjJ0lDo...
原创 向阳乔木 向阳乔木 AI不插电
2026年7月31日 09:14 北京
张小珺的播客都很优秀,但我经常会回听这一期播客,对于理解大模型发展很有帮助,常听常新。
https://www.xiaoyuzhoufm.com/episode/68ff9d1b083a71a4eb86c52c
谢青池在豆瓣做产品的时候,曾经系统读过城市规划和建筑学的论文。
那是为了做一个叫"阿尔法城"的社区产品,他把杨盖尔的著作翻了个遍,从城市规划的历史脉络里找社区治理的灵感。
2022年,他开始用同样的方法对付AI论文。
两年下来,读了200多篇,存档几百篇。
他不是技术出身,本科和研究生读的是计算机,但毕业就去做产品了,中间九年都在创业。
他说他读论文,是因为
产品经理的工作本质是在给定边界里求最优解,而边界变了,最优解就变了
。
他想搞清楚这个新世界的边界在哪里。
先解决语言问题,再解决学习问题
一开始他直接读英文原文,读了一周发现不对——他不是在学AI,他在学英语。
解决方法是沉浸式翻译。
随着大模型翻译能力越来越强,这个工具现在已经能把论文翻得相当流畅。
他的建议是:
这个时代,语言障碍基本可以用AI消掉,文字部分已经不是问题,再过一两年,语音部分大概也不会是问题了
。
工具之外,他推荐了几个系统性的学习路径:
视频
:吴恩达的机器学习和AI课程、李宏毅教授的机器学习(B站有完整授权版)、Andrej Karpathy的YouTube频道、李沐老师的论文精读系列、3Blue1Brown的数学和神经网络系列、王木头学科学、周米的GPU和网络讲解。
书籍
:《一站式LLM底层技术原理入门指南》(开源文档)、《动手学深度学习》(PyTorch版,李沐参与编写,有配套视频)、《深度学习中的数学》(适合补概率论基础)。
他特别提到:
英文内容在AI领域的质量比中文高很多,现在已经不需要被语言挡住了
。
他用三个视角读论文
谢青池说,读论文最难的不是读不懂某个技术点,而是不知道为什么要这么做。
每篇论文的作者,其实都在解决一个具体问题。
只是时间过去了,当时的历史背景逐渐淡化,后来的读者就找不到那个"为什么"了。
他整理出三个视角:
历史视角
:当时的行业碰到了什么问题,作者怎么解决的,对后续技术路线产生了什么影响。
范式变迁视角
:我们并非从零开始发现世界,而是在原有范式的框架里前行。旧范式碰到瓶颈,或者支线范式突然崛起,才会发生范式跃迁。
人的视角
:这些作者是怎么登上舞台的,他们在后续进展中扮演了什么角色。
他把这套框架用来梳理深度学习的发展史,从GPU的诞生讲到多模态模型,串起来的不只是技术,还有一群人的选择和命运。
GPU:从游戏显卡到AI基础设施
1999年,英伟达发布第一颗能独立处理三维图像几何计算的GPU。
2001年,GeForce 3引入了可编程的顶点着色器和像素着色器,GPU第一次可以被编程了。
2004年,一篇叫《Brook for GPUs》的论文出现了。作者Ian Buck和他的导师Pat Hanrahan做了一件事:把给超级计算机用的Brook语言移植到GPU上,开发了一套高级编程语言,把GPU抽象成流式处理器,引入了流、核函数、规约等基本框架,设计了编译器和运行时体系。
这就是CUDA的前身。
Ian Buck毕业后加入英伟达,至今仍是CUDA负责人。他的导师Pat Hanrahan后来凭借计算机图形学贡献获得2019年图灵奖,同时是皮克斯动画工作室创始员工之一,拿过三次奥斯卡,还创立了BI软件Tableau,2019年被Salesforce以157亿美元收购。
老黄为了推CUDA,在GPU性能没有提升的情况下把成本几乎翻了一倍,股票跌到地上,差点被恶意并购。他坚持了大约十年,才等到2012年AlexNet让全世界知道GPU能干这么重要的事情。
那时候英伟达对GPU的设想里,根本没有AI。
他们最大的野心是图像边缘检测和矩阵运算。
AlexNet:深度学习的起点
2012年,Alex Krizhevsky、Ilya Sutskever、Hinton三个人写了一篇论文,开启了深度学习时代。
背景是李飞飞团队创建的ImageNet数据集:1400多万张标注图像,2万多个类别。从2010年开始举办图像识别竞赛,第一届只有13支队伍,第二届7支,第三届6支,眼看就办不下去了。
第三届,也就是2012年,发生了很大的变化。
在这之前,整个领域被手工特征提取的方法主导。Ilya在论文里写道:所有人都认为视觉系统需要对任务本质的详细理解来精心进行手工设计,只向神经网络展示数据、不提供人的抽象,网络永远无法解决图像分类任务。
AlexNet同时scale了三件事:数据(得益于ImageNet)、计算量(得益于Alex搞定了GPU)、模型规模(6250万参数,65万神经元,约0.06B,在当时是巨大的神经网络)。
它比第二名好出十几个百分点,吸引了整个行业的注意。Google随后参与了竞购,余凯老师也在场。他对伊利亚的第一印象是"夸夸其谈",对Alex的印象是"靠谱、少言、能搞定GPU"。