分享
AI 行业大事记 2509
输入“/”快速插入内容
🧭
AI 行业大事记 2509
用户8030
用户8030
2025年9月24日修改
🔗
原文链接
:
https://mp.weixin.qq.com/s/9LiQPJVZEEuQ1AEC-A1gPQ?scene=1
📝
联合出品
:
Jomy
X
南乔
X
大聪明
🍺本期收录:2025 年 8 月 AI 行业大事
97
件
✦ ✦ ✦
👀 趋势观察
1. 语言模型
✦ 8 月可谓语言模型的集中更新月:OpenAI 发布了 GPT-5 和开源的 GPT-OSS 系列,Claude 上线 Opus-4.1,DeepSeek 推出混合推理模型 V3.1;腾讯、字节、智谱、面壁智能等国内厂商也接连发布了各类开源模型。
✦ 然而,
这些新模型的问世,并未给 AI 行业带来质的变化
——它们更多只是让现有产品在体验上「好用了一点」。模型能力提升带来的边际价值,正持续递减。
✦ 在新的技术范式出现之前,
如何有效降低推理成本,或将成为整个行业的重要趋势
。尤其是在垂直领域,针对特定任务的小参数模型,其潜力依然远未被充分挖掘。
2. 图像
✦ Qwen-Image 刚问世不久,风头便被 Nano-Banana(Gemini-2.5-Flash-Image-Preview)抢走。后者在图像一致性上的进步,
几乎真真切切地「杀死」了过去大部分的 ComfyUI 工作流。
如果说 gpt-image-1 还只是个「玩具」,那么 Nano-Banana 已经具备了作为生产力工具的实力。
✦ 按这个节奏推测,
国产模型大概率会在一个月内追平
。届时,图片编辑领域将被 AI 完全接管——门槛降至极低,甚至可能免费普及。
✦ 我们或将迎来这样一个互联网:90% 的图片都由 AI 生成,
摄影与设计的传统界限将被彻底重塑
。
3. 视频
✦ 本月一个明显的趋势是,
数字人模型更新与开源的速度明显加快
,但基础视频模型变化不大。
✦ 可以预见,
数字人技术的成熟也会催生出海量的 AI 商品讲解员与 AI 主播
,但问题是——在屏幕另一端的我们,真的想看那么多数字人吗?
4. 音频
✦ 音频领域有点像几个月前的图像领域的状态 —— 缓步前进。
AI 音频生成其实还是存在一些小瑕疵——情绪控制、音色一致性、多语种的自然度等
。
✦ 正如 Nano-Banana 的出现带来的变革,音频领域的这些问题被完全解决后,可能会诞生一些我们现在没有想象到的应用。
5. 3D
✦ 3D 领域可以分为两个方向来看:
单物体生成
和
世界生成
。
✦ 单物体生成持续在往更精细的工业化生产进步。
✦ 世界生成又分化为了 2 个派别:一个本质是
视频生成(例如 Genie3)
,一个本质是
3D 生成(例如 Hunyuan-World)
。
近几个月,这两个方向都有了不小的进展
,但最终哪条道路能够胜出,仍难下定论。
6. 具身智能
✦ 人形机器人的进展依旧缓慢,其「大脑」——核心模型尚未成熟。
✦
英伟达 Jetson Thor 开发套件揭示了它的本质:一台会走路的 AI 一体机
。而以现有的硬件参数来看,当前的 AI 算力仍不足以支撑一台人形机器人的全部需求。
7. Agent
✦ 通用 Agent 正在向多 Agent 协作的方向演进。通俗来说,就是
让不同垂直的 Agent 以串行和并行的方式,共同解决同一个问题
。
✦ 前两个月还颇为火热的 AI 浏览器赛道,本月却明显降温。值得注意的是,
Claude 选择推出的是浏览器插件,而非完整浏览器
。作为头部模型厂商,这一取舍是否会对其他厂商的战略方向产生直接影响,值得观察。
8. Coding
✦ AI Coding 领域本月呈现出三个值得关注的趋势:
✦
Coding Agent 云端化
——如 OpenAI Codex,以及本月推出的 Open SWE。