智谱唐杰:万亿参数竞赛是全行业走过的一段弯路
唐杰复盘Scaling Law
智谱联合创始人唐杰发长文复盘Scaling Law,直言万亿参数竞赛是全行业一起走过的弯路。
参数迷信的由来
- 2020年,Kaplan等人提出Scaling Law,认为算力增加后参数应比数据增长更快
- GPT-3、Gopher、MT-NLG等模型沿此方向冲向万亿参数
转折点出现
- 2022年,Chinchilla实验发现参数过大但数据不足的问题
- 参数和数据应同步增长,万亿参数竞赛自此转向
新变量涌现
- 推理成本:模型上线后长期调用成本成为重要考量
- MoE架构:总参数与激活参数分离,简单堆参数甚至拖累推理
- 任务差异:记忆更吃参数,推理更吃数据
GLM-5.3验证新路径
唐杰以GLM-5.3为例,该模型与GLM-5.2共用同一基座和架构,总参数与激活参数未变,仅通过一个月后训练(扩大长程任务环境和强化学习)即实现能力提升。
结论:Scaling未结束,模型规模、预训练数据、算力投入和后训练深度均有空间,但每代模型瓶颈不同,加码方向需随之调整。下一轮竞争的关键不是参数数量,而是算力投向哪里。