唐杰复盘Scaling Law

智谱联合创始人唐杰发长文复盘Scaling Law,直言万亿参数竞赛是全行业一起走过的弯路。

参数迷信的由来

  • 2020年,Kaplan等人提出Scaling Law,认为算力增加后参数应比数据增长更快

  • GPT-3、Gopher、MT-NLG等模型沿此方向冲向万亿参数


转折点出现

  • 2022年,Chinchilla实验发现参数过大但数据不足的问题

  • 参数和数据应同步增长,万亿参数竞赛自此转向


新变量涌现

  • 推理成本:模型上线后长期调用成本成为重要考量

  • MoE架构:总参数与激活参数分离,简单堆参数甚至拖累推理

  • 任务差异:记忆更吃参数,推理更吃数据


GLM-5.3验证新路径

唐杰以GLM-5.3为例,该模型与GLM-5.2共用同一基座和架构,总参数与激活参数未变,仅通过一个月后训练(扩大长程任务环境和强化学习)即实现能力提升。

结论:Scaling未结束,模型规模、预训练数据、算力投入和后训练深度均有空间,但每代模型瓶颈不同,加码方向需随之调整。下一轮竞争的关键不是参数数量,而是算力投向哪里。