智谱GLM-5.3自优化推理系统,端到端吞吐提升3.2倍
核心进展
智谱披露,GLM-5.3 驱动的 Infra Agent 已参与优化 GLM-5.3-Flash 推理系统。从首次跑通到承接全部生产流量,用时不到两周,端到端吞吐提升至最初的 3.2 倍。
关键突破
联合创始人兼首席科学家唐杰指出,Agent 卡点不在写代码,而在定位问题。一次修改令吞吐下降 20%,Agent 知道改坏却无法定位层级。
智谱将资深工程师的排查方法工具化,让 Agent 自检结果、归因耗时、对比方案并迭代修改。借此发现长上下文计算误差、KV 传输阻塞、解码 kernel 重复计算等问题,单个 kernel 重写后提速 1.71 倍。
角色变化
唐杰判断,工程师将转向"设计反馈的人"——定目标、设边界、审核高风险修改,Agent 负责提假设、改代码、跑实验。完整 RSI 尚远,但"模型优化系统,系统服务模型"的最小闭环已经出现。