9 月 17 日,智谱创始人兼首席科学家唐杰在社交平台发表长文并转发技术博客,公开了公司在递归自我改进方向上的首个工程化实践。由GLM-5.3 驱动的基础设施智能体 Infra Agent,在超过 10 万张国产芯片集群上从零参与搭建并优化了GLM-5.3-Flash 的生产级推理服务,不到两周把端到端吞吐提升到初始基线的 3 倍左右。
这项工作在此前需要一支资深基础设施团队花费数周完成。智谱把难点归为三处:国产芯片的内存容量与带宽相对受限,不能照搬成熟图形处理器生态的经验;软件栈尚不成熟,部分关键算子缺少现成实现,底层文档常常只能靠推测与验证;模型本身采用新架构,要同时处理文字、图像和 100 万 token 的超长上下文请求,缓存容量压力成倍放大。
解法是用软件能力补硬件短板。技术栈里融合了面向线性注意力与输出层的节点内张量并行、以重算换内存的策略、8 位权重与激活量化、INT8 与 FP8 和 BF16 的混合精度缓存量化,以及层分割等手段;在此之上引入编码、预填充、解码分离的架构,让推理的三个阶段各自调度。智谱称硬件利用效率与单 token 成本已经达到主流图形处理器的相当水平。
被反复强调的不是优化清单,而是反馈机制。系统给的端到端指标往往只有一句吞吐下降两成,说不出问题出在哪一层。智谱把正确性测试、运行日志、执行轨迹、运行时事件与微基准整合进迭代流程,形成被称为稠密反馈的分层验证体系,让智能体能够自己提出假设、修改代码、跑局部实验,再根据结果决定下一步验证什么。
技术博客给出了三个具体案例。长上下文场景中,智能体顺着执行链路发现某个内核默认采用较低的计算精度,导致误差在状态合并时累积,改为更高精度的组合算法后问题缓解;预填充与缓存传输无法重叠的场景里,它追查到跨语言边界处的线程锁没有释放;解码内核存在重复计算,它从优化模板库中匹配到相应方案后重构代码,取得约 1.7 倍的提升。
唐杰同时划出了边界:距离真正意义上的递归自我改进还很遥远,目标设定、边界划定与风险判断仍然由人类工程师负责,智谱也明确表示自己尚未实现完全自主的自我改进。他认为目前出现的是一个最小闭环,模型优化系统,系统再承载模型。行业层面,多家头部实验室也在公布类似进展,智能体参与自身研发工作的比例,正在成为观察这一方向的新指标。
申请创业报道,分享创业好点子。点击此处,共同探讨创业新机遇!
