智谱AI对外披露下一代大模型技术路线与交付目标。新模型将采用“大基座”架构,不再区分基础版与轻量版,单一权重同时覆盖从端侧推理到云端高并发的全场景需求;内部验收标准明确要求发布首日即可承接现有全部API流量,无需灰度爬坡或分批扩容。

大基座路线核心思路
过去业界普遍采用“大模型+蒸馏小模型”组合策略,以牺牲部分能力换取部署成本下降。智谱此次转向统一基座,主要基于三点判断:一是MoE稀疏激活机制已使单次推理算力消耗与稠密小模型持平;二是KV Cache压缩与投机解码技术成熟,长上下文服务延迟可控;三是企业客户对多版本维护、效果对齐的隐性成本敏感度超过显性算力支出。
新基座训练数据规模较上一代扩大3倍,其中合成数据占比提升至40%,用于强化代码、数学、多轮工具调用等弱项能力。模型结构引入动态路由与自适应计算深度,简单请求自动走浅层通路,复杂任务激活完整参数,实测平均FLOPs降低28%而基准分数未降。
发布即满规模的保障措施
为确保上线当日稳定承载峰值QPS,智谱同步推进三项工程准备:
- 推理集群预置: 在全国六个可用区提前部署专用GPU资源池,容量按历史峰值1.5倍预留,冷启动时间压缩至90秒内;
- 流量调度重构: 新版网关支持按Token粒度负载均衡,结合实时负载预测动态调整实例数,避免突发请求击穿单节点;
- 容灾演练常态化: 每周执行一次全量故障注入测试,验证跨AZ切换、降级熔断、缓存回源等预案有效性,RTO控制在30秒以内。
API定价维持不变,老用户无需修改调用参数即可无缝切换至新模型。控制台提供一键回滚开关,若新版本出现异常可在10秒内切回旧版权重。
开放节奏
新模型将于9月中旬开启定向内测,首批邀请200家高频调用企业参与压力验证;10月上旬公测,全量API密钥自动生效;11月正式发布并开源7B/14B两个适配端侧的衍生版本,主基座保持闭源商用。
© 版权声明
文章版权归作者所有,未经允许请勿转载。
相关文章
暂无评论...



