北京商报讯(记者 魏蔚)9月23日,北京商报记者获悉,百度智能云联合SGLang社区围绕多芯适配、上下文缓存、KV Cache优化、显存优化、MoE(混合专家模型)专家压缩和推理服务治理等话题,梳理出Agent(智能体)走向生产环境所需要的推理底座。
Agent时代,推理基础设施需要从底层硬件适配、计算效率优化到上下文管理进行系统性升级。要实现这一目标,面对超大模型部署,百度百舸通过权重零冗余分布式部署、显存占用优化和MoE专家压缩。在相关测试中,MoE专家压缩50%后,长输出和高并发场景下的输出吞吐峰值是原来的2.23倍。此外,百度百舸从流量、负载和集群缓存三个层面进行服务治理,通过动态调度、变长行为感知分桶和KV Cache无感热迁移,让请求进入更加合适的推理实例。同时,百度百舸构建多级缓存体系,并通过全链路命中率漏斗定位缓存损失环节。

暂无评论