智谱于 9 月 18 日正式推出大模型 GLM-5.3-FlashX,该模型的最高推理速度可达 200 tokens/s,旨在为企业和开发者提供更快、更流畅的模型体验。目前,GLM-5.3-FlashX 的 API 已经上线。根据介绍,为应对快速增长的用户需求,智谱在原有国产芯片算力基础上,进一步加大了对 Infra 方面的投入与推理优化。GLM-5.3-Flash 仍然保持同尺寸最强的智能水平,并具备极高性价比,此次提速进一步增强了其在智能、价格和速度上的全面竞争力。
据了解,智谱此前推出的 GLM-5.3-Flash 在正式发布前,以匿名模型「Ox Alpha」面向全球开发者进行了大规模测试,获得了广泛认可。上线后的调用量持续攀升,曾登顶 OpenRouter 平台使用量排行榜第一,同时创下 OpenCode 和 OpenRouter 双平台调用量新高。智谱表示,处理 GLM-5.3-Flash 所有线上调用请求共投入了 10 万颗国产芯片。
虽然未公开具体芯片厂商,但有行业分析师推测其大概率采用华为昇腾系列芯片。
智谱 GLM-5.3-FlashX 具备高效推理能力
在集群层面,智谱采用生产级 EPD 分离式架构,将多模态编码、prompt 预填充和逐 token 解码拆分为独立调度、独立扩缩容的工作池,端到端服务性能较初始基线提升三倍,硬件效率和单 token 成本已达到与主流英伟达 GPU 相当的水平。智谱方面表示,此次优化验证了国产芯片在大规模场景下高效、经济地支撑前沿模型的推理需求。

