智谱发布GLM-5.3-FlashX模型,推理速度最高可达200 tokens/s

【太平洋科技快讯】据智谱官方消息,9月18日,GLM-5.3-FlashX模型正式上线,最高推理速度可达200 tokens/s。

上个月,智谱推出的模型GLM-5.3-Flash,曾以“Ox Alpha”代号面向全球开发者测试(详情可查看此前太平洋科技的报道内容:),收获海内外开发者较多认可,接口调用规模持续走高。GLM-5.3-Flash在同规格模型当中保持不错的能力表现,同时拥有较高性价比。

伴随业务需求快速上涨,智谱依托10万张国产芯片构建的推理算力底座,持续加大基础设施投入,同时开展推理层面的深度优化工作。

今日,智谱正式推出新模型GLM-5.3-FlashX,API接口已经全面对外开放,面向企业以及开发者提供响应速度更佳的大模型服务。新模型在原有基础之上完成速度升级,在模型能力、访问速率、服务定价维度形成综合竞争实力。据介绍,GLM-5.3-FlashX推理速度相比GLM-5.3-Flash提升5倍,定价上调至原版本的2.5倍。返回搜狐,查看更多

阅读 ()
平台声明
该文观点仅代表作者本人,搜狐号系信息发布平台,搜狐仅提供信息存储空间服务。