智谱GLM-5.3上线
GLM-5.3-Flash(“牛来”模型)是智谱GLM-5系列的首个原生多模态大模型,于2026年8月26日正式发布并开源。此前一周,它以 “Ox Alpha” 的匿名身份在海外平台OpenRouter和OpenCode上突然上线,因Ox意为“牛”,恰逢电影《牛来》走红,被中文开发者昵称为 “牛来大模型” 。
该模型在匿名测试期间便展现出惊人实力:上线首日即登顶OpenRouter并刷新单日用量纪录,在OpenCode上终结了DeepSeek长达56天的榜首位置。短短6天内,全球开发者累计使用了约62万亿Token,单日处理能力高达100万亿Token。
📊 性能与成本
规模与架构:总参数量320B(3200亿),激活参数仅18B(180亿),采用稀疏与线性注意力混合架构。
性能:在Artificial Analysis综合智能指数中拿下57分,与Claude Opus 4.8持平,编程和智能体任务表现出色。
成本:定价仅为Claude Opus 4.8的四十分之一,输入价格低至每百万Token 0.4元。
🚀 国产算力合作:10万张芯片的里程碑
此次合作最引人注目的,是智谱首次在大规模真实流量中全部使用国产芯片提供服务:
规模空前:智谱调用了超过10万张国产芯片集群支撑该模型的推理服务。
主要供应商:据媒体报道,供应商可能包括华为、摩尔线程和海光等公司。另有消息称,模型训练环节或依托了海光DCU等国产AI加速芯片集群。
验证成效:此次成功运行证明了国产芯片已具备高效、经济地支撑前沿模型大规模推理的能力。智谱还为国产加速器深度优化了SGLang推理引擎,使端到端性能提升3倍,单Token成本接近主流英伟达GPU水平。
GLM-5.3-Flash的发布,不仅展示了智谱在多模态大模型领域的技术实力,更通过“国模+国芯” 的组合,验证了国产算力支撑全球级AI应用的可行性
