StableLearn Logo

搜索内容

News 7 min read

“牛来”揭面:智谱 GLM-5.3-Flash 匿名期跑出 44 万亿 Token

匿名模型 Ox Alpha 身份揭晓:它来自智谱 Z.ai 的 GLM-5.3-Flash。免费预览期内,OpenCode 记录 50.3 万用户、1312 万完成会话和 44 万亿 Token。

Cover image for “牛来”揭面:智谱 GLM-5.3-Flash 匿名期跑出 44 万亿 Token

“牛来”终于揭面。

匿名模型 Ox Alpha 来自 Z.ai(智谱),是 GLM 系列的新版本,外界所称的 GLM-5.3-Flash。彭博援引 Z.ai 的确认报道,智谱同时计划释出模型权重。

身份之外,匿名期的使用数据更值得看。Ox Alpha 没有发布会、参数海报或模型卡,先以 stealth/ox-alpha 的名字在 OpenRouter 免费开放,随后进入 OpenCode 的代码工作流。代码库、终端任务和长上下文任务很快涌入,这场猜身份的游戏也变成了一次大规模实测。

截至 8 月 26 日,OpenCode 的公开数据页面记录:Ox Alpha 已有 50.3 万独立用户、1312 万完成会话、44 万亿 Token 使用量,Token 份额达到 10.6%

44 万亿 Token,匿名模型已经进了真实工作流

44 万亿 Token 是一个很难忽略的数字。它不是社交平台上的围观次数,而是已经进入实际工作流的模型调用量。

这 1312 万次完成会话发生在模型上线后的短时间内。OpenCode 上的 Token 份额已达到 10.6%,Ox Alpha 很快进入了平台最常用的模型之列。

免费预览是最直接的推力。OpenRouter 将 Ox Alpha 标为免费模型,OpenCode 的预览期也让开发者能把代码库交给 Agent 连续处理,而不是只做几轮聊天式试用。

网上流传的 每天 100 万亿 Token,指的是预览期对外给出的服务容量,不是已经消耗的实际用量。44 万亿 Token 才是公开页面记录的调用量,也更接近这次预览在真实工作流中的份量。

它给开发者的,不只是一个匿名入口

Ox Alpha 上线时给出的产品画像很明确:代码、长周期 Agent、复杂推理和生产工作流。

OpenRouter 页面列出的规格如下:

项目Ox Alpha 预览期信息
上下文窗口1,048,576 Token
最大输出131,072 Token
输入文本、图像、视频
定位编程、长程 Agent、复杂推理
价格免费预览

1M 上下文和 131K 输出放在代码场景里,意味着模型可以一次读进更大的仓库、更多文档和更长的 Agent 轨迹,而不必频繁删减上下文。对于需要反复读文件、跑命令、修错误、再执行验证的任务,这比普通聊天能力更有吸引力。

OpenRouter 的公开性能面板给出的中位数据是约 6 秒延迟、24 tokens/s 吞吐、100% uptime。它未必是最快的模型,但长上下文、多模态输入和免费预览放在同一个入口里,足以让开发者愿意拿复杂任务反复试。

身份是怎样被定位的?

智谱确认前,社区已经从 Ox Alpha 的技术细节里找到不少线索。

有人对比 tokenizer,发现它与 GLM-5.3 在多组 prompt 上出现稳定对应关系;有人拿受控视频测试输入 token 预算,发现其采样和缩放特征接近 GLM-5V-Turbo;还有人从异常参数的 API 报错格式里找到了相似痕迹。

这件事说明,模型的身份并不只藏在回答风格里。文风可以模仿,System Prompt 可以改;分词器、视频编码、上下文预算和服务层报错却更难伪装。

匿名发布没有把模型藏住,反而让社区用 token 计数、视频输入和异常请求,一点点拼出了它的技术指纹。

匿名预览,为什么能跑出这么大的量?

匿名、免费,再接入 OpenRouter 和 OpenCode,开发者不必等发布会,也不用先签付费套餐,就能直接把真实任务交给模型。调用量、会话完成情况和社区反馈会随之出现,比发布日的一张分数表来得更快。

这种方式并不轻松。服务容量、推理成本和异常流量都需要承担。OpenRouter 的预览说明也写明,请求与回复会由模型提供商保留。开发团队在把私有仓库交给匿名预览模型前,仍要先划清数据边界。

44 万亿 Token 不能直接替代能力测评,却记录了一批真实任务留下的使用痕迹。对于主打编码与长程 Agent 的模型,这种使用数据有自己的参考价值。

GLM-5.3-Flash 接下来要面对什么?

身份揭晓后,真正的考验才开始。

匿名期里,免费和神秘感会放大所有好评;进入正式发布阶段后,开发者会开始问更现实的问题:价格怎么定、开放哪些接口、权重如何获取、私有部署是否方便、长任务的稳定性究竟怎样。

GLM-5.3 的公开介绍把重点放在后训练 Scaling、复杂软件工程和长程 Agent 上。Ox Alpha 在 OpenCode 上跑出的使用量至少说明,在免费预览期间,开发者愿意把高频、重负载的编码任务交给它。

最后

“牛来”留下的,不只是一次匿名身份揭晓。它在数日内把一场模型预览推入全球开发者的真实工作流,并留下了 44 万亿 Token 的公开记录。

先把模型放进真实任务里,再让使用数据说话。这种发布方式的效果,已经很直观。

来源:

分享文章

更多文章