Tokenizer、视频编码、API 报错全扒一遍
衡宇 发自 凹非寺
量子位
全世界刷屏的“牛来大模型”,到底是谁家的牛?
这两天,AI 圈已经快把它扒了个底朝天。
目前,讨论度最高的模型厂商候选人,一是智谱,二是谷歌。
猜智谱的人已经开始验 Tokenizer、测视频 token 消耗、找 API 报错,恨不得给模型做一套数字 DNA 鉴定。
猜谷歌的人则主要盯着 DeepMind 员工最近的发言,以及那个迟迟没有正式露面的 Gemini 3.5 Pro。
牛来大模型其实叫 Ox Alpha。
因为 Ox 就是“牛”,又正赶上最近“牛来”梗火遍互联网,国内网友干脆给它起了个亲切的名字,叫“牛来大模型”。
8 月 20 日,它突然以匿名模型的身份出现在 OpenRouter 上。OpenRouter 只说它来自一家暂时保持匿名的第三方提供商。
它拥有 104.86 万 token 上下文,单次最多输出 13.1 万 token,能读取文本、图片和视频,专门面向代码、长周期 Agent 和复杂推理。
而且,OpenCode 随后宣布,Ox Alpha 上线 OpenCode Go,连续数天几乎不限量免费使用,而且不计入用户原本的 Go 额度(公开讨论中甚至出现了每天 100 万亿 token 级别服务容量的说法)。
于是,开发者们拿着代码库、终端和各种刁钻任务,一拥而上去给它出题。
然后纷纷猜测:
牛来啊牛来,你到底是谁家的大模型?

为啥猜是这两家的?
大家之所以猜牛来大模型是智谱或谷歌,是因为它在中文深度理解、超长上下文处理或多模态融合上,展现出了这两家公司的模型特色。
而且,在底层工程细节上,它也暴露出了相似的技术指纹。
为啥猜是智谱的?
智谱是这场猜谜游戏中的领先热门。
网友已经从牛来大模型的分词器、视频编码方式,一路扒到了 API 服务层。
先来看 Tokenizer。
Tokenizer 负责把输入内容切分成模型能够处理的 token。不同模型家族往往采用不同的词表和切分逻辑,所以面对一些刻意设计的文本时,token 数量会留下较为稳定的“指纹”。
有测试者拿不同 Prompt 对 Ox Alpha 和多款模型进行比较,结果发现,Ox Alpha 与 GLM-5.3 的 token 计数呈现出高度一致的关系。
一组流传较广的测试中,同样一段混合了中英文、代码和 emoji 的文本,GLM-5.3 与 GLM-5.2 都计算出 68 个 token,Ox Alpha 则显示为 143 个。
多出来的 75 个 token,恰好能够由模型外部附加的一段隐藏 System Prompt 解释。
另有测试者使用 25 组不同 Prompt 进行验证,也观察到了类似的固定偏移关系。
后面的多模态指纹更有意思。
文本模型可能通过蒸馏、后训练或者 System Prompt,模仿另一款模型的回答习惯;但视频编码和 token 预算,却涉及多模态输入进入模型前的工程设计。
有研究者专门制作了 4 段受控测试视频,然后分别交给 Ox Alpha 和几款多模态模型,观察系统为视频分配多少输入 token。
结果显示,Ox Alpha 和 GLM-5V-Turbo 在多项特征上出现了高度相似的 token 预算。
其中包括:视频帧率变化后,采样策略基本不受影响;视频时长增加时,token 消耗约以每秒 147 个 token 的速度增长;每帧分辨率变化对应的 token 缩放方式也较为相似。
在 4 段控制视频上,两者测出的额外 token 预算甚至能够逐项对上。
测试中拿来比较的 MiMo、Qwen 和 GLM-4.6V 等模型,都呈现出了不同特征。
此外,还有API 服务层留下来的蛛丝马迹。
社区有人故意给 Ox Alpha 传入异常参数,捕捉到了类似 [1210] The temperature parameter is illegal 的错误信息。
类似的错误码、参数限制以及中英文混排的返回方式,也被认为与智谱相关服务存在较高相似度。
甚至还有用户声称,在模型的推理输出中捕捉到过“trained by Z.ai”这样的残留信息。
不过,这一条目前主要来自社区截图和二手转述,证据等级明显低于前面的 Tokenizer 和视频 token 测试,现阶段更适合当作彩蛋来看。

还有一个背景,让“智谱说”显得更加顺理成章。
今年 2 月,OpenRouter 曾经上线另一款匿名模型 Pony Alpha,当时大家也围着它猜了半天。
最后,OpenRouter 揭晓答案:Pony Alpha 就是 GLM-5 的早期测试版本。
所以看到 Ox Alpha 以后,不少人的第一反应就是——
智谱,你又来了?
谷歌突然成“认牛大会”热门人选
原本智谱的线索一路领先,结果这两天,剧情又拐向了谷歌。
的确,Ox Alpha 公开出来的产品画像,确实容易让人联想到 Gemini。
1M 级超长上下文、原生图像和视频输入、面向长期 Agent 任务、强调复杂代码工程和工具调用,这些都是 Google 过去几代 Gemini 持续重点投入的方向。
而谷歌此时恰好还有一款迟迟没有正式公布的 Gemini Pro。
今年 Google I/O 期间,谷歌曾经给出 Gemini 3.5 Pro“Coming next month”的预期,后续发布时间一拖再拖。直到现在,外界依旧在等待新的 Gemini Pro 旗舰型号。关于它的发布节奏、内部测试和产品调整,也出现过多轮爆料。

主要是 Google 和 DeepMind 员工这两天的社交媒体动态,也开始疯狂给网友提供想象空间。
例如,Google DeepMind 研究员 Evan Otero 在相关讨论中发了“Gemini”,随后又说了一句:“如果 Ox Alpha 就是我们一路遇到的朋友呢?”

当然,这两条发言都没有明确表示“Ox Alpha 就是 Gemini”。
但放在全网疯狂猜模型身份的背景下,很快被社区解读为一次 vague posting。
Techmeme 汇总的社交媒体讨论中,还有不少开发者注意到,近期 Gemini 团队成员突然密集谈论 Gemini 以及下一代模型。也有人因此把牛来大模型与 Gemini 3.5 Pro,甚至 Gemini 4 联系起来。
于是,网上迅速分成两派——
一派拿着 Tokenizer 和视频 token 账单喊:“这明明就是 GLM。”
另一派指着 DeepMind 员工的帖子说:“Google,你别演了。”
目前,没有公开证据能够支持这种说法,但这也说明,仅凭模型外部行为判断开发者身份越来越困难。
尤其在蒸馏、模型融合、后训练以及第三方推理服务越来越普遍以后,“模型是谁训练的”和“模型在哪里部署”,甚至都可能是两道题。
一头免费牛,把全世界程序员都吸引过来了
抛开身份谜题,牛来大模型自己也足够有戏。
首先是规格。
1M 上下文意味着,一次 Prompt 理论上能够塞进去整个大型代码仓库、数百页文档,或者一长串 Agent 运行记录。
131K 最大输出也远超普通聊天场景。
再加上图片和视频输入、工具调用以及强制推理模式,Ox Alpha 从一开始瞄准的就是代码 Agent 和长周期任务。
目前,OpenCode 公开数据显示,牛来大模型已经累计出现 250B token 级别的使用量,拥有约 8500 名独立用户和超过 11 万次完成会话。
Stripe CEO Patrick Collison 亲自上手试用后也表示:“It’s very impressive.”
一些小规模代码测试,更把它推上了风口。
一项包含 10 个真实软件工程任务的社区测试中,Ox Alpha 完成了 8 个,得到 80% 的结果。
同一组任务中,Fable 5 为 65%,GLM-5.3 为 62%,GPT-5.6 Sol 为 52%。

需要强调的是,这只是 10 道题的小样本社区测试,不属于官方 Benchmark,也远远不足以证明 Ox Alpha 的综合能力已经超过这些旗舰模型。
而另一边,唱反调的人也不少。
Abacus.AI CEO Bindu Reddy 公开表示,他们测试后发现 Ox Alpha 表现低于预期,一些指标只达到较早一代模型左右的水平。
沃顿商学院教授 Ethan Mollick 也表示,惊艳程度一般般啦~

还有开发者拿自己的私有 Benchmark 测试后认为,它在低推理强度下表现一般;在视觉任务中,也有人发现它明显弱于 Gemini 系列。
所以,眼下对 Ox Alpha 最准确的描述,可能还是——
一款在某些代码和 Agent 任务中表现极为亮眼、规格极其激进,同时评测结果分歧也极大的匿名模型。
免费,再加上神秘身份,给它额外套了一层流量 Buff。
One More Thing
另一种调侃称,也有可能是 Cursor 拿智谱模型自己训了一遍。
然后套了个牛头(?)
至于答案,大概率不会藏太久。
毕竟按照 OpenRouter 最近几次 Alpha 模型的剧情发展,匿名期结束之后,总得有人出来牵牛回家。
哞——
参考链接:
[1]
https://openrouter.ai/api/v1/models
[2]
https://opencode.ai/docs/zen/
[4]
https://www.businessinsider.com/ox-alpha-ai-model-mystery-2026-8
[5]
https://openrouter.ai/models?fmt=cards&input_modalities=video&q=amazon