Tokenizer、動画エンコード、APIエラーまで徹底検証
衡宇 発凹非寺
量子位
世界中を騒がせている「牛来大模型」とは、いったいどこのモデルなのか?
この2日間、AI界隈ではその正体を徹底的に探る動きが続いている。
現在、最も有力視されているモデル提供元の候補は、智譜(Zhipu)とGoogleの2社だ。
智譜だと考える人々は、すでにTokenizerを検証し、動画トークンの消費量を測定し、APIエラーまで探し出している。まるでモデルのデジタルDNA鑑定を行うかのような勢いだ。
一方、Google説を唱える人々は、最近のDeepMind社員の発言や、いまだ正式発表されていないGemini 3.5 Proに注目している。
牛来大模型の正式名称は、Ox Alphaだ。
Oxは「牛」を意味するうえ、最近は「牛来」というネットミームが中国のインターネット上で広まっている。そのため、中国のネットユーザーは親しみを込めて、このモデルを「牛来大模型」と呼ぶようになった。
8月20日、Ox Alphaは匿名モデルとして突然OpenRouterに登場した。OpenRouterは、当面は匿名を維持する第三者プロバイダーから提供されているとだけ説明している。
コンテキスト長は104.86万トークン、1回あたりの最大出力は13.1万トークン。テキスト、画像、動画を読み取ることができ、コード、長期的なAgentタスク、複雑な推論に特化している。
さらにOpenCodeはその後、Ox AlphaをOpenCode Goに導入すると発表した。数日間にわたってほぼ無制限で無料利用でき、ユーザー本来のGo利用枠にもカウントされない(公開された議論では、1日あたり100兆トークン規模のサービス容量があるという話まで出ている)。
こうして開発者たちは、コードベースやターミナル、さまざまな難題を持ち寄り、Ox Alphaに次々と課題を与え始めた。
そして、口々にこう推測している。
牛来よ、牛来。いったいどこの大規模モデルなんだ?

なぜこの2社だと考えられているのか?
牛来大模型が智譜またはGoogleだと推測されているのは、中国語の深い理解、超長文コンテキストの処理、マルチモーダル融合において、この2社のモデルに見られる特徴を示しているからだ。
さらに、基盤レベルの実装の細部にも、両社と似た技術的な指紋が現れている。
なぜ智譜だと考えられているのか?
智譜は、この正体当てゲームにおける最有力候補だ。
ネットユーザーは、牛来大模型のTokenizerや動画のエンコード方式から、APIサービス層に至るまで、手がかりを掘り起こしている。
まずはTokenizerだ。
Tokenizerは、入力内容をモデルが処理できるトークンへ分割する役割を担う。モデルファミリーが異なれば、語彙や分割ロジックも異なることが多い。そのため、意図的に設計したテキストを入力すると、トークン数に比較的安定した「指紋」が残る。
あるテスターが、さまざまなPromptを使ってOx Alphaと複数のモデルを比較したところ、Ox AlphaとGLM-5.3のトークン数には非常に高い一致関係が見られた。
広く拡散されたテストの1つでは、中国語と英語、コード、絵文字が混在した同一のテキストについて、GLM-5.3とGLM-5.2はいずれも68トークンと計算したのに対し、Ox Alphaは143トークンと表示した。
余分な75トークンは、モデルの外部から追加された隠しSystem Promptによって、ちょうど説明できるという。
別のテスターが25種類の異なるPromptを使って検証したところ、同様の固定的な差分関係が確認された。
さらに興味深いのが、マルチモーダルの指紋だ。
テキストモデルであれば、蒸留や追加学習、System Promptによって、別のモデルの回答傾向を模倣できる。しかし、動画のエンコード方式やトークン予算は、マルチモーダル入力がモデルに入る前のエンジニアリング設計に関わる。
ある研究者は、条件を制御したテスト動画を4本用意し、それぞれをOx Alphaと複数のマルチモーダルモデルに入力して、システムが動画にどれだけの入力トークンを割り当てるかを調べた。
その結果、Ox AlphaとGLM-5V-Turboは、複数の特徴において非常によく似たトークン予算を示した。
具体的には、動画のフレームレートを変えてもサンプリング戦略はほとんど変わらないこと、動画の長さが増えるとトークン消費量が毎秒約147トークンのペースで増加すること、フレームごとの解像度の変化に応じたトークンの拡大方式も比較的似ていることなどが挙げられる。
4本の制御動画では、両者が測定した追加トークン予算が、項目ごとに一致するほどの結果さえ得られた。
比較対象となったMiMo、Qwen、GLM-4.6Vなどのモデルは、それぞれ異なる特徴を示した。
さらに、APIサービス層にも痕跡が残されている。
コミュニティでは、Ox Alphaにわざと異常なパラメーターを渡したところ、[1210] The temperature parameter is illegal に似たエラーメッセージを捕捉できたという報告がある。
同様のエラーコードやパラメーター制限、中国語と英語が混在したレスポンス形式も、智譜関連サービスとかなり似ていると考えられている。
さらに、モデルの推論出力から「trained by Z.ai」という残留情報を捉えたと主張するユーザーまでいる。
ただし、この情報は現時点ではコミュニティ上のスクリーンショットや二次的な伝聞が中心であり、前述のTokenizerや動画トークンのテストに比べて証拠としての信頼度は明らかに低い。現段階では、イースターエッグ程度に受け止めておくのが適切だろう。

さらに、「智譜説」を自然に感じさせる背景もある。
今年2月、OpenRouterは別の匿名モデル、Pony Alphaを公開した。当時も、ユーザーたちはその正体をめぐって長いあいだ推測を繰り広げた。
最終的にOpenRouterが明かした答えは、Pony AlphaがGLM-5の初期テスト版だったというものだった。
そのためOx Alphaを見た多くの人が、まずこう考えた。
智譜、また来たのか?
Googleが突然「牛の正体当て大会」の有力候補に
当初は智譜の手がかりが大きく先行していたが、この2日間で、展開はGoogleの方向へと急旋回した。
確かに、Ox Alphaが公開している製品像は、Geminiを連想させやすい。
100万トークン級の超長文コンテキスト、ネイティブな画像・動画入力、長期的なAgentタスクへの対応、複雑なコード開発やツール呼び出しの重視。これらはいずれも、Googleが過去数世代のGeminiで継続的に注力してきた分野だ。
そしてGoogleには、このタイミングで、いまだ正式発表されていないGemini Proが存在する。
今年のGoogle I/Oで、GoogleはGemini 3.5 Proについて「Coming next month」という見通しを示したが、その後、リリース時期は何度も延期された。現在に至るまで、外部では新たなGemini Proのフラッグシップモデルを待ち続けている。リリース時期や社内テスト、製品調整に関するリークも、これまでに何度も登場している。

特にこの2日間、GoogleやDeepMindの社員によるソーシャルメディア上の動きが、ネットユーザーの想像力を大いにかき立てている。
たとえば、Google DeepMindの研究者Evan Oteroは関連する議論の中で「Gemini」と投稿し、その後、「もしOx Alphaが、私たちがずっと出会ってきた友人だとしたら?」と発言した。

もちろん、この2つの発言はいずれも「Ox AlphaはGeminiだ」と明確に示したものではない。
しかし、ネット全体がモデルの正体を推測している状況のなかで、コミュニティではすぐに、これは一種の曖昧な匂わせ投稿だと解釈された。
Techmemeがまとめたソーシャルメディア上の議論では、最近、Geminiチームのメンバーが突然、Geminiや次世代モデルについて頻繁に語り始めたことに気づいた開発者も少なくない。そこから、牛来大模型をGemini 3.5 Pro、さらにはGemini 4と結びつける人まで現れた。
こうしてネット上では、瞬く間に2つの派閥に分かれた。
一方はTokenizerと動画トークンの請求データを手に、「これはどう見てもGLMだ」と主張する。
もう一方はDeepMind社員の投稿を指して、「Google、もう演技はやめろ」と言う。
現時点で、この説を裏付ける公開証拠は存在しない。しかしこれは、モデルの外部挙動だけから開発元を判断することが、ますます難しくなっていることも示している。
特に、蒸留、モデル融合、追加学習、第三者による推論サービスが一般化するにつれて、「誰がモデルを訓練したのか」と「モデルがどこにデプロイされているのか」は、そもそも別々の問題になり得る。
無料の牛一頭が、世界中のプログラマーを引き寄せた
正体当ての謎をいったん脇に置いても、牛来大模型そのものが十分に話題性を備えている。
まずはスペックだ。
100万トークンのコンテキストがあれば、理論上は1回のPromptに、大規模なコードリポジトリ全体や数百ページのドキュメント、あるいは長時間にわたるAgentの実行ログを詰め込める。
最大出力131Kも、一般的なチャット用途の水準をはるかに上回る。
さらに画像・動画入力、ツール呼び出し、強制推論モードにも対応している。Ox Alphaは当初から、コードAgentや長期的なタスクを主なターゲットとしている。
OpenCodeが公開したデータによると、牛来大模型はすでに累計250Bトークン規模で利用されており、独立ユーザー数は約8,500人、完了したセッション数は11万回を超えている。
Stripe CEOのPatrick Collisonも実際に試用した後、「It’s very impressive.」とコメントした。
小規模なコードテストの結果が、さらにOx Alphaを注目の的へと押し上げた。
実際のソフトウェアエンジニアリングタスク10問で構成されたコミュニティテストでは、Ox Alphaは8問を完了し、80%の結果を得た。
同じタスクセットでは、Fable 5が65%、GLM-5.3が62%、GPT-5.6 Solが52%だった。

ただし、これはわずか10問を対象にした小規模なコミュニティテストにすぎず、公式Benchmarkではない。Ox Alphaの総合能力がこれらのフラッグシップモデルを上回ったことを証明するには、到底不十分だ。
一方で、反対意見も少なくない。
Abacus.AIのCEO、Bindu Reddyは、テストの結果、Ox Alphaの性能は期待を下回ったと公に述べている。一部の指標では、比較的初期世代のモデルと同程度にとどまったという。
ウォートン・スクール教授のEthan Mollickも、「そこまで驚くほどではないかな」といった趣旨の感想を示した。

また、自分たちのプライベートBenchmarkでテストした開発者の中には、推論強度が低い場合の性能は平均的だと評価する人もいる。視覚タスクでは、Geminiシリーズより明らかに弱いと感じたという報告もある。
したがって、現時点でOx Alphaを最も正確に表現するなら、次のようになるだろう。
一部のコードおよびAgentタスクで非常に目覚ましい性能を発揮し、極めて大胆なスペックを備える一方、評価結果には大きなばらつきがある匿名モデル。
無料であることに加えて、謎に包まれた正体が、さらなる注目を集めるバフを与えている。
One More Thing
別の冗談として、Cursorが智譜のモデルを使って独自に再トレーニングした可能性もあるという見方もある。
そして、牛の頭をかぶせた、とか(?)
答えが明らかになるまで、それほど長くはかからないだろう。
なにしろ、OpenRouterで最近登場したAlphaモデルの展開を見る限り、匿名期間が終われば、誰かが牛を連れて帰ることになるはずだ。
モォー。
参考リンク:
[1]
https://openrouter.ai/api/v1/models
[2]
https://opencode.ai/docs/zen/
[4]
https://www.businessinsider.com/ox-alpha-ai-model-mystery-2026-8
[5]
https://openrouter.ai/models?fmt=cards&input_modalities=video&q=amazon