コンテンツにスキップ
メインサイト ニュース コンソール

謎の「牛来」モデル、やはりZhipuだった!GLM初のネイティブマルチモーダル、国産カードも採用

· 量子位
国内AI

< img id=“wx_img” src=“https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png” width=“400” height=“400”>

2026-08-27
00:48:12
出典:[量子位](https://www.qbitai.com/)
GLM-5.3 Flash
>

金磊 凹非寺より

量子位 | 公式アカウント QbitAI

ついに、ここ数日ネット上で大きな話題となっていた謎のモデル**「牛来」**(Ox Alpha)の正体が明らかになりました!

しかも、やはり中国のプレイヤーでした——

智譜(Zhipu)が先ほどリリースし、即座にオープンソース化したGLM-5.3 Flashです。しかも、GLM-5シリーズで初めてネイティブマルチモーダルに対応したモデルです。

「牛来」が盛り上がっていたこの数日の間に、実はすでに多くの人がOx Alpha版を使って実際に試していました。

なかでも特に多かったのが、SpaceXのRaptorロケットエンジンの3DインタラクティブWebページを手作業で作らせるという使い方です。

たとえば、ブロガーのTim Jayasは、数日を置いて同じPromptで「牛来」にこのタスクを2回実行させた後、次のような感想を投稿しました。

「牛来」は、自ら継続的に学習できるモデルのように感じる。

奇遇にも、私たちもGLM-5.3 Flashの内部テスト資格を入手し、同じプロジェクトを試してみました。Promptを入力した後は、最後まで一切操作する必要がありませんでした。

しばらく待つと、3D Raptorエンジンのプロジェクトが完成しました。その仕上がりをご覧ください。

動画はこちら:

https://mp.weixin.qq.com/s/wNQAWeUacfB8a1F_kQZe_g

結果を比較してみると、言うまでもなく、GLM-5.3 Flashが作成した3D Raptorエンジンは、さらに洗練されたものになっています。

では、なぜ「牛来」モデルはこれほど話題になったのでしょうか?

各公式アカウントの投稿を見るだけでも、その理由の一端がうかがえます。

たとえばOpenRouterでは、「牛来」が初日からランキング首位に躍り出ただけでなく、1日あたりのトークン使用量の過去最高記録も更新しました。

OpenCodeは、Ox Alphaが登場した瞬間、DeepSeekがOpenCodeで56日連続首位を維持していた記録を終わらせたと発表しています。

そして智譜が正式に「牛来」の正体を明かした後、GLM-5.3 Flashにはほかにも注目すべき特徴があることが分かりました。

モデルサイズについては、GLM-5.3 Flashはわずか320Bですが、性能面ではパラメータ数753BのGLM-5.2を全面的に上回っています。

さらに、最新のAAランキングによると、GLM-5.3 Flashはすでに57点を獲得。世界的に見てもフロンティアモデルの仲間入りを果たしており、Claude Opus 4.8と同点です。

価格については、GLM-5.3 Flashの料金は5.3版の1/10。期間限定割引を適用するとGLM-5.3の1/20、Opus 4.8の1/40で、DS-V4-Flashよりも安価です。

そして、もう一つ誇るべきことがあります——

先ほど触れた62Tトークンは、すべて中国製チップ上で処理されていました! 海外勢が1か月にわたって追い続けた謎のモデルは、純血の中国産「牛」だったのです。

それではここから、恒例の徹底実測に入りましょう。

智譜GLM、ついに目を手に入れる

先ほど述べたとおり、智譜のGLM-5.3 Flashは、5シリーズで初めてネイティブマルチモーダルに対応したモデルです。

そこで第1弾の実測では、マルチモーダル機能を中心に検証しました。

まず、複数人が話している動画をGLM-5.3 Flashに与え、元の動画をもとに話者を区別し、正確に字幕を付けさせました。

Promptは以下のとおりです。

まず異なる話者を識別し、人物ごとのカラー表示とカラオケ風の追従効果を兼ね備えた字幕を作成してください。人物の背景色は固定し、現在読まれている単語やフレーズをさらにハイライトします。配色には、シアンブルー、ウォームイエロー、コーラルレッド、ホワイトによる高コントラストな組み合わせを使用し、現在の単語は低輝度から明るいハイライト色へ滑らかに遷移させてください。メインスピーカー、司会者、短時間だけ発言する割り込み話者を区別し、BGM、拍手、環境音としての人の声は話者として個別に扱わないでください。字幕は最終的なタイムラインに基づいて再アラインメントし、編集後のどのクリップにも元動画の古い時間位置をそのまま使用してはいけません。まず動画全体を確認してから判断し、冒頭のサンプルだけを根拠に後半の構成を推測しないでください。編集点は自然に保ち、話し声の聞き取りやすさを最優先してください。字幕は画面のセーフエリア内に配置し、複雑な背景でも読みやすいよう、縁取りや背景板を使用してください。

このタスクは、モデルのマルチモーダル処理能力が大きく問われます。まず動画の内容を理解し、人物と音声を対応させ、何より字幕を正確に付けなければなりません。

それでは、GLM-5.3 Flashの結果を見てみましょう。

動画はこちら:

https://mp.weixin.qq.com/s/wNQAWeUacfB8a1F_kQZe_g

注目すべき点の一つは、GLM-5.3 Flashが画面内に一度しか登場しなかった「ネームタグ」まで捉え、それを手がかりに音声、名前、人物の関係を対応付けられることです。

このことからも、GLM-5.3 Flashのこのタスクにおけるマルチモーダル能力は、十分に合格点に達していると言えるでしょう。

字幕付けは少し簡単すぎると感じるなら、次はGLM-5.3 Flashに中国の名作映画『神話』を1本丸ごと“食べさせ”、映画解説動画を直接作らせてみます。

Promptは以下のとおりです。

この完全版の映画を、中国語の映画解説動画1本に編集してください。メインストーリーと人物関係を整理し、重要な対立や感情の転換を強調してください。解説内容が原作映画と一致するようにし、ナレーション音声と中国語字幕も生成してください。

完成した動画を見てみましょう。

動画はこちら:

https://mp.weixin.qq.com/s/wNQAWeUacfB8a1F_kQZe_g

先ほどの字幕付けと比べると、今回GLM-5.3 Flashが“見る”動画はより長く、作品全体のストーリーを把握したうえで、重要かつつながりのある場面を切り出す必要があります。

最終結果を見る限り、GLM-5.3 Flashは映画解説の裏側にある一連の重要な工程を自ら理解して実行できており、仕上がりも十分に合格水準に達しています。

次はマルチモーダルに加えて、コーディング能力も組み合わせて検証してみましょう。

大まかなタスクは、まずGLM-5.3 Flashに完成したプロダクトデザイン案を1枚与え、その画像をもとに、実際に操作できるプロダクトのUIを作らせるというものです。

用意したデザイン案はこちらです(上下にスクロールして全体を確認できます)。

Promptは次のとおりです。

このUIデザイン案に従って、完全なモバイル向けショッピングアプリを実装してください。元のデザインの配色、フォント、画像、カード、ページレイアウトを可能な限り再現し、画像に示されている主要ページとショッピングフローを、実際に操作できる形で実装してください。ホーム/発見、商品一覧、絞り込み、商品詳細、レビュー、お気に入り、カート、配送、住所、決済、注文完了、店舗マップ、マイページ、設定などの機能を実装してください。

最終的なインタラクションの様子を見てみましょう。

動画はこちら:

https://mp.weixin.qq.com/s/wNQAWeUacfB8a1F_kQZe_g

今回も、連続する一連の機能がPromptの指示どおり、スムーズに操作できます。

さらに複雑なタスクとして、智譜の公式が公開した、GLM-5.3 Flashを単独で12時間稼働させた後の3D Blenderシーン構築の結果もあります。

動画はこちら:

https://mp.weixin.qq.com/s/wNQAWeUacfB8a1F_kQZe_g

つまり、現在のGLM-5.3 Flashは、十分な時間を与えさえすれば、低価格で複雑なタスクを自力で最後までやり遂げられるということです。

アーキテクチャも完全刷新

実測結果を見たところで、こんな疑問を持つ人もいるでしょう。

なぜ320Bのモデルで、これほどの結果を出せるのでしょうか?

その答えは、「Flash」という名前の裏側に隠されています。

今回、智譜はモデルアーキテクチャそのものから効率化に取り組みました。

GLM-5.3 Flashの総パラメータ数は320Bですが、実際に活性化されるパラメータはわずか18B。層数もGLM-4.5時代の92層から45層へと削減されています。しかし、スリム化したにもかかわらず、性能はより大規模な前世代のGLM-5.2を上回りました。さらに最新の30Tトークンによるマルチモーダル事前学習コーパスを組み合わせ、智譜が目指したのは「計算量は減らしても、仕事量は減らさない」ことです。

ここで最も大きな変更が加えられたのが、アテンション機構です。GLM-5.3 Flashは、線形アテンションとスパースアテンションを組み合わせたハイブリッドアーキテクチャを採用しています。

線形アテンションが局所情報を捉え、スパースアテンションが軽量インデクサーを使って、本当に関連性の高いグローバルコンテキストを拾い上げます。1Mという超長大なコンテキストに対しても、すべてのトークン同士を総当たりで計算する必要はありません。

智譜はさらにIndexPoolを追加し、インデクサーが本来保持していた4つのキャッシュベクトルを1つに圧縮しました。計算すると、GLM-5.3と比べてGLM-5.3 Flashではアテンションの計算量が3.01倍削減され、KV Cacheも4.44倍小さくなっています。

これが、先ほどの実測で感じられた特徴の一つを説明しています。名前に「Flash」と付いているものの、長時間にわたるタスクを実行しても、決して“軽量版”という印象を与えないのです。

特に、今回ついに手に入れた「目」が大きなポイントです。智譜はVisual Coding向けにデータ合成パイプラインを専用に構築し、モデルがタスクの実行中に完成したページ、インタラクション、3Dシーンを自ら確認し、視覚的なフィードバックに基づいて継続的に修正できるようにしました。

そのため、先ほどのデザイン案の再現や3Dモデリングのようなタスクでも、書きながら確認し、確認しながらさらに修正できるのです。

このほか、現在GLM-5.3 Flashがオンライン上の実際のリクエストを処理する際には、すべて中国製チップ上で稼働しています。

中国製アクセラレータチップ上でマルチモーダル処理と1Mコンテキストに対応するため、智譜はマルチモーダルエンコーディング、Promptのプリフィル、トークン単位の逐次デコードを、独立してスケジューリングやスケールアップ/ダウンが可能なEncode-Prefill-Decode分離アーキテクチャに分割しました。さらにLayer Splitやハイブリッドキャッシュ量子化など、一連の低レイヤー最適化も施しています。

その結果、同一ハードウェア上の初期ベースラインと比べて、エンドツーエンドのサービス性能は3倍に向上し、1トークンあたりのコストも主流のNVIDIA GPUと同等の水準を実現しました。

中国製、オープンソース。自信があるからこそ

こうして振り返ると、「牛来」がここ数日、海外で突然大きな話題になった理由も、また違って見えてきます。

正式に正体が明かされるまで、OpenRouterやOpenCodeの海外開発者たちは、Ox-Alphaがどこのモデルなのか知りませんでした。使いやすいという理由だけで、次々とPromptを入力し、結果としてランキング首位まで押し上げたのです。

ところが智譜がカードを表に返すと、さらにその先がありました。

モデルが中国製なら、その世界中から押し寄せた実際のトラフィックを受け止めた計算基盤まで中国製だったのです。

先ほど述べたとおり、Ox-Alphaは匿名テスト期間中にOpenRouterとOpenCodeの両プラットフォームで呼び出し数の新記録を打ち立てました。そして、そのすべてのリクエストが中国製チップによって処理されていました。

このことの意義は、「中国製モデルがまた一度勝利した」というだけにとどまりません。これまで、フロンティアモデルにはますます現実的になっている問題がありました。性能が向上する一方で、利用コストも上がり続けていたのです。

特にAgentが本格的に仕事をするようになると、1回のタスクに数十分、数時間かかり、トークンが水道の蛇口を全開にしたように消費されます。モデルがどれほど賢くても、価格が高ければ、多くのタスクでユーザーは無意識に費用を計算してしまいます。

GLM-5.3 Flashが今回示した答えは、いたってシンプルです。アーキテクチャ、推論、計算効率をさらに突き詰め、フロンティア性能の価格も引き下げること。

AAで57点を獲得し、Claude Opus 4.8と同点でありながら、価格はその1/40です。フロンティアモデルが、ようやく「日常的に消費できる製品」らしくなってきました。

最後に、オープンソース化です。

GLM-5.3 Flashはすでに正式に全世界へ向けてオープンソース化され、ZCodeにも接続されているほか、APIも公開されています。モデルは中国製チップ上で稼働でき、重みも直接公開されているため、開発者が利用できるだけでなく、企業が自社環境にデプロイすることも可能です。

モデル、中国製の計算基盤、そしてオープンソースエコシステムが、今回は本当の意味で一つにつながりました。

ここまで来ると、「牛来」という名前も、急にぴったりに思えてきます。

仕事はできて、食べる量は少ない。そして今回は、牛も自前なら、草も自前です。

BigModelオープンプラットフォーム: https://docs.bigmodel.cn/cn/guide/models/vlm/glm-5.3-flash

Z.ai: https://docs.z.ai/guides/vlm/glm-5.3-flash

GLM Coding Plan: https://bigmodel.cn/glm-coding

Blog: https://z.ai/blog/glm-5.3-flash

オープンソースリンク: https://huggingface.co/zai-org/GLM-5.3-Flash https://huggingface.co/zai-org/GLM-5.3-Flash-BF16

*著作権所有。許可なくいかなる形式での転載・使用も禁じます。違反者には厳正に対処します。*
#国内AI#Omniapi.co

4All API チームによる投稿

原文リンク:https://www.qbitai.com/2026/08/479919.html

主流 AI モデル API をお探しですか?4All API は OpenAI / Anthropic / Google Gemini / Qwen / DeepSeek など数十種類のモデルを単一の API キーで呼び出せます。公式準拠の価格、エンタープライズ品質の通信路、5 分で接続完了。

4All API コンソールに登録 →