コンテンツにスキップ
メインサイト ニュース コンソール

智谱 GLM-5.3-Flash がリリース、商汤「大装置」が国産計算リソースを支援

· 量子位
国内AI

国産ヘテロジニアス技術で、最先端AIを普及の時代へ

8月26日夜、Zhipu は GLM-5.3-Flash(320B-A18B)を正式にリリースし、オープンソース化しました。これは GLM-5 シリーズ初のネイティブ・マルチモーダルモデルで、総パラメータ数は 320B、性能は GLM-5.2 を上回ります。世界的に権威のある Artificial Analysis Intelligence Index(AA 総合知能指数)では、GLM-5.3-Flash は 57 点を獲得し、世界最先端モデルの能力領域に入りました。Anthropic で最も人気の高いモデル Claude Opus 4.8 と同スコアです。GLM-5.3-Flash は極めて低コストでの運用を前提に設計されたアーキテクチャを採用し、Zhipu が用意した最新の 30T Token マルチモーダル事前学習コーパスと組み合わせることで、より少ない計算資源でより高い性能を実現します。

先進的な国産ヘテロジニアス混合推論技術を基盤に、SenseTime 大装置は GLM-5.3-Flash の提供開始を大規模な国産コンピューティング能力と Token サービスで支援し、国産計算資源の大規模商用化における新たな本格的な導入事例を築きました。

この協業の背景には、SenseTime が構築した「1つのモデル、1つの Token(トークン)ファクトリー、1つのエージェント管理システム」という中核能力体系があります。その中で Token ファクトリーは、インテリジェントな能力を大規模に生産する重要な役割を担っています。マルチモーダルモデルと大装置のインフラを共同で最適化し、異なるチップ、クラスタ、エネルギー、デリバリーノードを組み合わせることで、より高品質で低コストの Token を継続的に生成します。同時に、Token ファクトリーと大規模モデルの間に双方向のフィードバックループを構築し、ネイティブ・マルチモーダルモデルの反復的な改善ニーズに、より柔軟に対応します。SenseTime 大装置による Zhipu GLM-5.3-Flash の効率的な提供支援は、まさにこのクローズドループ能力を力強く実証するものです。

長らく、市場では国産コンピューティング能力について、コストパフォーマンスが低く、大規模な商用化は難しいという見方が一般的でした。しかし正式リリースに先立ち、GLM-5.3-Flash は匿名モデル Ox-Alpha(中国語コミュニティでは「牛来」と呼ばれていました)として、OpenCode と OpenRouter で大規模なテストを実施しました。Token の呼び出し量は 62T に達し、**これらのリクエストトラフィックはすべて国産チップによって計算処理を支えました。**同一のハードウェア環境における初期ベースラインと比較すると、GLM-5.3-Flash は国産チップクラスタ上でエンドツーエンドのサービス性能を 3 倍に向上させ、ハードウェア効率と Token 単価は主要な NVIDIA GPU と同等の水準に達しました。

この取り組みは、国産コンピューティング能力が、実際の大規模なビジネス環境において、最先端の大規模モデルの推論ニーズを効率的かつ経済的に支えられることを示しています。

大規模モデルを最も深く理解する AI インフラとして、SenseTime 大装置は国産化を全面的に推進し、国産計算資源を「単一ポイントで利用可能」な段階から「大規模商用化」へと継続的に発展させています。今年の WAIC では、国産コンピューティング能力の大規模商用化が抱える課題に対し、SenseTime 大装置は「コストパフォーマンス、適応性、エネルギー効率」の3つの側面から体系的に解決策を提示しました。

コストパフォーマンスの面では、SenseTime 大装置は単一カードの性能を競う従来の発想から脱却し、先進的なヘテロジニアス混合推論技術を採用しています。推論の各段階における計算性能と帯域幅の異なるニーズに応じて、アーキテクチャや位置付けの異なる国産チップの強みを最大限に引き出し、効率的に連携させます。推論全体のコストパフォーマンスは NVIDIA H シリーズの 1.25 倍に達し、国産の同種チップによる推論と比較すると、同等のコストで Token 生産能力を約 2.5 倍に拡大できます。

適応性の面では、基盤演算子の最適化、マルチカード並列処理のチューニング、ツールチェーンへの対応などを通じて、国産コンピューティング能力の導入障壁を大幅に引き下げました。エネルギー効率の面では、SenseTime 大装置はコンピューティングと電力を連携させる Agent を提供し、TPW(Tokens Per Watt)を再定義するとともに、AIDC における新たな価値指標として位置付けています。

さらに、多様な計算資源を統合し、推論エンジンとチップ性能を継続的に最適化することで、SenseTime 大装置の Token Factory は、大規模・高効率・低コストの Token 供給能力を形成しつつあります。7月の1日平均 Token サービス量はすでに 2.42 兆に達しており、2026年末には1日平均 10 兆を突破する見込みです。年間の Token 量は 25 倍に増加する見通しです。

今後、SenseTime 大装置は国産計算資源を基盤とする Token サービスの構築に継続的に投資し、高性能・低コストで大規模な提供が可能な AI インフラを整備していきます。そして、国産コンピューティング能力を単一ポイントでの技術的ブレークスルーから、産業エコシステム全体の発展へと推進していきます。

本記事は SenseTime が提供し、量子位が許諾を得て転載したものです。見解は原著者に帰属します。

#国内AI#Omniapi.co

4All API チームによる投稿

原文リンク:https://www.qbitai.com/2026/08/480223.html

主流 AI モデル API をお探しですか?4All API は OpenAI / Anthropic / Google Gemini / Qwen / DeepSeek など数十種類のモデルを単一の API キーで呼び出せます。公式準拠の価格、エンタープライズ品質の通信路、5 分で接続完了。

4All API コンソールに登録 →