SenseTimeの「大装置」がHiDream.aiの動画生成事業における国産コンピューティングへのシームレスな移行を支援
国産コンピューティングで動画生成の大規模運用を実現
国産コンピューティングを大規模な商用環境へ展開するにあたり、「適応検証」から「実際の本番運用」へ移行するための重要な一歩をどのように乗り越えるかが、業界の新たな課題となっています。最近、SenseTimeの「大装置」とHiDream.aiは、動画生成事業を起点として、国産コンピューティングへの適応から大規模運用までの一連のプロセスを実現しました。
画像・動画生成モデルを中核とするAI企業にとって、国産化は単純にモデルをあるGPUから別のGPUへ移行することを意味しません。特に動画生成モデルは、パラメータ規模が大きく、推論処理が長く、計算負荷も高いため、基盤となるコンピューティングリソースから推論フレームワーク、モデル性能、生成品質、ツールチェーンに至るまで、あらゆる工程が国産化の障壁となる可能性があります。
世界をリードするマルチモーダル生成AIイノベーション企業であるHiDream.aiは、次世代のネイティブなフルモーダル・ワールドモデルの構築に取り組んでいます。独自開発したHiDreamシリーズの大規模モデルを基盤に、商業マーケティング、映像制作、コンテンツ制作などの分野で事業を展開しています。現在、その製品は世界100以上の国と地域で利用され、5,000万人を超えるプロフェッショナルユーザーと4万社以上の企業顧客にサービスを提供しています。

HiDream.aiの重要なAIインフラパートナーであるSenseTimeの「大装置」は、安定性と高効率を兼ね備えたAIインフラによって、同社のモデル開発と継続的な改善を支えてきました。今回、両社はさらに協力範囲を国産コンピューティングへの適応検証へと拡大しました。
HiDream.aiの主要事業をめぐり、SenseTimeの「大装置」は基盤コンピューティングリソースの置き換えを起点に、モデル推論、性能最適化、生成品質などの重要な工程に深く関与しました。フルスタックの技術適応とFDEエキスパートサービスを通じて、HiDream.aiが国産コンピューティング環境で安定稼働できるよう支援し、マルチモーダル大規模モデルの国産化展開に向けた再利用可能なモデルケースを構築しました。
01 LightX2VのマルチGPU並列処理により、動画生成の高速化率93%を達成
ビジュアル生成アプリケーションでは、性能不足がユーザーの利用コストを押し上げるだけでなく、プロダクト体験や事業の大規模展開にも影響します。そこで今回の協業において、HiDream.aiは明確な事業目標を掲げました。国産コンピューティング環境で高解像度動画を効率的に生成し、エンドツーエンドの生成時間を業界最高水準まで短縮することです。
この具体的な目標に基づき、SenseTimeの「大装置」チームはLightX2VをベースにマルチGPU並列処理を最適化し、さらに複数マシン・複数GPU環境における拡張性を検証しました。チームはまずモデルの最適化に着手し、学習と推論の協調最適化というアプローチに基づいて、LightX2Vのステップ蒸留やCFG蒸留などの学習手法を適用しました。これにより、動画品質を維持しながら推論速度を大幅に向上させました。
推論時には、CFGの二分岐並列処理、Ulysses系列並列処理、TP並列処理など、複数レベルの並列化手法を導入しました。動画生成プロセスにおける計算タスクを分割して協調的にスケジューリングすることで、業務上求められる品質を満たしながら、複数GPUのリソース利用効率と並列処理による高速化能力を高めました。
その結果、国産チップ上でDiTモデルを実行する環境において、マルチGPU並列による動画生成の高速化率93%を達成し、国産コンピューティングの性能を最大限に引き出しました。

02 生成品質を最適化し、マルチGPU環境での品質の一貫性を向上
モデルを新たなコンピューティング環境へ移行した結果、生成速度は向上しても、人物の表情や動作、ディテールなどに明らかな変化が生じるのであれば、その国産化移行を本番環境へ本格的に導入することは困難です。
マルチGPU推論の過程で、両チームは、同一モデルであってもシングルGPU環境とマルチGPU環境では、生成品質にわずかな差異が生じる可能性があることを確認しました。たとえば、人物の表情などの特徴表現に違いが見られました。この課題に対し、SenseTimeの「大装置」チームはマルチGPU通信プロセスをさらに最適化し、Face特徴量を再注入するなどの手法によって、マルチGPU推論における特徴の一貫性を強化しました。これにより、マルチGPUでの生成品質をシングルGPU環境の品質にさらに近づけました。
また別の実際的な課題として、一部の動画では最終フレーム付近の指などのディテールが不鮮明になることが判明しました。調査の結果、この問題はモデルの学習段階と実際の推論段階で動画フレーム数に差異があることに起因していました。これに対し、チームは推論プロセスに必要な補完処理と最適化を施し、長時間動画の生成におけるディテール表現を改善しました。
SenseTimeの「大装置」チームは、こうした細部にわたる調整を通じて、国産モデルを国産コンピューティングに適応させ、実際の本番環境へ展開する過程で生じたエンジニアリング上の課題を一つひとつ解決しました。
03 異種チップへのゼロコスト移行をサポート
HiDream.aiにとって、国産化への適応では単一チップへの対応だけでなく、異なる国産チップ間の異種環境への適応にも対応する必要があります。
この課題に対し、SenseTimeの「大装置」は統一されたハードウェア抽象化体系を構築しました。異種ハードウェアの初期化、統一デバイス抽象化レイヤー、Registryによるディスパッチファクトリー、ハードウェア演算子プラグインなどにより、異なる基盤ハードウェア間の差異を吸収します。統一抽象化体系を基盤として、「一度開発すれば、複数のプラットフォームに適応」できる環境を実現しました。現在、このソリューションは10種類以上の異種チップ上で、モデルのゼロコスト移行をサポートしています。
同時に、SenseTimeの「大装置」はComfyUIなど主要なAI開発ツールのエコシステムへの適応も完了しました。既存のワークフローや開発習慣を変更することなく、国産コンピューティングプラットフォーム上でアプリケーションの開発とデプロイを行えるため、移行・開発コストを大幅に削減できます。

04 FDEエキスパートサービス:業務に深く入り込み、全プロセスの完結を支援
HiDream.aiのようなAIイノベーション企業にとって、モデルの研究開発やプロダクトの継続的な改善には、もともと多くのリソースが必要です。そこに国産化環境への適応・移行のための人員をさらに大量投入すれば、追加の人件費と時間的コストが発生することは避けられません。
そこでSenseTimeの「大装置」は、FDE(Forward Deployed Engineer、前線配置エンジニア)エキスパートサービスという形態を通じて、専門的なエンジニアリング能力をHiDream.aiの業務現場に深く組み込みました。
今回の協業において、SenseTimeの「大装置」は国産コンピューティングの基盤やプラットフォーム機能を提供するだけではありませんでした。専門のエンジニアリングチームを編成し、HiDream.aiの実際の業務ニーズを中心に、国産化への適応プロセス全体に深く関与しました。モデル移行、演算子の最適化、マルチGPU並列処理から、生成品質のチューニング、ツールチェーンへの適応、最終的な業務品質の確保に至るまで、実際の業務指標に基づいて課題を一つずつ洗い出し、解決しました。
この「コンピューティングプラットフォーム+エンジニアリングエキスパート」の協業方式により、AI企業は国産化移行に伴う膨大なエンジニアリング作業を削減し、より多くの研究開発リソースをモデルの革新とプロダクトの継続的な改善に集中させることができます。
05 事業展開:国産コンピューティングがショート動画の大規模制作を支援
SenseTimeの「大装置」が提供するAIインフラ能力とFDEエキスパートチームの支援のもと、HiDream.aiの画像モデルは国産コンピューティングへの適応検証を完了し、さらにオンラインでの大規模トラフィックとショート動画制作を支える段階へ進みました。
今回のSenseTimeの「大装置」とHiDream.aiの協業は、国産コンピューティングで動画生成事業を支えるための再利用可能な道筋を実証しました。すなわち、基盤となる異種コンピューティングリソースを土台とし、統一ハードウェア抽象化体系と開発ツールへの適応をつなぎ役とし、モデル性能と生成品質の最適化を中核に据え、さらにFDEエキスパートサービスを通じて業務現場に深く入り込むことで、国産コンピューティングのフルスタック適応、技術検証から大規模本番運用までの完全なクローズドループを実現するというものです。
今後、両社はさらに多くのAI活用シーンをめぐって協業を深め、国産AIインフラと生成AIアプリケーションの融合・発展に向けた可能性を共同で探っていきます。国産コンピューティングを「使える」段階から「使いやすい」段階へと加速させ、AIイノベーション企業が技術革新と事業の大規模展開をより効率的に実現できるよう支援していきます。
本記事はSenseTimeが提供し、量子位が許諾を得て転載したものです。見解は原著者に帰属します。