コンテンツにスキップ
メインサイト ニュース コンソール

オープンソースの国産8Bモデル、性能はクローズドソースのImage 2に匹敵!

· 量子位
国内AI

SenseNova U1.5 Lite

金磊(凹非寺発)

わずか3週間で、国産画像生成モデルがまた進化した。

前回紹介したこの画像生成モデルは、4K画像の直接生成に対応し、オープンソースでありながら、モデル規模はわずか8Bだった。

そして今回、正式版が登場した。3つの言葉でまとめるなら、次のとおりだ。

より完全に、より正確に、より安定して。

たとえば、異なる食べ物の写真9枚を一度に入力する。

そして、次のように簡単な Prompt を添える。

この9種類の料理を、すてきなレシピ共有カード1枚にまとめてください。

撮影アングルや比率、背景がそれぞれ異なる9枚の画像が、1枚の画像の中に整然とレイアウトされた。AI は各料理を正確に認識しただけでなく、適度に美しく整え、画像全体をより見栄えよく仕上げている。

次に、画像編集の例を見てみよう。

元画像に対して、**「範囲選択+注釈」**によって、変更したい部分を指定する。

AI が指示を受けて編集を完了すると、結果は次のようになった。

複数の対象領域が指定どおりに変更されている一方で、ベッド、ベッドサイドテーブル、グラス、右側のキャビネット、そして寝室全体の空間的な関係性は、ほぼそのまま維持されていることが分かる。

この AI こそ、商湯科技(SenseTime)が今回正式にオープンソース化したSenseNova U1.5 Liteだ。主な特徴は次のとおり。

  • 3,000~4,000文字に及ぶ超長文・複雑な指示への対応:より長く複雑な要件を一度に理解し、対象、数量、位置、テキスト、レイアウト、スタイルなど、複数の制約を同時に処理できるため、細部の抜け漏れが起こりにくい。
  • より高品質なビジュアル生成:構図、色彩、質感、光と影、ディテールがより自然になり、全体的な完成度が向上。
  • より信頼性の高いネイティブ画像編集:指定した内容をより正確に変更しながら、人物、構造、レイアウト、その他の領域をより適切に維持。
  • テキストと複雑なレイアウトの処理能力を強化:日本語・英語のテキスト、ポスター、インフォグラフィック、多数のテキストを含むレイアウトをより正確に処理し、複雑な画面構成にも対応。
  • より精密なビジュアル制御:範囲選択、マーキング、複数画像の参照などに対応し、「どこを、何に変更するか」をより正確に指定可能。
  • Native 4K 高解像度出力:4Kの高精細画像を直接生成しながら、構図、テクスチャ、小さな文字、光と影などのディテールも維持。

しかも SenseNova U1.5 Lite は、8Bというモデル規模を維持している。複雑なレイアウトや高精度な編集といった主要な場面では、クローズドな GPT-Image-2 にも匹敵する。

3週間前の SenseNova U1.5 Lite Preview 版が、1つの統合モデルによってビジュアル能力をどこまで拡張できるかを検証するものだったとすれば、今回の正式版で商湯科技がさらに検証しているのは、これらの能力をそれぞれ強化したうえで、再び1つの軽量モデルに統合し、実際のクリエイティブワークフローに安定して組み込めるかどうかという点だ。

効果はどう強化されたのか? 細部を見てみよう

ここからは、引き続き実際の結果を見ていこう。

最初のタスクは、情報整理能力が試される実例だ。テーマは、カカオ豆からチョコレートまでの工程である。

縦長のインフォグラフィック1枚の中に、Harvesting、Fermentation、Roasting、Grinding、Tempering、Finished Chocolate の6段階を同時に示す必要がある。

各段階には説明文だけでなく、対応するカカオの実、発酵箱、焙煎設備、粉砕装置、チョコレート液などのビジュアル要素も必要だ。さらに、6つの階層にわたる内容を、レイアウトに沿って上から下へ展開しなければならない。

最終結果を見ると、SenseNova U1.5 Lite はすでに、長文、階層構造、イラスト、数字の順序、レイアウトの関係性を含む、一連のビジュアル表現全体を構成できるようになっている。

この能力をより日常的なコンテンツ制作に応用すると、ソーシャルメディアのカバー画像の作成といったタスクになる。

たとえば、次の画像を見てほしい。

このような画像は、一見すると要素がそれほど多くない。しかし難しいのは、「カバー画像らしさ」を出すことだ。

タイトルには存在感が必要で、メインの被写体は十分に目を引かなければならない。3匹の犬は、外見、服装、表情にそれぞれ違いを持たせつつ、互いに調和している必要がある。同時に、画像全体で統一されたファッション性を保たなければならず、単にかわいい要素をいくつか組み合わせるだけでは不十分だ。

最終結果を見ると、正式版はこの種の実用的なビジュアルタスクにおいて、すぐに使えるカバー作品に近い仕上がりを見せ始めている。

続いて、SenseNova U1.5 Lite の部分編集能力を見てみよう。

Prompt は次のとおりだ。

参考画像の折り紙コラージュ風のビジュアルを踏襲し、地域共有キッチンの運営モデルを示すインフォグラフィックを生成してください。

一見すると、2枚の画像は全体の構造やスタイルがほとんど変わっていない。今回の要件が「参考画像を踏襲する」ことだからだ。

細部をよく見ると、もともと教育プロジェクトに関する要素だった部分が、コック帽、まな板、レシピなど、キッチン関連のビジュアルに置き換えられている。また、左側の情報も Membership Fees、Commercial Rental、Cooking Classes、Market Sales、Event Hosting へと変更されている。

この種のタスクでは、モデルはまず、画像内のどの要素がテーマの内容に属し、どの要素がより基礎的なデザインロジックに属するのかを見分ける必要がある。そのうえで後者を維持し、新しい内容を元のビジュアル言語に沿って展開しなければならない。

しかし、参考画像が1枚から複数枚に増えると、タスクの難易度はさらに高くなる。

たとえば、次の3枚の参考画像を入力する。

そして、次の Prompt を添える。

Edit Image 1 using Images 2 and 3 as content references rather than pasted rectangular images. Replace the framed band silhouettes with all five Radiohead members from Image 2, transformed into the poster’s distressed monochrome halftone style. Reflow the four lower feature blocks into a compact left column and add an ESSENTIAL LISTENING list on the right using Image 3 only for wording and hierarchy. Render the new list directly on the same continuous black distressed background with matching off-white type; do not retain any white or cream card background. Preserve all original text and all other poster elements.

今回は、Prompt の要件がさらに細かい。3枚目の参考画像は内容と情報階層の参照にのみ使用し、元の白いカード背景までそのまま持ち込んではならない。新しい曲目リストは、ポスター本来の黒いエイジング加工背景に直接なじませる必要がある。

SenseNova U1.5 Lite が出力した結果は次のとおりだ。

結果を見ると、Radiohead の5人のメンバーが元のバンドの領域に配置され、人物の処理もポスター全体の質感に自然につながっている。左下の情報は再構成されてコンパクトにまとめられ、ESSENTIAL LISTENING は右側のレイアウトに直接組み込まれ、目立つ白い背景も残っていない。

先ほどの3枚の参考画像では、1枚目がレイアウトとスタイル、2枚目が人物のアイデンティティ、3枚目がテキストの内容と構造だけを担当している。モデルはまずこの3つを分けて理解し、最後に1枚の画像へ再統合しなければならない。

しかし、実際のデザイン作業では、ここまで複雑ではないものの、より頻繁に発生する可能性のある要件もある――数文字を変更する作業だ。

今回は元画像を入力したうえで、Prompt は次のようにした。

左下の濃紺の長方形の情報欄にある展覧会の開催期間と住所の詳細を、
“JUNE 15 – JULY 30, 2024
URBAN GALLERY
123 CREATIVE WAY
ARTSVILLE, USA”
から
“AUGUST 10 –
SEPTEMBER 28, 2024
METRO MUSEUM
456 DESIGN ROAD
CREATIVITY CITY, UK”
に置き換えてください。元の白色とピンク色のフォントスタイル、およびレイアウトは変更しないでください。

最終的に、左下の情報が置き換えられた。画面中央に大きく配置された「RHYTHM OF FORM」、周囲の彩度の高い幾何学模様、そして元のテキスト階層は、すべて元の位置に維持されている。

まず分けて鍛え、最後に統合する

ここまでの結果を見ると、次の疑問が浮かぶ。8Bモデルは、テキスト、美的表現、複雑なレイアウト、長文指示、部分編集を、どのようにしてすべて高い水準で実現しているのだろうか。

SenseNova U1.5 Lite は引き続き、NEO-unify ネイティブ統合マルチモーダルアーキテクチャを採用しているという。視覚理解、画像生成、画像編集を、同一のモデルに統合した構成だ。

つまり、実際にピクセルを変更する前に、モデルはまず画面を理解しなければならない。

どこが主体なのか、何が何の隣にあるのか、どれがテキストなのか、ユーザーが指しているのはどの領域なのか、1枚の参考画像の中でどの要素を残すべきなのか――こうした理解のプロセスは、その後の生成や編集から完全に切り離されているわけではない。

そして今回の正式版で大きく変わった点の1つが、トレーニング段階にある。商湯科技が採用したのは、非常に分かりやすい方法だ。まず分けて鍛え、最後に統合する。

テキストレンダリング、美的表現、画像編集などの目標について、それぞれに対応する専門 Expertを個別にトレーニングする。

これらの Expert のトレーニングが完了した後、複数教師によるオンライン戦略蒸留技術 MOPD を通じて、それぞれの専門能力を同じ SenseNova U1.5 Lite に再統合する。

そのため、トレーニング時には複数の専門教師が存在するものの、最終的に提供・デプロイされる際にユーザーが受け取るのは、1つの8Bモデルだけだ。

背後で「今回はどのサブモデルを呼び出すべきか」を判断する追加の Router は存在せず、ユーザーがテキスト、美的表現、編集用の複数モデルを切り替える必要もない。

この方法は、先ほどの事例とも対応している。

たとえば Radiohead の複数参考画像タスクでは、モデルはまず元のポスターのビジュアル構造を理解し、次に人物を認識し、さらに別の画像からテキスト構造を抽出しなければならない。そのうえで初めて生成を完了できる。

ポスターの文字を変更する場合も同じだ。

「左下だけを変更する」には、まず「左下」とはどこか、どのテキストが対象領域に属するのか、その周囲にあるどの図形、フォント、レイアウトを変更してはいけないのかを理解する必要がある。こうした判断が完了して初めて、最後のピクセル生成に進む。

したがって、統合トレーニング体系において、視覚的な意味理解と空間モデリングによって形成された構造化された認知は、生成や編集を逆方向から支援することもできる。商湯科技はこの点をプレスリリースで「理解と生成による双方向の相互強化」と表現している。

そして、この能力を複雑なタスクでも安定して発揮させるため、正式版ではポストトレーニングの段階で、さらに3つの要素を重点的に強化した。

1つ目は指示遵守だ。ユーザーが、主体の数、左側にあるもの、テキストの配置場所、使用する色、変更してはいけない要素など、多数の要件を書いたとき、モデルが最終的にどれだけ正確に実行できるかが問われる。

2つ目はビジュアル品質の選好だ。指示を実行したうえで、画像全体の構図、質感、光と影、最終的な仕上がりが要求水準に達しているかどうかである。

3つ目は編集対象外領域の保持だ。変更すべき領域を正確に変更し、もともと正しかった領域を維持できるかどうかが重要になる。

この3点は、先ほどの事例で特に問題になりやすかった部分にちょうど対応している。複雑なインフォグラフィックでは要件の抜け漏れが起こりやすく、STYLE のようなカバー画像では美的な完成度が直接試される。一方、寝室の編集、Radiohead、テキストの置き換えでは、いずれも編集対象外の領域を維持する能力が欠かせない。

さらに、プロンプト拡張にも対応している。ユーザーが短い要望だけを入力した場合、PE が意図を整理し、より完全な制作プランを作成してから、U1.5 Lite に実行させることができる。

以上が、正式版 SenseNova U1.5 Lite を支える技術的なポイントだ。

画像生成モデルの評価基準は、変わりつつある

少し長い時間軸で振り返り、SenseNova U シリーズのこれまでの変化を見てみると、明確な傾向が見えてくる。

初期の画像生成モデルを評価する際、最も比較しやすかったのは、結果が十分に驚くべきものかどうかだった。しかし AI による画像生成能力が広く普及するにつれ、モデルを実際のワークフローに組み込めるかどうかを左右する課題は、1枚目の画像を生成した後に現れるようになっている。

これが、SenseNova U1.5 Lite の正式版が「安定性」を繰り返し強調する理由でもある。目新しく見える機能をいくつか追加するよりも、1つのビジュアルタスクを生成から納品まで完遂するための一連のプロセスを解決することを重視しているのだ。

それに伴い、モデルの評価基準も変化している。画像が十分に美しいかどうかは依然として重要だが、差を生むのは、要件の理解からコンテンツの生成、修正、調整、最終納品までをモデルが一貫して完了できるかどうかになりつつある。

統合モデルの価値も、まさにここにある。

SenseNova U1.5 Lite が最終的に提供するのは、依然として8Bモデルだけだ。外部ルーティングを次々に追加することも、異なるタスクを複数のモデルに分担させることもない。複数の専門 Expert によって能力を補強し、それらを再び1つの統合モデルに収めている。この方式のメリットは明確だ。呼び出し経路が短く、デプロイも軽量でありながら、異なるタスク間の一貫性もできるだけ維持できる。

開発者やクリエイターが実際に利用する場面に落とし込めば、最終的には次の3文字に集約できる:速い、良い、無駄がない。

商湯科技は、マルチモーダルが今後も AI が物理世界へ進出し、実際の生産プロセスに入っていくための重要な方向性になると判断している。そのため今回の U1.5 Lite 正式版でも、安定性、指示遵守、編集精度に多くの力を注いでいる。これらは、目新しい機能のように一目で人を引きつけるものではないかもしれない。しかし、モデルが実際に使われるかどうかを、より直接的に左右する要素である。

3週間前の Preview 版が、8Bの統合モデルでどこまで広範なビジュアル能力をカバーできるかを検証するものだったとすれば、

正式版で問われているのは、すでに広げられたこれらの能力を、本当に安定して実務に使えるのかということだ。

GitHub:
https://github.com/OpenSenseNova/SenseNova-U1

Hugging Face:
https://huggingface.co/collections/sensenova/sensenova-u15

SenseNova Studio オンライン体験:
https://unify.light-ai.top/

#国内AI#Omniapi.co

4All API チームによる投稿

原文リンク:https://www.qbitai.com/2026/08/479192.html

主流 AI モデル API をお探しですか?4All API は OpenAI / Anthropic / Google Gemini / Qwen / DeepSeek など数十種類のモデルを単一の API キーで呼び出せます。公式準拠の価格、エンタープライズ品質の通信路、5 分で接続完了。

4All API コンソールに登録 →