コンテンツにスキップ
メインサイト ニュース コンソール

Granite 4.2 大規模言語モデル:どのように構築されたのか

· Hugging Face 翻訳済
教程模型卡

Granite 4.2 推論モデルシリーズの技術構築詳解

著者: Granite チーム、IBM

概要: Granite 4.2 は、当社初の純粋な密モデルかつデコーダーオンリー(decoder-only)の推論用大規模言語モデルシリーズで、3B、8B、30B の 3 つの規模を展開しています。各モデルはゼロから構築され、約 15 兆(15T)トークンを用いて事前学習されました。また、5 段階の学習戦略によってコンテキストウィンドウを 512K トークンまで拡張しています。その後、思考の連鎖(chain-of-thought)、推論、エージェント軌跡データを用いて教師あり微調整を行い、最後に多段階強化学習(RL)パイプラインによってポストトレーニングを実施しています。このパイプラインにはエージェント強化学習(agentic RL)も含まれており、8B および 30B モデルは、実際のサンドボックス環境でツールを使用して操作を実行する方法を学習します。各モデルは思考 / 非思考を切り替えられるほか、簡単な問題に対して短い推論予算で処理できる**低負荷(low-effort)**思考モードを備え、ツール呼び出しにもネイティブ対応しています。すべての Granite 4.2 モデルは Apache 2.0 ライセンスで公開されています。

概要

Granite 4.2 は、Granite 言語モデルシリーズの中でも推論に重点を置いたバージョンです。従来の Granite は優れた指示追従アシスタントでしたが、Granite 4.2 では明示的な推論能力がさらに加わりました。各モデルは回答前に思考の連鎖を生成でき、タスクに必要な思考量に応じて、思考モードまたは非思考モードで実行できます。その中間に位置する低負荷モードでは、簡単な問題に対して短い推論予算を使用します。

3 つの規模(3B、8B、30B)は同一のアーキテクチャ設計を採用し、同一の学習パイプライン(ゼロからの事前学習、SFT、その後の多段階 RL)に従います。違いはモデル規模のみです。3 つのモデルはいずれも、優れた推論能力と指示追従能力を備えています。最も顕著な能力差は、ポストトレーニング段階に現れます。8B および 30B モデルは、さらに**エージェント強化学習(agentic RL)**段階を経て、エージェントとして動作する方法を学習します。具体的には、実環境でツールを呼び出し、コードを編集・実行し、ターミナルを操作し、Web を検索します。すべてのモデルがネイティブなツール呼び出しに対応しています。OpenAI 互換エンドポイント(たとえば vLLM)経由で提供する場合、モデルは OpenAI の関数呼び出し形式でツール呼び出しを出力するため、追加の適合作業なしでエージェントフレームワークに接続できます。Granite 4.2 は SGLang にも対応しています。直接デプロイ可能な構成については、SGLang cookbook を参照してください。

以降では、アーキテクチャ、事前学習、教師あり微調整、多段階 RL パイプライン、評価結果など、モデルの構築プロセスについて説明します。

モデルアーキテクチャ

Granite 4.2 モデルは、純粋なデコーダー型の密な Transformer アーキテクチャに基づいており、主要コンポーネントは次のとおりです。

  • アテンション機構: グループ化クエリアテンション(Grouped Query Attention、GQA)。40 個のアテンションヘッドと 8 個の KV ヘッドを含む
  • 位置埋め込み: 回転位置埋め込み(Rotary Position Embedding、RoPE)、θ = 10,000,000
  • フィードフォワードネットワーク: SwiGLU 活性化関数を使用する MLP
  • 正規化: RMSNorm(ε = 1e-5)
  • 埋め込み層: 入力埋め込みと出力埋め込みは独立しており、重みを共有しない
  • 精度: bfloat16
コンポーネント3B Dense8B Dense30B Dense
埋め込み次元256040964096
層数404064
アテンションヘッドの次元64128128
アテンションヘッド数403232
KV ヘッド数888
MLP 隠れ層の次元81921280032768
MLP 活性化関数SwiGLUSwiGLUSwiGLU
シーケンス長131072131072131072
位置埋め込みRoPERoPERoPE
パラメータ数3B8B30B

事前学習

Granite 4.2 はゼロから、約 15 兆(15T)トークンを用いて学習され、5 段階の学習戦略を採用しています。第 1~2 段階では基礎的な事前学習に重点を置き、第 3~4 段階では中期学習を行いながら、より高品質なデータを段階的に使用してアニーリングを実施します。第 5 段階では長文コンテキスト学習を導入し、コンテキストウィンドウを 512K トークンまで拡張します。各段階では異なるデータ比率と学習率スケジュールを使用し、学習データを、広範なインターネット規模のデータから、より厳密に選別された高品質なデータソースへと段階的に移行させています。

事前学習の方針は全体として前世代モデルを踏襲しています。データ比率、段階構成、長文コンテキスト拡張について詳しくは、Granite 4.1 ブログを参照してください。

SFT:データ準備と品質管理

教師あり微調整(SFT)によって、基盤モデルを、信頼性の高い指示追従・推論・ツール使用アシスタントへと変換します。SFT のデータ混合は、エージェントデータ(31.6%)と非エージェントデータ(68.4%)で構成され、合計約 720 万サンプル、約 100B トークンに相当します。このうち約 65B トークンを学習に使用しました。

エージェントコーパスは、ソフトウェアエンジニアリング(SWE、69%)、ツール呼び出し(12.1%)、ターミナル使用(8.0%)、数学(3.5%)、検索(0.8%)、操作実行(0.2%)など、複数の分野をカバーしています。これらのサンプルと軌跡は、OpenHands、OpenCode、Terminus-2、SWE-agent、OpenResearcher、MiniSWE、OpenSeeker、EnvScaler、Gemini CLI、Hermes、Codex、Goose など、複数のエージェント用スキャフォールディングおよび実行フレームワークによって生成されました。エージェントデータには、オープンソースデータセット由来のサンプルに加え、独自の合成 RL 環境で生成したデータも含まれており、さまざまなエージェントと実行フレームワークの組み合わせをカバーしています。

非エージェントコーパスは、主に次のカテゴリで構成されています。指示追従(18.8%)、コード(18.8%)、数学(14.6%)、多言語(7.0%)、科学(5.4%)、推論(3.0%)、安全性(0.8%)。

データ品質管理

サンプルを最終的な SFT データ混合に追加する前に、複数段階の品質管理を実施します。まず、異なるソースのデータを標準化し、統一された OpenAI Chat 形式に再フォーマットします。これにより、異なるデータセットやスキャフォールディング間で、対話構造とツールインタラクションの形式を統一します。

次に、GPT-OSS-120B と Gemma 4 を大規模言語モデルベースの評価器として使用し、サンプル品質を評価します。低スコアのサンプルは削除します。また、幻覚や虚偽の情報、無効なツールインタラクションを含むサンプルや、対応するツール一覧に定義されていない関数を呼び出すサンプルも削除します。適用可能な場合は、データセット固有のヒューリスティックルールも複数適用し、品質をさらに高めるとともに、既知のノイズ源を除去します。

最後に、ローカル重複排除とグローバル重複排除を同時に実施します。重複排除には、tools フィールドと messages フィールドの組み合わせから SHA-256 ハッシュ値を計算する方式を使用し、各データソース内および SFT データ混合全体に存在する重複サンプルを削除します。

SFT の学習詳細

まず、コーパス全体をランダムにシャッフルします。これにより、データの並び順による影響を抑え、学習中に異なる分野のサンプルが十分に混在するようにします。次に、シャッフル済みのコーパスを同じサイズの .parquet シャードに分割し、モデルのトークナイザーとチャットテンプレートを用いてトークナイズしたうえで、大規模分散学習に備えます。

最終的な大規模学習を開始する前に、代表的な構成でハイパーパラメーターを調整します。学習率スケジュール、初期学習率、ウォームアップ比率をスキャンし、異なるモデル規模で安定して学習できる設定を決定します。最終的な学習構成は次のとおりです。

パラメーター値
計算リソース32~128 ノード(モデル規模による)。各ノードに Grace/GB200 を 4 台搭載
シーケンス長(パッキング後)131,072(128K)
グローバルバッチサイズ128
学習率1.0e-5。ウォームアップ後は一定。第 2 段階では 3.0e-6
学習率のウォームアップtrain_iters の 2.5%
学習時間約 2 epoch
並列化方式TP=2、PP=1、CP=4 または CP=2

30B モデルの第 2 段階 SFT

30B モデルについては、さらに次の処理も実施しました。

#教程#模型卡#Omniapi.co

4All API チームによる投稿

原文リンク:https://huggingface.co/blog/ibm-granite/granite-4-2

主流 AI モデル API をお探しですか?4All API は OpenAI / Anthropic / Google Gemini / Qwen / DeepSeek など数十種類のモデルを単一の API キーで呼び出せます。公式準拠の価格、エンタープライズ品質の通信路、5 分で接続完了。

4All API コンソールに登録 →