IBM 发布 Granite 4.2 推理模型系列,三规格 Apache 2.0 开源
IBM 发布 Granite 4.2 推理模型系列,3B/8B/30B 三规格 Apache 2.0 开源,支持思考模式…
IBM 联合 Hugging Face 发布 Granite 4.2 推理大模型系列,包含 3B、8B 和 30B 三种稠密参数规格,均以 Apache 2.0 协议开源。该系列是 IBM Granite 家族中首个明确面向推理任务的版本,支持思考/非思考双模式、原生工具调用,并面向 agent 场景做了专门的强化学习训练。
系列定位与运行模式
Granite 4.2 是 Granite 语言模型家族中首个聚焦推理的稠密解码器模型系列。此前 Granite 版本以指令遵循能力见长,4.2 则在所有模型上都增加了显式的链式推理能力,可在回答前先生成思维过程。
三种规格共享同一架构设计与训练流程(从零预训练 → SFT → 多阶段 RL),仅在规模上有所区分,便于在不同算力条件下部署。每个模型都内置三种运行模式:
- 思考(thinking)模式:分配完整推理预算处理复杂任务
- 非思考(non-thinking)模式:跳过显式推理,响应更快
- 低投入(low-effort)模式:在简单问题上仅花费少量推理预算
模型架构
Granite 4.2 采用纯解码器稠密 Transformer 架构,主要组件包括:
- 注意力机制:分组查询注意力(GQA),40 个查询头,8 个 KV 头
- 位置编码:旋转位置编码(RoPE),θ = 10,000,000
- 前馈网络:使用 SwiGLU 激活函数的 MLP
- 归一化:RMSNorm(ε = 1e-5)
- Embedding:输入与输出 embedding 分离
- 精度:bfloat16
各规格关键参数差异:
- 3B:embedding 2560,40 层,头尺寸 64,MLP 隐层 8192
- 8B:embedding 4096,40 层,头尺寸 128,MLP 隐层 12800
- 30B:embedding 4096,64 层,头尺寸 128,MLP 隐层 32768
三者的训练序列长度均为 131,072。
预训练:五阶段策略
Granite 4.2 在约 15 万亿 token 上从零开始预训练,采用五阶段训练策略:
- 阶段 1–2:基础预训练阶段,使用广泛的网页规模数据
- 阶段 3–4:中训练阶段,逐步过渡到更高质量的数据集并进行退火
- 阶段 5:长上下文训练阶段,将上下文窗口扩展至 512K token
各阶段使用差异化的数据配比与学习率调度,整体从通用网页数据渐进过渡到经过筛选的高质量语料。
SFT:数据构成与质量控制
监督微调阶段使用约 720 万条样本、约 100B token(其中约 65B 可训练)的混合数据,按用途划分为 agentic 与非 agentic 两大类:
- Agentic 数据(31.6%):软件工程(69%)、工具调用(12.1%)、终端使用(8.0%)、数学(3.5%)、搜索(0.8%)、操作(0.2%)
- 非 agentic 数据(68.4%):指令遵循(18.8%)、编程(18.8%)、数学(14.6%)、多语言(7.0%)、科学(5.4%)、推理(3.0%)、安全(0.8%)
数据生成使用了 OpenHands、Terminus-2、SWE-agent、Codex、Goose 等多种 agent 框架与脚手架,涵盖开源数据集与 IBM 自建的合成 RL 环境。
质量控制流程包括:
- 将不同来源数据统一规范化为 OpenAI Chat 格式
- 以 GPT-OSS-120B 与 Gemma 4 作为 LLM 评判器,剔除低分样本以及包含幻觉、虚构信息、无效工具调用的样本
- 针对特定数据集补充启发式规则
- 进行本地与全局去重,基于 SHA-256 哈希识别重复内容
多阶段 RL 与部署
后训练阶段采用多阶段强化学习流程。其中 8B 与 30B 模型额外加入 agentic RL 阶段,在真实沙箱环境中学习调用工具、编辑和运行代码、操作终端以及执行网页搜索。所有 Granite 4.2 模型均支持原生工具调用。
部署层面,Granite 4.2 提供 OpenAI 兼容端点(例如通过 vLLM 部署),可直接发出符合 OpenAI function-calling 格式的工具调用,无需额外胶水代码即可接入现有 agent 框架,并支持 SGLang 推理引擎。
开源与生态
Granite 4.2 全系以 Apache 2.0 协议开源,配套发布 Hugging Face 模型集合、GitHub 仓库与官方文档,便于企业在自有环境中进行推理、微调与集成,进一步丰富了企业级开源大模型的选型空间。
