中国公司腾讯今日发布了新的开放权重纯文本输入(不支持视觉)的 LLM:总参数量 7700 亿,激活参数量 490 亿,支持 100 万 token 上下文窗口,模型在 Hugging Face 上占用 1.56 TB。
与其此前于 7 月发布的 Hy3 相比,这次模型规模大幅增加。Hy3 的总参数量为 2950 亿,激活参数量为 210 亿,上下文窗口为 256,000 token,模型大小为 598 GB。
我最近开始通过研究模型的聊天模板(chat template)来更好地理解它们的能力。以下是 Hugging Face 上 Hy4 的 chat_template.jinja,其中包含以下部分:
{%- if not reasoning_effort is defined %} {%- set reasoning_effort = 'high' %}{%- elif reasoning_effort not in ['high', 'no_think'] %} {%- if reasoning_effort is none %} {{- raise_exception('reasoning_effort error : None, should be no_think/high') }} {%- else %} {{- raise_exception('reasoning_effort error : ' + reasoning_effort + ', should be no_think/high') }} {%- endif %}{%- endif %}因此,这看起来意味着它只有两种推理强度级别:“high”(默认)和“no_think”(禁用推理)。
我使用默认的高强度推理,通过 OpenRouter 尝试了“生成一幅鹈鹕骑自行车的 SVG”这一提示词,并得到了如下结果:

引用其中的推理过程:
[…] 也许可以加一顶头盔?这能强化骑行主题,但可能会遮住头部。或许可以加一顶小自行车帽或头盔?用户并没有要求;加一顶红色头盔可能会很可爱。但鹈鹕的喙很大,头盔可能会遮挡它。还是不加比较好。
也许可以加太阳镜?不要。
也许可以加点水?不要。
有趣的是,这段推理过程使用了略微不完整的英语表达。推测这是因为对于隐藏的推理文本来说,完美的语法并没有实际价值,反而会浪费 token。