腾讯混元 Hy4 preview 详解:770B 开源旗舰,Apache 2.0,定价是 Hy3 的 6 倍
8 月 28 日,腾讯混元发布并开源新一代旗舰 Hy4 preview: 770B 总参数 / 49B 激活,100 万上下文,Apache 2.0 权重。它把混元从「便宜的国产开源模型」这一档, 搬到了和 GLM-5.3、Kimi K3 正面竞争的位置——能力和价格一起往上走。这篇讲清楚它是什么、基准怎么读、以及按你的账单换不换得动。
一、先看结论
腾讯混元 8 月 28 日发布并同步开源的新一代旗舰模型,MoE 架构,770B 总参数、每 token 激活 49B。 权重和代码走 Apache 2.0,商用免费,Hugging Face 上同时放了 BF16 和 FP8 两个版本,vLLM 和 SGLang 都有官方预构建镜像。
官方把它定位成生产力模型,重点做四类活:软件工程、办公与数据分析、游戏开发、科研计算。 对应的能力是长程任务的理解规划、跨文件协作、连续多步工具调用——都是 Agent 跑长链路时最容易断的地方。
混元这一代的价格是往上走的。Hy3 输入 $0.136 / 输出 $0.554(站内数据),Hy4 preview 是 $0.834 / $2.501, 输入贵 6.1 倍、输出贵 4.5 倍。这不是涨价,是换赛道——Hy3 在拼低价,Hy4 preview 在拼能力, 对标的是 GLM-5.3($1.40 / $4.40)和 DeepSeek V4 Pro 0813($1.32 / $3.96),并且比这两家都便宜。
已经在用 GLM-5.3、Kimi K3、DeepSeek V4 Pro 跑 Agent 编程和长文档的团队,这是一个价格更低的同档候选。 原来用 Hy3 图便宜的团队要注意,换到 Hy4 preview 账单会涨 4 到 6 倍,先算清楚再动。
注:下文标注「官方」的基准分和价格来自腾讯发布材料与模型卡,标注「站内数据」的来自 TrakToken 每日同步的价格与智能指数表, 标注「第三方观测」的来自 OpenRouter 等公开平台的运行数据。三者口径不同,对照看之前先看清标注。
二、从财报电话会到发布:这半个月的时间线
| 7 月 6 日 | Hy3 上线(站内数据记录的价格生效日):295B / 21B 激活,262K 上下文,输入 $0.136、输出 $0.554,智能指数 42.2。 这一版靠低价站住位置。 |
| 8 月 12 日 | 腾讯二季度财报电话会上确认 Hy4 正在训练,参数量比 Hy3 大,并且会支持多模态。同期披露混元的调用量在快速增长。 |
| 8 月 28 日 | Hy4 preview 发布并开源。770B / 49B 激活,1M 上下文,Apache 2.0。 同日在 WorkBuddy、CodeBuddy、元宝、ima 上线,API 走腾讯云 TokenHub 和 OpenRouter, WorkBuddy 与 CodeBuddy 给两周限时免费。 |
| 留下的差异 | 财报会上说的多模态,在这个 preview 版里没有出现——模型卡和 OpenRouter 的 listing 都只标了文本模态。 多模态大概率留给后面的正式版。 |
从 Hy3 到 Hy4 preview 不到两个月。混元今年把大版本节奏压到了平均两个月一版,和智谱、月之暗面、DeepSeek 现在的节奏是一致的。
三、架构与规格:770B 里只激活 49B
| 参数规模 | 770B 总参数 / 49B 激活,激活比例约 6.4% |
| 主干结构 | 78 层。第 1 层是标准稠密 FFN,其余 77 层换成 MoE,每层 256 个路由专家 + 1 个共享专家,每 token 走 top-8 路由专家加共享专家 |
| 注意力 | Gated DeepSeek Sparse Attention,配 IndexCache 做跨层稀疏索引复用——索引算一次多层用,省掉重复计算 |
| 残差通路 | iHC(identity Hyper-Connections),4 条残差流,加宽层间信息通路 |
| 投机解码 | 内置 1 个原生 MTP 层,10B 总参数 / 0.7B 激活,vLLM 推荐投机 3 个 token、SGLang 推荐 4 个 |
| 其他维度 | 隐层 6,144,注意力头 64,MoE 中间层 2,048,FFN 中间层 18,432,词表 120,832 |
| 上下文 / 输出 | 1,048,576 token 上下文;OpenRouter listing 上最大输出 64K |
| 许可与权重 | Apache 2.0,商用免费。Hugging Face 上 BF16 约 1.42 TiB / 131 个分片,另有 FP8 版本 |
| 部署 | 官方预构建镜像 vllm/vllm-openai:hy4-preview 与 lmsysorg/sglang:hy4-preview, 张量并行 8 路,注意力后端用 FLASHMLA_SPARSE。官方示例给的是 8×B300 或 16×B200 |
| 推荐采样参数 | temperature 0.9、top_p 1.0。推理档默认 high(长思维链),要直答就传 reasoning_effort: "no_think" |
Hy4 preview 的注意力方案直接沿用了 DeepSeek 稀疏注意力的思路,再加一层 IndexCache 的跨层索引复用。 同一周发布的 GLM-5.3-Flash 走的是线性注意力加稀疏注意力混合、外加 IndexPool 压缩索引向量。 两家的具体做法不同,要解决的是同一件事:100 万上下文下,注意力计算量和 KV Cache 占用不能跟着线性涨。
官方材料里提到,Hy4 preview 首次参与了训练方法、数据策略、评估体系和底层算子的自动优化, 其中推理侧围绕算子融合和通信优化做了多轮迭代,端到端吞吐提升 31.8%。这是官方口径的自述,暂时没有第三方复现。
BF16 权重 1.42 TiB,FP8 也在 770GB 量级,官方部署示例是 8 卡 B300 起步。 开源在这里的价值主要是可审计、可私有化交付、不被单一 API 锁定,不是「省钱自己跑」。 要算这笔账可以先去 开源模型部署选型 对一下显存和硬件成本。
四、能力:官方基准与那场内部盲测
下面这组分数来自腾讯发布材料与模型卡,官方称在 12 项基准上实现代际提升。跨代对比(Hy3 → Hy4 preview)比横向对比更可信,先看这一列。
| 基准 | Hy4 preview | Hy3 | 同档参照 |
|---|---|---|---|
| Terminal-Bench 2.1(终端操作) | 85.4 | 70.8 | 与 Claude Opus 5 持平 |
| DeepSWE(软件工程) | 64.3 | 28.0 | — |
| SWE-bench Multilingual | 82.9 | — | — |
| SWE-Bench Pro | 65.7 | — | GLM-5.2 为 62.1 |
| MCP-Atlas(工具编排) | 83.7 | — | — |
| Toolathlon Verified(工具调用) | 74.1 | — | Kimi K3 约 75、Opus 5 约 76 |
| APEX-Agents(pass@1) | 37.1 | — | Kimi K3 为 37.2 |
| GPQA Diamond(科学问答) | 92.3 | — | — |
| HLE(带工具) | 55.4 | — | GLM-5.3-Flash 为 55.3 |
| Skillsbench V1.1 | 62.9 | — | — |
| CyberGym(安全) | 78.4 | — | — |
最能说明问题的是 DeepSWE 那一行:从 28.0 到 64.3。这个基准考的是能不能在真实代码仓库里连续做完一个改动, Hy3 在这类任务上基本跑不完,Hy4 preview 到了可用区间。Terminal-Bench 2.1 从 70.8 到 85.4 是同一件事的另一个侧面。 官方说的「12 项基准代际提升」,主要提升就集中在这类长链路的 Agent 任务上。
那场 163 人的内部盲测
腾讯还公布了一组内部评测:163 位内部专家,203 个工程任务,盲评两两对比打分(满分 4 分)。
| 对比 | Hy4 preview | 对手 | 胜 / 平 / 负 |
|---|---|---|---|
| 对 GLM-5.3 | 2.99 | 2.92 | 46.8% / 12.8% / 40.4% |
| 对 Kimi K3 | 2.99 | 2.94 | 51.2% / 7.9% / 40.9% |
这组数据要谨慎读。评测者是腾讯内部专家、任务集由腾讯选定,方向性偏差躲不掉。 更重要的是差距本身:2.99 对 2.92、2.99 对 2.94,胜率都在 47%–51%,负率都在 40% 上下。 三个模型在工程任务上是同一水平,谁都没有拉开身位。做选型的时候,能力差别不足以成为决策依据,价格和速度才是。
五、价格:按每百万 token 逐项核对
官方公布两套价目:国内 6 元 / 18 元 / 缓存命中 0.3 元,国际 $0.834 / $2.501 / 缓存命中 $0.042。 按汇率折算下来两套是同一个价(隐含 7.19–7.20),不存在内外价差。下表统一用美元口径。
| 模型 | 输入 $/1M | 输出 $/1M | 缓存命中 $/1M | 智能指数 |
|---|---|---|---|---|
| Hy4 preview(官方) | 0.834 | 2.501 | 0.042 | 待接入 |
| Hy3 | 0.136 | 0.554 | 0.034 | 42.2 |
| GLM-5.3 | 1.40 | 4.40 | 0.26 | 59.5 |
| GLM-5.3-Flash | 0.15 | 0.50 | 0.026 | 57.5 |
| DeepSeek V4 Pro 0813 | 1.32 | 3.96 | 0.044 | 53.2 |
| Kimi K3(max) | 3.00 | 15.00 | 0.30 | 59.7 |
| GPT-5.6 Luna(max) | 0.20 | 1.20 | 0.02 | 52.3 |
| GPT-5.6 Sol(max) | 4.00 | 20.00 | 0.40 | 60.9 |
| Claude Opus 5(max) | 5.00 | 25.00 | 0.50 | 63.1 |
Hy4 preview 一行为官方公布价;其余为站内每日同步数据,推理型模型取满推理档。智能指数为 Artificial Analysis 口径。
和内部盲测里的两个对手比:输出价比 GLM-5.3 的 $4.40 低 43%,比 Kimi K3 的 $15.00 低 83%。 和 DeepSeek V4 Pro 0813 比,输入低 37%、输出低 37%。如果盲测结论成立(三家能力相当), 那么在这个能力档位上,Hy4 preview 现在是价格最低的一个。
$0.042 只有输入价的 1/20。同档里 GLM-5.3 的缓存命中是 $0.26,贵 6 倍多;Kimi K3 是 $0.30,贵 7 倍。 Agent 场景里系统提示词和代码库上下文反复重传,缓存命中价往往决定一半以上的账单, 这一项的差距比标价差距更值得算。展开可以看 缓存命中价那篇。
GLM-5.3-Flash($0.15 / $0.50,智能指数 57.5)和 GPT-5.6 Luna($0.20 / $1.20,52.3)在更低的价格带。 Hy4 preview 的输出价是 GLM-5.3-Flash 的 5 倍。所以真正要回答的问题是: 你的任务是不是真的需要旗舰档,还是 Flash 档就够。这个问题只能用自己的任务样本跑一遍来回答。
我们的价格与指数由上游数据源每日同步,新模型接入需要几天,Hy4 preview 发布当天还没有进表。 等它进来之后,腾讯模型报价页 会自动更新, 到时候可以用统一口径的智能指数和现有模型直接比。在那之前,上面所有能力结论都来自官方自测。
六、按一份真实用量算月度账单
抽象的单价对比没法直接用。这里按一个中等规模 Agent 编程团队的典型月用量算一遍: 月输入 5 亿 token(其中 70% 命中缓存)、月输出 5,000 万 token。你可以把自己的数字代进同一个公式。
| 模型 | 缓存命中 | 未命中输入 | 输出 | 月合计 |
|---|---|---|---|---|
| GLM-5.3-Flash | $9 | $23 | $25 | $57 |
| Hy3 | $12 | $20 | $28 | $60 |
| GPT-5.6 Luna | $7 | $30 | $60 | $97 |
| Hy4 preview | $15 | $125 | $125 | $265 |
| DeepSeek V4 Pro 0813 | $15 | $198 | $198 | $411 |
| GLM-5.3 | $91 | $210 | $220 | $521 |
| Kimi K3 | $105 | $450 | $750 | $1,305 |
| GPT-5.6 Sol | $140 | $600 | $1,000 | $1,740 |
| Claude Opus 5 | $175 | $750 | $1,250 | $2,175 |
口径:月输入 5 亿 token(70% 缓存命中)+ 月输出 5,000 万 token,单价取上表。数字四舍五入到美元。 实际账单还要看缓存命中率、推理档位和长思维链带来的额外输出 token。
第一,在旗舰档里换到 Hy4 preview,相比 GLM-5.3 省一半($265 对 $521),相比 Kimi K3 省 80%。 第二,旗舰档和 Flash 档之间差 4 到 5 倍($265 对 $57)。 先确认自己是不是真的需要旗舰档,这个决策的金额影响比在旗舰档内部选谁更大。
Hy4 preview 默认走 high 推理档,官方自己承认它「在复杂任务上思考时间偏长、倾向于过度自我验证」。 长思维链会推高输出 token 数,上表的 5,000 万输出如果实际变成 8,000 万,月合计就从 $265 变成 $340。 不需要深推理的任务传 no_think,这一档省下来的钱是实的。
七、混元这半年:Hy3 到 Hy4
| 模型 | 上线 | 参数 | 上下文 | 输入 $ | 指数 |
|---|---|---|---|---|---|
| Hy3-preview(非推理) | 2026-04-23 | 295B / 21B | 256K | 0.063 | 26.6 |
| Hy3-preview(推理) | 2026-04-23 | 299B | 256K | 0.063 | 34.4 |
| Hy3 | 2026-07-06 | 295B / 21B | 256K | 0.136 | 42.2 |
| Hy4 preview | 2026-08-28 | 770B / 49B | 1M | 0.834 | 待接入 |
Hy3 系列数据来自站内每日同步记录,Hy4 preview 为官方公布值。
今年国产模型的主流动作是把参数往下压、把价格往下打——智谱的 GLM-5 系列从 744B / 40B 走到 GLM-5.3-Flash 的 320B / 18B, 价格从 $1.00 降到 $0.15。混元这一代是反的:参数从 295B 涨到 770B,激活从 21B 涨到 49B,价格从 $0.136 涨到 $0.834。 腾讯选的是先把能力做到旗舰档,再谈成本。
这一步对办公文档和整仓代码这两类场景是硬需求。Hy3 的 256K 装不下一个中等规模仓库的关键路径, 1M 加上稀疏注意力把这条路打通了。同期 GLM-5.3、DeepSeek V4 Pro、GPT-5.6 系列都在 1M 这条线上,混元这次是补齐。
Hy3 系列已经开源,Hy4 preview 走 Apache 2.0,商用、修改、再分发都没有附加条件。 同一周智谱的 GLM-5.3-Flash 用的是 MIT。两家头部厂商在同一周把旗舰级权重放到最宽松的两个协议上, 这是今年开源侧最实际的变化。全景可以看 开源模型部署选型。
八、几个需要提醒的地方
腾讯在 8 月 12 日的财报电话会上说 Hy4 会支持多模态,但这个 preview 版的模型卡和 OpenRouter listing 都只有文本模态。 需要看截图、看图表、看视频的场景,现在还得等正式版,或者用别的模型。
OpenRouter 上第三方观测到的 P50 吞吐在 17–36 tokens/秒之间波动,P50 首 token 延迟 3.2–7.1 秒, 目前只有腾讯云一个供应来源。作为参照,站内记录的 GLM-5.3-Flash 是 49.2 tokens/秒、首 token 1.2 秒。 加上它默认长思维链,交互式场景的实际等待时间会比较难受。发布首日的数据不代表稳态,但要上生产得自己压一轮。
模型卡里写明:复杂任务上思考时间超出必要,以及倾向于过度验证自己的输出。 腾讯把这一版明确标成早期预览,说预训练和后训练都还有空间。这两条直接对应输出 token 变多和响应变慢,会进你的账单。
上面两张表的数据来源都是腾讯发布材料。内部盲测的评测者是腾讯自己的专家、任务集由腾讯选定。 站内数据表里还没有 Hy4 preview 这一行,独立口径的智能指数要等上游数据源接入,通常需要几天。 在那之前,把这些分数当成厂商的说法,不要当成第三方结论。
WorkBuddy 和 CodeBuddy 的两周限时免费是拉新,结束后按 6 元 / 18 元的标价走。做成本模型的时候直接用标价。
九、你现在可以做的几件事
| 先算账 | 拿上个月的 input / output token 量和缓存命中率,按 $0.834 / $2.501 / $0.042 套一遍, 和现在用的模型对比。成本计算器 支持直接填月度用量。 |
| 先回答档位问题 | 旗舰档和 Flash 档差 4 到 5 倍钱。拿 20 到 50 条真实任务,同时跑 Hy4 preview 和 GLM-5.3-Flash, 看便宜那档够不够用。够用的话后面的比较就不用做了。 |
| 把缓存打开 | 缓存命中 $0.042 是输入价的 1/20,同档里最低的一档。Agent 场景系统提示词和代码库上下文重复率高, 这一项对账单的影响可能比换模型本身还大。 |
| 把推理档管起来 | 默认 high 会产生很多思维链 token。分类、抽取、改写这类活直接传 reasoning_effort: "no_think", 只在真正需要规划的环节留深推理。 |
| 要自己部署的话 | Apache 2.0 权重在 Hugging Face,BF16 约 1.42 TiB、FP8 在 770GB 量级,官方示例 8×B300 起步。 先在 开源模型页 对一下显存和硬件账, 多数团队算完会发现调 API 更划算。 |
| 横向比一比 | GLM-5.3 vs DeepSeek V4 Pro vs Kimi K3 vs GLM-5.3-Flash,按你的真实场景参数看月度成本。Hy4 preview 进表后会出现在同一个列表里。 |
本文整理自腾讯官方发布材料、Hugging Face 模型卡与 GitHub 仓库、OpenRouter 公开目录, 价格与智能指数部分来自 TrakToken 每日同步的数据。可以和 GLM-5.3-Flash 详解、国内大模型 API 价格对比、2026 API 定价总览 对照阅读。
纠错与补充欢迎通过页面右下角的「反馈」入口告诉我们。联系:hi@kuhung.me。