MAAS / WEEKLY
SIGNAL REPORT · ISSUE 23

MaaS 平台
周度追踪报告 2026.09.01

01 / LEAD

本周头条

本周最重大的模型发布、开源与平台变化。点击卡片展开详情。

腾讯混元 · 8月28日01

腾讯混元 Hy4 Preview 发布并开源
770B MoE,49B激活,1M上下文,开源第一梯队扩员至"四强并立"

770B 总参49B 激活1M 上下文

8月28日,腾讯混元发布并开源 Hy4 Preview,这是本周最重大的国产模型发布事件。关键信息:

① 模型规格:770B 总参数,49B 激活参数,MoE 架构,上下文窗口超过 1M tokens。Apache 2.0 开源协议,HuggingFace/ModelScope/GitCode/CNB 同步发布。

② 定位与能力:面向长程软件工程、重文档办公与科研。官方内部盲测:163名专家、203项工程任务,均分 2.99/4.00,略高于 GLM-5.3(2.92)与 Kimi K3(2.94)。Terminal-Bench 2.1 达 85.4(Hy3 为 71.7)。承认早期版本可能过度核验、耗时偏长。

③ API 定价:国内价缓存命中 ¥0.3/百万tokens,输入 ¥6,输出 ¥18。API 经腾讯云 TokenHub 与 OpenRouter 开放。WorkBuddy/CodeBuddy 两周免费体验,Hy3 免费期延至 9月30日。

④ 行业意义:开源第一梯队从此前的"三强"(Kimi K3、Qwen3.8 Max、GLM-5.3)变为"四强并立"。Apache 2.0 协议比 GLM-5.3 自有协议更友好,对国内 Agent/办公套件集成更易签。但独立评测尚未跟上,彼德研究院提示"不得把内部盲测直接写成第三方排名"。

(跟进报道腾讯混元:2026-08-25/08-21/08-18/08-14/08-11)

智谱 · 8月28日02

智谱 GLM-5.3 权重 8月28日如期开源
但许可改为自有协议(非MIT),GLM-5.3-Flash 同步发布

MIT

上周报告追踪的"GLM-5.3权重8月28日开源倒计时"事件已落地。关键进展:

① 旗舰权重如期放出:8月28日凌晨,HuggingFace 仓库 zai-org/GLM-5.3 出现 Initial commit 0828,兑现"发布后两周内开源"承诺。模型约 744B-753B 总参/约40B激活,1M上下文,提供 BF16/FP8,适配 vLLM/SGLang/Transformers。

② 许可证分叉——旗舰自有协议,Flash 走 MIT:GLM-5.3 旗舰采用自有"GLM-5.3 License":允许本地部署、微调与一般商用;但年营收超过100亿美元且对外提供模型服务时需通过 Z.ai 安全审查。而 GLM-5.3-Flash(8月26日发布)走 MIT 协议,形成分叉。这意味着中小团队可自由使用,但超大规模竞品被协议拦住。

③ GLM-5.3-Flash 发布(8月26日)——GLM-5系列首个原生多模态模型:320B总参/18B激活,45层,首个稀疏+线性注意力混合架构的开源前沿模型。AA综合智能指数57分追平 Claude Opus 4.8,限时折扣价约 Opus 4.8 的 1/40。DeepSWE v1.1 63.4 反超 Opus 4.8 的 58.0。此前以匿名模型"Ox-Alpha"空降 OpenCode 和 OpenRouter 收集真实反馈,当周成为双平台最受欢迎模型。

④ 国产芯片大规模验证:Ox-Alpha 全部流量由国产芯片集群承载(数万张国产加速卡),智谱在 SGLang 基础上构建专用推理引擎:EPD分离架构、W8A8量化、混合缓存量化、Layer Split。国产芯片端到端性能较基线提升3倍,单token成本达主流 NVIDIA GPU 水平。

(跟进报道GLM-5.3:2026-08-25/08-21/08-18/08-14/08-11/08-07/08-04)

WATCH · 8月26日03

阿里 Qwen3.8-Flash-Next 开源(8月26日)
Qwen4 架构预览,125B总参/6B激活

125B 总参6B 激活

阿里 Qwen 官方博客发布 Qwen3.8-Flash-Next 开源权重。

① Qwen4 架构预告:主模型 125B,另加 51B N-gram embedding,每token约激活 6B。原生上下文 262K,YaRN 可扩展至 1M。官方角色等同当年 Qwen3-Next 之于 Qwen3.5——提前放出将用于 Qwen4 的架构。

② 低激活量的价值:6B 激活量带来本地/边缘可运行性,对研究者的价值高于对采购方。生产 API 对应 Qwen3.8-Flash。AA 参考价约 $0.10/1M。

③ 彼德研究院判断:"这是架构预告,不是 Qwen4 旗舰本身。"

(跟进报道阿里百炼:2026-08-25/08-21/08-18/08-14/08-11/08-07)

Kimi · 8月31日04

Kimi K2.5/moonshot-v1 8月31日正式下线
K3 全面接棒

K3 全面接棒

8月31日,月之暗面 Kimi K2.5 模型正式下线,同期下线的还有 moonshot-v1 系列模型。K2.5 于今年1月27日发布,基于万亿参数 MoE 架构,服役仅7个月。K3(2.88万亿参数,KDA架构)全面接棒。

(跟进报道Kimi:2026-08-25/08-21/08-18/08-14/08-11)

02 / LANDED

关键节点落地

本周已执行的存量节点,相关业务应确认迁移与成本变化是否完成闭环。

9月23日

阿里百炼 Wan3.0视频生成限时7折截止

阿里百炼

9月29日

百度千帆 DeepSeek-V3.2/V3.2-Think正式下线

百度千帆

9月30日

原腾讯混元大模型平台全面停服

腾讯混元

03 / MATRIX

平台状态矩阵

绿色表示本周活跃或处于事件兑现期,黄色表示整体稳定。

9 个平台信号 / 更新至 09.01

平台状态本周动态关注节点
火山方舟(豆包)活跃

V4-Pro价格8/28调整生效

Agent Plan套餐持续运营

阿里百炼稳定

Qwen3.8-Flash-Next开源(8/26)、8月功能更新仅2条

Qwen4旗舰发布(预计Q4)、Wan3.0七折至9/23

百度千帆稳定

V1接口8/31正式下线

DeepSeek-V3.2 9/29下线

腾讯混元活跃

Hy4 Preview发布并开源(8/28)、Hy3免费延至9/30

原混元平台9/30停服、Hy4独立评测待验证

硅基流动稳定

上线高速版DeepSeek-V4-Flash-0731

上市进程推进

智谱AI稳定

GLM-5.3权重8/28开源(自有协议)、GLM-5.3-Flash发布(8/26, MIT)、国产芯片验证

GLM-5.3社区微调进展、更大模型在路上

Kimi稳定

K2.5/moonshot-v1 8/31正式下线、K3全面接棒

最快6个月内上市、K3美国托管洽谈

MiniMax稳定

M3 Pro 8月发布落空

M3 Pro(Q3最后窗口=9月)

DeepSeek稳定

无新更新,最新仍为8/21 V4-Flash-Vision-Exp

Harness生态扩展

没有匹配的平台信号
04 / CALENDAR

下一步关注

近期关键时间节点,提前准备迁移与方案确认。

9月

**MiniMax M3 Pro发布(Q3最后窗口,2.7万

MiniMax

9月30日

腾讯混元Hy3免费期截止

腾讯混元

即将上线

千问办公(QwenWork)钉钉入口

阿里百炼

预计Q4

Qwen4旗舰发布

阿里百炼

05 / READOUT

格局变化

本周趋势洞察,解读事件背后的产业格局演变。

TREND · 09.01

8月28日超级日

上周报告预测的"8月28日超级日"已全部落地:①智谱GLM-5.3权重如期开源(自有协议);②腾讯Hy4 Preview发布并开源(Apache 2.0);③火山方舟deepseek-v4-pro价格调整生效。三件大事同日发生,标志着中国开源大模型进入"四强并立"时代。

02

开源协议分叉——从"一律MIT"到"分层授权"

GLM-5.3旗舰采用自有协议(年营收超100亿美元需安全审查),而GLM-5.3-Flash走MIT。这标志着国产开源模型从"一律MIT"向"分层授权"演进:旗舰模型通过协议限制超大规模竞品商业使用,轻量版走MIT鼓励社区传播。与此对比,腾讯Hy4选择Apache 2.0(更友好),百度千帆未开源旗舰。开源协议本身正在成为竞争工具。…

03

"前沿智能≠前沿价格"被智谱打破——GLM-5.3-Flash以1/40价格追平Opus 4.8

GLM-5.3-Flash的AA智能指数57分追平Claude Opus 4.8,但价格仅为其1/40。这不是补贴,而是架构创新:稀疏+线性注意力混合架构+IndexPool+mHC,注意力计算量降3.01倍,KV缓存降4.44倍。加上国产芯片大规模验证(数万张国产加速卡,EPD分离架构),智谱证明了"前沿智力不必伴随前沿成本"。这对所有"旗舰模型"的定价构成压力。…

04

国产芯片跑前沿模型被大规模验证

GLM-5.3-Flash在发布前以"Ox-Alpha"匿名身份在OpenCode和OpenRouter上运行,全部流量由国产芯片集群承载,用户体感"又强又便宜"而不知底层硬件。这是国产芯片大规模承载开源前沿模型的首次公开验证:W8A8量化、INT8/FP8/BF16混合缓存、Layer Split,单token成本达主流NVIDIA GPU水平。对国产算力供应链具有重要里程碑意义。…

06 / ARCHIVE

周报归档

共 23 期完整周报,按日期倒序排列。