在四小时的时间窗口内,gemma4:31b 的平均吞吐量最高,达到 106.92 词元/秒,而 nemotron-3-ultra 表现最弱,为 41.95 词元/秒。最具运维意义的波动出现在 deepseek-v4-flash 中,其吞吐量从 07:50 的 140.19 词元/秒急剧下降至 07:55 的 15.7 词元/秒,随后在 08:00 恢复至 123.5 词元/秒。glm-5.2 呈现出最强的上升趋势,增长了 33.3%,最新吞吐量达到 116.56 词元/秒。该数据集包含六个模型的 288 个有效数据点,实现了 100.0% 的覆盖率,不存在缺失数据限制。
每小时性能洞察
GLM-5.2 对滚动四小时性能数据的摘要
在四小时的时间窗口内,deepseek-v4-flash 实现了最强的平均吞吐量,达到 103.84 词元/秒,而 nemotron-3-ultra 最弱,为 45.14 词元/秒。最具运营意义的波动出现在 glm-5.2 中,该模型从 216.98 词元/秒的峰值急剧下降至 04:30 时的 13.59 词元/秒,反映出 53.4% 的变异系数。该数据集包含跨六个模型的 288 个有效观测值,相当于每个模型 48 个预期样本的恰好 100.0% 覆盖率,这意味着没有需要报告的缺失数据限制。
在四小时的时间窗口内,glm-5.2 的平均输出词元吞吐量最高,为 122.38 词元/秒,而 nemotron-3-ultra 最弱,为 46.77 词元/秒。最具运营意义的波动出现在 glm-5.2 中,其从 02:25 的 223.93 词元/秒峰值急剧下降至 04:30 的 13.59 词元/秒低点,反映出 60.7% 的下降趋势。相比之下,deepseek-v4-flash 保持了最稳定的性能,平均为 106.89 词元/秒,变异系数为 20.7%。该数据集包含跨六个模型的 288 个有效观测值,实现了 100.0% 的覆盖率,没有缺失数据的限制。
在四小时的时间窗口内,glm-5.2 的平均吞吐量最高,达到 153.49 词元/秒,而 nemotron-3-ultra 最低,为 47.92 词元/秒。最具运营意义的波动出现在 glm-5.2 中,其从窗口初期的 200 词元/秒以上急剧下降至 04:30 的最低点 13.59 词元/秒,反映出 43.8% 的下降趋势。相比之下,minimax-m3 保持稳定,变异系数为 18.1%,平均值为 63.38 词元/秒。该数据集包含跨六个模型的 288 个有效数据点,实现了 100.0% 的覆盖率,没有缺失数据的限制。
在288个有效观测数据中,glm-5.2是最强的模型,平均吞吐量为186.51词元/秒,而nemotron-3-ultra最弱,为46.66词元/秒。最具运维意义的趋势是glm-5.2在时间窗口后期的吞吐量急剧下降,从03:15的216.98词元/秒降至04:00的最低58.75词元/秒,产生-10.9%的周期趋势。Deepseek-v4-pro也表现出高波动性,在123.03词元/秒和26.57词元/秒之间剧烈波动。该数据集的覆盖率为100.0%,在每模型预期的48个样本中不存在缺失数据限制。
在四小时的时间窗口内,glm-5.2 是表现最强的模型,平均吞吐量为 196.91 词元/秒,而 nemotron-3-ultra 表现最弱,为 41.71 词元/秒。最具操作意义的波动性来自 nemotron-3-ultra,其变异系数为 42.4%,尽管呈 34.5% 的上升趋势,但最低降至 5.25 词元/秒。相反,glm-5.2 保持了最高的稳定性,变异系数仅为 10.2%。数据集包含 288 个有效观测值,在所有每个模型预期的 48 个样本中实现了 100.0% 的覆盖率,这意味着不存在影响此分析的缺失数据限制。
在四小时的时间窗口内,glm-5.2 以 195.03 词元/秒的平均吞吐量表现最强,而 nemotron-3-ultra 最弱,为 39.86 词元/秒。最具操作意义的波动来自 nemotron-3-ultra,它在 23:30 降至 5.25 词元/秒,变异系数为 43.9%。Deepseek-v4-pro 和 deepseek-v4-flash 也经历了严重的瞬时下降,分别降至 8.78 和 14.69 词元/秒。数据集覆盖率为 100.0%,包含 288 个有效点,这意味着没有缺失数据限制影响这一特定分析窗口。
在四小时的时间窗口内,glm-5.2 以 188.70 词元/秒的平均吞吐量表现最强,而 nemotron-3-ultra 最弱,为 32.04 词元/秒。在运行方面,nemotron-3-ultra 表现出极大的波动性,变异系数达 59.3%,在 4.42 和 67.56 词元/秒之间波动。此外,deepseek-v4-pro 和 deepseek-v4-flash 经历了严重的瞬时下降,分别骤降至 8.78 和 14.69 词元/秒。该数据集包含跨六个模型的 288 个有效观测值,实现了 100.0% 的覆盖率,没有缺失数据限制。
在整个四小时窗口期内,glm-5.2 表现出最强的平均吞吐量,达到 186.23 词元/秒,而 nemotron-3-ultra 最弱,为 32.32 词元/秒。在运行方面,nemotron-3-ultra 表现出极端的波动性,变异系数达 61.5%,频繁跌破 10 词元/秒。此外,deepseek-v4-pro 和 deepseek-v4-flash 经历了严重的瞬时减速,分别骤降至 8.78 词元/秒和 14.69 词元/秒。尽管数据集显示所有 288 个有效样本的覆盖率达到 100.0%,但五分钟的粒度限制了检测子区间微中断或精确定位这些吞吐量急剧下降确切持续时间的能力。
在四小时窗口内,glm-5.2 提供了最强的平均吞吐量,达到 178.42 词元/秒,而 nemotron-3-ultra 最弱,为 33.78 词元/秒。在运行方面,nemotron-3-ultra 表现出严重的波动性,变异系数为 58.4%,并呈现急剧下降趋势,从 19:05 的 45.26 词元/秒降至 23:00 的 10.34 词元/秒。Deepseek-v4-flash 也表现出不稳定性,在 22:25 骤降至 14.69 词元/秒。尽管数据集覆盖率为 100.0%,包含 288 个有效点,但四小时窗口限制了对昼夜负载模式的可见性。
在四小时的时间窗口内,glm-5.2 的平均吞吐量最高,达到 175.08 词元/秒,而 nemotron-3-ultra 最低,为 33.08 词元/秒。在运行表现上,nemotron-3-ultra 波动极大,在 4.29 和 68.67 词元/秒之间波动,变异系数为 57.6%,其吞吐量呈 21.2% 的下降趋势。相比之下,minimax-m3 保持了最稳定的性能,平均为 66.99 词元/秒,变异系数仅为 17.1%。该数据集包含 288 个有效观测值,在所有六个模型中实现了 100.0% 的覆盖率,没有缺失数据限制。
在四小时的时间窗口内,glm-5.2 提供了最强的平均吞吐量,达到 172.69 词元/秒,而 nemotron-3-ultra 最弱,为 37.07 词元/秒。在运行方面,deepseek-v4-pro 表现出最显著的下降趋势,下降 16.1%,最新读数为 64.85 词元/秒。与此同时,gemma4:31b 表现出极端波动性,在 32.12 词元/秒的最小值和 178.8 词元/秒的最大值之间摆动。该数据集包含跨六个模型的 288 个有效观测值,覆盖率为 100.0%,这意味着不存在影响本次运行审查的缺失数据限制。
在四小时的时间窗口内,glm-5.2 提供了最强的平均吞吐量,达到 168.37 词元/秒,而 nemotron-3-ultra 最弱,为 31.61 词元/秒。最具操作意义的波动发生在 nemotron-3-ultra 中,其记录了 57.1% 的变异系数和 2.26 词元/秒的严重最低值,表明生成极不稳定。相反,deepseek-v4-pro 表现出显著的下降趋势,下降了 10.4%,平均降至 78.81 词元/秒。该数据集包含所有六个模型的 288 个有效数据点,覆盖率为 100.0%,这意味着不存在影响此分析的缺失数据限制。
在四小时的时间窗口内,glm-5.2 提供了最强的平均吞吐量,达到 172.86 词元/秒,而 nemotron-3-ultra 最弱,为 25.1 词元/秒。在运行方面,nemotron-3-ultra 表现出极端的波动性,在 15:35 左右暴跌至 1.67 词元/秒,随后在 16:45 恢复至 72.03 词元/秒。Deepseek-v4-pro 也表现出早期的剧烈波动,在 15:05 降至 11.73 词元/秒。所有六个模型在 288 次有效观测中均实现了 100.0% 的覆盖率,这意味着没有缺失数据限制影响这一特定数据集。然而,该数据集缺乏每个请求的并发细节,限制了更深层次的容量分析。
在四小时的时间窗口内,glm-5.2 的平均吞吐量最高,达到 177.87 词元/秒,而 nemotron-3-ultra 最弱,为 21.25 词元/秒。最具操作意义的波动出现在 nemotron-3-ultra 中,其变异系数高达 84.7%,并跌至 1.67 词元/秒的最低值。Deepseek-v4-pro 也表现出明显的不稳定性,降至 11.73 词元/秒。该数据集包含跨六个模型的 288 个有效观测值,实现了 100.0% 的覆盖率。由于数据集仅跨越四小时,缺乏更长时间跨度的上下文,限制了对昼夜模式或持续性能衰退进行评估的能力。
在四小时的时间窗口内,glm-5.2 提供了最强的平均吞吐量,达到 183.76 词元/秒,而 nemotron-3-ultra 最弱,为 20.1 词元/秒。在运行方面,nemotron-3-ultra 表现出最显著的波动和性能下降,从 72.07 词元/秒的峰值骤降至持续低于 3 词元/秒的低点,趋势为 -39.8%。尽管数据集报告在所有 288 个有效点计数上实现了 100.0% 的覆盖率,但五分钟的粒度限制了对子区间延迟峰值或会影响实时用户体验的短暂限流事件的检测能力。
在四小时的时间窗口内,glm-5.2 提供了最强的平均吞吐量,达到 184.47 词元/秒,而 nemotron-3-ultra 最弱,为 23.35 词元/秒。最具操作意义的波动是 nemotron-3-ultra 的严重性能下降,从 72.07 词元/秒的峰值跌至 1.67 词元/秒的最低值,变异系数为 85.4%,趋势为 -46.4%。Deepseek-v4-flash 也表现出不稳定性,在 13:00 骤降至 7.06 词元/秒。所有 288 个有效点的数据集覆盖率为 100.0%,这意味着不存在影响本分析的缺失数据限制。
在四小时的时间窗口内,glm-5.2 提供了最强的平均吞吐量,达到 186.74 词元/秒,而 nemotron-3-ultra 最弱,为 25.67 词元/秒。最具操作意义的波动性出现在 nemotron-3-ultra 中,其表现出极度的不稳定,变异系数高达 78.0%,吞吐量降至最低 2.3 词元/秒。这种波动水平表明,与更稳定的模型相比,其性能下降极不稳定。数据集完整,覆盖率为 100.0%,每个模型预期的全部 48 个样本均无缺失数据限制。
在四小时的时间窗口内,glm-5.2 提供了最强的平均吞吐量,达到 181.76 词元/秒,而 nemotron-3-ultra 最弱,为 27.42 词元/秒。最具操作意义的波动出现在 deepseek-v4-pro 中,其趋势下降了 18.1%,并跌至 13.99 词元/秒的最低值。Deepseek-v4-flash 也表现出严重的不稳定性,在 13:00 骤降至 7.06 词元/秒。数据集覆盖完整,包含 288 个有效观测值,因此不存在影响此分析的缺失数据限制。
在这四个小时的时间窗口内,glm-5.2 以 182.1 词元/秒的平均吞吐量表现最强,而 nemotron-3-ultra 最弱,为 29.76 词元/秒。最具操作意义的波动是 nemotron-3-ultra 在上午临近结束时吞吐量的严重崩溃,从 11:15 的 50.35 词元/秒降至 12:05 的 3.23 词元/秒,导致其变异系数达到 60.5%。此外,deepseek-v4-flash 和 deepseek-v4-pro 在最后一个时间间隔分别急剧下降至 7.06 词元/秒和 13.99 词元/秒。该数据集完整,覆盖率为 100.0%,包含 288 个有效数据点,因此不存在影响本分析的缺失数据限制。
在四小时的时间窗口内,glm-5.2 提供了最强的平均吞吐量,达到 185.4 词元/秒,而 nemotron-3-ultra 最弱,为 31.63 词元/秒。最具运维意义的波动是 nemotron-3-ultra 高达 64.9% 的变异系数,包括在 08:35 降至 0.4 词元/秒,以及到 12:00 时下降 -37.1% 至 4.92 词元/秒的下降趋势。尽管数据集覆盖率达到 100.0% 且包含 288 个有效点,但五分钟的采样间隔限制了对五分钟以内的微中断或瞬时延迟峰值的检测。
在整个四小时的数据集中,glm-5.2 提供了最强的平均吞吐量,达到 177.71 词元/秒,而 nemotron-3-ultra 最弱,为 35.06 词元/秒。最具操作意义的波动出现在 nemotron-3-ultra 中,该模型在 08:35 降至 0.4 词元/秒,反映出严重的延迟不稳定性。deepseek-v4-flash 呈现出最大的负向趋势,为 -10.6%。尽管所有模型的覆盖率均为 100%,但该数据集因缺少请求并发元数据而受到限制,无法隔离租户负载对这些吞吐量下降的影响。
在整个四小时窗口期内,glm-5.2 表现出最强的平均吞吐量,达到 182.69 词元/秒,而 nemotron-3-ultra 表现最弱,为 37.46 词元/秒。在运行方面,nemotron-3-ultra 表现出最严重的波动性,在 08:35 骤降至 0.4 词元/秒,这表明存在间歇性的服务中断。相反,minimax-m3 呈现出明显的下降趋势,下降了 11.1%,最新吞吐量为 25.93 词元/秒。尽管数据集报告在所有 288 个有效点计数上均实现了 100.0% 的覆盖率,但五分钟的观测间隔缺乏确定这些极端吞吐量下降是代表完全中断还是瞬时限流所需的粒度。
在四小时的时间窗口内,glm-5.2 提供了最强的平均吞吐量,达到 181.57 词元/秒,而 nemotron-3-ultra 最弱,为 35.11 词元/秒。最具操作意义的波动是 nemotron-3-ultra 在 08:30 至 08:35 UTC 之间严重的吞吐量崩溃,其输出从 1.47 词元/秒暴跌至 0.4 词元/秒,随后恢复至 28.18 词元/秒。此数据集不存在缺失数据的局限性,因为所有六个模型在其预期的 48 个样本中均实现了 100.0% 的覆盖率。
在四小时的时间窗口内,glm-5.2 表现出最强的平均吞吐量,达到 180.86 词元/秒,而 nemotron-3-ultra 最弱,为 30.78 词元/秒。最具操作意义的波动出现在 glm-5.2 中,尽管其平均值较高,但在五分钟内却急剧下降至 39.01 词元/秒和 58.29 词元/秒。Nemotron-3-ultra 也表现出极端的不稳定性,范围从 4.16 到 69.35 词元/秒,变异系数为 49.2%。所有六个模型均实现了 100% 的覆盖率,包含 288 个有效数据点,因此该数据集不存在缺失数据的限制。
在四小时的时间窗口内,glm-5.2 以 187.27 词元/秒的平均吞吐量表现最强,而 nemotron-3-ultra 以 33.11 词元/秒表现最弱。在运行方面,deepseek-v4-flash 和 nemotron-3-ultra 表现出严重的波动性,变异系数分别达到 35.9% 和 52.5%,这是由吞吐量骤降至 22.35 词元/秒和 4.16 词元/秒所致。尽管数据集覆盖率为 100.0%,但分析因缺少并发请求数量而受限,从而无法区分模型侧的延迟激增与用户驱动的负载波动。
在整个四小时的时间窗口内,glm-5.2 提供了最强的平均输出词元吞吐量,为 185.69 词元/秒,而 nemotron-3-ultra 最弱,为 34.49 词元/秒。最具操作意义的波动发生在 nemotron-3-ultra 上,其从 69.73 词元/秒的峰值急剧下降至 4.16 词元/秒的最低值,反映出 41.5% 的下降趋势。deepseek-v4-pro 也表现出明显的不稳定性,降至 20.18 词元/秒。该数据集包含跨六个模型的 288 个有效观测值,覆盖率为 100.0%,这意味着不存在影响此分析的缺失数据限制。
在整个四小时窗口内,glm-5.2 的平均吞吐量最高,达到 190.22 词元/秒,而 nemotron-3-ultra 最低,为 37.63 词元/秒。最具操作意义的波动出现在 deepseek-v4-flash 中,其在 18.33 和 152.68 词元/秒之间剧烈波动,变异系数为 46.4%,表明响应时间极不稳定。此外,deepseek-v4-pro 呈现出显著的下降趋势,在此期间下降了 19.0%,并触及 20.18 词元/秒的低点。尽管覆盖率为 100.0%,但数据集缺乏并发请求量数据,限制了判断吞吐量下降是源于容量饱和还是内部模型低效的能力。
在四小时的时间窗口内,glm-5.2 的平均吞吐量最高,达到 187.89 词元/秒,而 nemotron-3-ultra 最低,为 41.06 词元/秒。最具运营意义的波动出现在 deepseek-v4-flash 中,其在 155.36 词元/秒和 18.33 词元/秒之间表现出剧烈波动,导致变异系数为 52.5%。这种不稳定的性能使容量规划变得复杂。尽管数据集覆盖率为 100.0% 且没有缺失样本,但分析受限于短暂的四个小时持续时间,无法评估昼夜模式或长期退化。
在四小时的时间窗口内,glm-5.2 以 187.87 词元/秒提供了最强的平均吞吐量,而 nemotron-3-ultra 最弱,为 38.29 词元/秒。最具操作意义的波动出现在 deepseek-v4-flash 中,其在 155.36 词元/秒和 18.33 词元/秒之间表现出剧烈波动,变异系数为 50.6%。这种不稳定的性能给最终用户带来了不可预测的延迟。尽管数据集覆盖率标记为 100.0%,包含 288 个有效点,但五分钟的采样间隔缺乏亚分钟级的分辨率,限制了对短暂微峰值性能下降的检测能力。
在整个四小时窗口内,glm-5.2 提供了最强的平均吞吐量,达到 186.96 词元/秒,而 nemotron-3-ultra 最弱,为 38.17 词元/秒。最具操作意义的波动出现在 deepseek-v4-flash 中,该模型在 19.96 和 155.36 词元/秒之间表现出剧烈波动,反映出 51.2% 的变异系数。同样,nemotron-3-ultra 遭遇了严重的微跌,最低降至 1.9 词元/秒。尽管数据集报告所有模型的覆盖率为 100.0%,但五分钟的采样间隔缺乏隔离这些急剧瞬时下降根本原因所需的粒度。
在四小时的时间窗口内,glm-5.2 提供了最强的平均吞吐量,达到 185.62 词元/秒,而 nemotron-3-ultra 最弱,为 35.94 词元/秒。最具操作意义的波动出现在 deepseek-v4-flash,该模型在 19.96 和 155.36 词元/秒之间表现出剧烈波动,变异系数为 55.4%,表明其性能高度不稳定。此外,glm-5.2 经历了严重的瞬时下降,在 22:30 骤降至 46.55 词元/秒,并在 00:00 降至 88.69 词元/秒。该数据集包含跨六个模型的 288 个有效数据点,覆盖率为 100.0%,这意味着不存在影响本分析的缺失数据限制。
在四小时的时间窗口内,glm-5.2 提供了最强的平均吞吐量,达到 191.34 词元/秒,而 nemotron-3-ultra 最弱,为 33.9 词元/秒。最具操作意义的波动来自 deepseek-v4-flash,其在 21.36 和 142.82 词元/秒之间剧烈波动,变异系数为 59.9,表明性能极不稳定。此外,glm-5.2 在 22:30 经历了严重的吞吐量下降,降至 46.55 词元/秒,随后恢复。尽管数据集覆盖率为 100.0%,包含 288 个有效点,但五分钟的观测间隔限制了对五分钟以下的微突发或短暂中断的检测能力,这意味着快速的瞬时性能下降无法被捕获。
在四小时的时间窗口内,glm-5.2 以 194.24 词元/秒的平均吞吐量表现最强,而 nemotron-3-ultra 最弱,为 29.28 词元/秒。最具操作意义的波动出现在 deepseek-v4-flash,其数值在 21.36 和 135.06 词元/秒之间剧烈波动,变异系数为 60.1%。Nemotron-3-ultra 也表现出极端的不稳定性,在回升 80.8% 之前曾降至 3.68 词元/秒。该数据集记录了所有六个模型 100.0% 的覆盖率,包含 288 个有效数据点,但四小时的持续时间限制了对长期容量规划中缺失数据的任何评估。
在四小时的时间窗口内,glm-5.2 是表现最强的模型,平均吞吐量为 196.78 词元/秒,而 nemotron-3-ultra 是表现最弱的,为 23.55 词元/秒。最具操作意义的波动来自 deepseek-v4-flash 和 nemotron-3-ultra,它们表现出极端的吞吐量摆动;deepseek-v4-flash 在 12.02 至 135.06 词元/秒之间波动,nemotron-3-ultra 在 2.64 至 71.78 词元/秒之间变化。这种程度的不稳定性为受影响的工作负载造成了高度不可预测的延迟。数据集显示 100.0% 的覆盖率,包含 288 个有效数据点,这意味着没有缺失数据的限制影响这一特定分析。
在四小时的时间窗口内,glm-5.2 以 193.53 词元/秒的平均吞吐量表现最强,而 nemotron-3-ultra 最弱,为 24.61 词元/秒。在运行方面,deepseek-v4-flash 表现出严重的波动性,变异系数达 50.8%,在 11.88 和 133.32 词元/秒之间摆动。此外,nemotron-3-ultra 经历了急剧的运行性能下降,从 17:05 的 44.21 词元/秒跌至 18:30 的最低 2.64 词元/秒,反映出 -26.5% 的趋势。该数据集包含 288 个有效观测值,在所有 48 个每模型预期样本中实现了 100.0% 的覆盖率,这意味着不存在缺失数据限制来约束本分析。
在整个四小时窗口期内,glm-5.2 表现出最强的平均吞吐量,达到 186.2 词元/秒,而 nemotron-3-ultra 最弱,为 26.77 词元/秒。在运行方面,nemotron-3-ultra 表现出严重的波动性和急剧的性能下降,从 16:20 的 56.06 词元/秒跌落至 18:30 的 2.64 词元/秒。deepseek-v4-flash 同样显示出不稳定性,在 16:25 飙升至 159.21 词元/秒,随后在 16:50 暴跌至 8.22 词元/秒。本分析受限于数据缺失;每个模型在预期的 48 个样本中记录了 45 个有效样本,覆盖率为 93.8%。
在四小时的时间窗口内,glm-5.2 提供了最强的平均吞吐量,达到 181.14 词元/秒,而 nemotron-3-ultra 表现最弱,为 31.55 词元/秒。最具操作意义的波动出现在 nemotron-3-ultra 中,该模型经历了 25.8% 的严重下行趋势,骤降至 2.64 词元/秒的最低点。同样,deepseek-v4-flash 表现出高度的不稳定性,其变异系数为 44.4%,并多次出现跌破 15 词元/秒的急剧下降。一个关键限制是,该数据集在预期的 288 个数据点中仅包含 198 个有效点,导致覆盖率为 68.8%。这些缺失数据使得无法对整个时间段进行完整评估。
在四小时的时间窗口内,glm-5.2 是表现最强的模型,平均吞吐量为 173.55 词元/秒,而 nemotron-3-ultra 最弱,为 37.89 词元/秒。在运行方面,deepseek-v4-flash 表现出最显著的波动性,降至 8.22 词元/秒和 11.88 词元/秒的极低值,导致其变异系数高达 41.4%。所有模型各有恰好 21 个样本,导致数据集覆盖率仅为 43.8%。这种数据缺失的限制使得对该时段前 140 分钟的情况无法观测,这意味着计算出的平均值可能无法代表完整的运行能力。
在滚动的四小时窗口内,glm-5.2 是平均吞吐量最强的模型,达到 164.88 词元/秒,而 nemotron-3-ultra 最弱,为 38.09 词元/秒。最具操作意义的波动出现在 deepseek-v4-flash 中,其表现出严重的吞吐量不稳定性;尽管平均值为 80.49 词元/秒,但它跌至 8.22 词元/秒和 11.88 词元/秒的极端低点。此项评估受到重大缺失数据局限性的制约。数据集在预期的 288 个观测值中仅包含 90 个有效观测值,代表 31.2% 的覆盖率,导致该时段的大部分时间处于未监控状态。