在四小时的时间窗口内,glm-5.2是平均吞吐量最强的模型,达到90.88词元/秒,紧随其后的是deepseek-v4-flash,达到91.45词元/秒。最弱的是nemotron-3-ultra,为33.9词元/秒。在运行方面,gemma4:31b表现出最显著的波动性,变异系数高达49.8%,吞吐量从最大值132.98词元/秒降至最小值15.1词元/秒。它在该时期内还呈现出-31.9%的急剧下降趋势。该数据集的覆盖率为100.0%,包含288个有效数据点,因此不存在影响本分析的缺失数据限制。
每小时性能洞察
滚动四小时性能数据摘要
在四小时的时间窗口内,deepseek-v4-flash 的平均吞吐量最高,达到 92.84 词元/秒,而 nemotron-3-ultra 表现最弱,为 38.09 词元/秒。在运行方面,gemma4:31b 显示出最严重的波动,变异系数为 52.5%,从 166.2 词元/秒的峰值跌至 23.08 词元/秒的最新读数。Deepseek-v4-pro 也表现出剧烈的不稳定性,在 23:40 骤降至 12.2 词元/秒。相比之下,glm-5.2 是唯一呈现正向趋势的模型,上升了 5.7%,平均达到 90.84 词元/秒。该数据集包含所有六个模型的 288 个有效数据点,覆盖率达到 100.0%,不存在缺失数据的限制。
在四小时的时间窗口内,glm-5.2 的平均输出词元吞吐量最高,为 98.5 词元/秒,而 nemotron-3-ultra 最低,为 39.84 词元/秒。最具运营意义的波动来自 gemma4:31b,其从 169.69 词元/秒的峰值急剧下降至 27.07 词元/秒的低谷,产生了 47.2% 的高变异系数和 41.7% 的下降趋势。Deepseek-v4-flash 是唯一表现出正趋势增长的模型,增长率为 4.8%。该数据集包含跨所有六个模型的 288 个有效观测值,实现了 100.0% 的覆盖率,没有缺失数据的限制。
在这四小时的窗口期内,gemma4:31b 的平均输出词元吞吐量最高,为 101.78 词元/秒,而 nemotron-3-ultra 最低,为 41.72 词元/秒。最具运营意义的波动是 gemma4:31b 在窗口期后期的急剧下降,从 169.69 词元/秒的峰值跌至 27.07 词元/秒,产生了 22.1% 的负趋势。相反,deepseek-v4-flash 提升了 18.3%,最终达到 92.53 词元/秒。数据集覆盖率为 100.0%,涵盖所有 288 个有效观测值,这意味着没有影响该特定时间段的缺失数据限制。
在四小时的时间窗口内,gemma4:31b 是表现最强的模型,平均吞吐量为 106.24 词元/秒,而 nemotron-3-ultra 是表现最弱的模型,为 39.39 词元/秒。最具运维意义的波动来自 gemma4:31b,其在 55.26 和 169.69 词元/秒之间剧烈波动,变异系数为 32.7%。此外,deepseek-v4-flash 在 22:40 UTC 经历了一次严重的单区间下降,降至 19.63 词元/秒。该数据集包含 288 个有效观测值,在所有六个模型中实现了 100.0% 的覆盖率,没有缺失数据的限制。
在四小时的时间窗口内,gemma4:31b 是表现最强的模型,平均吞吐量为 103.45 词元/秒,而 nemotron-3-ultra 是表现最弱的模型,为 38.92 词元/秒。最具运营意义的波动来自 nemotron-3-ultra,其变异系数为 38.1%,并降至 10.01 词元/秒的最低值。此外,deepseek-v4-flash 呈现出显著的下降趋势,在此期间下降了 19.1%,最新值为 110.94 词元/秒。该数据集包含 288 个有效观测值,在所有模型中实现了 100.0% 的覆盖率,这意味着不存在影响本分析的缺失数据限制。
在四小时的时间窗口内,deepseek-v4-flash 取得了最强的平均吞吐量,达到 102.08 词元/秒,而 nemotron-3-ultra 最弱,为 34.11 词元/秒。最具运营意义的趋势是 deepseek-v4-flash 的吞吐量下降了 23.7%,从早期高于 150 词元/秒的峰值降至 21:00 的 67.71 词元/秒。此外,nemotron-3-ultra 表现出严重的波动性,在 10.01 和 69.21 词元/秒之间摆动,变异系数为 43.1%。该数据集包含跨六个模型的 288 个有效观测值,实现了 100.0% 的覆盖率,没有缺失数据的限制。
在四小时的时间窗口内,deepseek-v4-flash 是平均吞吐量最高的模型,达到 109.08 词元/秒,而 nemotron-3-ultra 最低,为 29.36 词元/秒。最具运维意义的波动来自 nemotron-3-ultra,其变异系数为 50.0%,吞吐量在 5.25 到 64.45 词元/秒之间波动。deepseek-v4-flash 也表现出显著的波动性,范围从 41.53 到 194.47 词元/秒。数据集包含六个模型的 288 个有效数据点,覆盖率达到 100.0%,在每模型预期 48 个样本上不存在缺失数据限制。
在四小时的时间窗口内,deepseek-v4-flash 是表现最强的模型,平均吞吐量为 115.67 词元/秒,而 nemotron-3-ultra 是表现最弱的模型,为 27.13 词元/秒。最具运营意义的波动来自 nemotron-3-ultra,其变异系数为 53.1%,并降至 5.25 词元/秒的最低值。相反,minimax-m3 呈现出显著的上升趋势,在此期间增长了 31.6%,最终达到 89.36 词元/秒的后期峰值。该数据集包含跨六个模型的 288 个有效观测值,实现了 100.0% 的覆盖率,没有缺失数据的限制。
在四小时的时间窗口内,deepseek-v4-flash 是表现最强的模型,平均吞吐量为 114.64 词元/秒,而 nemotron-3-ultra 是表现最弱的模型,为 26.33 词元/秒。最具运营意义的波动出现在 minimax-m3 中,该模型在 UTC 16:00 降至 6.55 词元/秒,随后才恢复。Nemotron-3-ultra 也表现出极端的不稳定性,在 5.25 和 60.53 词元/秒之间波动,并呈现 24.3% 的下降趋势。该数据集具有 100.0% 的覆盖率,涵盖六个模型的 288 个有效数据点,因此不存在影响本分析的缺失数据限制。
在四小时的时间窗口内,deepseek-v4-flash 是表现最强的模型,平均吞吐量为 110.76 词元/秒,而 nemotron-3-ultra 是表现最弱的模型,为 27.65 词元/秒。最具运营意义的波动来自 nemotron-3-ultra,其变异系数为 54.9%,负向趋势为 30.3%,最低降至 5.25 词元/秒。同样,minimax-m3 表现出严重的不稳定性,突然降至 6.55 词元/秒,负向趋势为 22.6%。该数据集包含六个模型的 288 个有效数据点,实现了 100.0% 的覆盖率,没有缺失数据的限制。
在四小时的时间窗口内,deepseek-v4-flash 的平均吞吐量最高,达到 107.2 词元/秒,而 nemotron-3-ultra 最低,为 33.27 词元/秒。最具运营意义的波动来自 deepseek-v4-flash,它在 12:35 降至最低 9.23 词元/秒,尽管在 12:50 达到了最高 165.72 词元/秒。glm-5.2 呈现出最大的上升趋势,增长了 20.1%,最新值达到 118.23 词元/秒。该数据集包含跨六个模型的 288 个有效观测值,实现了 100.0% 的覆盖率,没有缺失数据的限制。
在四小时的时间窗口内,deepseek-v4-flash 的平均输出词元吞吐量最高,达到 101.4 词元/秒,而 nemotron-3-ultra 最低,为 32.38 词元/秒。最具运行意义的波动来自 deepseek-v4-flash,其范围从 9.23 词元/秒的低点到 165.72 词元/秒的高点,反映出尽管其平均值领先,但存在高度不稳定性。Nemotron-3-ultra 也表现出显著的波动,降至 5.86 词元/秒。该数据集包含六个模型的 288 个有效数据点,实现了 100.0% 的覆盖率,没有缺失数据的限制。所有模型均保持了完整的样本数,为该时期的吞吐量性能提供了完整的可见性。
在四小时的时间窗口内,deepseek-v4-flash 的平均吞吐量最高,达到 102.2 词元/秒,而 nemotron-3-ultra 表现最弱,为 33.31 词元/秒。最具运维意义的波动出现在 deepseek-v4-flash 中,其吞吐量从 09:50 的 143.88 词元/秒急剧下降至 10:00 的 13.6 词元/秒,随后在 12:35 触及 9.23 词元/秒的最低值。glm-5.2 也出现了严重下降,在 11:00 降至 11.16 词元/秒。该数据集包含六个模型的 288 个有效数据点,实现了 100.0% 的覆盖率,没有缺失数据的限制。
在这四个小时的窗口期内,deepseek-v4-flash 的平均吞吐量最高,达到 103.02 词元/秒,而 nemotron-3-ultra 最低,为 33.36 词元/秒。最具运维意义的波动出现在 deepseek-v4-flash 中,其吞吐量从 09:50 的 143.88 词元/秒骤降至 10:00 的 13.6 词元/秒,随后在 10:20 恢复至 112.54 词元/秒。该模型还表现出最宽的绝对吞吐量范围,最小值为 13.6 词元/秒,最大值为 147.15 词元/秒。数据集包含所有六个模型的 288 个有效观测值,实现了 100.0% 的覆盖率,没有缺失数据的限制。
在四小时的时间窗口内,deepseek-v4-flash 实现了最高的平均吞吐量,达到 104.88 词元/秒,而 nemotron-3-ultra 表现最弱,为 33.02 词元/秒。最具运维意义的波动出现在 deepseek-v4-flash 中,其吞吐量从 09:50 的 143.88 词元/秒急剧下降至 10:00 的 13.6 词元/秒,随后在 10:20 恢复至 112.54 词元/秒。类似地,glm-5.2 从 08:55 的 117.99 词元/秒突然下降至 09:00 的 15.24 词元/秒。该数据集包含跨六个模型的 288 个有效观测值,实现了 100.0% 的覆盖率,没有缺失数据的限制。
在四小时的时间窗口内,gemma4:31b 是表现最强的模型,平均吞吐量为 107.11 词元/秒,而 nemotron-3-ultra 是表现最弱的,为 35.85 词元/秒。最具运维意义的波动来自 deepseek-v4-flash,其保持了 106.18 词元/秒的高平均值,但在该时段末尾急剧下降至 13.6 词元/秒的最低值。Nemotron-3-ultra 也表现出显著的不稳定性,变异系数高达 44.8%,并呈现 18.3% 的下降趋势。该数据集包含 288 个有效观测值,覆盖率为 100.0%,因此不存在影响本分析的缺失数据限制。
在四小时的时间窗口内,deepseek-v4-flash 表现出最强的平均吞吐量,达到 106.54 词元/秒,而 nemotron-3-ultra 最弱,为 37.82 词元/秒。最具运维意义的波动出现在 gemma4:31b 中,其变异系数为 36.7%,从 29.56 词元/秒的最小值波动至 167.19 词元/秒的最大值。此外,glm-5.2 在窗口末期出现急剧的吞吐量下降,从 08:55 的 117.99 词元/秒跌落至 09:00 的 15.24 词元/秒。该数据集包含跨六个模型的 288 个有效数据点,实现了 100.0% 的覆盖率,没有缺失数据的限制。
在四小时的时间窗口内,gemma4:31b 的平均吞吐量最高,达到 106.92 词元/秒,而 nemotron-3-ultra 表现最弱,为 41.95 词元/秒。最具运维意义的波动出现在 deepseek-v4-flash 中,其吞吐量从 07:50 的 140.19 词元/秒急剧下降至 07:55 的 15.7 词元/秒,随后在 08:00 恢复至 123.5 词元/秒。glm-5.2 呈现出最强的上升趋势,增长了 33.3%,最新吞吐量达到 116.56 词元/秒。该数据集包含六个模型的 288 个有效数据点,实现了 100.0% 的覆盖率,不存在缺失数据限制。
在四小时的时间窗口内,deepseek-v4-flash 实现了最强的平均吞吐量,达到 103.84 词元/秒,而 nemotron-3-ultra 最弱,为 45.14 词元/秒。最具运营意义的波动出现在 glm-5.2 中,该模型从 216.98 词元/秒的峰值急剧下降至 04:30 时的 13.59 词元/秒,反映出 53.4% 的变异系数。该数据集包含跨六个模型的 288 个有效观测值,相当于每个模型 48 个预期样本的恰好 100.0% 覆盖率,这意味着没有需要报告的缺失数据限制。
在四小时的时间窗口内,glm-5.2 的平均输出词元吞吐量最高,为 122.38 词元/秒,而 nemotron-3-ultra 最弱,为 46.77 词元/秒。最具运营意义的波动出现在 glm-5.2 中,其从 02:25 的 223.93 词元/秒峰值急剧下降至 04:30 的 13.59 词元/秒低点,反映出 60.7% 的下降趋势。相比之下,deepseek-v4-flash 保持了最稳定的性能,平均为 106.89 词元/秒,变异系数为 20.7%。该数据集包含跨六个模型的 288 个有效观测值,实现了 100.0% 的覆盖率,没有缺失数据的限制。
在四小时的时间窗口内,glm-5.2 的平均吞吐量最高,达到 153.49 词元/秒,而 nemotron-3-ultra 最低,为 47.92 词元/秒。最具运营意义的波动出现在 glm-5.2 中,其从窗口初期的 200 词元/秒以上急剧下降至 04:30 的最低点 13.59 词元/秒,反映出 43.8% 的下降趋势。相比之下,minimax-m3 保持稳定,变异系数为 18.1%,平均值为 63.38 词元/秒。该数据集包含跨六个模型的 288 个有效数据点,实现了 100.0% 的覆盖率,没有缺失数据的限制。
在288个有效观测数据中,glm-5.2是最强的模型,平均吞吐量为186.51词元/秒,而nemotron-3-ultra最弱,为46.66词元/秒。最具运维意义的趋势是glm-5.2在时间窗口后期的吞吐量急剧下降,从03:15的216.98词元/秒降至04:00的最低58.75词元/秒,产生-10.9%的周期趋势。Deepseek-v4-pro也表现出高波动性,在123.03词元/秒和26.57词元/秒之间剧烈波动。该数据集的覆盖率为100.0%,在每模型预期的48个样本中不存在缺失数据限制。
在四小时的时间窗口内,glm-5.2 是表现最强的模型,平均吞吐量为 196.91 词元/秒,而 nemotron-3-ultra 表现最弱,为 41.71 词元/秒。最具操作意义的波动性来自 nemotron-3-ultra,其变异系数为 42.4%,尽管呈 34.5% 的上升趋势,但最低降至 5.25 词元/秒。相反,glm-5.2 保持了最高的稳定性,变异系数仅为 10.2%。数据集包含 288 个有效观测值,在所有每个模型预期的 48 个样本中实现了 100.0% 的覆盖率,这意味着不存在影响此分析的缺失数据限制。
在四小时的时间窗口内,glm-5.2 以 195.03 词元/秒的平均吞吐量表现最强,而 nemotron-3-ultra 最弱,为 39.86 词元/秒。最具操作意义的波动来自 nemotron-3-ultra,它在 23:30 降至 5.25 词元/秒,变异系数为 43.9%。Deepseek-v4-pro 和 deepseek-v4-flash 也经历了严重的瞬时下降,分别降至 8.78 和 14.69 词元/秒。数据集覆盖率为 100.0%,包含 288 个有效点,这意味着没有缺失数据限制影响这一特定分析窗口。
在四小时的时间窗口内,glm-5.2 以 188.70 词元/秒的平均吞吐量表现最强,而 nemotron-3-ultra 最弱,为 32.04 词元/秒。在运行方面,nemotron-3-ultra 表现出极大的波动性,变异系数达 59.3%,在 4.42 和 67.56 词元/秒之间波动。此外,deepseek-v4-pro 和 deepseek-v4-flash 经历了严重的瞬时下降,分别骤降至 8.78 和 14.69 词元/秒。该数据集包含跨六个模型的 288 个有效观测值,实现了 100.0% 的覆盖率,没有缺失数据限制。
在整个四小时窗口期内,glm-5.2 表现出最强的平均吞吐量,达到 186.23 词元/秒,而 nemotron-3-ultra 最弱,为 32.32 词元/秒。在运行方面,nemotron-3-ultra 表现出极端的波动性,变异系数达 61.5%,频繁跌破 10 词元/秒。此外,deepseek-v4-pro 和 deepseek-v4-flash 经历了严重的瞬时减速,分别骤降至 8.78 词元/秒和 14.69 词元/秒。尽管数据集显示所有 288 个有效样本的覆盖率达到 100.0%,但五分钟的粒度限制了检测子区间微中断或精确定位这些吞吐量急剧下降确切持续时间的能力。
在四小时窗口内,glm-5.2 提供了最强的平均吞吐量,达到 178.42 词元/秒,而 nemotron-3-ultra 最弱,为 33.78 词元/秒。在运行方面,nemotron-3-ultra 表现出严重的波动性,变异系数为 58.4%,并呈现急剧下降趋势,从 19:05 的 45.26 词元/秒降至 23:00 的 10.34 词元/秒。Deepseek-v4-flash 也表现出不稳定性,在 22:25 骤降至 14.69 词元/秒。尽管数据集覆盖率为 100.0%,包含 288 个有效点,但四小时窗口限制了对昼夜负载模式的可见性。
在四小时的时间窗口内,glm-5.2 的平均吞吐量最高,达到 175.08 词元/秒,而 nemotron-3-ultra 最低,为 33.08 词元/秒。在运行表现上,nemotron-3-ultra 波动极大,在 4.29 和 68.67 词元/秒之间波动,变异系数为 57.6%,其吞吐量呈 21.2% 的下降趋势。相比之下,minimax-m3 保持了最稳定的性能,平均为 66.99 词元/秒,变异系数仅为 17.1%。该数据集包含 288 个有效观测值,在所有六个模型中实现了 100.0% 的覆盖率,没有缺失数据限制。
在四小时的时间窗口内,glm-5.2 提供了最强的平均吞吐量,达到 172.69 词元/秒,而 nemotron-3-ultra 最弱,为 37.07 词元/秒。在运行方面,deepseek-v4-pro 表现出最显著的下降趋势,下降 16.1%,最新读数为 64.85 词元/秒。与此同时,gemma4:31b 表现出极端波动性,在 32.12 词元/秒的最小值和 178.8 词元/秒的最大值之间摆动。该数据集包含跨六个模型的 288 个有效观测值,覆盖率为 100.0%,这意味着不存在影响本次运行审查的缺失数据限制。
在四小时的时间窗口内,glm-5.2 提供了最强的平均吞吐量,达到 168.37 词元/秒,而 nemotron-3-ultra 最弱,为 31.61 词元/秒。最具操作意义的波动发生在 nemotron-3-ultra 中,其记录了 57.1% 的变异系数和 2.26 词元/秒的严重最低值,表明生成极不稳定。相反,deepseek-v4-pro 表现出显著的下降趋势,下降了 10.4%,平均降至 78.81 词元/秒。该数据集包含所有六个模型的 288 个有效数据点,覆盖率为 100.0%,这意味着不存在影响此分析的缺失数据限制。
在四小时的时间窗口内,glm-5.2 提供了最强的平均吞吐量,达到 172.86 词元/秒,而 nemotron-3-ultra 最弱,为 25.1 词元/秒。在运行方面,nemotron-3-ultra 表现出极端的波动性,在 15:35 左右暴跌至 1.67 词元/秒,随后在 16:45 恢复至 72.03 词元/秒。Deepseek-v4-pro 也表现出早期的剧烈波动,在 15:05 降至 11.73 词元/秒。所有六个模型在 288 次有效观测中均实现了 100.0% 的覆盖率,这意味着没有缺失数据限制影响这一特定数据集。然而,该数据集缺乏每个请求的并发细节,限制了更深层次的容量分析。
在四小时的时间窗口内,glm-5.2 的平均吞吐量最高,达到 177.87 词元/秒,而 nemotron-3-ultra 最弱,为 21.25 词元/秒。最具操作意义的波动出现在 nemotron-3-ultra 中,其变异系数高达 84.7%,并跌至 1.67 词元/秒的最低值。Deepseek-v4-pro 也表现出明显的不稳定性,降至 11.73 词元/秒。该数据集包含跨六个模型的 288 个有效观测值,实现了 100.0% 的覆盖率。由于数据集仅跨越四小时,缺乏更长时间跨度的上下文,限制了对昼夜模式或持续性能衰退进行评估的能力。
在四小时的时间窗口内,glm-5.2 提供了最强的平均吞吐量,达到 183.76 词元/秒,而 nemotron-3-ultra 最弱,为 20.1 词元/秒。在运行方面,nemotron-3-ultra 表现出最显著的波动和性能下降,从 72.07 词元/秒的峰值骤降至持续低于 3 词元/秒的低点,趋势为 -39.8%。尽管数据集报告在所有 288 个有效点计数上实现了 100.0% 的覆盖率,但五分钟的粒度限制了对子区间延迟峰值或会影响实时用户体验的短暂限流事件的检测能力。
在四小时的时间窗口内,glm-5.2 提供了最强的平均吞吐量,达到 184.47 词元/秒,而 nemotron-3-ultra 最弱,为 23.35 词元/秒。最具操作意义的波动是 nemotron-3-ultra 的严重性能下降,从 72.07 词元/秒的峰值跌至 1.67 词元/秒的最低值,变异系数为 85.4%,趋势为 -46.4%。Deepseek-v4-flash 也表现出不稳定性,在 13:00 骤降至 7.06 词元/秒。所有 288 个有效点的数据集覆盖率为 100.0%,这意味着不存在影响本分析的缺失数据限制。
在四小时的时间窗口内,glm-5.2 提供了最强的平均吞吐量,达到 186.74 词元/秒,而 nemotron-3-ultra 最弱,为 25.67 词元/秒。最具操作意义的波动性出现在 nemotron-3-ultra 中,其表现出极度的不稳定,变异系数高达 78.0%,吞吐量降至最低 2.3 词元/秒。这种波动水平表明,与更稳定的模型相比,其性能下降极不稳定。数据集完整,覆盖率为 100.0%,每个模型预期的全部 48 个样本均无缺失数据限制。
在四小时的时间窗口内,glm-5.2 提供了最强的平均吞吐量,达到 181.76 词元/秒,而 nemotron-3-ultra 最弱,为 27.42 词元/秒。最具操作意义的波动出现在 deepseek-v4-pro 中,其趋势下降了 18.1%,并跌至 13.99 词元/秒的最低值。Deepseek-v4-flash 也表现出严重的不稳定性,在 13:00 骤降至 7.06 词元/秒。数据集覆盖完整,包含 288 个有效观测值,因此不存在影响此分析的缺失数据限制。
在这四个小时的时间窗口内,glm-5.2 以 182.1 词元/秒的平均吞吐量表现最强,而 nemotron-3-ultra 最弱,为 29.76 词元/秒。最具操作意义的波动是 nemotron-3-ultra 在上午临近结束时吞吐量的严重崩溃,从 11:15 的 50.35 词元/秒降至 12:05 的 3.23 词元/秒,导致其变异系数达到 60.5%。此外,deepseek-v4-flash 和 deepseek-v4-pro 在最后一个时间间隔分别急剧下降至 7.06 词元/秒和 13.99 词元/秒。该数据集完整,覆盖率为 100.0%,包含 288 个有效数据点,因此不存在影响本分析的缺失数据限制。
在四小时的时间窗口内,glm-5.2 提供了最强的平均吞吐量,达到 185.4 词元/秒,而 nemotron-3-ultra 最弱,为 31.63 词元/秒。最具运维意义的波动是 nemotron-3-ultra 高达 64.9% 的变异系数,包括在 08:35 降至 0.4 词元/秒,以及到 12:00 时下降 -37.1% 至 4.92 词元/秒的下降趋势。尽管数据集覆盖率达到 100.0% 且包含 288 个有效点,但五分钟的采样间隔限制了对五分钟以内的微中断或瞬时延迟峰值的检测。
在整个四小时的数据集中,glm-5.2 提供了最强的平均吞吐量,达到 177.71 词元/秒,而 nemotron-3-ultra 最弱,为 35.06 词元/秒。最具操作意义的波动出现在 nemotron-3-ultra 中,该模型在 08:35 降至 0.4 词元/秒,反映出严重的延迟不稳定性。deepseek-v4-flash 呈现出最大的负向趋势,为 -10.6%。尽管所有模型的覆盖率均为 100%,但该数据集因缺少请求并发元数据而受到限制,无法隔离租户负载对这些吞吐量下降的影响。
在整个四小时窗口期内,glm-5.2 表现出最强的平均吞吐量,达到 182.69 词元/秒,而 nemotron-3-ultra 表现最弱,为 37.46 词元/秒。在运行方面,nemotron-3-ultra 表现出最严重的波动性,在 08:35 骤降至 0.4 词元/秒,这表明存在间歇性的服务中断。相反,minimax-m3 呈现出明显的下降趋势,下降了 11.1%,最新吞吐量为 25.93 词元/秒。尽管数据集报告在所有 288 个有效点计数上均实现了 100.0% 的覆盖率,但五分钟的观测间隔缺乏确定这些极端吞吐量下降是代表完全中断还是瞬时限流所需的粒度。
在四小时的时间窗口内,glm-5.2 提供了最强的平均吞吐量,达到 181.57 词元/秒,而 nemotron-3-ultra 最弱,为 35.11 词元/秒。最具操作意义的波动是 nemotron-3-ultra 在 08:30 至 08:35 UTC 之间严重的吞吐量崩溃,其输出从 1.47 词元/秒暴跌至 0.4 词元/秒,随后恢复至 28.18 词元/秒。此数据集不存在缺失数据的局限性,因为所有六个模型在其预期的 48 个样本中均实现了 100.0% 的覆盖率。
在四小时的时间窗口内,glm-5.2 表现出最强的平均吞吐量,达到 180.86 词元/秒,而 nemotron-3-ultra 最弱,为 30.78 词元/秒。最具操作意义的波动出现在 glm-5.2 中,尽管其平均值较高,但在五分钟内却急剧下降至 39.01 词元/秒和 58.29 词元/秒。Nemotron-3-ultra 也表现出极端的不稳定性,范围从 4.16 到 69.35 词元/秒,变异系数为 49.2%。所有六个模型均实现了 100% 的覆盖率,包含 288 个有效数据点,因此该数据集不存在缺失数据的限制。
在四小时的时间窗口内,glm-5.2 以 187.27 词元/秒的平均吞吐量表现最强,而 nemotron-3-ultra 以 33.11 词元/秒表现最弱。在运行方面,deepseek-v4-flash 和 nemotron-3-ultra 表现出严重的波动性,变异系数分别达到 35.9% 和 52.5%,这是由吞吐量骤降至 22.35 词元/秒和 4.16 词元/秒所致。尽管数据集覆盖率为 100.0%,但分析因缺少并发请求数量而受限,从而无法区分模型侧的延迟激增与用户驱动的负载波动。
在整个四小时的时间窗口内,glm-5.2 提供了最强的平均输出词元吞吐量,为 185.69 词元/秒,而 nemotron-3-ultra 最弱,为 34.49 词元/秒。最具操作意义的波动发生在 nemotron-3-ultra 上,其从 69.73 词元/秒的峰值急剧下降至 4.16 词元/秒的最低值,反映出 41.5% 的下降趋势。deepseek-v4-pro 也表现出明显的不稳定性,降至 20.18 词元/秒。该数据集包含跨六个模型的 288 个有效观测值,覆盖率为 100.0%,这意味着不存在影响此分析的缺失数据限制。
在整个四小时窗口内,glm-5.2 的平均吞吐量最高,达到 190.22 词元/秒,而 nemotron-3-ultra 最低,为 37.63 词元/秒。最具操作意义的波动出现在 deepseek-v4-flash 中,其在 18.33 和 152.68 词元/秒之间剧烈波动,变异系数为 46.4%,表明响应时间极不稳定。此外,deepseek-v4-pro 呈现出显著的下降趋势,在此期间下降了 19.0%,并触及 20.18 词元/秒的低点。尽管覆盖率为 100.0%,但数据集缺乏并发请求量数据,限制了判断吞吐量下降是源于容量饱和还是内部模型低效的能力。
在四小时的时间窗口内,glm-5.2 的平均吞吐量最高,达到 187.89 词元/秒,而 nemotron-3-ultra 最低,为 41.06 词元/秒。最具运营意义的波动出现在 deepseek-v4-flash 中,其在 155.36 词元/秒和 18.33 词元/秒之间表现出剧烈波动,导致变异系数为 52.5%。这种不稳定的性能使容量规划变得复杂。尽管数据集覆盖率为 100.0% 且没有缺失样本,但分析受限于短暂的四个小时持续时间,无法评估昼夜模式或长期退化。
在四小时的时间窗口内,glm-5.2 以 187.87 词元/秒提供了最强的平均吞吐量,而 nemotron-3-ultra 最弱,为 38.29 词元/秒。最具操作意义的波动出现在 deepseek-v4-flash 中,其在 155.36 词元/秒和 18.33 词元/秒之间表现出剧烈波动,变异系数为 50.6%。这种不稳定的性能给最终用户带来了不可预测的延迟。尽管数据集覆盖率标记为 100.0%,包含 288 个有效点,但五分钟的采样间隔缺乏亚分钟级的分辨率,限制了对短暂微峰值性能下降的检测能力。
在整个四小时窗口内,glm-5.2 提供了最强的平均吞吐量,达到 186.96 词元/秒,而 nemotron-3-ultra 最弱,为 38.17 词元/秒。最具操作意义的波动出现在 deepseek-v4-flash 中,该模型在 19.96 和 155.36 词元/秒之间表现出剧烈波动,反映出 51.2% 的变异系数。同样,nemotron-3-ultra 遭遇了严重的微跌,最低降至 1.9 词元/秒。尽管数据集报告所有模型的覆盖率为 100.0%,但五分钟的采样间隔缺乏隔离这些急剧瞬时下降根本原因所需的粒度。
在四小时的时间窗口内,glm-5.2 提供了最强的平均吞吐量,达到 185.62 词元/秒,而 nemotron-3-ultra 最弱,为 35.94 词元/秒。最具操作意义的波动出现在 deepseek-v4-flash,该模型在 19.96 和 155.36 词元/秒之间表现出剧烈波动,变异系数为 55.4%,表明其性能高度不稳定。此外,glm-5.2 经历了严重的瞬时下降,在 22:30 骤降至 46.55 词元/秒,并在 00:00 降至 88.69 词元/秒。该数据集包含跨六个模型的 288 个有效数据点,覆盖率为 100.0%,这意味着不存在影响本分析的缺失数据限制。