在四小时的时间窗口内,glm-5.2 是表现最强的模型,平均吞吐量为 88.37 词元/秒,而 minimax-m3 是表现最弱的,为 39.32 词元/秒。最具运维意义的波动来自 nemotron-3-ultra,其吞吐量表现出剧烈波动,最低降至 5.45 词元/秒,随后峰值达到 152.72 词元/秒,变异系数为 57.6%。这种高方差与更为稳定的 glm-5.2 形成对比,后者的变异系数保持在较低的 23.2%。该数据集包含跨六个模型的 288 个有效观测值,实现了 100.0% 的覆盖率,没有缺失数据的限制。
每小时性能洞察
滚动四小时性能数据摘要
在四小时的时间窗口内,glm-5.2 是表现最强的模型,平均吞吐量为 90.62 词元/秒,而 minimax-m3 是表现最弱的模型,为 41.15 词元/秒。最具运营意义的波动来自 nemotron-3-ultra,其变异系数为 57.1%,在最低 5.45 词元/秒到最高 152.72 词元/秒之间波动。相反,glm-5.2 最为稳定,变异系数为 26.0%。该数据集包含六个模型的 288 个有效数据点,实现了 100.0% 的覆盖率,没有缺失数据的限制。
在四小时的时间窗口内,glm-5.2 是表现最强的模型,平均吞吐量为 89.85 词元/秒,而 minimax-m3 是表现最弱的,为 40.36 词元/秒。最具运维意义的波动出现在 nemotron-3-ultra 中,其呈现出 93.9% 的上升趋势和 89.4% 的变异系数,在 1.44 词元/秒的最小值与 152.72 词元/秒的最大值之间波动。deepseek-v4-flash 也表现出显著的不稳定性,呈现 28.8% 的下降趋势。该数据集包含涵盖所有六个模型的 288 个有效观测值,实现了 100.0% 的覆盖率,且无缺失数据限制。
在四小时的时间窗口内,deepseek-v4-flash 的平均输出词元吞吐量最高,达到 93.14 词元/秒,而 nemotron-3-ultra 最低,为 27.8 词元/秒。运行方面最显著的波动来自 nemotron-3-ultra,该模型在早期保持在 2 词元/秒附近,但在 02:35 飙升至 112.31 词元/秒,导致变异系数为 121.2%。deepseek-v4-flash 也表现出不稳定性,尽管其平均值较高,但在 03:45 降至 9.75 词元/秒。该数据集包含跨六个模型的 288 个有效观测值,覆盖率为 100.0%,因此不存在影响本分析的缺失数据限制。
在四小时的观察期内,deepseek-v4-flash 是表现最强的模型,平均吞吐量为 105.93 词元/秒,而 nemotron-3-ultra 是表现最弱的模型,为 16.36 词元/秒。最具操作意义的波动出现在 nemotron-3-ultra 中,该模型在超过两小时的时间内保持在 13 词元/秒以下,随后突然飙升至 112.31 词元/秒的最大值,反映出 172.3% 的变异系数。此外,deepseek-v4-pro 表现出急剧的吞吐量下降,最低降至 4.28 词元/秒。该数据集包含所有六个模型的 288 个有效观测值,实现了 100.0% 的覆盖率,没有缺失数据的限制。
在四小时的观察期内,deepseek-v4-flash 是表现最强的模型,平均速度为 111.10 词元/秒,而 nemotron-3-ultra 是表现最弱的模型,平均速度仅为 3.89 词元/秒。最具运营意义的波动出现在 deepseek-v4-pro 中,其速度从 01:50 的 75.57 词元/秒急剧下降至 02:00 的 4.28 词元/秒。同样,gemma4:31b 表现出高波动性,变异系数为 31.6%,在 42.23 和 130.77 词元/秒之间波动。该数据集包含跨六个模型的 288 个有效数据点,实现了 100.0% 的覆盖率。由于数据集缺乏并发请求量指标,因此无法确定这些吞吐量下降是源于容量饱和还是上游需求变化。
在这四个小时的窗口期内,deepseek-v4-flash 是表现最强的模型,平均吞吐量为 110.71 词元/秒,而 nemotron-3-ultra 是表现最弱的模型,吞吐量为 3.7 词元/秒。在运行方面,minimax-m3 呈现出最显著的下降趋势,下降了 17.5% 至最新吞吐量 42.38 词元/秒,同时伴随着高波动性,变异系数为 37.9%。相比之下,deepseek-v4-flash 和 deepseek-v4-pro 分别呈上升趋势,增长了 10.5% 和 10.0%。该数据集包含所有六个模型的 288 个有效观测值,实现了 100.0% 的覆盖率,没有缺失数据的限制。
在四小时的时间窗口内,deepseek-v4-flash 的平均输出词元吞吐量最高,达到 102.67 词元/秒,而 nemotron-3-ultra 最低,为 8.22 词元/秒。最具运行意义的波动是 nemotron-3-ultra 的变异系数达到 129.5%,其吞吐量从 47.28 词元/秒的峰值暴跌至持续低于 5 词元/秒的水平。相反,gemma4:31b 呈现出强劲的上升趋势,攀升 68.9% 至后期 130.77 词元/秒的峰值。该数据集包含跨六个模型的 288 个有效数据点,实现了 100.0% 的覆盖率,不存在缺失数据限制。
在这四个小时的窗口期内,deepseek-v4-flash 的平均输出词元吞吐量最高,达到 98.04 词元/秒,而 nemotron-3-ultra 最低,为 16.61 词元/秒。在运行方面最具显著性的波动是 nemotron-3-ultra 在 UTC 20:45 之后的严重性能下降,其吞吐量从大约 44.71 词元/秒骤降至 2.28 词元/秒,呈现出 87.3% 的下降趋势。此外,deepseek-v4-pro 在 UTC 20:20 至 20:35 之间表现出剧烈的不稳定性,最低降至 8.78 词元/秒。该数据集包含跨六个模型的 288 个有效观测值,实现了 100.0% 的覆盖率,不存在缺失数据限制,因为所有模型均保持了预期的 48 个样本。
在四小时的时间窗口内,deepseek-v4-flash 的平均吞吐量最高,为 91.64 词元/秒,而 nemotron-3-ultra 最低,为 22.46 词元/秒。最具运维意义的趋势是 nemotron-3-ultra 出现了严重的性能下降,在 20:45 之后下降了 63.5%,最新吞吐量降至 4.34 词元/秒。此外,deepseek-v4-pro 表现出高波动性,在 20:35 左右飙升至 121.52 词元/秒,随后又暴跌至 8.78 词元/秒。该数据集记录了六个模型的 288 个有效数据点,实现了 100.0% 的覆盖率,不存在缺失数据的限制。这种完全的可见性证实了所观察到的吞吐量不稳定是真实的运维问题,而非报告假象。
在四小时的时间窗口内,deepseek-v4-flash 是表现最强的模型,平均吞吐量为 94.0 词元/秒,而 nemotron-3-ultra 是表现最弱的模型,吞吐量为 28.15 词元/秒。最具运营意义的趋势是 minimax-m3 下降了 30.5%,最新吞吐量降至 31.33 词元/秒,同时 deepseek-v4-pro 出现严重波动,尽管平均吞吐量为 65.8 词元/秒,但最低降至 8.78 词元/秒。该数据集包含 288 个有效观测值,覆盖率达到 100.0%,因此不存在影响本分析的缺失数据限制。
在四小时的时间窗口内,deepseek-v4-flash 的平均输出词元吞吐量最高,为 92.27 词元/秒,而 nemotron-3-ultra 最低,为 29.9 词元/秒。最具运维意义的波动出现在 deepseek-v4-pro 中,尽管其平均值为 63.84 词元/秒,但在 17:00 骤降至 4.65 词元/秒的最低点。minimax-m3 呈现出明显的下降趋势,从 16:10 的 75.69 词元/秒跌至 19:45 的 14.84 词元/秒。该数据集包含跨六个模型的 288 条有效观测数据,实现了 100.0% 的覆盖率,不存在缺失数据限制。
在这四个小时的窗口期内,deepseek-v4-flash 的平均输出词元吞吐量最高,达到 88.85 词元/秒,而 nemotron-3-ultra 最低,为 25.89 词元/秒。最具运维意义的波动出现在 deepseek-v4-pro 中,其吞吐量从 15:55 的 93.62 词元/秒降至 17:00 的 4.65 词元/秒,尽管其平均值为 63.94 词元/秒,但这反映出严重的运行不稳定性。此外,deepseek-v4-flash 也表现出高波动性,在 31.66 和 140.36 词元/秒之间大幅摆动。该数据集包含跨六个模型的 288 个有效观测值,实现了 100.0% 的覆盖率,不存在缺失数据的限制。这一完整的数据集能够对所有受追踪模型的吞吐性能进行可靠的运维监控。
在四小时的时间窗口内,deepseek-v4-flash 的平均吞吐量最高,为 84.03 词元/秒,而 nemotron-3-ultra 最低,为 24.19 词元/秒。最具运行意义的波动出现在 deepseek-v4-pro 中,其吞吐量从 16:55 的 11.57 词元/秒急剧下降至 17:00 的 4.65 词元/秒,随后在 17:05 恢复至 72.09 词元/秒。deepseek-v4-flash 也表现出高波动性,在整个时间段内于 20.26 和 136.84 词元/秒之间波动。该数据集包含 288 个有效观测值,覆盖率为 100.0%,与每个模型预期的 48 个样本相匹配,因此不存在影响本分析的缺失数据限制。
在四小时的观察窗口内,glm-5.2 以 78.58 词元/秒的平均输出词元吞吐量表现最强,而 nemotron-3-ultra 以 23.45 词元/秒表现最弱。最具运维意义的波动出现在 deepseek-v4-pro 上,其吞吐量从 16:50 的 81.83 词元/秒骤降至 17:00 的 4.65 词元/秒。deepseek-v4-flash 展现出最高的单区间峰值,在 15:45 达到 135.02 词元/秒。尽管数据集报告所有六个模型的覆盖率为 100.0%,但本分析受限于并发请求量数据的缺失,无法区分模型侧性能下降与流量驱动的延迟。
在四小时的时间窗口内,glm-5.2 提供了最强的平均输出词元吞吐量,达到 78.7 词元/秒,而 nemotron-3-ultra 最弱,为 23.49 词元/秒。最具运维意义的波动出现在 deepseek-v4-flash 中,其范围从最低 17.57 词元/秒到最高 135.02 词元/秒,产生了高达 36.2% 的变异系数。尽管呈现出 10.8% 的上升趋势,但这种不稳定的性能使容量规划变得复杂。该数据集包含跨六个模型的 288 个有效观测值,实现了 100.0% 的覆盖率,没有缺失数据的限制。
在整个四小时的时间窗口内,glm-5.2 是表现最强的模型,平均吞吐量为 76.93 词元/秒,而 nemotron-3-ultra 是表现最弱的模型,为 24.19 词元/秒。最具运维意义的趋势是 gemma4:31b 46.6% 的急剧下降,从早期 64.91 词元/秒的峰值跌至最近 21.15 词元/秒的读数。此外,deepseek-v4-flash 表现出高波动性,吞吐量在 17.57 和 114.03 词元/秒之间波动。该数据集包含涵盖所有六个模型的 288 个有效观测值,实现了 100.0% 的覆盖率。由于数据仅限于这单一的四小时时段,因此缺乏确定这些吞吐量波动是代表正常的昼夜模式还是孤立事件所需的历史背景。
在这四个小时的窗口期内,deepseek-v4-flash 的平均吞吐量最高,为 77.56 词元/秒,而 nemotron-3-ultra 最低,为 24.97 词元/秒。最具运行意义的波动是 deepseek-v4-flash 在窗口期后期的急剧下降,从 10:30 的 131.65 词元/秒跌至 14:00 的最低 17.57 词元/秒,呈 24.9% 的下降趋势。同样,glm-5.2 也表现出高波动性,在 11:35 跌至 10.66 词元/秒后,于 13:55 飙升至 113.81 词元/秒。该数据集包含 288 个有效观测值,在所有六个模型中实现了 100.0% 的覆盖率,没有缺失数据的限制。
在四小时的时间窗口内,deepseek-v4-flash 实现了最高的平均吞吐量,达到 78.04 词元/秒,而 nemotron-3-ultra 表现最弱,为 26.04 词元/秒。最具运维意义的波动出现在 minimax-m3 中,尽管其平均值为 44.44 词元/秒,但波动范围在 7.13 至 81.72 词元/秒之间,以及 nemotron-3-ultra 中,其吞吐量降至 4.15 词元/秒。deepseek-v4-pro 呈现出显著的上升趋势,增长了 20.2%,峰值达到 101.04 词元/秒。该数据集包含跨六个模型的 288 个有效观测值,覆盖率达到 100.0%。由于数据集缺少并发请求数,吞吐量下降不能仅归因于模型性能下降。
在四小时的观察窗口内,deepseek-v4-flash 实现了最强的平均输出词元吞吐量,达到 82.26 词元/秒,而 nemotron-3-ultra 最弱,为 27.6 词元/秒。最具运营意义的趋势是 deepseek-v4-pro 的吞吐量急剧上升,从窗口初期的低点 18.41 词元/秒增长了 115.8%,达到峰值 101.04 词元/秒。高波动性也影响了 nemotron-3-ultra,尽管其最高值为 61.92 词元/秒,但该模型跌至 4.15 词元/秒的低点。数据集包含跨六个模型的 288 个有效观测值,覆盖率为 100.0%,这意味着没有影响本次性能评估的缺失数据限制。
在这四个小时的窗口期内,deepseek-v4-flash 的平均吞吐量最高,达到 79.53 词元/秒,而 nemotron-3-ultra 最低,为 27.85 词元/秒。最具运维意义的趋势是 deepseek-v4-pro 从 09:00 的 18.41 词元/秒低点回升至 10:40 的 101.04 词元/秒,反映出 18.5% 的上升趋势。高波动性同样明显,glm-5.2 从 09:05 的 117.29 词元/秒骤降至 09:35 的 18.02 词元/秒。该数据集实现了完整覆盖,包含 288 个有效数据点,且在六个模型中不存在缺失数据的限制。
在四小时的时间窗口内,glm-5.2 提供了最强的平均吞吐量,达到 72.64 词元/秒,而 nemotron-3-ultra 最弱,为 29.32 词元/秒。最具运维意义的趋势是 deepseek-v4-pro 出现了严重的吞吐量下降,降幅达 45.6%,在窗口后期的平均值接近 25 词元/秒,与之形成对比的是 deepseek-v4-flash,其呈上升趋势,增长了 13.1%。所有六个模型均表现出高波动性,变异系数介于 35.0% 到 48.2% 之间,且频繁跌破 20 词元/秒。该数据集包含完整覆盖,共有 288 个有效观测值,因此不存在影响本分析的缺失数据限制。
在四小时的时间窗口内,glm-5.2 提供了最高的平均输出词元吞吐量,达到 80.13 词元/秒,而 nemotron-3-ultra 表现最弱,为 30.46 词元/秒。最具操作意义的波动出现在 deepseek-v4-flash 中,其波动范围介于 15.11 词元/秒的低点和 132.92 词元/秒的高点之间,变异系数百分比为 38.8%。此外,deepseek-v4-pro 呈现出显著的下降趋势,下降了 25.1% 至最新吞吐量 18.41 词元/秒。该数据集包含 288 个有效观测值,在所有六个模型中实现了 100.0% 的覆盖率,不存在缺失数据限制。
在四小时的时间窗口内,glm-5.2 提供了最强的平均输出词元吞吐量,达到 85.39 词元/秒,而 nemotron-3-ultra 最弱,为 28.32 词元/秒。最具运营意义的趋势是 deepseek-v4-flash 的吞吐量急剧下降,下降了 21.5% 至最新读数 93.79 词元/秒,尽管其保持了 76.33 词元/秒的高平均值。此外,nemotron-3-ultra 表现出高波动性,最低降至 3.1 词元/秒。该数据集包含涵盖所有六个模型的 288 个有效观测值,实现了 100.0% 的覆盖率,没有影响本分析的缺失数据限制。
在四小时的时间窗口内,glm-5.2 是表现最强的模型,平均吞吐量为 85.92 词元/秒,而 nemotron-3-ultra 是表现最弱的模型,为 29.86 词元/秒。最具运维意义的波动出现在 deepseek-v4-flash 中,该模型保持了 80.76 词元/秒的高平均值,但表现出剧烈的波动,最低降至 15.11 词元/秒,并呈现出 17.0% 的下降趋势。同样,nemotron-3-ultra 也经历了极度的不稳定,骤降至 3.1 词元/秒。该数据集包含 288 个有效观测值,覆盖率达到 100.0%,这意味着不存在缺失数据方面的限制来约束本次运维审查。
在四小时的时间窗口内,deepseek-v4-flash 的平均输出词元吞吐量最高,为 87.95 词元/秒,而 nemotron-3-ultra 最低,为 32.02 词元/秒。最具运营意义的波动出现在 nemotron-3-ultra 中,尽管其最大值为 58.94 词元/秒,但最低降至 3.1 词元/秒,导致变异系数为 49.9%。此外,gemma4:31b 呈现出显著的下降趋势,下降了 29.8%,最新吞吐量为 25.94 词元/秒。该数据集包含跨六个模型的 288 个有效观测值,实现了 100.0% 的覆盖率。然而,存在缺失数据的局限性:数据集缺少并发请求并发数,无法将吞吐量下降与特定负载条件进行关联。
在四小时的时间窗口内,deepseek-v4-flash 的平均吞吐量最高,为 88.7 词元/秒,而 nemotron-3-ultra 最低,为 36.63 词元/秒。最具运营意义的趋势是 nemotron-3-ultra 下降了 23.4%,从 00:05 的 62.19 词元/秒跌至 04:00 的 17.06 词元/秒,同时伴随剧烈波动,包括在 02:20 骤降至 5.01 词元/秒。deepseek-v4-pro 也出现显著退化,下降 14.8%,在 03:10 跌至 11.59 词元/秒的后期低点。数据集记录了所有模型的 288 个有效数据点,覆盖率为 100.0%,因此不存在影响本分析的缺失数据限制。
在四小时的时间窗口内,glm-5.2 以 87.1 词元/秒的平均输出词元吞吐量表现最强,而 nemotron-3-ultra 以 38.49 词元/秒表现最弱。最具运营意义的波动来自 gemma4:31b,其在 25.71 词元/秒的最小值和 123.93 词元/秒的最大值之间剧烈波动,变异系数为 43.0%。Deepseek-v4-pro 在此期间呈现出 21.9% 的显著上升趋势。该数据集包含跨六个模型的 288 个有效观测值,实现了 100.0% 的覆盖率。由于数据集缺少请求并发和提示词长度元数据,吞吐量下降无法归因于负载峰值或输入大小。
在四小时的观察窗口内,deepseek-v4-flash 提供了最强的平均输出词元吞吐量,达到 84.25 词元/秒,而 nemotron-3-ultra 最弱,为 43.03 词元/秒。最具运营意义的波动出现在 gemma4:31b 中,其表现出严重的吞吐量不稳定性,从 135.28 词元/秒的最大值骤降至 25.71 词元/秒的最小值,变异系数高达 43.1%。这种不稳定的性能与 minimax-m3 形成对比,后者围绕其 54.09 词元/秒的平均值维持了更为平稳的输出。所有六个模型均实现了完整的数据覆盖,收集到了 48 个预期样本中的 48 个,这意味着不存在影响此特定滚动窗口分析的缺失数据限制。
在四小时的观察期内,deepseek-v4-flash 实现了最强的平均输出词元吞吐量,达到 82.82 词元/秒,而 nemotron-3-ultra 最弱,为 38.82 词元/秒。最具操作意义的波动来自 nemotron-3-ultra,其表现出极端的不稳定性,变异系数为 52.6%,吞吐量最低降至 2.72 词元/秒。相反,minimax-m3 提供了最稳定的性能,保持 56.39 词元/秒的稳定平均值,变异系数低至 14.7%。该数据集包含跨六个模型的 288 个有效观测值,实现了 100.0% 的覆盖率,没有缺失数据的限制。
在四小时的时间窗口内,deepseek-v4-pro 的平均输出词元吞吐量最高,为 82.1 词元/秒,而 nemotron-3-ultra 最低,为 35.61 词元/秒。在运行方面最具显著性的波动来自 nemotron-3-ultra,其最低降至 2.72 词元/秒,变异系数为 57.7%,表明生成速度极不稳定。相反,minimax-m3 提供了最稳定的性能,标准差仅为 8.32 词元/秒。所有六个模型均保持了完整的数据集覆盖率,收集了 48 个预期样本中的 48 个,这意味着没有影响这一特定分析周期的缺失数据限制。
在四小时的时间窗口内,deepseek-v4-pro 的平均输出词元吞吐量最高,为 81.87 词元/秒,而 nemotron-3-ultra 最低,为 34.49 词元/秒。最具运行意义的波动出现在 nemotron-3-ultra 中,该模型在 21:25 左右急剧下降至 2.72 词元/秒的最低点,随后才恢复。glm-5.2 也表现出极端的不稳定性,在 5.6 和 124.65 词元/秒之间波动。相比之下,minimax-m3 提供了最稳定的性能,以较低的变异系数保持了 55.39 词元/秒的稳定平均值。该数据集包含完整的观测数据,没有缺失数据的限制,捕获了六个模型的所有 288 个预期数据点。
在四小时的观察窗口内,deepseek-v4-flash 表现出最强的平均输出词元吞吐量,达到 76.97 词元/秒,而 nemotron-3-ultra 最弱,为 29.52 词元/秒。最具运营意义的波动出现在 glm-5.2 中,尽管其平均值为 69.03 词元/秒,但表现出剧烈的摆动,骤降至最低 5.6 词元/秒后又飙升至 113.36 词元/秒。相反,minimax-m3 提供了最稳定的性能,保持 53.63 词元/秒的平均值,且变异系数低至 13.7%。该数据集包含跨六个模型的 288 个有效数据点,实现了 100.0% 的覆盖率,没有缺失数据的限制。
在这四小时的窗口期内,glm-5.2 的平均输出词元吞吐量最高,达到 68.84 词元/秒,而 nemotron-3-ultra 表现最弱,为 31.70 词元/秒。最具操作意义的波动出现在 deepseek-v4-flash 中,其从 3.53 词元/秒的低点波动至 137.04 词元/秒的高点,变异系数为 49.0%。同样,glm-5.2 也经历了严重的下降,在 19:40 降至 5.60 词元/秒。相比之下,minimax-m3 保持了最稳定的性能,仅在 35.12 和 67.47 词元/秒之间变化。该数据集包含完整的观测数据,没有缺失数据的限制,涵盖了所有 288 个预期样本。
在四小时的时间窗口内,glm-5.2 提供了最强的平均吞吐量,达到 72.3 词元/秒,而 gemma4:31b 最弱,为 28.59 词元/秒。最具操作意义的波动出现在 deepseek-v4-flash 中,其表现出极端的不稳定性,变异系数为 63.3%,在跌至 3.53 词元/秒的最低点后又飙升至 137.04 词元/秒的峰值。这种高方差与 minimax-m3 形成对比,后者保持了最稳定的性能,平均为 52.17 词元/秒。该数据集包含所有六个模型的 288 个有效观测值,实现了 100.0% 的覆盖率,没有缺失数据限制影响吞吐量分析。
在四小时的时间窗口内,glm-5.2 提供了最强的平均输出词元吞吐量,达到 75.43 词元/秒,而 nemotron-3-ultra 最弱,为 28.25 词元/秒。最具操作意义的波动出现在 deepseek-v4-flash 中,该模型表现出极端的不稳定性,变异系数为 76.9%,在降至 3.53 词元/秒的最低点后又飙升至 105.83 词元/秒的最高点。该模型在此期间还呈现出 107.2% 的急剧上升趋势。数据集不存在缺失数据的限制,因为所有六个模型均保持了完整的覆盖率,每个模型恰好有 48 个有效样本,与预期数量完全吻合。
在四小时的时间窗口内,glm-5.2 提供了最强的平均输出词元吞吐量,达到 78.64 词元/秒,而 deepseek-v4-flash 最弱,为 25.56 词元/秒。最具操作意义的波动出现在 deepseek-v4-flash 中,其表现出极端的不稳定性,变异系数为 81.2%,在降至 3.53 词元/秒的最低点后又飙升至 101.76 词元/秒。同样,deepseek-v4-pro 也表现出高波动性,标准差为 25.45 词元/秒。该数据集包含跨六个模型的 288 个有效数据点,实现了 100.0% 的覆盖率,没有缺失数据的限制,为所有受监控模型提供了吞吐量性能的完整视图。
在四小时的时间窗口内,glm-5.2 提供了最高的平均输出词元吞吐量,达到 72.27 词元/秒,而 deepseek-v4-flash 表现最弱,为 23.99 词元/秒。最具操作意义的波动出现在 deepseek-v4-pro 中,其吞吐量从 13:35 的 98.35 词元/秒急剧下降至 14:05 的 7.16 词元/秒,反映出严重的吞吐量不稳定性。此外,glm-5.2 呈现出强劲的上升趋势,在此期间增长了 40.2%,并在 16:45 附近达到 117.3 词元/秒的峰值。该数据集包含跨六个模型的 288 个有效观测值,实现了 100.0% 的覆盖率,没有缺失数据的限制。
在四小时的时间窗口内,glm-5.2 提供了最强的平均输出词元吞吐量,达到 62.55 词元/秒,而 nemotron-3-ultra 最弱,为 31.48 词元/秒。最具运营意义的波动出现在 deepseek-v4-flash 中,该模型从接近 116.36 词元/秒的早期高点急剧下降至 10.42 词元/秒的低点,反映出 68.4% 的趋势下降。同样,gemma4:31b 表现出高变异性,变异系数为 48.0%,并呈现 34.1% 的下降趋势。相比之下,minimax-m3 保持稳定,平均为 52.61 词元/秒,变异系数仅为 14.4%。该数据集包含完整覆盖,在所有 288 个有效观测中均无缺失数据限制。
在四小时的时间窗口内,glm-5.2 提供了最强的平均吞吐量,达到 64.42 词元/秒,而 nemotron-3-ultra 最弱,为 31.03 词元/秒。最具操作意义的波动出现在 deepseek-v4-flash 中,其从 135.87 词元/秒的最大值降至 15.23 词元/秒的低点,变异系数为 52.8%,同时呈现 37.9% 的负趋势,最终收于 16.87 词元/秒。该数据集包含跨六个模型的 288 个有效观测值,实现了 100.0% 的覆盖率,没有缺失数据的限制。
在四小时的时间窗口内,glm-5.2 是表现最强的模型,平均吞吐量为 75.13 词元/秒,而 nemotron-3-ultra 是表现最弱的,为 29.14 词元/秒。最具操作意义的波动出现在 glm-5.2 和 deepseek-v4-flash 中,它们的吞吐量分别急剧下降至 12.83 词元/秒和 17.9 词元/秒,同时变异系数较高,约为 37% 至 39%。相比之下,minimax-m3 保持了最稳定的性能,平均吞吐量为 54.39 词元/秒,变异系数低至 13.9%。该数据集包含跨六个模型的 288 个有效观测值,实现了 100% 的覆盖率,没有缺失数据的限制。
在四小时的时间窗口内,glm-5.2 是表现最强的模型,平均吞吐量为 81.32 词元/秒,而 nemotron-3-ultra 是表现最弱的,为 30.38 词元/秒。最具运维意义的波动出现在 deepseek-v4-flash 中,其吞吐量在 17.9 和 135.87 词元/秒之间波动,尽管其平均值稳定在 74.15 词元/秒。同样,glm-5.2 和 deepseek-v4-pro 均在时间窗口中期出现严重下降,吞吐量分别骤降至 12.83 和 11.23 词元/秒。相比之下,minimax-m3 保持稳定,变异系数低至 14.9%。该数据集不存在缺失数据的局限性,在所有 288 个有效观测中实现了 100.0% 的覆盖率。
在四小时的时间窗口内,glm-5.2 提供了最强的平均吞吐量,达到 83.99 词元/秒,而 gemma4:31b 最弱,为 31.01 词元/秒。最具操作意义的波动出现在 deepseek-v4-flash 中,其范围从 15.79 到 135.87 词元/秒,变异系数为 40.1%,表明输出能力极不稳定。相比之下,minimax-m3 保持了最稳定的性能,仅在 38.6 和 71.53 词元/秒之间波动。该数据集包含跨六个模型的 288 个有效观测值,实现了 100.0% 的覆盖率,没有缺失数据的限制。在整个监控期间,所有预期的样本均已成功记录。
在四小时的时间窗口内,glm-5.2 提供了最强的平均输出词元吞吐量,达到 82.3 词元/秒,而 nemotron-3-ultra 最弱,为 28.6 词元/秒。最具操作意义的波动出现在 deepseek-v4-flash 中,其范围从 15.79 到 127.74 词元/秒,变异系数为 36.7%,表明尽管平均速度高达 75.94 词元/秒,但生成速度极不稳定。同样,gemma4:31b 经历了严重的下降,最低降至 8.24 词元/秒。相比之下,minimax-m3 保持了最稳定的性能,仅在 38.6 和 70.2 词元/秒之间波动。该数据集包含 288 个有效观测值,覆盖率为 100.0%,因此不存在影响此分析的缺失数据限制。
在四小时的时间窗口内,deepseek-v4-flash 的平均输出词元吞吐量最高,为 80.84 词元/秒,而 nemotron-3-ultra 最低,为 26.43 词元/秒。最具运行意义的波动来自 nemotron-3-ultra,其从 05:15 的 42.86 词元/秒降至 06:15 的 2.53 词元/秒,反映出 70.4 的变异系数。此外,gemma4:31b 呈现急剧下降趋势,从 05:55 的 103.54 词元/秒峰值跌至 08:05 的 8.24 词元/秒低点。该数据集包含涵盖所有六个模型的 288 个有效观测值,实现了 100.0% 的覆盖率,没有缺失数据的限制。
在四小时的时间窗口内,glm-5.2 的平均吞吐量最高,达到 80.98 词元/秒,而 nemotron-3-ultra 表现最弱,为 26.96 词元/秒。最具运维意义的波动出现在 gemma4:31b 中,该模型经历了严重的吞吐量下降,从 126.71 词元/秒的峰值跌至 9.0 词元/秒后才部分恢复,导致 47.1% 的下降趋势。Nemotron-3-ultra 也表现出极端的不稳定性,在超过二十分钟的时间内骤降至 2.53 词元/秒。由于数据缺失,分析受到限制,因为每个模型记录了 47 个样本,而非预期的 48 个,覆盖率为 97.9%。
在四小时期间内,glm-5.2 是表现最强的模型,平均吞吐量为 83.98 词元/秒,紧随其后的是 deepseek-v4-flash,为 83.59 词元/秒。表现最弱的模型是 nemotron-3-ultra,为 25.73 词元/秒。在运行方面,nemotron-3-ultra 表现出最显著的波动和性能下降,从 05:05 的 38.14 词元/秒稳步下降至 06:15 的最低 2.53 词元/秒,反映出 47.2% 的负向趋势。相比之下,deepseek-v4-pro 提升了 20.5%。该数据集包含跨六个模型的 288 个有效观测值,实现了 100.0% 的覆盖率,没有缺失数据的限制。
在四小时的时间窗口内,glm-5.2 提供了最强的平均吞吐量,达到 87.04 词元/秒,而 nemotron-3-ultra 最弱,为 28.94 词元/秒。最具操作意义的波动出现在 gemma4:31b 中,其在 15.1 词元/秒的最小值和 126.71 词元/秒的最大值之间剧烈波动,变异系数为 47.9%。同样,nemotron-3-ultra 表现出极端的不稳定性,在 UTC 06:00 时降至仅 2.9 词元/秒。该数据集不存在缺失数据的局限性,因为所有六个模型在预期的每个模型 48 个样本中均保持了 100.0% 的覆盖率。
在四小时的时间窗口内,glm-5.2 是表现最强的模型,平均吞吐量为 91.94 词元/秒,而 nemotron-3-ultra 是表现最弱的,为 34.27 词元/秒。最具运维意义的波动出现在 gemma4:31b 中,其变异系数为 51.9%,吞吐量波动范围从最低 15.1 词元/秒到最高 132.98 词元/秒。尽管所有六个模型的数据集完整,覆盖率达到 100.0% 且包含 288 个有效数据点,但仍出现了这种高波动性。然而,这份四小时的数据集缺乏先前的基线数据,这限制了判断这些吞吐量波动是代表正常的运维行为还是正在出现的基础设施性能下降的能力。
在四小时的时间窗口内,glm-5.2是平均吞吐量最强的模型,达到90.88词元/秒,紧随其后的是deepseek-v4-flash,达到91.45词元/秒。最弱的是nemotron-3-ultra,为33.9词元/秒。在运行方面,gemma4:31b表现出最显著的波动性,变异系数高达49.8%,吞吐量从最大值132.98词元/秒降至最小值15.1词元/秒。它在该时期内还呈现出-31.9%的急剧下降趋势。该数据集的覆盖率为100.0%,包含288个有效数据点,因此不存在影响本分析的缺失数据限制。