在四小时的时间窗口内,deepseek-v4-flash 的平均输出词元吞吐量最高,为 86.16 词元/秒,而 gemma4:31b 最低,为 23.88 词元/秒。运行方面最显著的波动来自 nemotron-3-ultra,其在此期间下降了 45.8%,变异系数为 76.2%,在 104.14 词元/秒和 5.89 词元/秒之间波动。deepseek-v4-flash 也表现出高度的不稳定性,在恢复之前骤降至 13.15 词元/秒。该数据集包含跨六个模型的 288 个有效观测值,覆盖率为 100.0%,因此不存在影响本分析的缺失数据限制。
每小时性能洞察
滚动四小时性能数据摘要
在四小时的时间窗口内,deepseek-v4-flash 的平均吞吐量最高,达到 88.92 词元/秒,而 gemma4:31b 最低,为 30.81 词元/秒。最具运维意义的波动出现在 nemotron-3-ultra 中,其变异系数为 76.4%,吞吐量在 6.66 到 104.14 词元/秒之间波动。deepseek-v4-flash 也表现出剧烈的周期性下降,在 09:00 降至 13.15 词元/秒,尽管其 p95 高达 135.46 词元/秒。该数据集包含跨六个模型的 288 个有效观测值,实现了 100.0% 的覆盖率,没有缺失数据的限制。
在四小时的时间窗口内,deepseek-v4-flash 的平均吞吐量最高,达到 101.75 词元/秒,而 minimax-m3 最低,为 36.09 词元/秒。在运行表现上,deepseek-v4-flash 和 nemotron-3-ultra 显示出严重的波动性,变异系数分别为 39.1% 和 73.8%。deepseek-v4-flash 在 06:35 骤降至 17.64 词元/秒,并在 09:00 降至 13.15 词元/秒。整体数据集覆盖率为 99.7%,包含 287 个有效数据点,但 gemma4:31b 缺失一个样本,仅有 47 个数据点且覆盖率为 97.9%,这略微限制了其趋势准确性。
在四小时的时间窗口内,deepseek-v4-flash 的平均吞吐量最高,达到 111.4 词元/秒,而 minimax-m3 最低,为 39.45 词元/秒。最具运营意义的波动出现在 nemotron-3-ultra 中,其从 6.66 词元/秒的低点波动至 104.14 词元/秒的高点,变异系数为 74.0%。deepseek-v4-flash 也表现出剧烈的不稳定性,在 06:35 降至 17.64 词元/秒,随后才恢复。本分析受限于 gemma4:31b 的数据缺失,该模型仅记录了 47 个样本,而非预期的 48 个,导致其覆盖率降至 97.9%,而所有其他模型的覆盖率均为 100%。
在四小时的时间窗口内,deepseek-v4-flash 的平均吞吐量最高,达到 111.72 词元/秒,而 minimax-m3 最低,为 39.37 词元/秒。最具运维意义的波动出现在 nemotron-3-ultra,其变异系数为 72.0%,下降趋势为 -23.9%,从早期峰值 103.84 词元/秒跌至 6.66 词元/秒的低点。整体数据集覆盖率在 287 个有效数据点上达到了 99.7%,但缺失数据的局限性影响了 gemma4:31b,该模型仅采集到 48 个预期样本中的 47 个,覆盖率为 97.9%。
在四小时的时间窗口内,deepseek-v4-flash 的平均吞吐量最高,为 115.96 词元/秒,而 minimax-m3 最低,为 38.25 词元/秒。最具运营意义的波动出现在 nemotron-3-ultra 上,其从 4.6 词元/秒的低点波动至 103.84 词元/秒的高点,变异系数为 73.1%,表明其输出能力极不稳定。相比之下,glm-5.2 保持了更稳定的性能,平均为 92.02 词元/秒,变异系数较低,为 26.6%。数据缺失限制影响了本次评估:gemma4:31b 仅记录了 47 个样本,而非预期的 48 个,导致覆盖率为 97.9%。
在四小时的时间窗口内,deepseek-v4-flash 是表现最强的模型,平均吞吐量为 113.36 词元/秒,而 nemotron-3-ultra 是表现最弱的模型,为 36.36 词元/秒。最具操作意义的波动来自 nemotron-3-ultra,其变异系数为 67.9%,尽管最高达到 100.59 词元/秒,但最低降至 4.6 词元/秒。相比之下,deepseek-v4-flash 保持稳定趋势,在该期间净变化为零。数据集包含 288 个有效观测值,在所有六个模型中实现了 100.0% 的覆盖率,这意味着不存在影响本分析的缺失数据限制。
在四小时的时间窗口内,deepseek-v4-flash 的平均吞吐量最高,为 121.68 词元/秒,而 nemotron-3-ultra 最弱,为 35.74 词元/秒。最具运营意义的波动来自 nemotron-3-ultra,其表现出极端的不稳定性,变异系数为 69.3%,并急剧下降至 4.6 词元/秒的最低值。此外,gemma4:31b 呈现出显著的下降趋势,在此期间下降了 24.8%,最新值为 24.24 词元/秒。该数据集包含跨六个模型的 288 个有效观测值,实现了完全覆盖。然而,存在缺失数据的局限性,因为所提供的点数组省略了各个观测值的确切 UTC 日期,仅依赖于简短的时间戳。
在四小时的观察窗口内,deepseek-v4-flash 实现了最强的平均吞吐量,达到 122.11 词元/秒,而 minimax-m3 最弱,为 44.02 词元/秒。最具运营意义的波动出现在 nemotron-3-ultra 中,其变异系数为 71.3%,频繁出现低至 8.1 词元/秒的急剧下降,并呈现 42.8% 的负向趋势,最终收于 19.17 词元/秒。相比之下,deepseek-v4-pro 保持了最稳定的性能,变异系数为 18.4%,平均值为 86.66 词元/秒。数据集覆盖率为完整的 100.0%,涵盖所有 288 个有效样本,因此不存在影响本分析的缺失数据限制。
在这四个小时的窗口内,deepseek-v4-flash 是表现最强的模型,平均吞吐量为 131.53 词元/秒,而 minimax-m3 是表现最弱的模型,为 46.94 词元/秒。最具运营意义的波动出现在 nemotron-3-ultra 中,其变异系数为 63.7%,下降趋势为 -52.8%,从 142.99 词元/秒的峰值跌至 8.46 词元/秒的低点。相比之下,deepseek-v4-flash 保持了最稳定的性能,变异系数仅为 15.3%。该数据集包含 288 个有效观测值,在所有六个模型中实现了 100.0% 的覆盖率,没有缺失数据的限制。
在四小时的时间窗口内,deepseek-v4-flash 是最强的模型,平均速度为 133.41 词元/秒,而 minimax-m3 是最弱的,为 47.28 词元/秒。最具运营意义的波动出现在 nemotron-3-ultra 中,其变异系数为 55.9%,尽管平均速度为 66.75 词元/秒,但吞吐量最低降至 8.46 词元/秒。glm-5.2 呈现出 32.9% 的显著上升趋势,峰值达到 158.74 词元/秒。该数据集包含六个模型的 288 个有效数据点,实现了 100.0% 的覆盖率,没有缺失数据的限制。
在四小时的时间窗口内,deepseek-v4-flash 实现了最强的平均吞吐量,达到 130.41 词元/秒,而 minimax-m3 最弱,为 46.21 词元/秒。最具操作意义的波动性出现在 nemotron-3-ultra 中,该模型在 7.52 词元/秒和 142.99 词元/秒之间表现出剧烈波动,变异系数为 59.0%。相比之下,deepseek-v4-flash 保持了最稳定的性能,变异系数仅为 17.0%。该数据集包含跨六个模型的 288 个有效观测值,实现了 100.0% 的覆盖率。由于数据集不包含任何缺失的观测值,因此不存在影响这一特定四小时分析的缺失数据限制。
在四小时的观察窗口内,deepseek-v4-flash 是表现最强的模型,平均吞吐量为 128.19 词元/秒,而 minimax-m3 是表现最弱的模型,为 45.72 词元/秒。最具运营意义的波动出现在 nemotron-3-ultra 中,其变异系数为 61.5%,吞吐量波动范围从最低 7.52 词元/秒到最高 137.44 词元/秒。这种极端的波动性表明生成性能高度不稳定。该数据集包含完整覆盖范围,所有模型共有 288 个有效数据点,因此在这一特定时间间隔内不存在缺失数据的限制。
在四小时的时间窗口内,deepseek-v4-flash 的平均吞吐量最高,为 118.76 词元/秒,而 gemma4:31b 最低,为 36.46 词元/秒。最具运营意义的波动出现在 nemotron-3-ultra 中,其范围从 7.52 到 128.09 词元/秒,变异系数为 66.6%,表明生成速度极不稳定。相反,deepseek-v4-pro 保持了最一致的相对吞吐量,尽管最后急剧下降至 22.53 词元/秒,但总体变化较小。该数据集包含跨六个模型的 288 个有效观测值,实现了 100.0% 的覆盖率,没有缺失数据的限制。所有预期的样本均已记录,为这些吞吐量波动提供了完整的可见性。
在四小时的时间窗口内,deepseek-v4-flash 是表现最强的模型,平均吞吐量为 107.02 词元/秒,而 gemma4:31b 是表现最弱的模型,为 27.17 词元/秒。最具运营意义的波动出现在 nemotron-3-ultra 中,其变异系数为 72.3%,吞吐量在 7.52 到 128.09 词元/秒之间波动。相比之下,deepseek-v4-pro 提供了最稳定的性能,在其 87.36 词元/秒的平均值附近仅波动 16.3%。该数据集包含跨六个模型的 288 个有效观测值,实现了 100.0% 的覆盖率。由于数据仅限于这一个滚动窗口,因此无法评估关于更广泛的昼夜规律或与前一日比较的任何缺失数据局限性。
在四小时的观察期内,deepseek-v4-flash 是表现最强的模型,平均吞吐量为 100.82 词元/秒,而 gemma4:31b 表现最弱,为 21.5 词元/秒。最具运维意义的波动出现在 gemma4:31b 和 nemotron-3-ultra 中,它们表现出高变异性,变异系数分别为 68.9% 和 68.8%。这种波动包括严重的吞吐量下降,其中 gemma4:31b 降至最低 6.01 词元/秒,nemotron-3-ultra 降至 7.81 词元/秒。相比之下,deepseek-v4-pro 保持了最稳定的性能,变异系数为 22.9%。该数据集具有完整覆盖范围,在所有 288 次有效观测中均无缺失数据限制。
在四小时的时间窗口内,deepseek-v4-flash 是表现最强的模型,平均吞吐量为 96.64 词元/秒,而 gemma4:31b 是表现最弱的模型,为 17.39 词元/秒。最具运营意义的波动出现在 nemotron-3-ultra 中,其变异系数为 71.5%,吞吐量在 7.44 到 101.31 词元/秒之间波动。同样,deepseek-v4-flash 在 17:05 经历了急剧下降至 17.69 词元/秒,随后才恢复。该数据集包含跨六个模型的 288 个有效观测值,实现了 100.0% 的覆盖率。由于该数据集不包含任何缺失数据,因此不存在影响这一特定吞吐量分析的缺失数据限制。
在这四小时的窗口期内,deepseek-v4-flash 的平均输出词元吞吐量最高,达到 90.13 词元/秒,而 gemma4:31b 最低,为 13.18 词元/秒。最具运营意义的波动出现在 nemotron-3-ultra 中,其最低降至 4.51 词元/秒,变异系数为 71.9%,并伴随 -12.5% 的下降趋势。相比之下,deepseek-v4-flash 呈现 10.8% 的上升趋势,峰值达到 117.41 词元/秒。该数据集包含跨六个模型的 288 个有效观测值,实现了 100.0% 的覆盖率,没有缺失数据的限制。
在四小时的时间窗口内,deepseek-v4-flash 是表现最强的模型,平均吞吐量为 89.7 词元/秒,而 gemma4:31b 是表现最弱的模型,为 15.14 词元/秒。最具运维意义的波动出现在 nemotron-3-ultra 中,其变异系数为 79.6%,并在 3.91 词元/秒的最小值与 104.52 词元/秒的最大值之间波动。deepseek-v4-flash 也表现出显著的波动性,在 13:00 降至 15.79 词元/秒,随后稳定在 100 词元/秒以上。该数据集包含跨六个模型的 288 个有效观测值,实现了 100.0% 的覆盖率,没有缺失数据的限制。
在这四个小时的窗口内,deepseek-v4-flash 的平均输出词元吞吐量最高,达到 85.13 词元/秒,而 gemma4:31b 最低,为 17.5 词元/秒。在运行方面最具显著性的波动出现在 nemotron-3-ultra 中,其范围从 3.91 到 104.52 词元/秒,变异系数为 85.9%,表明生成速度极不稳定。相反,deepseek-v4-pro 表现出最稳定的相对性能,变异系数为 28.1%。该数据集包含跨六个模型的 288 个有效观测值,实现了 100.0% 的覆盖率,没有缺失数据的限制。所有模型均报告了预期的 48 个样本,提供了当前云吞吐量操作的完整视图。
在四小时的时间窗口内,deepseek-v4-flash 的平均输出词元吞吐量最高,为 83.28 词元/秒,而 gemma4:31b 最低,为 21.12 词元/秒。最具运维意义的波动出现在 nemotron-3-ultra 中,其在 3.91 和 104.52 词元/秒之间波动,变异系数为 83.9%,表明生成速度极不稳定。相比之下,glm-5.2 呈现出强劲的上升趋势,增长 27.6%,最终达到 56.83 词元/秒。该数据集包含跨六个模型的 288 个有效观测值,实现了 100.0% 的覆盖率,没有缺失数据的限制。
在这四个小时的窗口期内,deepseek-v4-flash 的平均输出词元吞吐量最高,达到 89.33 词元/秒,而 gemma4:31b 表现最弱,为 23.6 词元/秒。最具运营意义的波动出现在 nemotron-3-ultra 中,该模型在 3.91 和 114.46 词元/秒之间表现出剧烈波动,变异系数为 82.4%。此外,deepseek-v4-flash 和 deepseek-v4-pro 均在窗口期结束时出现急剧下降,分别跌至 15.79 和 25.4 词元/秒。该数据集包含 288 个有效观测值,覆盖率为 100.0%,这意味着不存在影响本分析的缺失数据限制。
在四小时的时间窗口内,deepseek-v4-flash 的平均吞吐量最高,达到 90.88 词元/秒,而 gemma4:31b 最低,为 25.06 词元/秒。最具运维意义的波动出现在 nemotron-3-ultra 中,该模型在此期间下降了 34.0%,降至 5.04 词元/秒的低点,变异系数为 77.3%。相比之下,deepseek-v4-pro 保持了最稳定的性能,其变异系数为 24.7%,尽管曾短暂降至 20.06 词元/秒。该数据集包含跨六个模型的 288 个有效观测值,覆盖率达到 100.0%,因此没有任何缺失数据的局限性会影响这一特定时间区间。
在四小时的时间窗口内,deepseek-v4-flash 的平均输出词元吞吐量最高,为 94.66 词元/秒,而 gemma4:31b 最低,为 27.25 词元/秒。最具运营意义的波动出现在 nemotron-3-ultra 中,其变异系数为 74.9%,尽管最高达到 114.46 词元/秒,但最低仅为 4.27 词元/秒。deepseek-v4-pro 表现出更稳定的性能,平均为 80.9 词元/秒,变异系数较低,为 24.9%。数据集覆盖率为 100.0%,涵盖所有 288 个有效观测值,因此不存在影响本分析的缺失数据限制。
在这四个小时的窗口期内,deepseek-v4-flash 是表现最强的模型,平均吞吐量为 97.44 词元/秒,而 gemma4:31b 是表现最弱的,为 29.63 词元/秒。最具运营意义的波动来自 nemotron-3-ultra,其表现出在 4.27 和 104.5 词元/秒之间的极端波动,导致变异系数为 68.9%。此外,glm-5.2 在此期间呈现出 21.9% 的急剧下降趋势,从早期高于 100 词元/秒的峰值跌至 40.5 词元/秒。该数据集包含 288 个有效观测值,覆盖率为 100.0%,这意味着没有影响本分析的缺失数据限制。
在这四个小时的窗口内,deepseek-v4-flash 的平均输出词元吞吐量最高,达到 99.44 词元/秒,而 minimax-m3 最低,为 36.79 词元/秒。最具运维意义的波动出现在 nemotron-3-ultra 上,其从 116.52 词元/秒的峰值跌至 4.27 词元/秒,反映出 62.9% 的变异系数。同样,gemma4:31b 呈现出急剧的下降趋势,下降了 46.3%,最终收于 23.55 词元/秒。该数据集包含跨六个模型的 288 个有效观测值,实现了 100.0% 的覆盖率。由于数据仅限于这一单一滚动窗口且不存在任何缺失数据区间,因此无法代表更长期的吞吐量基线或昼夜模式。
在四小时的时间窗口内,deepseek-v4-flash 是表现最强的模型,平均吞吐量为 103.13 词元/秒,而 minimax-m3 是表现最弱的模型,为 34.42 词元/秒。最具运营意义的波动出现在 gemma4:31b 中,其变异系数为 51.2%,下行趋势为 53.3%,从接近 99.66 词元/秒的早期高点降至 21.14 词元/秒的最新值。相比之下,deepseek-v4-pro 依然最为稳定,变异系数为 17.9%,平均值为 85.77 词元/秒。该数据集的覆盖率为 100.0%,包含 288 个有效数据点,因此不存在影响本分析的缺失数据限制。
在四小时的时间窗口内,deepseek-v4-flash 的平均吞吐量最高,为 101.66 词元/秒,而 minimax-m3 最低,为 35.12 词元/秒。最具运维意义的波动出现在 nemotron-3-ultra 中,其范围从 4.37 到 116.52 词元/秒,变异系数为 78.2%,表明尽管有 182.8% 的上升趋势,但仍存在严重的不稳定性。此外,gemma4:31b 的吞吐量急剧下降了 31.8%,从早期的峰值 113.35 词元/秒降至期末的 22.92 词元/秒。该数据集包含所有模型的 288 个有效观测值,实现了 100.0% 的覆盖率,没有缺失数据的限制。
在四小时的时间窗口内,deepseek-v4-flash 的平均吞吐量最高,达到 107.22 词元/秒,而 nemotron-3-ultra 最低,为 30.06 词元/秒。对运维最具意义的波动是 nemotron-3-ultra 的极端不稳定性,其变异系数为 90.6%,并呈现 319.6% 的急剧上升趋势,从 3.68 词元/秒的低点攀升至 116.52 词元/秒的峰值。相比之下,deepseek-v4-pro 和 glm-5.2 保持相对稳定,平均分别为 83.72 和 90.15 词元/秒。该数据集包含跨六个模型的 288 个有效观测值,覆盖率为 100.0%,因此不存在影响本分析的缺失数据限制。
在四小时的时间窗口内,deepseek-v4-flash 实现了最强的平均吞吐量,达到 110.44 词元/秒,而 nemotron-3-ultra 表现最弱,为 30.32 词元/秒。最具操作意义的波动是 nemotron-3-ultra 的极端不稳定性,其变异系数为 101.4%,下降趋势为 48.6%,从早期 124.36 词元/秒的峰值跌至 3.68 词元/秒的低点。相比之下,glm-5.2 保持了最稳定的性能,变异系数为 27.2%。该数据集包含完整的观测数据,覆盖率为 100.0%,在所有 288 个有效数据点上均无缺失数据限制。
在四小时的时间窗口内,deepseek-v4-flash 是表现最强的模型,平均吞吐量为 109.74 词元/秒,而 minimax-m3 最弱,为 36.17 词元/秒。最具运营意义的趋势是 nemotron-3-ultra 的吞吐量严重崩溃,从早期峰值 159.16 词元/秒下降了 82.7%,到结束时降至 15.03 词元/秒。该模型还表现出极端的波动性,变异系数为 105.8%,其中包括 3.68 词元/秒的低点。该数据集具有完整的覆盖率,包含 288 个有效数据点,并且所有六个模型均不存在缺失数据的限制。
在四小时的时间窗口内,deepseek-v4-flash 的平均吞吐量最高,达到 107.68 词元/秒,而 minimax-m3 表现最弱,为 37.75 词元/秒。最具运维意义的波动出现在 nemotron-3-ultra,其范围从 3.68 到 159.16 词元/秒,变异系数为 86.1%,下行趋势为 40.2%,最终收于 12.93 词元/秒。相比之下,deepseek-v4-flash 呈上升趋势,增幅为 24.2%,峰值达到 158.03 词元/秒。该数据集记录了六个模型的 288 个有效数据点,实现了 100.0% 的覆盖率,不存在缺失数据的限制。
在四小时的时间窗口内,deepseek-v4-flash 的平均吞吐量最高,为 97.68 词元/秒,而 minimax-m3 最低,为 41.83 词元/秒。最具运维意义的波动出现在 nemotron-3-ultra 上,其吞吐量从 22:55 的 152.86 词元/秒降至 23:00 的 15.44 词元/秒,反映出其 62.8% 的高变异系数。此外,deepseek-v4-flash 呈现出强劲的上升趋势,在此期间增长了 33.8%,并在 01:00 达到 127.69 词元/秒。该数据集包含跨六个模型的 288 个有效观测值,覆盖率为 100.0%,这意味着在此时间间隔内没有需要报告的缺失数据限制。
在四小时的时间窗口内,deepseek-v4-pro 的平均输出词元吞吐量最高,为 90.01 词元/秒,而 minimax-m3 最低,为 43.78 词元/秒。最具运营意义的波动出现在 nemotron-3-ultra 中,其范围从 6.03 到 159.16 词元/秒,变异系数为 67.0%,表明生成速度极不稳定。相比之下,glm-5.2 保持了最一致的性能,仅在 21.76 和 115.46 词元/秒之间变化。该数据集包含跨六个模型的 288 个有效观测值,实现了 100.0% 的覆盖率,没有缺失数据的限制。所有模型均准确记录了 48 个五分钟采样,为该期间的吞吐量趋势提供了完整的可见性。
在四小时的时间窗口内,glm-5.2 的平均吞吐量最高,达到 86.14 词元/秒,而 minimax-m3 最低,为 43.15 词元/秒。最具运营意义的波动出现在 nemotron-3-ultra 中,其范围从 3.67 到 152.86 词元/秒,变异系数为 74.3%,包括在 19:55 和 22:40 附近出现低于 10 词元/秒的严重下降。相比之下,deepseek-v4-flash 保持最为稳定,平均维持在 84.73 词元/秒,变异系数仅为 18.6%。该数据集包含跨六个模型的 288 个有效观测值,实现了 100.0% 的覆盖率,无缺失数据限制。
在四小时的时间窗口内,deepseek-v4-flash 的平均输出词元吞吐量最高,达到 83.99 词元/秒,而 nemotron-3-ultra 最低,为 47.85 词元/秒。运行方面最显著的波动出现在 nemotron-3-ultra 上,其最低降至 3.67 词元/秒,变异系数为 70.6%,并伴有剧烈波动,例如飙升至 140.34 词元/秒。相比之下,deepseek-v4-flash 保持稳定,变异系数为 17.4%。该数据集包含跨六个模型的 288 个有效观测值,实现了 100.0% 的覆盖率,没有缺失数据的限制。
在四小时的时间窗口内,deepseek-v4-flash 实现了最高的平均吞吐量,达到 85.98 词元/秒,而 nemotron-3-ultra 表现最弱,为 39.88 词元/秒。最具操作意义的波动来自 nemotron-3-ultra,其变异系数为 69.8%,并降至 3.67 词元/秒的最低值。此外,gemma4:31b 呈现出明显的下降趋势,下降了 31.1%,最新值为 46.23 词元/秒。该数据集包含跨六个模型的 288 个有效观测值,实现了 100.0% 的覆盖率。由于数据仅捕获了这一特定的四小时时间段,因此无法评估关于更广泛的每日或每周吞吐量周期的任何缺失数据限制。
在四小时的时间窗口内,deepseek-v4-flash 的平均吞吐量最高,为 87.88 词元/秒,而 minimax-m3 最低,为 37.45 词元/秒。最具运营意义的波动出现在 nemotron-3-ultra 中,其吞吐量从 19:10 的 87.58 词元/秒急剧下降至 19:55 的 3.67 词元/秒,导致高达 71.3% 的变异系数。同样,gemma4:31b 表现出剧烈波动,范围从 11.65 到 136.02 词元/秒。本分析受限于数据缺失问题:每个模型仅记录了 47 个有效样本,而非预期的 48 个,导致滚动五分钟观测中存在一个小的空缺。
在四小时的时间窗口内,deepseek-v4-flash 的平均输出词元吞吐量最高,为 87.14 词元/秒,而 nemotron-3-ultra 最弱,为 43.02 词元/秒。最具运营意义的波动出现在 gemma4:31b 中,其从 9.86 词元/秒的低点波动至 136.02 词元/秒的高点,变异系数为 66.8%,表明生成速度极不稳定。相比之下,deepseek-v4-flash 保持了最一致的性能,仅在 34.94 词元/秒和 119.49 词元/秒之间变化。该数据集包含完整的观测数据,覆盖率为 100.0%,且在所有评估的模型中均无缺失数据限制。
在这四个小时的窗口内,deepseek-v4-flash 是表现最强的模型,平均吞吐量为 85.13 词元/秒,而 minimax-m3 是表现最弱的,为 32.0 词元/秒。最具运营意义的波动出现在 nemotron-3-ultra 中,其变异系数为 69.1%,吞吐量波动范围从最低 3.41 词元/秒到最高 116.34 词元/秒。glm-5.2 呈现出 25.4% 的显著下降趋势,从早期高于 110 词元/秒的峰值降至期末的 52.01 词元/秒。该数据集包含 288 个有效观测值,覆盖率为 100.0%,因此不存在影响本分析的缺失数据限制。
在四小时的时间窗口内,deepseek-v4-flash 的平均输出词元吞吐量最高,为 81.56 词元/秒,而 minimax-m3 最低,为 32.28 词元/秒。最具运营意义的波动出现在 nemotron-3-ultra 中,其范围从 3.41 到 116.34 词元/秒,变异系数为 72.2%,表明生成速度极不稳定。此外,glm-5.2 在窗口末期表现出吞吐量急剧下降,从 15:50 的 113.07 词元/秒跌至 17:00 的仅 12.38 词元/秒。该数据集包含跨六个模型的 288 个有效观测值,实现了 100.0% 的覆盖率,无缺失数据限制。
在四小时的时间窗口内,glm-5.2 提供了最强的平均输出词元吞吐量,达到 86.86 词元/秒,而 nemotron-3-ultra 最弱,为 32.58 词元/秒。最具操作意义的波动出现在 nemotron-3-ultra 中,其在 3.41 和 76.87 词元/秒之间剧烈波动,变异系数为 69.6%,表明生成速度高度不稳定。相反,deepseek-v4-flash 表现稳定,呈 2.9% 的上升趋势,平均达到 78.71 词元/秒。该数据集包含跨六个模型的 288 个有效观测值,实现了 100.0% 的覆盖率,没有缺失数据的限制。
在四小时的时间窗口内,glm-5.2 提供了最强的平均输出词元吞吐量,达到 87.36 词元/秒,而 nemotron-3-ultra 最弱,为 32.2 词元/秒。最具操作意义的波动出现在 nemotron-3-ultra 中,其变异系数为 75.1%,在 95.51 词元/秒的最大值和 3.41 词元/秒的最小值之间波动,同时伴随 31.3% 的下降趋势。相比之下,glm-5.2 保持了相对稳定性,变异系数为 20.3%。数据集包含 288 个有效数据点,在每模型 48 个预期样本中实现了 100% 的覆盖率,这意味着不存在影响本分析的缺失数据限制。
在四小时的时间窗口内,glm-5.2 提供了最强的平均输出词元吞吐量,达到 87.39 词元/秒,而 minimax-m3 最弱,为 38.42 词元/秒。最具运营意义的波动出现在 nemotron-3-ultra 中,其变异系数为 71.6%,频繁急剧下降至接近 5 词元/秒,并呈现 -24.5% 的下降趋势。相比之下,deepseek-v4-pro 表现出更稳定的性能,呈 4.6% 的上升趋势,变异系数为 27.7%。该数据集包含跨六个模型的 288 个有效观测值,实现了 100.0% 的覆盖率,没有缺失数据的限制。
在四小时的时间窗口内,glm-5.2 是平均吞吐量最高的模型,达到 84.26 词元/秒,略微领先于达到 84.01 词元/秒的 deepseek-v4-flash。最弱的是 minimax-m3,为 37.91 词元/秒。最具操作意义的波动出现在 nemotron-3-ultra 中,其变异系数为 71.7%,范围为 5.19 至 131.08 词元/秒,表明输出速率极不稳定。数据集覆盖完整,所有六个模型共有 288 个有效数据点,因此不存在影响本次评估的缺失数据限制。
在四小时的时间窗口内,glm-5.2 的平均输出词元吞吐量最高,达到 81.62 词元/秒,而 minimax-m3 表现最弱,为 34.79 词元/秒。最具运营意义的波动出现在 nemotron-3-ultra 中,其范围从 8.59 到 139.62 词元/秒,变异系数为 69.9%,表明与 glm-5.2 的 25.6% 相比存在严重的吞吐量不稳定性。Deepseek-v4-flash 也表现出显著的波动,在 08:10 降至 17.15 词元/秒,随后在 09:10 达到峰值 118.94 词元/秒。该数据集包含跨六个模型的 288 个有效观测值,覆盖率为 100.0%,因此没有任何缺失数据限制影响这一特定时间区间。
在四小时的时间窗口内,deepseek-v4-flash 的平均吞吐量最高,为 82.06 词元/秒,而 minimax-m3 最低,为 31.45 词元/秒。最具运维意义的波动出现在 nemotron-3-ultra 中,其范围从 6.9 到 139.62 词元/秒,变异系数为 69.6%,表明输出生成高度不稳定。相比之下,glm-5.2 保持了更稳定的 78.13 词元/秒的平均值,变异系数较低,为 26.3%。该数据集包含跨六个模型的 288 个有效观测值,实现了 100.0% 的覆盖率,没有缺失数据的限制,提供了系统性能的完整视图。
在四小时的时间窗口内,deepseek-v4-flash 实现了最强的平均吞吐量,达到 82.24 词元/秒,而 minimax-m3 最弱,为 30.54 词元/秒。最具运营意义的波动出现在 nemotron-3-ultra 中,其在 6.9 和 139.62 词元/秒之间剧烈波动,变异系数为 69.3%。此外,gemma4:31b 呈现出急剧的下降趋势,下降了 34.4%,降至后期低点 20.23 词元/秒。该数据集包含跨六个模型的 288 个有效观测值,实现了恰好 100.0% 的覆盖率,没有缺失数据的限制。
在四小时的时间窗口内,glm-5.2 以 82.72 词元/秒的平均输出词元吞吐量表现最强,而 minimax-m3 以 33.81 词元/秒表现最弱。最具运营意义的趋势是 deepseek-v4-flash 提升了 41.7% 至 119.21 词元/秒,与之形成对比的是 nemotron-3-ultra 下降了 31.9% 至 58.97 词元/秒。高波动性困扰着 nemotron-3-ultra,其 60.6% 的变异系数以及最低降至 6.9 词元/秒的表现就是明证。该数据集包含跨六个模型的 288 个有效数据点,实现了 100.0% 的覆盖率,没有缺失数据的限制。
在四小时的时间窗口内,glm-5.2 是表现最强的模型,平均吞吐量为 88.37 词元/秒,而 minimax-m3 是表现最弱的,为 39.32 词元/秒。最具运维意义的波动来自 nemotron-3-ultra,其吞吐量表现出剧烈波动,最低降至 5.45 词元/秒,随后峰值达到 152.72 词元/秒,变异系数为 57.6%。这种高方差与更为稳定的 glm-5.2 形成对比,后者的变异系数保持在较低的 23.2%。该数据集包含跨六个模型的 288 个有效观测值,实现了 100.0% 的覆盖率,没有缺失数据的限制。