← 返回性能仪表板

每小时性能洞察

滚动四小时性能数据摘要

已保留 1200 条摘要
4 小时窗口 · 384 个数据点 · 覆盖率 100.0%
  • glm-5.3 的平均吞吐量最高,达 152.71 词元/秒(峰值 185.15 词元/秒),而 nemotron-3-ultra 最弱,平均仅 5.4 词元/秒,从未超过 9.57 词元/秒。
  • glm-5.2 的波动性最为剧烈,变异系数为 40.0%,波动范围从 7.02 到 83.45 词元/秒;glm-5.3 和 glm-5.3-flash 均呈约 11% 的下降趋势(趋势分别为 -11.3% 和 -11.8%),而 deepseek-v4-flash 上升了 12.5%。
  • 不存在数据缺失的限制:全部八个模型均记录了 48 个预期样本中的 48 个,共计 384 个有效数据点,在四小时窗口内覆盖率达到 100.0%。
4 小时窗口 · 384 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强的模型,平均速度为 158.15 词元/秒(p95 为 183.67 词元/秒),而 nemotron-3-ultra 最弱,平均速度为 5.97 词元/秒,大约慢 26 倍。
  • glm-5.3 也是表现最稳定的模型(变异系数 16.7%),而 nemotron-3-ultra 呈现最急剧的下滑,趋势为 -25.3%,从 15.64 词元/秒的峰值降至 2.0 词元/秒的低谷;glm-5.2 波动最大,变异系数为 41.8%,最低降至 7.02 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均报告了 48 个预期样本中的 48 个,覆盖率为 100.0%,因此四小时的时间窗口得到完整呈现,这些数据没有任何需要附加说明的缺口。
4 小时窗口 · 384 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强的模型,平均吞吐量为 161.83 词元/秒(p95 为 183.91 词元/秒),而 nemotron-3-ultra 是最弱的模型,平均仅为 7.8 词元/秒,最大值也只有 62.89 词元/秒。
  • 运营层面最显著的波动来自 nemotron-3-ultra,其变异系数为 140.5%,最小值为 0.86 词元/秒,趋势为 -54.8%;glm-5.3-flash 也下降了 23.7%,从早期接近 120 词元/秒的读数跌至 45.23 词元/秒的低点。
  • 不存在数据缺失的限制:全部八个模型均报告了 48 个预期样本中的 48 个,覆盖率为 100.0%,且 384 个有效数据点完全覆盖了四小时的时间窗口。
4 小时窗口 · 384 个数据点 · 覆盖率 100.0%
  • glm-5.3 是平均吞吐量最强的模型,达到 158.41 词元/秒(p95 为 183.91 词元/秒),而 nemotron-3-ultra 最弱,仅为 17.93 词元/秒,约为领先者平均值的九分之一。
  • 运营层面最重大的变化是 nemotron-3-ultra 在 UTC 23:20 之后性能崩溃,从约 48 词元/秒跌至低于 2 词元/秒的读数,最低触及 0.86 词元/秒,趋势为 -76.4%,变异系数为 120.9%。
  • 该时间窗口内不存在数据缺失限制:全部八个模型均拥有 48 个预期样本中的 48 个,共计 384 个有效数据点,覆盖率为 100.0%,不过数据集仅覆盖四个小时。
4 小时窗口 · 384 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强模型,平均吞吐量为 154.96 词元/秒,领先于 gemma4:31b 的 117.81 词元/秒;nemotron-3-ultra 最弱,平均为 26.24 词元/秒,窗口结束时为 4.35 词元/秒。
  • 运营层面最显著的波动是 nemotron-3-ultra 在 23:20 UTC 之后的崩溃,从约 48 词元/秒跌至持续低于 2 词元/秒的读数(最低 0.86 词元/秒),产生 96.6% 的变异系数和 -74.3% 的趋势;glm-5.3-flash 呈上升趋势,上涨 17.0%,达到 100.01 词元/秒的平均值。
  • 不存在数据缺失的限制:全部八个模型均记录了 48 个预期样本中的 48 个,共计 384 个有效数据点,覆盖率为 100.0%,但该数据集仅涵盖这四小时的窗口。
4 小时窗口 · 384 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强的模型,平均吞吐量为 145.72 词元/秒(p95 为 180.61 词元/秒);nemotron-3-ultra 最弱,平均为 27.13 词元/秒,在窗口结束时仅为 1.56 词元/秒。
  • 运营层面最显著的波动是 nemotron-3-ultra 在窗口后期的崩溃:从 23:20 UTC 的 30.88 词元/秒降至 23:40 的 0.86 词元/秒,随后在 00:00 之前一直维持在接近 1 词元/秒的水平,导致其变异系数达到 91.2%。
  • 不存在数据缺失的限制:每个模型都报告了 48 个预期样本中的 48 个,总计 384 个有效数据点,在四小时窗口内覆盖率达到 100.0%。
4 小时窗口 · 384 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强模型,平均吞吐量为 138.9 词元/秒,峰值达 185.93 词元/秒;nemotron-3-ultra 最弱,平均为 26.0 词元/秒,最低为 4.05 词元/秒。
  • 运营层面最显著的波动来自 nemotron-3-ultra,其吞吐量在 4.05 至 96.85 词元/秒之间波动(变异系数 89.9%),其中包括在 UTC 21:25 飙升至 96.85 词元/秒;glm-5.3 也在 UTC 21:50 出现单个时间间隔骤降至 30.03 词元/秒的情况。
  • 不存在数据缺失的限制:全部八个模型均报告 48 个样本中的 48 个,共 384 个有效数据点,在四小时窗口内覆盖率为 100.0%。
4 小时窗口 · 384 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强的模型,平均吞吐量为 126.15 词元/秒(p95 为 171.55 词元/秒),而 nemotron-3-ultra 最弱,为 16.15 词元/秒,约为 glm-5.3 速率的八分之一。
  • nemotron-3-ultra 波动最为剧烈:在大部分时间处于 3-13 词元/秒之后,它在 21:25 飙升至 96.85 词元/秒,在 21:55 达到 82.53 词元/秒,变异系数为 116.5%;glm-5.2 也在 2.1 至 81.74 词元/秒之间波动(变异系数 64.9%)。
  • 没有缺失样本:全部八个模型均报告了 48 个预期样本中的 48 个,共 384 个有效数据点,覆盖率为 100.0%;四小时的时间窗口是唯一的范围限制。
4 小时窗口 · 384 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强的模型,平均吞吐量为 118.82 词元/秒(峰值 173.74 词元/秒),而 nemotron-3-ultra 最弱,平均为 8.03 词元/秒(最低 0.48 词元/秒)。
  • glm-5.2 表现出对运营影响最显著的波动性,变异系数为 68.0%,并在 19:20 至 19:50 期间出现持续低谷,吞吐量降至 2.1 至 10.43 词元/秒之间,随后在 20:25 恢复至 81.74 词元/秒;glm-5.3 也呈上升趋势,上涨 20.1%,在 21:00 达到 159.95 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均记录了 48 个预期样本中的 48 个,valid_point_count 为 384,覆盖率为 100.0%,因此四小时的时间窗口是完整的。
4 小时窗口 · 384 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强的模型,平均速度为 121.36 词元/秒(p95 为 155.07 词元/秒),而 nemotron-3-ultra 最弱,平均速度仅为 5.64 词元/秒,最大值仅为 12.98 词元/秒。
  • 运维层面最显著的变化是 glm-5.2 下降了 49.3%,其吞吐量在 UTC 时间 19:20 至 19:50 期间降至 2.1 至 10.43 词元/秒之间;nemotron-3-ultra 在该时间窗口内呈上升趋势,上升了 67.2%,glm-5.3-flash 上升了 24.1%。
  • 不存在数据缺失的限制:每个模型在 100.0% 的覆盖率下均报告了 48 个预期样本中的 48 个,且 384 个有效数据点与该四小时期间的预期总量相符。
4 小时窗口 · 384 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强的模型,平均吞吐量为 117.75 词元/秒(p95 为 157.74 词元/秒,最大值为 167.56 词元/秒),而 nemotron-3-ultra 最弱,平均仅为 3.94 词元/秒,从未超过 9.26 词元/秒。
  • 运营层面最显著的变化是 glm-5.2 下降了 28.5%,平均吞吐量降至 42.42 词元/秒,且相对波动性较高(变异系数 48.4%),并多次跌至接近 9-10 词元/秒;nemotron-3-ultra 上升了 176.9%,但仍远低于其他所有模型。
  • 不存在数据缺失的限制:全部八个模型均记录了预期的 48 个样本中的 48 个,共计 384 个有效数据点,在四小时时间窗口内覆盖率达到 100.0%。
4 小时窗口 · 384 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强模型,平均吞吐量为 114.56 词元/秒,峰值为 167.56 词元/秒,而 nemotron-3-ultra 是最弱模型,平均为 3.01 词元/秒,从未超过 9.26 词元/秒。
  • 运营层面最显著的波动性来自 nemotron-3-ultra:吞吐量在 UTC 17:05 降至 0.48 词元/秒,随后到 17:25 攀升至 9.26 词元/秒,变异系数为 79.4%,窗口期内趋势为 133.4%。
  • 不存在数据缺失的限制:全部八个模型均报告了 48 个预期样本中的 48 个,共 384 个有效数据点,覆盖率为 100.0%,因此平均值基于四小时期间完整的五分钟观测数据。
4 小时窗口 · 376 个数据点 · 覆盖率 97.9%
  • glm-5.3 是最强的模型,平均吞吐量为 114.03 词元/秒(p95 为 153.59 词元/秒),而 nemotron-3-ultra 最弱,平均仅为 1.82 词元/秒,从未超过 5.13 词元/秒。
  • 运营层面最显著的波动是 glm-5.3 在 14:25 降至 11.94 词元/秒,随后在 14:35 恢复至 130.48 词元/秒;glm-5.3-flash 也呈现出最陡峭的持续下降趋势,从 13:25 的 121.94 词元/秒下降 -28.2%,至 16:20 达到 39.05 词元/秒的低点。
  • 每个模型均记录了 48 个预期样本中的 47 个(97.9% 的覆盖率),因此每个模型缺失一个五分钟的时间间隔,在四小时的时间窗口中留下了一个小空缺。
4 小时窗口 · 384 个数据点 · 覆盖率 100.0%
  • glm-5.3 是平均吞吐量最强的模型,达到 112.26 词元/秒(p95 为 148.23 词元/秒),而 nemotron-3-ultra 最弱,平均仅为 1.85 词元/秒,从未超过 3.46 词元/秒。
  • glm-5.3 表现出最具运营意义的波动性:变异系数为 32.3%,吞吐量从 14:15 的 45.92 词元/秒骤降至 14:25 的 11.94 词元/秒,随后在 14:30 恢复至 130.48 词元/秒;其四小时趋势为 -10.1%。
  • 不存在数据缺失的限制:全部八个模型均报告了 48 个预期样本中的 48 个,共计 384 个有效数据点,在 12:03 至 16:03 UTC 时间窗口内覆盖率达到 100.0%。
4 小时窗口 · 384 个数据点 · 覆盖率 100.0%
  • glm-5.3 是平均吞吐量最强的模型,达到 114.21 词元/秒(峰值 171.47 词元/秒),而 nemotron-3-ultra 最弱,平均仅 2.08 词元/秒,大约比领先者慢 55 倍。
  • glm-5.3 还表现出对运营影响最显著的波动性:变异系数为 33.0%,吞吐量从 14:10 的 124.47 词元/秒骤降至 14:25 的 11.94 词元/秒,随后在 14:35 恢复至 130.48 词元/秒;nemotron-3-ultra 整体呈下降趋势,降幅 43.3%,最终为 1.13 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均报告了 48 个预期样本中的 48 个,共 384 个有效数据点,在四小时的时间窗口内覆盖率达到 100.0%。
4 小时窗口 · 376 个数据点 · 覆盖率 97.9%
  • glm-5.3 是最强的模型,平均吞吐量为 125.29 词元/秒(p95 为 164.82 词元/秒),而 nemotron-3-ultra 最弱,平均仅为 2.53 词元/秒,大约慢五十倍。
  • 运营层面最显著的变化是 nemotron-3-ultra 的持续下滑,从 10:05 的 3.12 词元/秒降至 13:55 的 1.14 词元/秒,趋势为 -36.2%,并在 13:50 达到 0.79 词元/秒的低点;glm-5.3 也出现急剧下跌,在 13:40 降至 37.83 词元/秒。
  • 每个模型在预期的 48 个样本中记录了 47 个(97.9% 的覆盖率),在 384 个数据点中获得 376 个有效数据点,因此每个模型缺失一个五分钟的时间间隔,短时间窗口的数据可能受到轻微影响。
4 小时窗口 · 384 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强模型,平均吞吐量为 122.8 词元/秒,领先于 gemma4:31b 的 113.35 词元/秒;nemotron-3-ultra 最弱,平均为 3.0 词元/秒,大约比领先者慢 40 倍。
  • glm-5.2 呈现最大的趋势变化,在统计窗口内上升 41.6%,从 09:05 的 20.06 词元/秒攀升至 11:40 的峰值 81.98 词元/秒;glm-5.3 是波动最大的高吞吐量模型,范围在 18.59 至 171.47 词元/秒之间(变异系数 27.9%)。
  • 无缺失数据限制:全部八个模型均有 48 个样本中的 48 个,共 384 个有效数据点,该时段覆盖率为 100.0%。
4 小时窗口 · 384 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强的模型,平均吞吐量为 122.47 词元/秒,领先于 114.0 词元/秒的 gemma4:31b;nemotron-3-ultra 最弱,平均仅为 3.2 词元/秒,大约比 glm-5.3 慢 38 倍。
  • glm-5.3 波动最为剧烈,从 08:50 的 132.8 词元/秒降至 08:55 的 35.53 词元/秒,再降至 09:20 的 18.59 词元/秒;而 minimax-m3 在 10:30 飙升至 104.62 词元/秒,远高于其 41.34 词元/秒的平均值;glm-5.2 呈上升趋势,达 30.6%。
  • 不存在数据缺失的限制:全部八个模型均报告 48 个样本中的 48 个,覆盖率为 100.0%,且数据集的 384 个有效数据点与预期数量相符,因此结论不受数据空缺的约束。
4 小时窗口 · 384 个数据点 · 覆盖率 100.0%
  • glm-5.3 是平均吞吐量最强的模型,达到 126.84 词元/秒(峰值 176.60 词元/秒),而 nemotron-3-ultra 最弱,平均仅为 3.37 词元/秒(峰值 5.28 词元/秒)。
  • 运营层面最显著的波动是 glm-5.3 从 08:50 的 132.80 词元/秒骤降至 08:55 的 35.53 词元/秒,并在 09:20 降至 18.59 词元/秒的低点,远低于其 126.84 词元/秒的平均值;minimax-m3 也在 10:30 飙升至 104.62 词元/秒,而其平均值为 39.84 词元/秒。
  • 不存在数据缺失的限制:全部 384 个预期观测值均存在,每个模型 48 个,覆盖率为 100.0%,因此唯一的约束是结果仅反映这单一的四小时时间窗口。
4 小时窗口 · 384 个数据点 · 覆盖率 100.0%
  • 平均吞吐量最强的是 glm-5.3,达 123.03 词元/秒;最弱的是 nemotron-3-ultra,为 4.21 词元/秒,minimax-m3 也较低,为 34.97 词元/秒,gemma4:31b 以 110.76 词元/秒位居第二。
  • glm-5.3 的运行波动最为剧烈,在 07:40 达到峰值 176.6 词元/秒,随后在 09:20 降至 18.59 词元/秒;而 nemotron-3-ultra 的相对波动性最高(CV 74.9%,范围 1.8 至 22.94 词元/秒),deepseek-v4-pro 最为稳定(CV 17.2%)。
  • 不存在数据缺失的限制:全部八个模型均报告了 48 个预期样本中的 48 个,总计 384 个有效数据点,覆盖率为 100.0%,因此观察到的低谷反映的是实测数值,而非采集缺口。
4 小时窗口 · 384 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强的模型,平均吞吐量为 129.90 词元/秒(p95 为 171.97 词元/秒,最大值为 176.60 词元/秒),而 nemotron-3-ultra 最弱,平均仅 4.69 词元/秒,大约慢 28 倍。
  • nemotron-3-ultra 表现出最具运营意义的波动性:变异系数为 69.5%,趋势为 -43.1%,吞吐量范围为 1.80 至 22.94 词元/秒,大多数读数介于 2 到 6 词元/秒之间;glm-5.3-flash 呈上升趋势,上升 15.3%,达到 83.72 词元/秒的平均值。
  • 不存在数据缺失的限制:全部八个模型均报告 48 个样本中的 48 个,共计 384 个有效数据点,在四小时窗口内覆盖率达到 100.0%。
4 小时窗口 · 384 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强的模型,平均吞吐量为 137.31 词元/秒(峰值 176.6 词元/秒),而 nemotron-3-ultra 最弱,平均仅为 5.41 词元/秒(最低 2.0 词元/秒),大约慢 25 倍。
  • minimax-m3 降幅最陡,呈下降趋势 36.3%,平均为 43.48 词元/秒;nemotron-3-ultra 波动最大,变异系数为 60.7%;glm-5.3-flash 是唯一明显上升的模型,增长 13.2%。
  • 不存在数据缺失的限制:所有八个模型均报告了 48 个预期样本中的 48 个,覆盖率为 100.0%,在四小时窗口内共有 384 个有效数据点。
4 小时窗口 · 384 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强的模型,平均吞吐量为 134.46 词元/秒(峰值 176.53 词元/秒),而 nemotron-3-ultra 最弱,平均仅 5.52 词元/秒,比领先者低约 24 倍。
  • 波动最显著的是 nemotron-3-ultra(CV 58.7%)和 minimax-m3(CV 43.8%),其中 minimax-m3 还呈现出最陡峭的下滑趋势(-18.9%),从 107.49 词元/秒的峰值跌至 35.8 词元/秒的最新读数;glm-5.3 在 07:00 从 176.53 骤降至 39.72 词元/秒,而 deepseek-v4-pro 最为稳定(CV 12.4%)。
  • 无缺失数据限制:全部八个模型在 48 个预期样本中均拥有 48 个,覆盖率为 100.0%,在四小时窗口内共计 384 个有效数据点。
4 小时窗口 · 384 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强的模型,平均吞吐量为 140.4 词元/秒(p95 为 176.31 词元/秒),而 nemotron-3-ultra 最弱,平均仅为 5.15 词元/秒,在整个时间窗口内从未超过 8.8 词元/秒。
  • 运营层面最显著的波动出现在 glm-5.3 中,它多次从持续 150-185 词元/秒的水平骤降至 38.65、61.08、45.59 和 53.01 词元/秒的短暂低点;minimax-m3 也在 16.05 和 107.49 词元/秒之间剧烈波动,变异系数为 40.6%。
  • 不存在数据缺失的限制:全部八个模型均报告 48 个样本中的 48 个,覆盖率为 100.0%,且完整数据集包含 384 个有效数据点,因此结论基于完整的五分钟观测数据。
4 小时窗口 · 384 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强的模型,平均吞吐量为 139.96 词元/秒(峰值达 185.94 词元/秒),而 nemotron-3-ultra 最弱,平均仅 5.05 词元/秒,大约比领先者慢 28 倍。
  • glm-5.2 的波动性对运行影响最大,变异系数为 38.0%,在 86.67 词元/秒和 10.18 词元/秒之间大幅波动;minimax-m3 同样不稳定,CV 为 41.7%,而 deepseek-v4-pro 运行最为稳定,CV 为 13.1%,围绕其 103.53 词元/秒的平均值波动。
  • 不存在数据缺失的限制:全部八个模型均报告了 48 个预期样本中的 48 个,共 384 个有效数据点,覆盖率为 100.0%,不过数据集仅涵盖这四个小时的时间窗口。
4 小时窗口 · 384 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强模型,平均吞吐量为 136.38 词元/秒,领先于 gemma4:31b 的 114.85 词元/秒和 deepseek-v4-pro 的 101.58 词元/秒;nemotron-3-ultra 最弱,平均仅 4.41 词元/秒,最大值仅为 8.06 词元/秒。
  • glm-5.3-flash 呈现最陡峭的趋势,上升 28.7% 至平均 76.55 词元/秒,而 glm-5.2 下降了 17.2%;nemotron-3-ultra 波动性最大,变异系数为 41.0%,glm-5.3 在 UTC 01:45 一度跌至 36.03 词元/秒。
  • 不存在数据缺失的限制:每个模型在 100.0% 的覆盖率下均报告了 48 个预期样本中的全部 48 个,共计 384 个有效数据点,因此四小时的时间窗口被完全覆盖。
4 小时窗口 · 384 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强的模型,平均速度为 138.18 词元/秒(峰值达 185.94 词元/秒),而 nemotron-3-ultra 是最弱的模型,平均速度仅为 5.22 词元/秒,最大值仅为 45.93 词元/秒。
  • 运营层面最显著的波动是 glm-5.2 在 00:00 骤降至 4.01 词元/秒,随后在 00:20 恢复至 86.12 词元/秒;nemotron-3-ultra 同样表现出极端的不稳定性,变异系数高达 120.1%。
  • 不存在数据缺失的限制:全部八个模型均报告了预期 48 个样本中的 48 个,在四小时的时间窗口内共有 384 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 384 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强的模型,平均吞吐量为 138.78 词元/秒,峰值达 185.94 词元/秒;nemotron-3-ultra 最弱,平均仅 7.49 词元/秒,从未超过 45.93 词元/秒。
  • 运营层面最显著的波动是 nemotron-3-ultra 的变异系数达 108.8%,且趋势为 -61.0%,而 glm-5.2 在 23:40 时从 34.59 词元/秒骤降至 00:00 时的 4.01 词元/秒,随后在 00:15 恢复至 81.18 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均报告了预期 48 个样本中的 48 个,共 384 个有效数据点,在四小时窗口内覆盖率为 100.0%。
4 小时窗口 · 384 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强的模型,平均吞吐量为 137.38 词元/秒(p95 为 178.65 词元/秒),而 nemotron-3-ultra 最弱,平均仅为 7.9 词元/秒,最大值也只有 45.93 词元/秒。
  • 运营层面最显著的波动是 glm-5.2 在 UTC 23:45 至 00:10 之间的崩溃,其平均吞吐量从 46.37 词元/秒降至 4.01 词元/秒的低点,随后恢复至 86.12 词元/秒;nemotron-3-ultra 同样表现出高度不稳定性,变异系数为 102.4%,趋势为 -47.9%。
  • 不存在数据缺失的限制:全部八个模型均报告了 48 个预期样本中的 48 个,共计 384 个有效数据点,在四小时时间窗口内覆盖率达到 100.0%。
4 小时窗口 · 384 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强模型,平均吞吐量为 133.5 词元/秒,领先于 deepseek-v4-pro 的 106.82 词元/秒;nemotron-3-ultra 最弱,平均仅 8.06 词元/秒,p95 仅为 22.43 词元/秒。
  • 波动最显著的是 nemotron-3-ultra 的 98.9% 变异系数,范围从 1.58 到 45.93 词元/秒,而 glm-5.2 在窗口末期出现崩溃,从 23:40 的 34.59 词元/秒跌至 00:00 的 4.01 词元/秒;glm-5.3 呈 18.0% 的上升趋势。
  • 不存在缺失数据的限制:全部八个模型均报告 48 个样本中的 48 个,覆盖率为 100.0%,共计 384 个有效数据点,不过该窗口仅覆盖四个小时。
4 小时窗口 · 384 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强的模型,平均吞吐量为 127.17 词元/秒,p95 为 178.65 词元/秒,峰值为 180.73 词元/秒;nemotron-3-ultra 最弱,平均为 7.13 词元/秒,峰值仅为 22.85 词元/秒。
  • 运营层面最显著的变化是 nemotron-3-ultra 的后期激增:在大部分时间维持在 2 至 9 词元/秒之间后,它在 22:35 跃升至 22.85 词元/秒,并在 23:00 之前一直保持在 19-22 词元/秒附近,推动其变异系数达到 80.0%;glm-5.3-flash 整体下降了 12.3%。
  • 不存在数据缺失的限制:全部八个模型均报告 48 个样本中的 48 个,覆盖率为 100.0%,且 384 个有效数据点与预期总数相符。
4 小时窗口 · 384 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强的模型,平均吞吐量为 121.74 词元/秒(48 个样本中的 48 个,峰值 180.73 词元/秒),而 nemotron-3-ultra 最弱,平均为 4.13 词元/秒,大约慢 30 倍。
  • glm-5.3 表现出最具运营意义的波动性:多次从约 140-160 词元/秒骤降至 33.17-47.57 词元/秒,标准差为 38.25 词元/秒,变异系数为 31.4%;deepseek-v4-flash 也在 21:40 附近下降了 22.0%,降至 40.88 词元/秒的低点。
  • 不存在数据缺失的限制:所有八个模型均报告 48 个预期样本中的 48 个,覆盖率为 100.0%(384 个有效数据点),因此唯一的约束就是四小时的时间窗口本身。
4 小时窗口 · 384 个数据点 · 覆盖率 100.0%
  • deepseek-v4-flash 是平均吞吐量最强的模型,达到 122.99 词元/秒,峰值高达 174.04 词元/秒,而 nemotron-3-ultra 最弱,平均仅为 3.05 词元/秒,且从未超过 7.36 词元/秒。
  • glm-5.3 表现出对运营影响最为显著的波动性:原本维持在 130-160 词元/秒附近的持续吞吐量,被突然的骤降所打断——17:20 降至 6.74 词元/秒,19:50 降至 36.67 词元/秒,20:50-20:55 降至约 33-34 词元/秒,标准差为 42.04 词元/秒。
  • 不存在数据缺失的限制:全部八个模型在 100.0% 的覆盖率下均交付了预期的 48 个样本中的 48 个,在四小时的时间窗口内共计 384 个有效数据点。
4 小时窗口 · 368 个数据点 · 覆盖率 95.8%
  • 平均吞吐量最高的是 deepseek-v4-flash,达到 128.19 词元/秒(p95 为 156.19 词元/秒),而 nemotron-3-ultra 最低,仅为 2.61 词元/秒,在整个时间窗口内从未超过 4.67 词元/秒。
  • 波动最显著的是 glm-5.2,在长期维持在约 40 词元/秒之后,于 18:25 飙升至 169.51 词元/秒,变异系数为 51.2%;glm-5.3 也在 17:20 骤降至 6.74 词元/秒,而 minimax-m3 呈 30.6% 的下行趋势,在达到 127.84 词元/秒的峰值后稳定在约 45-49 词元/秒。
  • 每个模型在预期的 48 个样本中记录了 46 个(覆盖率 95.8%),观测数据在 16:50-16:55 UTC 前后缺失,因此这些空档期间的短暂吞吐量下降或峰值未反映在平均值中。
4 小时窗口 · 368 个数据点 · 覆盖率 95.8%
  • deepseek-v4-flash 是最强的模型,平均吞吐量为 120.52 词元/秒,峰值达 174.04 词元/秒,而 nemotron-3-ultra 最弱,平均为 2.11 词元/秒,大约慢 57 倍。
  • 运营层面最显著的变化是 gemma4:31b,它从 16:20 的 14.49 词元/秒低点攀升至 17:10 的 140.99 词元/秒峰值,在该时间窗口结束时上升了 102.7%;glm-5.2 的波动性最高,变异系数为 63.7%。
  • 每个模型都记录了 48 个预期样本中的 46 个(覆盖率 95.8%),所有八个模型都缺失 16:50 和 16:55 UTC 的时间间隔,因此该空档期间的短暂下降未被观测到。
4 小时窗口 · 352 个数据点 · 覆盖率 91.7%
  • 平均吞吐量最强的是 deepseek-v4-flash,达 116.61 词元/秒(p95 为 150.9 词元/秒,最大值为 174.04 词元/秒),而 nemotron-3-ultra 最弱,平均仅 2.02 词元/秒,在整个时间窗口内从未超过 3.06 词元/秒。
  • 运营层面最显著的波动来自 gemma4:31b,其从 7.55 词元/秒的最低值摆动至 140.99 词元/秒的最大值,变异系数为 80.9%,趋势为 +291.6%,在 16:30 之前大致处于 8-30 词元/秒,之后持续处于 85-140 词元/秒;glm-5.3 也在 17:20 一度跌至 6.74 词元/秒。
  • 八个模型中的每一个均记录了 48 个预期样本中的 44 个(91.7% 的覆盖率),在 384 个预期数据点中留下 352 个有效数据点,因此每个模型缺失四次五分钟观测,短窗口平均值可能因此产生偏差。
4 小时窗口 · 352 个数据点 · 覆盖率 91.7%
  • glm-5.3 是平均吞吐量最强的模型,达到 112.82 词元/秒(p95 为 147.26 词元/秒),而 nemotron-3-ultra 最弱,平均仅 1.97 词元/秒,在整个时间窗口内从未超过 2.69 词元/秒。
  • 运营层面最显著的变化是 gemma4:31b 的后期飙升:它在大部分时间段内运行在接近 20 词元/秒的水平,随后从 16:30 的 61.56 词元/秒跃升至 16:40–16:45 期间持续保持的 109.81 词元/秒,推动其趋势达到 187.4%,变异系数达到 96.7%。glm-5.2 的波动也很大,从 14.27 词元/秒的低点到 184.81 词元/秒的峰值。
  • 每个模型都缺失了 48 个预期样本中的 4 个(已采集 44 个,覆盖率为 91.7%;共 352 个有效数据点),缺口出现在 UTC 时间 14:05、14:10、16:50 和 16:55,因此无法评估这些时间间隔内的短暂吞吐量变化。
4 小时窗口 · 344 个数据点 · 覆盖率 89.6%
  • glm-5.3 的平均吞吐量最高,达到 109.76 词元/秒(峰值 149.73 词元/秒),而 nemotron-3-ultra 最弱,仅为 1.91 词元/秒,从未超过 2.69 词元/秒。
  • glm-5.2 表现出对运营影响最大的波动性,变异系数为 85.2%,范围为 13.86 至 184.81 词元/秒,其中包括从 15:40 的 109.0 词元/秒飙升至 15:45 的 184.81 词元/秒,随后在 16:00 降至 48.93 词元/秒。
  • 每个模型均记录了 48 个预期样本中的 43 个(覆盖率 89.6%),每个模型缺失的是相同的五个时间戳,共留下 344 个有效数据点,因此这些间隙期间发生的短暂性能下降将无法被检测到。
4 小时窗口 · 344 个数据点 · 覆盖率 89.6%
  • glm-5.3 是最强模型,平均吞吐量为 112.97 词元/秒(峰值 171.99 词元/秒),而 nemotron-3-ultra 最弱,平均仅 2.22 词元/秒,大约低五十倍。
  • gemma4:31b 降幅最为剧烈,从 11:50 的 81.66 词元/秒峰值跌至 14:50 的 7.55 词元/秒,趋势为 -65.9%,变异系数为 69.7%;glm-5.2 走势相反,从 14:00 的 14.27 词元/秒跃升至 14:50 的 124.7 词元/秒。
  • 每个模型在预期的 48 个样本中拥有 43 个(覆盖率 89.6%),且在 UTC 12:40-12:50 和 14:05-14:10 存在共同缺口,因此平均值和趋势可能无法反映这些未观测到的时间段。
4 小时窗口 · 352 个数据点 · 覆盖率 91.7%
  • glm-5.3 是平均吞吐量最强的模型,达到 119.51 词元/秒(峰值 171.99 词元/秒),而 nemotron-3-ultra 最弱,平均仅为 2.11 词元/秒,大约慢 57 倍。
  • gemma4:31b 表现出最具运营意义的波动性:吞吐量呈 53.3% 的下降趋势,从 11:50 的 81.66 词元/秒峰值跌至 13:10 的 8.22 词元/秒低点,变异系数为 52.4%;glm-5.3 也出现剧烈波动,在 13:10 一度跌至 20.28 词元/秒。
  • 每个模型都缺失了 48 个预期样本中的 4 个(实际采集 44 个,覆盖率为 91.7%),其中包括 12:35 与 12:55 两次观测之间的一个共同缺口,因此所有模型在该时间段内的吞吐量均未被观测到。
4 小时窗口 · 360 个数据点 · 覆盖率 93.8%
  • glm-5.3 的平均吞吐量最高,达 131.45 词元/秒(峰值 171.99 词元/秒),而 nemotron-3-ultra 最弱,平均仅 2.07 词元/秒,从未超过 3.9 词元/秒。
  • 运营层面最显著的波动来自 gemma4:31b:变异系数为 45.5%,从 118.92 词元/秒的峰值跌至 12.04 词元/秒的最新读数,趋势为 -27.7%,相比之下 deepseek-v4-flash 更为稳定,平均 103.43 词元/秒。
  • 每个模型均记录了 48 个预期样本中的 45 个(覆盖率 93.8%),且在 UTC 12:35 至 12:55 之间存在共同缺口,因此该 20 分钟窗口内的吞吐量未被测量。
4 小时窗口 · 384 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强模型,平均吞吐量为 133.61 词元/秒,峰值达 171.99 词元/秒,而 nemotron-3-ultra 是最弱模型,平均仅为 2.13 词元/秒,从未超过 3.9 词元/秒。
  • 运行层面最显著的波动来自 deepseek-v4-flash,其吞吐量在 146.07 词元/秒的最大值与 17.99 词元/秒的最小值之间波动(变异系数 26.0%);gemma4:31b 呈现最陡峭的下滑趋势,从 08:05 的 96.14 词元/秒降至 12:00 的 34.57 词元/秒,趋势为 -29.3%。
  • 不存在数据缺失的限制:全部八个模型均记录了预期 48 个样本中的 48 个,在四小时窗口内共有 384 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 384 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强的模型,平均吞吐量为 132.02 词元/秒,领先于 deepseek-v4-flash 的 110.93 词元/秒和 deepseek-v4-pro 的 104.11 词元/秒;nemotron-3-ultra 最弱,平均为 3.0 词元/秒,远低于 glm-5.2 的 22.83 词元/秒。
  • 最显著的变动是普遍下滑:gemma4:31b 下跌 23.2% 至 10:00 时的 37.87 词元/秒,glm-5.2 下跌 22.7%,nemotron-3-ultra 下跌 48.1% 至 1.35 词元/秒,而 glm-5.3 保持稳定,为 +3.1%;deepseek-v4-flash 波动剧烈,在 09:40 骤降至 17.99 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均提供了 48 个预期样本中的 48 个,覆盖率为 100.0%,因此四小时的时间窗口得到了完整呈现。
4 小时窗口 · 384 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强的模型,平均吞吐量为 132.26 词元/秒,峰值达 177.27 词元/秒;nemotron-3-ultra 最弱,平均为 4.03 词元/秒,从未超过 10.5 词元/秒。
  • 每个模型在该时间窗口内均呈下降趋势,其中 glm-5.2 下降 28.3%,nemotron-3-ultra 下降 38.4%;glm-5.3 出现几次孤立的急剧下降,分别降至 37.68、41.49 和 47.03 词元/秒,而 glm-5.2 在 08:45 附近跌至 6.6 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均记录了预期 48 个样本中的 48 个,共有 384 个有效数据点,覆盖率为 100.0%,因此这四小时的时间窗口得到了完整呈现。
4 小时窗口 · 384 个数据点 · 覆盖率 100.0%
  • glm-5.3 是平均吞吐量最强的模型,达到 136.64 词元/秒(峰值 179.99 词元/秒),而 nemotron-3-ultra 最弱,平均仅 6.03 词元/秒,且从未超过 15.01 词元/秒。
  • 运营层面最显著的变化是 nemotron-3-ultra 持续下滑 51.2%,从 04:05 的 14.81 词元/秒降至 08:00 的 1.59 词元/秒,且波动性最高(变异系数 60.5%);glm-5.3 也出现突发的孤立骤降,在 05:30 降至 37.68 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均报告了预期 48 个样本中的 48 个,共计 384 个有效数据点,在四小时窗口内覆盖率达到 100.0%。
4 小时窗口 · 384 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强的模型,平均吞吐量为 148.71 词元/秒(p95 为 177.34 词元/秒),而 nemotron-3-ultra 最弱,平均仅为 11.70 词元/秒,仅在 03:35 一次超过 83.15 词元/秒。
  • 运营层面最显著的模式是 nemotron-3-ultra 的持续下滑:从 03:15 的 29.88 词元/秒降至 05:00 之后的 8 词元/秒以下,呈 72.9% 的下降趋势,变异系数为 110.4%,表明这是渐进性劣化而非随机波动。
  • 不存在数据缺失的限制:全部八个模型均报告了 48 个预期样本中的 48 个,覆盖率为 100.0%,在四小时窗口内共计 384 个有效数据点。
4 小时窗口 · 384 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强模型,平均吞吐量为 148.29 词元/秒,领先于 deepseek-v4-flash 的 125.52 词元/秒;nemotron-3-ultra 最弱,平均为 14.18 词元/秒,约为领先者的十分之一。
  • 运维层面最显著的波动来自 nemotron-3-ultra:变异系数为 104.7%,呈 60% 的下行趋势,从 03:35 的 83.15 词元/秒峰值滑落至 05:00 后的个位数,并在 06:00 降至 5.09 词元/秒;glm-5.3 也在 05:30 出现一次孤立的骤降,降至 37.68 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均报告了预期 48 个样本中的 48 个,覆盖率为 100%,在四小时时间窗口内共有 384 个有效数据点。
4 小时窗口 · 384 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强的模型,平均吞吐量为 152.12 词元/秒(p95 为 179.59 词元/秒),而 nemotron-3-ultra 最弱,平均为 18.21 词元/秒,约为领先者的八分之一。
  • 运营层面最显著的波动是 nemotron-3-ultra 的变异系数达 111.2%,其吞吐量在 1.38 至 83.15 词元/秒之间波动,其中包括从 UTC 01:05 到 01:30 连续六次读数介于 1.38 至 1.49 词元/秒之间;glm-5.3 也在 UTC 02:00 短暂降至 32.04 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均报告了预期的 48 个样本中的 48 个,覆盖率为 100.0%,且 384 个有效数据点与完整的四小时时间窗口相吻合。
4 小时窗口 · 384 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强的模型,平均速度为 153.12 词元/秒,p95 为 181.52 词元/秒;而 nemotron-3-ultra 最弱,平均速度为 18.10 词元/秒,p95 仅为 65.41 词元/秒。
  • 运营层面最显著的波动是 nemotron-3-ultra 的变异系数达到 111.9%,在 1.38 至 83.15 词元/秒之间摆动,其中包括从大约 01:05 到 01:30 近一个小时低于 2 词元/秒的时段;glm-5.3 也在 02:00 出现了骤降至 32.04 词元/秒的单区间低谷。
  • 不存在缺失数据的限制:全部八个模型均报告了 48 个预期样本中的 48 个,覆盖率为 100.0%,与数据集的 384 个有效数据点相符。
4 小时窗口 · 384 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强的模型,平均吞吐量为 155.11 词元/秒(p95 为 181.42 词元/秒),而 nemotron-3-ultra 最弱,平均为 19.02 词元/秒,大约慢八倍。
  • 运营层面最显著的波动是 nemotron-3-ultra 的变异系数达 106.7%,其吞吐量在大约 30 分钟内(01:05–01:30)骤降至约 1.4 词元/秒,随后在 01:45 飙升至 79.64 词元/秒;minimax-m3 也呈现 -21.6% 的趋势,最终为 34.86 词元/秒。
  • 无缺失数据限制:全部八个模型均报告了 48 个预期样本中的 48 个,覆盖率为 100.0%,在四小时窗口内共有 384 个有效数据点。