← 返回性能仪表板

每小时性能洞察

滚动四小时性能数据摘要

已保留 1201 条摘要
4 小时窗口 · 384 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强的模型,平均吞吐量为 155.11 词元/秒(p95 为 181.42 词元/秒),而 nemotron-3-ultra 最弱,平均为 19.02 词元/秒,大约慢八倍。
  • 运营层面最显著的波动是 nemotron-3-ultra 的变异系数达 106.7%,其吞吐量在大约 30 分钟内(01:05–01:30)骤降至约 1.4 词元/秒,随后在 01:45 飙升至 79.64 词元/秒;minimax-m3 也呈现 -21.6% 的趋势,最终为 34.86 词元/秒。
  • 无缺失数据限制:全部八个模型均报告了 48 个预期样本中的 48 个,覆盖率为 100.0%,在四小时窗口内共有 384 个有效数据点。
4 小时窗口 · 384 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强的模型,平均吞吐量为 144.70 词元/秒(p95 为 181.42 词元/秒),而 nemotron-3-ultra 最弱,平均仅为 22.13 词元/秒,峰值也仅有 83.36 词元/秒。
  • 运营层面最显著的波动来自 nemotron-3-ultra:其吞吐量在 1.25 至 83.36 词元/秒之间波动,变异系数为 104.0%,趋势为 -43.7%,其中包括从 UTC 01:05 到 01:30 期间持续接近 1.4 词元/秒的一段。
  • 不存在数据缺失的限制:全部八个模型均报告了 48 个预期样本中的 48 个,覆盖率为 100.0%,在四小时的时间窗口内共有 384 个有效数据点。
4 小时窗口 · 384 个数据点 · 覆盖率 100.0%
  • glm-5.3 是平均吞吐量最强的模型,达到 137.96 词元/秒(p95 为 179.95 词元/秒),而 nemotron-3-ultra 最弱,平均仅 22.89 词元/秒,从未超过 83.36 词元/秒。
  • 运营层面最显著的波动来自 nemotron-3-ultra:变异系数为 87.3%,在 23:05 骤降至 1.25 词元/秒,并在收盘时以 2.8 词元/秒收尾,趋势为 -22.1%;glm-5.3 尽管平均值很高,也在 22:15 出现骤降至 19.9 词元/秒、在 22:45 降至 20.86 词元/秒的孤立性急剧下跌。
  • 本时间窗口内不存在数据缺失的限制:全部八个模型均报告了预期的 48 个样本中的 48 个,每个模型覆盖率均为 100.0%,总计 384 个有效数据点。
4 小时窗口 · 384 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强的模型,平均吞吐量为 137.3 词元/秒(峰值达 175.89 词元/秒),而 nemotron-3-ultra 最弱,平均为 23.23 词元/秒,范围在 1.25 至 83.36 词元/秒之间。
  • 运营层面最显著的波动来自 nemotron-3-ultra,其变异系数为 85.7%,趋势为 +55.9%;它在 UTC 时间 22:50 至 23:05 期间骤降至 1.25–1.92 词元/秒。glm-5.3 也在 UTC 时间 21:15、22:15、22:30 和 22:45 出现多次单区间降至约 20 词元/秒的情况。
  • 不存在数据缺失的限制:全部八个模型均交付了预期 48 个样本中的 48 个,覆盖率为 100.0%,共 384 个有效数据点,因此吞吐量下降反映的是实测数值,而非采集缺口。
4 小时窗口 · 384 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强的模型,平均吞吐量为 134.59 词元/秒(p95 为 172.74 词元/秒),而 nemotron-3-ultra 是最弱的,平均仅为 17.48 词元/秒,远低于次低的 glm-5.2 的 25.04 词元/秒。
  • 运维层面最值得关注的波动是 glm-5.3 在 21:15、22:15、22:30 和 22:45 多次从约 150 词元/秒骤降至接近 20 词元/秒,以及 nemotron-3-ultra 的剧烈波动(cv 107.0%),最终收于 1.85 词元/秒,为其在该时段内的最低值。
  • 不存在数据缺失的限制:全部八个模型均报告了预期 48 个样本中的 48 个,共计 384 个有效数据点,在四小时窗口内覆盖率达到 100.0%。
4 小时窗口 · 384 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强的模型,平均吞吐量为 138.84 词元/秒(p95 为 171.43 词元/秒);nemotron-3-ultra 最弱,平均仅 12.98 词元/秒,最大值也只有 75.06 词元/秒。
  • 运营层面最显著的波动性来自 nemotron-3-ultra,其变异系数为 90.7%,吞吐量在 4.14 至 75.06 词元/秒之间波动,其中包括 21:50 时达到 75.06 词元/秒的峰值;gemma4:31b 也在 24.87 至 150.42 词元/秒之间波动(变异系数 39.7%)。
  • 不存在数据缺失的限制:全部八个模型均报告了预期的 48 个样本中的 48 个,每个模型的覆盖率为 100.0%,总计 384 个有效数据点,因此没有任何缺口影响这些数据。
4 小时窗口 · 384 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强的模型,平均吞吐量为 136.44 词元/秒,峰值达 182.28 词元/秒;nemotron-3-ultra 最弱,平均为 8.04 词元/秒,从未超过 24.22 词元/秒。
  • gemma4:31b 表现出对运行影响最显著的波动性,范围从 7.4 到 138.1 词元/秒,变异系数为 59.1%,且在该时间窗口内呈 97.3% 的上升趋势,而 deepseek-v4-flash 在 19:20 飙升至 179.03 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均报告了 48 个预期样本中的 48 个,共 384 个有效数据点,在四小时窗口内覆盖率达到 100.0%。
4 小时窗口 · 384 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强的模型,平均吞吐量为 127.74 词元/秒,领先于 deepseek-v4-flash 的 114.2 词元/秒;nemotron-3-ultra 最弱,平均为 7.42 词元/秒。
  • gemma4:31b 表现出最具运营意义的波动性:吞吐量范围为 7.4 至 124.82 词元/秒,变异系数为 72.9%,其 +208.1% 的趋势反映了从 17:10 前后低于 10 词元/秒的低点攀升至 19:15 之后超过 108 词元/秒的峰值。
  • 不存在缺失数据的限制:全部八个模型均报告了预期的 48 个样本中的 48 个,共计 384 个有效数据点,在四小时窗口内覆盖率达到 100.0%。
4 小时窗口 · 384 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强的模型,平均吞吐量为 119.89 词元/秒,领先于 deepseek-v4-flash 的 104.96 词元/秒;nemotron-3-ultra 最弱,平均仅为 6.16 词元/秒,p95 也只有 13.17 词元/秒。
  • 运维层面最显著的变化是 glm-5.3-flash 的下滑,从窗口早期的大约 89-118 词元/秒降至后期的大约 50-60 词元/秒,趋势为 -36.3%;gemma4:31b 同样表现出高波动性(变异系数 66.5%),在 17:10 附近一度跌至 7.4 词元/秒,随后在 18:45 达到 124.82 词元/秒的峰值。
  • 不存在数据缺失的限制:每个模型都报告了 48 个预期样本中的全部 48 个,总计 384 个有效数据点,在四小时窗口内覆盖率达到 100.0%。
4 小时窗口 · 384 个数据点 · 覆盖率 100.0%
  • glm-5.3 的平均吞吐量最强,达到 118.64 词元/秒,峰值为 167.33 词元/秒,而 nemotron-3-ultra 最弱,平均仅为 4.68 词元/秒,且从未超过 42.93 词元/秒。
  • 运营层面最显著的变化是 gemma4:31b 51% 的降幅,从 15:45 时 98.0 词元/秒的峰值降至 17:10 前后约 7.4 词元/秒的读数;nemotron-3-ultra 也表现出极端波动性,在 16:55 飙升至 42.93 词元/秒,远高于其 4.68 词元/秒的平均值。
  • 不存在数据缺失的限制:全部八个模型均报告了 48 个预期样本中的 48 个,覆盖率为 100.0%,因此 384 个有效数据点完全代表了这四个小时的时间窗口。
4 小时窗口 · 384 个数据点 · 覆盖率 100.0%
  • glm-5.3 是平均吞吐量最强的模型,达到 114.59 词元/秒,最高为 167.33 词元/秒;nemotron-3-ultra 最弱,平均仅 4.32 词元/秒,p95 仅为 10.26 词元/秒,下限为 0.44 词元/秒。
  • 运营层面最显著的波动是 nemotron-3-ultra 的变异系数达 143.1%,包括在 16:25 降至 0.44 词元/秒,以及在 16:55 飙升至 42.93 词元/秒;gemma4:31b 也在 7.61 至 98.0 词元/秒之间波动(变异系数 53.2%)。
  • 不存在数据缺失的限制:全部八个模型均报告了 48 个预期样本中的 48 个,覆盖率为 100.0%,与 384 个有效数据点相符,因此四小时的时间窗口得到了完整观测。
4 小时窗口 · 384 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强的模型,平均吞吐量为 110.11 词元/秒,峰值达 167.33 词元/秒;nemotron-3-ultra 是最弱的模型,平均仅为 2.95 词元/秒,从未超过 12.23 词元/秒。
  • gemma4:31b 呈现出最显著的趋势,从 13:05-13:10 前后 8.1 词元/秒的低谷攀升 95.8%,在 15:45 达到 98.0 词元/秒的峰值;glm-5.3 是波动最大的高吞吐量模型,在 10.98 至 167.33 词元/秒之间波动,变异系数为 33.6%。
  • 不存在数据缺失的限制:全部八个模型均报告了 48 个预期样本中的 48 个,共 384 个有效数据点,在四小时时间窗口内覆盖率达到 100.0%。
4 小时窗口 · 384 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强的模型,平均吞吐量为 109.06 词元/秒(p95 为 149.91 词元/秒),而 nemotron-3-ultra 最弱,平均仅为 3.83 词元/秒,峰值也仅有 12.23 词元/秒。
  • gemma4:31b 的波动性最高,变异系数为 59.9%,吞吐量在 7.62 至 63.54 词元/秒之间;glm-5.3 同样波动剧烈,在 11:25 达到 166.18 词元/秒的峰值后,于 12:40 骤降至 10.98 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均拥有 48 个预期样本中的 48 个,共 384 个有效数据点,覆盖率为 100.0%,但四小时的时间窗口限制了对更长期表现的评估。
4 小时窗口 · 384 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强的模型,平均速度为 113.92 词元/秒(p95 为 172.74 词元/秒),而 nemotron-3-ultra 最弱,平均速度仅为 5.15 词元/秒,最大值仅为 12.79 词元/秒。
  • 运行态势变化最剧烈的是 nemotron-3-ultra 的下滑(趋势 -46.2%),从 10:55 的 12.79 词元/秒峰值降至 12:30 的 0.98 词元/秒,收于 3.76 词元/秒;glm-5.3 同样波动较大,在 10.98 至 190.39 词元/秒之间摆动(变异系数 37.7%)。
  • 无缺失数据限制:全部八个模型均报告 48 个样本中的 48 个,覆盖率为 100.0%(384 个有效数据点),因此结果仅受截至 UTC 14:03 的四小时时间窗口的限制。
4 小时窗口 · 384 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强的模型,平均吞吐量为 112.81 词元/秒(p95 为 172.74 词元/秒),而 nemotron-3-ultra 最弱,平均仅为 6.45 词元/秒,峰值也仅有 14.55 词元/秒。
  • 最显著的趋势是 gemma4:31b 下降了 62.4%,从 09:05 的约 60 词元/秒降至 13:00 的 9.06 词元/秒;nemotron-3-ultra 在 12:30 附近也跌至 0.98 词元/秒。glm-5.3 波动较大(变异系数 40.4%),在 10.98 至 190.39 词元/秒之间摆动。
  • 不存在缺失数据的限制:全部八个模型均报告了 48 个预期样本中的 48 个,共 384 个有效数据点,覆盖率为 100.0%,因此平均值是在完整的四小时窗口内计算的。
4 小时窗口 · 384 个数据点 · 覆盖率 100.0%
  • glm-5.3 是平均吞吐量最强的模型,达到 113.41 词元/秒,峰值高达 190.39 词元/秒;nemotron-3-ultra 是最弱的模型,平均仅为 8.70 词元/秒,p95 也只有 14.45 词元/秒。
  • gemma4:31b 表现出最急剧的性能恶化,从 08:05 的 42.43 词元/秒一路下滑 54.3%,至 11:25 降至最低点 7.62 词元/秒;而 nemotron-3-ultra 波动性最大,变异系数高达 116.9%,在 1.31 至 66.14 词元/秒之间剧烈波动。
  • 不存在数据缺失的限制:全部八个模型均报告了 48 个预期样本中的 48 个,每个模型的覆盖率均为 100.0%,在四小时的时间窗口内共有 384 个有效数据点。
4 小时窗口 · 384 个数据点 · 覆盖率 100.0%
  • 平均吞吐量最强的是 glm-5.3,达 109.96 词元/秒,其次是 deepseek-v4-pro,达 97.26 词元/秒;最弱的是 nemotron-3-ultra,仅 12.29 词元/秒,glm-5.2 也较低,为 20.17 词元/秒。
  • 运营层面最显著的波动来自 nemotron-3-ultra,其范围从 66.14 词元/秒降至 1.31 词元/秒,变异系数为 117.6%,趋势为 -47.9%;glm-5.3 在持续保持 130 词元/秒以上的区间之间,也出现了骤降至 6.01 词元/秒的情况。
  • 无缺失数据:全部八个模型均交付了 48 个预期样本中的 48 个,共 384 个有效数据点,覆盖率为 100.0%;局限在于四小时的观测窗口,可能无法代表其他时段。
4 小时窗口 · 384 个数据点 · 覆盖率 100.0%
  • glm-5.3 的平均吞吐量最高,达 105.09 词元/秒(峰值 151.70 词元/秒),而 nemotron-3-ultra 表现最弱,平均仅 16.31 词元/秒,窗口结束时仅为 6.27 词元/秒。
  • glm-5.3 也是波动最剧烈的强势表现者,在 6.01 至 151.70 词元/秒之间波动(变异系数 42.0%),而 nemotron-3-ultra 恶化最为明显,呈 51.2% 的下降趋势,在 07:50 至 09:00 UTC 期间持续读数接近 2 词元/秒。
  • 不存在缺失数据的限制:全部八个模型均记录了 48 个预期样本中的 48 个,在四小时窗口内共计 384 个有效数据点,覆盖率达 100.0%。
4 小时窗口 · 384 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强的模型,平均吞吐量为 121.05 词元/秒,峰值为 174.59 词元/秒;nemotron-3-ultra 最弱,平均为 18.04 词元/秒,最低为 1.31 词元/秒。
  • glm-5.3 的波动性在运营层面最为显著,在 174.59 和 6.01 词元/秒之间波动,包括在 07:15–07:25 前后降至 38.25 和 28.70 词元/秒,以及在 08:30–08:35 降至 27.69 和 6.83 词元/秒;nemotron-3-ultra 同样不稳定,变异系数为 113.4%。
  • 不存在数据缺失的限制:全部八个模型各报告了 48 个样本中的 48 个,共计 384 个有效数据点,在四小时窗口内覆盖率达到 100.0%。
4 小时窗口 · 376 个数据点 · 覆盖率 97.9%
  • glm-5.3 是平均吞吐量最强的模型,达到 134.51 词元/秒(p95 为 173.75 词元/秒),而 glm-5.2 最弱,平均仅 21.98 词元/秒,峰值也只有 45.72 词元/秒。
  • 运营层面最显著的变化是 gemma4:31b 的下滑:其 64.99 词元/秒的平均值掩盖了 -54.0% 的趋势,从窗口期初期的约 110-144 词元/秒,降至 06:45 之后持续维持在 18-40 词元/秒附近的读数,变异系数为 52.0%。nemotron-3-ultra 的波动更为剧烈,CV 达 90.2%,波动范围从 1.67 到 102.21 词元/秒。
  • 每个模型都记录了 48 个预期样本中的 47 个(97.9% 的覆盖率),每个模型各留有一个五分钟的空缺,总计 376 个有效数据点,因此短暂的下降可能未被充分体现。
4 小时窗口 · 383 个数据点 · 覆盖率 99.7%
  • glm-5.3 是最强的模型,平均吞吐量为 138.16 词元/秒(p95 为 174.37 词元/秒),而 nemotron-3-ultra 最弱,平均仅为 19.82 词元/秒,远低于次低的 glm-5.2 的 36.0 词元/秒。
  • glm-5.2 呈现出对运营影响最大的下滑趋势,从 02:40 时 177.85 词元/秒的早期峰值下降 54.0% 至 06:00 时的 18.3 词元/秒,变异系数为 91.8%;nemotron-3-ultra 同样波动剧烈,范围在 0.51 至 91.48 词元/秒之间。
  • nemotron-3-ultra 缺失 48 个预期样本中的一个(已收集 47 个,覆盖率为 97.9%),使有效数据点总数为 383 个,因此其较低的平均值可能被低估。
4 小时窗口 · 383 个数据点 · 覆盖率 99.7%
  • glm-5.3 是最强的模型,平均吞吐量为 125.68 词元/秒(p95 为 171.31 词元/秒),而 nemotron-3-ultra 最弱,平均为 17.48 词元/秒,最低为 0.51 词元/秒。
  • 运营层面最显著的变化是 glm-5.2 的下滑:在 02:40 达到 177.85 词元/秒的峰值后,从 03:00 起降至持续 10-30 词元/秒的读数,趋势为 -66.5%,变异系数为 86.8%。相反,nemotron-3-ultra 从 02:00-03:00 前后接近 1 词元/秒的低点恢复至 04:55 时 91.48 词元/秒的最大值。
  • nemotron-3-ultra 缺失一个观测值(48 个样本中的 47 个,覆盖率 97.9%,缺少 03:05 的数据点),整体有效数据点为 383 个(覆盖率 99.7%),因此其恢复时间点部分未经核实。
4 小时窗口 · 384 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强的模型,平均吞吐量为 135.88 词元/秒(p95 为 183.58 词元/秒),而 nemotron-3-ultra 最弱,平均仅为 9.68 词元/秒,在整个时间窗口内从未超过 82.5 词元/秒。
  • 运营层面最显著的波动是 nemotron-3-ultra 的崩溃:在 23:10 UTC 达到 82.5 词元/秒的峰值后,它在 00:00–03:00 的大部分时间内保持在约 1.5 词元/秒以下,变异系数为 156.3%,趋势为 -71.0%;glm-5.2 也在 7.78 至 183.05 词元/秒之间大幅波动。
  • 不存在数据缺失的限制:所有八个模型均报告 48 个样本中的 48 个,覆盖率为 100.0%(384 个有效数据点),因此唯一的约束就是四小时的观测窗口本身。
4 小时窗口 · 384 个数据点 · 覆盖率 100.0%
  • glm-5.3 是平均吞吐量最强的模型,达到 141.89 词元/秒(p95 为 183.09 词元/秒);nemotron-3-ultra 最弱,平均仅为 15.86 词元/秒,最大值也仅有 82.5 词元/秒。
  • nemotron-3-ultra 表现出最具运营意义的波动性:在 23:10 达到 82.5 词元/秒的峰值后,从 00:10 到 00:50 期间跌破 1 词元/秒(最低 0.47 词元/秒),趋势为 -84.1%,变异系数为 133.5%;glm-5.2 也在 7.78 至 183.05 词元/秒之间大幅波动。
  • 不存在数据缺失的限制:全部八个模型均报告了 48 个预期样本中的 48 个,总计 384 个有效数据点,覆盖率为 100.0%,因此这四小时的时间窗口得到了完整观测。
4 小时窗口 · 384 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强的模型,平均吞吐量为 153.44 词元/秒,峰值达 190.9 词元/秒;nemotron-3-ultra 最弱,平均为 14.58 词元/秒,最低为 0.47 词元/秒。
  • nemotron-3-ultra 表现出对运营影响最大的波动性,变异系数为 148.8%,在 0.47 至 82.5 词元/秒之间大幅波动,其中包括从大约 UTC 00:10 到 00:50 期间输出接近零;gemma4:31b 在整个时间窗口内也下降了 22.9%,最终为 38.97 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均报告了预期 48 个样本中的 48 个,共 384 个有效数据点,覆盖率为 100.0%,不过该数据集仅涵盖这四个小时的时间段。
4 小时窗口 · 384 个数据点 · 覆盖率 100.0%
  • glm-5.3 是平均吞吐量最强的模型,达 144.94 词元/秒(p95 为 184.93 词元/秒,最大值 190.9 词元/秒),而 nemotron-3-ultra 最弱,平均仅 16.47 词元/秒,从未超过 82.5 词元/秒。
  • 运营层面最显著的波动来自 nemotron-3-ultra:变异系数为 129.4%,在 1.2 至 82.5 词元/秒之间摆动,且在 22:20 之前以约 1.2-4.8 词元/秒的读数为主。deepseek-v4-flash 呈现最明显的上升趋势,达 +16.5%,峰值 145.51 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均报告 48 个样本中的 48 个,覆盖率为 100.0%,共计 384 个有效数据点,但该数据集仅涵盖这四小时的时间窗口。
4 小时窗口 · 384 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强的模型,平均吞吐量为 146.70 词元/秒(48 个样本,范围 32.61 至 186.40 词元/秒),而 nemotron-3-ultra 是最弱的模型,平均为 11.56 词元/秒,从未超过 80.63 词元/秒,且最低降至 1.20 词元/秒。
  • 运营层面最显著的模式是 glm-5.2 的下滑:趋势为 -29.0%,吞吐量从窗口早期的约 148-160 词元/秒降至最新读数 44.47 词元/秒;nemotron-3-ultra 是波动最大的模型,变异系数为 153.0%,读数跨度为 1.20 至 80.63 词元/秒。
  • 不存在数据缺失的限制:所有八个模型均报告了 48 个预期样本中的 48 个,覆盖率为 100.0%,在四小时窗口内共有 384 个有效数据点。
4 小时窗口 · 384 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强的模型,平均吞吐量为 144.35 词元/秒,领先于 gemma4:31b 的 126.02 词元/秒;nemotron-3-ultra 最弱,平均仅为 6.75 词元/秒,最大值仅为 31.72 词元/秒。
  • 运营层面最显著的波动来自 nemotron-3-ultra:在 20:35 冲高至 31.72 词元/秒后,该窗口期其余时间回落至 2.2 词元/秒以下,变异系数为 95.8%,趋势为 -29.8%;deepseek-v4-flash 呈现最强的上升趋势,达 +18.7%。
  • 不存在数据缺失的限制:全部八个模型均报告 48 个样本中的 48 个,总计 384 个有效数据点,覆盖率为 100%,因此这四小时的窗口期得到了完整呈现。
4 小时窗口 · 384 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强的模型,平均吞吐量为 140.87 词元/秒(p95 为 177.21 词元/秒),而 nemotron-3-ultra 最弱,平均为 7.99 词元/秒,从未超过 31.72 词元/秒。
  • 运营层面最显著的模式是 nemotron-3-ultra 的极端波动性,其变异系数为 84.5%,波动范围从 1.04 到 31.72 词元/秒;glm-5.2 呈现最陡峭的趋势,上升 34.8% 达到 213.21 词元/秒的峰值。
  • 不存在数据缺失的限制:全部八个模型均交付了 48 个预期样本中的 48 个,共 384 个有效数据点,在四小时窗口内覆盖率达到 100.0%。
4 小时窗口 · 384 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强的模型,平均吞吐量为 143.59 词元/秒(48 个样本,峰值 183.55 词元/秒),而 nemotron-3-ultra 是最弱的,平均为 4.15 词元/秒(48 个样本,峰值 27.04 词元/秒)。
  • 运营层面最显著的波动来自 nemotron-3-ultra:变异系数 123.0%,趋势为 448.9%,17:00 时低至 0.4 词元/秒,17:15 时飙升至 27.04 词元/秒;glm-5.2 也从 17:20 的 167.12 词元/秒骤降至 17:35 的 36.14 词元/秒。
  • 不存在数据缺失的限制:全部八个模型在 48 个预期样本中均有 48 个,覆盖率为 100.0%,在四小时的时间窗口内共计 384 个有效数据点。
4 小时窗口 · 384 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强的模型,平均吞吐量为 143.14 词元/秒(p95 为 172.52 词元/秒),而 nemotron-3-ultra 是最弱的模型,仅为 2.74 词元/秒,远低于倒数第二的模型 glm-5.3-flash 的 82.17 词元/秒。
  • 运营层面最显著的波动来自 nemotron-3-ultra:它在观测窗口的大部分时间内保持在接近 1 词元/秒的水平(17:00 时最低为 0.4 词元/秒),在 17:15 飙升至 27.04 词元/秒,随后在 18:00 回落至 1.2 词元/秒,变异系数为 151.4%;minimax-m3 也在 31.63 至 144.38 词元/秒之间大幅波动。
  • 不存在数据缺失的限制:全部八个模型均报告了 48 个预期样本中的 48 个,共 384 个有效数据点,在四小时的观测窗口内覆盖率达到 100.0%。
4 小时窗口 · 384 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强的模型,平均吞吐量为 144.73 词元/秒(峰值 186.92 词元/秒,p95 为 176.49 词元/秒),而 nemotron-3-ultra 最弱,平均仅为 1.57 词元/秒,从未超过 2.75 词元/秒。
  • minimax-m3 波动最大(变异系数 40.9%),范围在 31.63–133.39 词元/秒之间,并有很长一段时间接近 40–50 词元/秒;glm-5.2 趋势最陡,达 +13.7%,从 27.55 词元/秒的低点上升至 176.38 词元/秒的峰值。
  • 不存在数据缺失的限制:全部八个模型均报告 48 个样本中的 48 个,覆盖率为 100.0%,且 384 个有效数据点与预期总数相符。
4 小时窗口 · 384 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强的模型,平均吞吐量为 144.15 词元/秒(峰值 186.92 词元/秒),而 nemotron-3-ultra 最弱,平均仅为 2.01 词元/秒,峰值也仅有 4.07 词元/秒。
  • 波动最显著的是 minimax-m3,变异系数为 43.3%,在 31.63 至 133.39 词元/秒之间波动;deepseek-v4-pro 在主流模型中降幅最陡,趋势为 -13.7%,而 nemotron-3-ultra 下跌 37.1%,在 15:30 附近低至 0.92 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均报告了 48 个预期样本中的 48 个,覆盖率为 100.0%,在四小时的时间窗口内共有 384 个有效数据点。
4 小时窗口 · 384 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强的模型,平均吞吐量为 151.83 词元/秒(p95 为 184.87 词元/秒),而 nemotron-3-ultra 是最弱的模型,平均为 4.56 词元/秒,远低于次低模型 minimax-m3 的 63.60 词元/秒。
  • 运营层面最显著的变化是 nemotron-3-ultra 的崩溃:它在 UTC 11:10 达到 34.17 词元/秒的峰值,随后在剩余时间窗口内降至约 1.3–2.4 词元/秒,降幅达 74.2%,变异系数为 135.6%。
  • 不存在数据缺失的限制:全部八个模型均报告了 48 个预期样本中的 48 个,共 384 个有效数据点,在四小时窗口内覆盖率为 100.0%,因此各项平均值均基于完整的五分钟观测数据。
4 小时窗口 · 384 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强的模型,平均吞吐量为 153.34 词元/秒(p95 为 184.87 词元/秒,最大值为 187.43 词元/秒),而 nemotron-3-ultra 最弱,平均为 9.45 词元/秒,最大值仅为 41.0 词元/秒。
  • 运营层面最显著的变化是 nemotron-3-ultra 的持续崩溃:在时间窗口早期以大约 15-35 词元/秒运行后,从大约 12:45 UTC 起跌破 3 词元/秒,最终收于 1.49 词元/秒,趋势为 -84.9%;glm-5.2 也在 22.39 至 165.25 词元/秒之间大幅波动(变异系数 35.7%)。
  • 不存在数据缺失的限制:每个模型都报告了 48 个预期样本中的 48 个,覆盖率为 100.0%,且 384 个有效数据点与完整的预期数量相符。
4 小时窗口 · 384 个数据点 · 覆盖率 100.0%
  • glm-5.3 是平均吞吐量最强的模型,达到 156.44 词元/秒(p95 为 184.4 词元/秒),而 nemotron-3-ultra 最弱,平均仅为 9.91 词元/秒,最大值也只有 41.0 词元/秒。
  • 运营层面最显著的波动来自 nemotron-3-ultra:在 1.66 至 41.0 词元/秒之间大幅摆动后,自 11:25 起稳定在接近 2 至 5 词元/秒的水平,变异系数为 101.6%,趋势为 -42.5%,远低于所有其他模型。
  • 不存在数据缺失的限制:全部八个模型均报告了 48 个预期样本中的 48 个,共计 384 个有效数据点,覆盖率为 100.0%,因此四小时时间窗口的数据是完整的。
4 小时窗口 · 384 个数据点 · 覆盖率 100.0%
  • glm-5.3 是平均吞吐量最强的模型,达到 156.83 词元/秒(峰值 187.43 词元/秒,p95 为 184.4 词元/秒),而 nemotron-3-ultra 最弱,平均仅为 10.98 词元/秒,从未超过 41.0 词元/秒。
  • 运营层面最显著的波动来自 nemotron-3-ultra,其变异系数为 98.2%,波动范围在 1.5 至 41.0 词元/秒之间;glm-5.2 也表现出突然的单区间骤降,例如 08:20 时为 175.4 词元/秒,到 08:30 骤降至 37.07 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均报告了预期的 48 个样本中的 48 个,共计 384 个有效数据点,覆盖率为 100.0%,不过该数据集仅涵盖这四个小时的时间窗口。
4 小时窗口 · 384 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强的模型,平均吞吐量为 156.98 词元/秒(最高 187.71 词元/秒),而 nemotron-3-ultra 最弱,平均仅 13.82 词元/秒,远低于其他所有模型。
  • 运营层面最显著的波动来自 nemotron-3-ultra(变异系数 108.8%):在 07:25 达到 80.28 词元/秒的峰值后,跌至 1.49 词元/秒的最低值,并在 07:50–09:55 时段的大部分时间内保持在约 5 词元/秒以下,趋势为 -16.4%。
  • 不存在数据缺失的限制:全部八个模型均报告 48 个预期样本中的 48 个,覆盖率为 100.0%,在四小时窗口内共计 384 个有效数据点。
4 小时窗口 · 384 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强的模型,平均吞吐量为 155.76 词元/秒(p95 为 182.96 词元/秒),而 nemotron-3-ultra 最弱,平均仅 11.94 词元/秒,在任何采样中从未超过 80.28 词元/秒。
  • 运营层面最显著的波动来自 nemotron-3-ultra:变异系数为 137.8%,趋势为 -69.9%,在早期出现 57.2 和 80.28 词元/秒的峰值后,持续处于接近 1.5 至 3 词元/秒的水平(08:00 时最低为 1.49 词元/秒)。
  • 不存在数据缺失的限制:全部八个模型均报告了 48 个预期样本中的 48 个,共 384 个有效数据点,在四小时窗口内覆盖率达到 100.0%。
4 小时窗口 · 384 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强的模型,平均吞吐量为 159.28 词元/秒(p95 为 184.30 词元/秒),而 nemotron-3-ultra 最弱,平均仅为 15.95 词元/秒,峰值也仅为 80.28 词元/秒。
  • nemotron-3-ultra 表现出对运营影响最大的波动性,变异系数达 118.2%,且持续出现接近 2-3 词元/秒的区段,包括 08:00 时的 1.49 词元/秒;deepseek-v4-pro 呈现最大的上升趋势,为 +13.8%。
  • 不存在数据缺失的限制:每个模型都报告了 48 个预期样本中的 48 个,覆盖率为 100.0%(384 个有效数据点),不过该时间窗口仅覆盖四个小时。
4 小时窗口 · 384 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强的模型,平均吞吐量为 164.47 词元/秒,最大值为 187.71 词元/秒,且相对波动性最低(CV 为 16.4%);nemotron-3-ultra 最弱,平均仅为 24.54 词元/秒,峰值仅 101.62 词元/秒,最终降至 1.49 词元/秒。
  • 运营层面最值得关注的波动性来自 nemotron-3-ultra,其在 1.49 至 101.62 词元/秒之间大幅波动,CV 为 105.8%,趋势为 -40.2%,其中从大约 05:35 到 06:55 期间持续维持在接近 2-4 词元/秒的水平;glm-5.2 也在 05:35 出现单区间骤降至 14.74 词元/秒的情况。
  • 不存在数据缺失的限制:全部八个模型均报告了 48 个预期样本中的 48 个,共 384 个有效数据点,在 04:03-08:03 UTC 时间窗口内覆盖率为 100.0%。
4 小时窗口 · 384 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强的模型,平均吞吐量为 165.69 词元/秒,而 nemotron-3-ultra 最弱,平均为 26.04 词元/秒,差距约为六倍;glm-5.3 的波动幅度也最小,变异系数(CV)为 13.5%。
  • nemotron-3-ultra 表现出对实际运行影响最大的波动性:变异系数(CV)为 107.0%,趋势为 -52.2%,并且多次骤降至 1.63 词元/秒,而其峰值为 101.62 词元/秒;glm-5.2 是下一个最不稳定的模型,标准差为 44.85,最低降至 14.74 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均报告了 48 个预期样本中的 48 个,共 384 个有效数据点,在四小时的时间窗口内覆盖率达到 100.0%。
4 小时窗口 · 384 个数据点 · 覆盖率 100.0%
  • glm-5.3 是平均吞吐量最强的模型,达 171.05 词元/秒(p95 为 184.61 词元/秒,最低为 146.47 词元/秒),而 nemotron-3-ultra 最弱,平均仅为 34.42 词元/秒,峰值也仅达 105.72 词元/秒。
  • 运营层面最显著的波动来自 nemotron-3-ultra,其变异系数为 85.3%,并多次出现输出近乎归零的崩溃,包括 06:00 时的 1.65 词元/秒,以及从 03:50 到 04:15 和再次从 05:35 起读数大致在 2 至 4 词元/秒之间。glm-5.2 的波动也很大,从 14.74 到 205.32 词元/秒。
  • 该时间窗口内不存在数据缺失的限制:全部八个模型均报告了 48 个预期样本中的 48 个,共有 384 个有效数据点,覆盖率为 100.0%,因此这些平均值能够完全代表这四个小时的时段。
4 小时窗口 · 384 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强模型,平均吞吐量为 167.36 词元/秒,保持在 116.24–187.06 词元/秒的紧凑区间内;nemotron-3-ultra 最弱,平均为 38.02 词元/秒,从未超过 105.72 词元/秒。
  • 运营层面最显著的波动是 nemotron-3-ultra 的 77.9% 变异系数,从 04:05 的 2.12 词元/秒低点波动至 04:20 的 101.62 词元/秒;deepseek-v4-flash 也在 04:50 降至 10.18 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均记录了 48 个样本中的 48 个,覆盖率为 100.0%,在四小时窗口内共计 384 个有效数据点。
4 小时窗口 · 384 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强的模型,平均吞吐量为 162.32 词元/秒;nemotron-3-ultra 最弱,平均为 31.82 词元/秒,范围为 1.74–105.72 词元/秒。
  • nemotron-3-ultra 表现出对运营影响最大的波动性:变异系数为 88.7%,且从 00:40 到 01:05 连续六个采样低于 4 词元/秒,最新读数为 2.73 词元/秒;相比之下,其他模型仅出现孤立的下探,例如 glm-5.2 在 02:25 的 25.68 词元/秒和 deepseek-v4-pro 在 03:00 的 39.5 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均报告了 48 个预期采样中的 48 个,有效数据点总计为 384,覆盖率为 100.0%,因此唯一的约束就是四小时的观测窗口本身。
4 小时窗口 · 384 个数据点 · 覆盖率 100.0%
  • glm-5.3 的平均吞吐量最高,达 161.74 词元/秒(p95 为 184.12 词元/秒),而 nemotron-3-ultra 最弱,平均仅为 37.40 词元/秒,远低于次低模型 minimax-m3 的 60.49 词元/秒。
  • 运营层面最显著的波动是 nemotron-3-ultra 高达 74.3% 的变异系数:在 00:00 前后运行于接近 78 词元/秒的水平,随后从 00:40 到 01:05 骤降至 1.74–3.47 词元/秒的持续低谷,属于类似宕机的性能劣化。glm-5.2 也呈现出 -17.1% 的趋势,并在 02:25 一度跌至 25.68 词元/秒。
  • 不存在缺失数据的限制:全部八个模型均记录了 48 个预期样本中的 48 个,共计 384 个有效数据点,覆盖率为 100.0%,因此这四小时的时间窗口是完整的。
4 小时窗口 · 384 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强的模型,平均吞吐量为 161.40 词元/秒(p95 为 184.12 词元/秒);nemotron-3-ultra 最弱,平均为 36.79 词元/秒,从未超过 101.92 词元/秒。
  • 运营层面最显著的波动来自 nemotron-3-ultra:变异系数为 83.3%,趋势为 -46.9%,吞吐量从 101.92 词元/秒的峰值崩溃至在 00:30–01:15 UTC 的大部分时间内低于 4 词元/秒;gemma4:31b 的波动也很大(49.53–176.08 词元/秒,变异系数 27.3%)。
  • 不存在数据缺失的限制:所有八个模型均报告 48 个样本中的 48 个,覆盖率为 100.0%,共计 384 个有效数据点,因此结果仅受四小时观测窗口的限制。
4 小时窗口 · 384 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强的模型,平均吞吐量为 158.43 词元/秒,略胜 152.55 词元/秒的 glm-5.2,而 nemotron-3-ultra 最弱,平均为 29.34 词元/秒,尽管峰值达到 101.92 词元/秒,也仅约为领先者的五分之一。
  • nemotron-3-ultra 表现出对运营影响最大的波动性:变异系数为 105.6%,在 1.74 至 101.92 词元/秒之间摆动,并在窗口后期从 00:00 的约 78 词元/秒骤降至 00:40 的 1.74 词元/秒;glm-5.2 也在 21:55 骤降至 21.12 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均报告了 48 个预期样本中的 48 个,共 384 个有效数据点,覆盖率为 100.0%,不过该窗口仅跨越四个小时。
4 小时窗口 · 384 个数据点 · 覆盖率 100.0%
  • glm-5.3 是平均吞吐量最强的模型,达到 159.81 词元/秒(p95 为 182.91 词元/秒),而 nemotron-3-ultra 最弱,平均仅为 26.08 词元/秒,远低于次低的模型 minimax-m3 的 68.89 词元/秒。
  • 运营层面最显著的波动是 nemotron-3-ultra 在 22:25 UTC 前后的阶梯式变化:在大约前两个半小时内,其运行速度介于 2.07 至 6.78 词元/秒之间,随后跃升至 101.92 词元/秒的峰值,产生 118.3% 的变异系数。
  • 不存在数据缺失的限制:全部八个模型均记录了 48 个预期样本中的 48 个,在四小时的时间窗口内共计 384 个有效数据点,覆盖率达到 100.0%。
4 小时窗口 · 384 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强的模型,平均吞吐量为 149.26 词元/秒,领先于 135.11 词元/秒的 glm-5.2;nemotron-3-ultra 最弱,平均为 13.92 词元/秒,最低为 1.45 词元/秒。
  • 运营层面最显著的波动来自 nemotron-3-ultra,该模型在大部分时间窗口内运行在接近 2 至 6 词元/秒的水平,随后在 22:35 飙升至 101.92 词元/秒,使其变异系数达到 185.1%。
  • 不存在数据缺失的限制:全部八个模型均报告 48 个样本中的 48 个,覆盖率为 100.0%,且数据集的 384 个有效数据点与预期总数相符。