← 返回性能仪表板

每小时性能洞察

滚动四小时性能数据摘要

已保留 1188 条摘要
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • 平均吞吐量最强的是 deepseek-v4.1-flash,达 155.96 词元/秒;最弱的是 nemotron-3-ultra,为 18.87 词元/秒,整个时间窗口内的范围为 3.72 至 40.01 词元/秒。
  • glm-5.2 波动最为剧烈(CV 90.7%),从 18:20 的 34.37 词元/秒飙升至 19:00 的 203.28 词元/秒;deepseek-v4.1-flash 也曾在 18:00 骤降至 41.63 词元/秒,随后回升至 144.78 词元/秒。
  • 不存在数据缺失的限制:全部 8 个模型均报告了 12 个样本中的 12 个,在四小时窗口内拥有 96 个有效数据点和 100.0% 的覆盖率。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4.1-flash 是平均吞吐量最强的模型,达 164.58 词元/秒,而 nemotron-3-ultra 最弱,为 19.98 词元/秒,约为领先者速率的八分之一。
  • 运营层面最显著的波动出现在 glm-5.2,其吞吐量在观测窗口内下降了 41.0%,变异系数为 76.6%,其中包括 16:00 UTC 一次达到 197.41 词元/秒的偶发峰值;deepseek-v4.1-flash 在其最后一个采样点也降至 41.63 词元/秒。
  • 不存在缺失数据的局限:全部八个模型均有 12 个预期样本中的 12 个,数据集报告 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4.1-flash 是最强的模型,平均吞吐量为 163.78 词元/秒,峰值达 216.17 词元/秒,而 nemotron-3-ultra 最弱,平均为 16.0 词元/秒,从未超过 33.36 词元/秒。
  • glm-5.2 的波动性最高,变异系数为 70.6%,波动范围从 28.68 到 197.41 词元/秒;nemotron-3-ultra 的下降幅度最陡峭,呈 57.0% 的下降趋势,在 UTC 16:00 降至 3.72 词元/秒的低点。
  • 不存在缺失数据的限制:所有八个模型均报告了 12 个样本中的 12 个,数据集在四小时的时间窗口内显示 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4.1-flash 是最强模型,平均吞吐量为 154.58 词元/秒,而 nemotron-3-ultra 最弱,平均为 17.08 词元/秒。
  • deepseek-v4.1-flash 呈现唯一的正向趋势,在 16:00 上升 28.9% 至 186.52 词元/秒;glm-5.2 波动最大,变异系数达 60.9%,在 29.99 至 197.41 词元/秒之间波动,而 minimax-m3 的最新读数降至 10.31 词元/秒,为其最低值。
  • 不存在数据缺失的限制:全部八个模型均有 12 个样本中的 12 个,在四小时窗口内共有 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4.1-flash 是最强的模型,平均吞吐量为 151.75 词元/秒(峰值达 216.17 词元/秒),而 nemotron-3-ultra 最弱,平均为 17.26 词元/秒(最低 7.6 词元/秒)。
  • glm-5.3 降幅最陡,趋势为 -27.2%,从 12:00 的 142.48 词元/秒降至 14:20 的 19.2 词元/秒;nemotron-3-ultra 上升 84.4%,达到 33.36 词元/秒。glm-5.2 波动性最大,变异系数为 49.1%,范围为 6.92 至 139.3 词元/秒。
  • 无缺失数据限制:全部八个模型均报告 12 个样本中的 12 个、96 个有效数据点,在四小时窗口内覆盖率达到 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4.1-flash 是最强的模型,平均吞吐量为 157.46 词元/秒,峰值达 203.72 词元/秒,而 nemotron-3-ultra 最弱,平均为 18.85 词元/秒,从未超过 71.14 词元/秒。
  • 运营层面最显著的变化是 nemotron-3-ultra 从 10:20 时的 71.14 词元/秒骤降至个位数(7.6 至 10.56 词元/秒)并持续了观测窗口的大部分时间,降幅达 45.0%;glm-5.2 也在 6.92 至 169.78 词元/秒之间波动,变异系数为 52.7%。
  • 不存在数据缺失的限制:全部八个模型均有 12 个样本中的 12 个,共 96 个有效数据点,覆盖率为 100.0%,但结论仅基于四个小时的观测数据。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4.1-flash 是最强的模型,平均吞吐量为 168.36 词元/秒,而 nemotron-3-ultra 最弱,平均为 18.53 词元/秒。
  • glm-5.2 波动最大,变异系数为 60.0%,从 11:00 的 169.78 词元/秒骤降至 12:00 的 6.92 词元/秒;nemotron-3-ultra 在该时间窗口内也下降了 51.3%。
  • 无缺失数据限制:全部 8 个模型均有 12 个样本中的 12 个,共 96 个有效数据点,在 09:20 至 13:00 UTC 的 20 分钟间隔观测中覆盖率达到 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4.1-flash 是最强的模型,平均吞吐量为 179.55 词元/秒(峰值 207.47 词元/秒),而 nemotron-3-ultra 是最弱的模型,平均仅为 20.19 词元/秒,从未超过 71.14 词元/秒。
  • glm-5.2 表现出对运营影响最大的波动性,变异系数为 72.8%:它在 UTC 11:00 飙升至 169.78 词元/秒,随后在 UTC 12:00 骤降至 6.92 词元/秒,在四十分钟内波动幅度约为 163 词元/秒。
  • 此时间窗口内不存在数据缺失的限制:全部 8 个模型均交付了 12 个预期样本中的 12 个,产生 96 个有效数据点,在四个小时期间内覆盖率达到 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4.1-flash 是最强的模型,平均吞吐量为 183.51 词元/秒(范围在 150.44 至 219.87 词元/秒之间),而 nemotron-3-ultra 最弱,平均为 20.71 词元/秒,其中包括 3.81 词元/秒的最低值。
  • glm-5.2 表现出对实际运行影响最大的波动性,变异系数为 64.0%,在 18.09 至 169.78 词元/秒之间摆动,且最终读数 169.78 词元/秒远高于其 62.55 词元/秒的平均值;nemotron-3-ultra 同样不稳定,CV 为 79.3%。
  • 不存在数据缺失的限制:全部 8 个模型均有 12 个样本中的 12 个,valid_point_count 为 96,覆盖率为 100.0%,因此四小时窗口的数据是完整的。
4 小时窗口 · 95 个数据点 · 覆盖率 99.0%
  • deepseek-v4.1-flash 是最强的模型,平均吞吐量为 185.35 词元/秒(峰值 219.87 词元/秒),而 nemotron-3-ultra 最弱,平均仅 15.89 词元/秒,最低降至 3.81 词元/秒。
  • glm-5.2 的波动性对运营影响最大,变异系数为 58.3%,趋势为 -46.6%,从 07:00 的 133.66 词元/秒峰值降至 08:40 的 18.09 词元/秒;glm-5.3-flash 同样在 224.47 和 62.21 词元/秒之间大幅波动。
  • deepseek-v4.1-flash 在预期的 12 个样本中仅有 11 个(覆盖率 91.7%),缺失了 06:20 的观测数据,因此其平均值与完整覆盖的模型相比可能缺乏可比性。
4 小时窗口 · 92 个数据点 · 覆盖率 95.8%
  • 平均吞吐量最高的是 deepseek-v4.1-flash,达 184.42 词元/秒(峰值 219.87 词元/秒),而 nemotron-3-ultra 最低,为 18.97 词元/秒,从未超过 30.56 词元/秒。
  • glm-5.3-flash 降幅最为明显,趋势为 -36.9%,从 06:20 的 224.47 词元/秒峰值降至 09:00 的 65.08 词元/秒;glm-5.2 在后期同样出现劣化,最终为 19.08 词元/秒,而其峰值为 133.66 词元/秒。
  • deepseek-v4.1-flash 仅报告了预期 12 个样本中的 8 个(覆盖率 66.7%),且在 05:20 至 06:20 期间没有任何观测数据,因此其平均值基于部分数据计算。
4 小时窗口 · 89 个数据点 · 覆盖率 92.7%
  • deepseek-v4.1-flash 在平均吞吐量方面领先,达到 192.64 词元/秒(峰值 219.87 词元/秒),而 nemotron-3-ultra 最弱,平均仅为 22.47 词元/秒,峰值仅为 43.96 词元/秒。
  • nemotron-3-ultra 降幅最为陡峭,在整个时间窗口内下降 46.2%,在 07:20 降至 3.81 词元/秒的低点,而 glm-5.3-flash 从 06:20 的 224.47 词元/秒峰值波动至 08:00 的 62.21 词元/秒。
  • deepseek-v4.1-flash 仅有 12 个预期样本中的 5 个(覆盖率 41.7%),且全部出现在 06:40 之后,因此其领先的平均值建立在部分数据之上;整体覆盖率为 92.7%,共有 89 个有效数据点。
4 小时窗口 · 86 个数据点 · 覆盖率 89.6%
  • glm-5.3-flash 以 142.74 词元/秒的平均速度(峰值 224.47 词元/秒)领先于全覆盖模型;nemotron-3-ultra 最弱,平均速度为 29.26 词元/秒,最终收于 14.59 词元/秒。deepseek-v4.1-flash 平均速度为 209.81 词元/秒,但仅基于两个样本。
  • glm-5.3-flash 从 03:20 的 61.38 词元/秒上升至 06:20 的 224.47 词元/秒峰值(+51.9% 的趋势),而 glm-5.2 在 07:00 飙升至 133.66 词元/秒;glm-5.2 和 glm-5.3 波动最大,变异系数分别为 52.6% 和 46.2%。
  • deepseek-v4.1-flash 在预期的 12 个样本中仅有 2 个(16.7% 的覆盖率),这限制了对其 209.81 词元/秒平均值的置信度;整体数据集覆盖率为 89.6%,共有 86 个有效数据点。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • glm-5.3-flash 是最强的模型,平均吞吐量为 138.75 词元/秒,在 06:00 UTC 达到峰值 215.92 词元/秒,而 nemotron-3-ultra 最弱,平均为 28.58 词元/秒。
  • glm-5.2 呈现最大的上升趋势,达 +72.7%,从 02:20 的 41.79 词元/秒攀升至 06:00 的 63.95 词元/秒;nemotron-3-ultra 波动最大,变异系数为 54.7%,范围在 4.76 至 61.81 词元/秒之间,而 glm-5.3 在 03:20 一度跌至 9.93 词元/秒。
  • deepseek-v4-flash 在全部 12 个预期时间区间内报告的样本数为零,使整体覆盖率降至 87.5%(96 个有效数据点中的 84 个),因此其在该时间窗口内的吞吐量未知。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • glm-5.3-flash 是最强的模型,平均吞吐量为 125.18 词元/秒(范围 61.38–175.56 词元/秒),而 nemotron-3-ultra 最弱,平均仅为 33.74 词元/秒,最低降至 4.76 词元/秒。
  • glm-5.2 的波动性对运营影响最大,变异系数为 77.9%,波动区间在 19.28 至 205.45 词元/秒之间,且趋势为 -46.9%;deepseek-v4-pro 也下降了 -24.1%,最新读数为 49.34 词元/秒。
  • deepseek-v4-flash 在整个时间窗口内没有任何样本(预期 12 个中为 0 个),使整体覆盖率降至 87.5%(84 个有效数据点),因此无法评估其吞吐量。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • glm-5.3-flash 是最强的模型,平均吞吐量为 129.13 词元/秒(p95 为 173.69 词元/秒),而 nemotron-3-ultra 最弱,平均为 31.33 词元/秒,峰值仅为 61.81 词元/秒。
  • 最显著的变化是 glm-5.2 下降了 63.7%,从 01:40 的 205.45 词元/秒峰值跌至 03:40 的 19.28 词元/秒低点;03:20 时所有报告中的模型也出现了普遍下滑,其中 glm-5.3 降至 9.93 词元/秒。
  • deepseek-v4-flash 在预期的 12 个样本中报告了 0 个,因此其吞吐量未知,整体覆盖率为 87.5%(84 个有效数据点),这限制了整个模型集之间的可比性。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • glm-5.3-flash 是最强的模型,平均吞吐量为 131.66 词元/秒,略胜 gemma4:31b 的 126.91 词元/秒,而 nemotron-3-ultra 最弱,平均仅 28.24 词元/秒,最终更是低至 4.76 词元/秒。
  • glm-5.2 波动最大,变异系数达 72.1%,在 22.0 至 205.45 词元/秒之间大幅波动;gemma4:31b 也在 02:00 骤降至 43.48 词元/秒,随后回升至 133.89 词元/秒。
  • deepseek-v4-flash 在全部 12 个预期时间区间内均未报告任何样本,其吞吐量无法测量,使整体覆盖率降至 87.5%(96 个有效数据点中仅 84 个)。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • glm-5.3-flash 是最强的模型,平均吞吐量为 134.02 词元/秒(峰值达 187.3 词元/秒),而 nemotron-3-ultra 最弱,平均仅为 30.99 词元/秒,从未超过 53.76 词元/秒。
  • glm-5.2 表现出对运营影响最大的波动性,变异系数为 68.6%,从 00:00 的 29.68 词元/秒到 01:40 的 205.45 词元/秒,在该时间窗口内趋势增幅达 114.3%。
  • deepseek-v4-flash 在全部 12 个预期的 20 分钟间隔内报告的采样数为零,因此整体覆盖率仅为 87.5%(96 个预期数据点中的 84 个),无法评估该模型的任何吞吐量数据。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • glm-5.3-flash 是最强的模型,平均吞吐量为 142.28 词元/秒(峰值达 222.81 词元/秒),而 nemotron-3-ultra 最弱,平均为 24.42 词元/秒,约为领先者速率的六分之一。
  • 最显著的变动是 glm-5.3 从 23:40 的 164.66 词元/秒下降至 00:40 的 53.7 词元/秒,趋势为 -12.1%;glm-5.2 同样表现出高波动性,变异系数为 50.3%,并在 01:00 出现后期飙升至 131.68 词元/秒。
  • deepseek-v4-flash 在预期的 12 个样本中报告了 0 个(覆盖率为 0%),导致其性能未知,并将整体覆盖率降至 87.5%(84 个有效数据点)。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • glm-5.3 是最强的模型,平均吞吐量为 138.84 词元/秒(峰值 178.39 词元/秒),而 nemotron-3-ultra 是最弱的,平均仅 26.73 词元/秒,峰值仅为 39.56 词元/秒。
  • glm-5.2 表现出最具运营意义的波动性:变异系数为 52.2%,趋势为 -29.5%,从 20:40 的 132.56 词元/秒峰值下降到 00:00 的 29.68 词元/秒,其中 21:00 出现 28.66 词元/秒的低点。
  • deepseek-v4-flash 在预期的 12 个样本中采样数为零(覆盖率为 0.0%),因此其吞吐量完全未知;整体数据集覆盖率为 87.5%,共 84 个有效数据点,这限制了对该模型进行任何全集群范围的比较。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • glm-5.3-flash 是平均吞吐量最强的模型,达到 134.38 词元/秒,峰值为 222.81 词元/秒,而 nemotron-3-ultra 最弱,平均仅为 25.11 词元/秒,从未超过 39.56 词元/秒。
  • glm-5.3-flash 呈现最大的上升趋势,为 43.3%,收于 187.3 词元/秒,但 glm-5.2 波动最大,变异系数为 52.7%,在窗口期内于 22.07 至 132.56 词元/秒之间波动。
  • deepseek-v4-flash 在全部 12 个预期观测值中报告的样本数为零,因此其吞吐量未知,整体覆盖率仅为 87.5%(96 个有效数据点中的 84 个),限制了跨窗口的比较。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • glm-5.3 是最强的模型,平均吞吐量为 128.26 词元/秒(最新为 159.0 词元/秒),而 nemotron-3-ultra 是最弱的,平均为 23.07 词元/秒,峰值仅为 39.56 词元/秒。
  • glm-5.3 在该时间窗口内呈现最大的上升趋势,达 24.4%;glm-5.3-flash 在 21:00 降至 52.34 词元/秒后,于 21:40 飙升至 222.81 词元/秒;glm-5.2 波动性最大,变异系数为 65.3%,波动范围在 22.07 至 182.47 词元/秒之间。
  • deepseek-v4-flash 在 12 个采样点中报告了 0 个(0% 覆盖率),使整体覆盖率降至 87.5%(84 个有效数据点),因此无法评估其在该时段的吞吐量。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • glm-5.3-flash 是平均吞吐量最强的模型,达到 110.21 词元/秒,略微领先于 glm-5.3 的 109.60 词元/秒,而 nemotron-3-ultra 最弱,仅为 21.75 词元/秒,约为领先者速率的五分之一。
  • glm-5.2 波动最大,变异系数为 67.7%,从 19:00 的 182.47 词元/秒峰值骤降至 20:00 的 22.07 词元/秒,且趋势为 -28.8%;gemma4:31b 在 19:00 也跌至 31.40 词元/秒。
  • deepseek-v4-flash 在预期 12 个样本的情况下报告为零个样本,使整体覆盖率为 87.5%(96 个有效数据点中的 84 个),因此无法在该时间窗口内评估其吞吐量。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • glm-5.3-flash 是平均吞吐量最强的模型,达到 110.26 词元/秒,略微领先于 109.48 词元/秒的 gemma4:31b;nemotron-3-ultra 最弱,仅为 17.35 词元/秒,最大值也仅有 32.86 词元/秒。
  • glm-5.2 波动最大,变异系数为 73.5%,从 16:40 的 13.41 词元/秒波动至 19:00 的 182.47 词元/秒峰值,随后在 20:00 回落至 22.07 词元/秒。
  • deepseek-v4-flash 没有任何样本(预期 12 个中实际 0 个,覆盖率 0.0%),因此其吞吐量未知;总体覆盖率为 87.5%,预期 96 个数据点中有 84 个有效数据点。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • glm-5.3 是平均吞吐量最强的模型,达到 107.81 词元/秒,略微领先于 glm-5.3-flash(102.40 词元/秒)和 gemma4:31b(103.36 词元/秒);nemotron-3-ultra 最弱,为 17.24 词元/秒,约为领先者的六分之一。
  • glm-5.2 表现出对运营影响最大的波动性,变异系数为 84.8%,在 13.41 至 216.33 词元/秒之间波动,其中包括在 19:00 跳升至 182.47 词元/秒;deepseek-v4-pro 也在 17:20 一度跌至 29.95 词元/秒。
  • deepseek-v4-flash 在预期的 12 个样本中报告了 0 个,使整体覆盖率降至 87.5%(84 个有效数据点),因此全机队范围的比较完全排除了该模型。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • gemma4:31b 是平均吞吐量最强的模型,达到 107.47 词元/秒,而 nemotron-3-ultra 最弱,为 16.2 词元/秒;glm-5.3-flash 以 94.38 词元/秒紧随其后,minimax-m3 为 30.98 词元/秒。
  • glm-5.2 表现出对运营影响最大的波动性,变异系数为 101.6%,波动范围从 13.41 到 216.33 词元/秒,其中包括在 16:00 UTC 出现的一次飙升至 216.33 词元/秒的峰值,而其平均值为 55.4 词元/秒。
  • deepseek-v4-flash 没有数据,12 个预期样本中仅有 0 个,覆盖率为 0.0%,使整体覆盖率降至 87.5%(84 个有效数据点),因此无法在此时间窗口内评估其吞吐量。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • glm-5.3-flash 是最强的模型,平均吞吐量为 95.4 词元/秒,而 nemotron-3-ultra 最弱,平均为 17.07 词元/秒,minimax-m3 也较低,为 25.34 词元/秒。
  • glm-5.2 表现出对运营影响最大的波动性,在 16:00 UTC 时飙升至 216.33 词元/秒,而其平均值为 47.23 词元/秒,变异系数为 117.0%;gemma4:31b 在整个时间窗口内也在 47.07 至 166.23 词元/秒之间波动。
  • deepseek-v4-flash 未返回任何样本(预期 12 个中为 0 个,覆盖率 0.0%),因此其吞吐量未知;整体覆盖率为 87.5%,共 84 个有效数据点,这限制了对整个机群的结论。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • glm-5.3-flash 是最强的模型,平均吞吐量为 100.74 词元/秒,领先于 deepseek-v4-pro 的 96.21 词元/秒;nemotron-3-ultra 最弱,平均为 18.55 词元/秒,minimax-m3 紧随其后,为 25.38 词元/秒。
  • glm-5.2 波动最为剧烈,变异系数为 109.3%,在 49.04 词元/秒的平均值下,最终在 16:00 飙升至 216.33 词元/秒;glm-5.3-flash 最为稳定,波动范围为 76.42 至 133.83 词元/秒。
  • deepseek-v4-flash 在全部 12 个预期观测中均未返回任何样本,覆盖率为 0%,使整体数据集覆盖率降至 87.5%(84 个有效数据点),因此无法评估其吞吐量。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • glm-5.3-flash 是最强模型,平均吞吐量为 112.04 词元/秒(范围 76.47–183.17 词元/秒),而 nemotron-3-ultra 最弱,平均仅 18.73 词元/秒,峰值也只有 32.08 词元/秒。
  • 所有模型在观测时段内吞吐量均呈下降趋势;glm-5.2 整体下降 56.5%,波动性最大,在 9.93 至 117.83 词元/秒之间波动,变异系数达 66.7%,其中包括 12:00 UTC 的一次尖峰。
  • deepseek-v4-flash 没有任何数据(12 个采样中为 0,覆盖率为 0%),使数据集覆盖率降至 87.5%(预期 96 个数据点中仅有 84 个),因此无法评估其吞吐量。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • glm-5.3-flash 是最强的模型,平均吞吐量为 117.35 词元/秒(峰值 183.17 词元/秒),而 nemotron-3-ultra 最弱,平均为 17.63 词元/秒(最低 2.52 词元/秒)。
  • 大多数模型在时间窗口后期出现下降:gemma4:31b 下降了 31.6%,glm-5.2 下降了 32.3%,minimax-m3 在 14:00 降至 5.55 词元/秒。glm-5.2 的波动性也最大,变异系数为 58.1%,波动范围介于 9.93 至 117.83 词元/秒之间。
  • deepseek-v4-flash 在 12 个采样中报告了 0 个(0% 覆盖率),使整体覆盖率降至 87.5%(84 个有效数据点),因此其吞吐量无法评估。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • glm-5.3-flash 是最强模型,平均吞吐量为 117.08 词元/秒,略胜 111.85 词元/秒的 glm-5.3;nemotron-3-ultra 最弱,平均仅 17.37 词元/秒,低于 minimax-m3 的 31.45 词元/秒。
  • gemma4:31b 波动最为剧烈,在 40.17 至 156.18 词元/秒之间摆动,变异系数为 40.0%,其中 12:00 的读数为 44.93 词元/秒,随后 12:20 达到 121.26 词元/秒;nemotron-3-ultra 同样波动较大,从 2.24 到 32.08 词元/秒。
  • deepseek-v4-flash 没有任何样本(预期 12 个中为 0 个,覆盖率 0.0%),因此无法评估其吞吐量;整体覆盖率为 87.5%,共 84 个有效数据点。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • glm-5.3-flash 是最强的模型,平均吞吐量为 120.26 词元/秒(峰值达 183.17 词元/秒),而 nemotron-3-ultra 最弱,平均仅为 15.62 词元/秒,从未超过 28.36 词元/秒。
  • 运营层面最显著的波动来自 nemotron-3-ultra,其变异系数为 58.8%,在 2.24 至 28.36 词元/秒之间波动,包括在 UTC 时间 10:00、10:40 和 11:00 反复跌破 6 词元/秒;deepseek-v4-pro 呈现最明显的上升趋势,为 22.0%。
  • deepseek-v4-flash 在全部 12 个预期观测中贡献了零个样本,因此其吞吐量完全未知;整体数据集覆盖率为 87.5%,共 84 个有效数据点,这限制了对该四小时时间窗口内整个集群得出任何结论。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • glm-5.3-flash 是平均吞吐量最强的模型,达到 113.79 词元/秒(峰值 154.62 词元/秒),以微弱优势领先于 112.32 词元/秒的 glm-5.3,而 nemotron-3-ultra 最弱,平均仅 13.82 词元/秒,从未超过 28.46 词元/秒。
  • deepseek-v4-pro 表现出对运营影响最显著的波动性,在整个时间窗口内在 15.75 至 114.25 词元/秒之间摆动,同时录得最大的上升趋势,达 40.0%;nemotron-3-ultra 同样不稳定,变异系数为 65.5%,并多次跌破 6 词元/秒。
  • deepseek-v4-flash 未贡献任何样本(预期 12 个中为 0 个,覆盖率 0.0%),因此其吞吐量未知;整体数据集覆盖率为 87.5%,共 84 个有效数据点,这限制了对整个集群性能的结论。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • glm-5.3-flash 是最强的模型,平均吞吐量为 131.0 词元/秒,在 UTC 06:40 达到峰值 232.65 词元/秒;nemotron-3-ultra 最弱,平均为 18.31 词元/秒,在 UTC 10:00 降至 2.24 词元/秒。
  • 波动最显著的是 nemotron-3-ultra,其变异系数为 72.9%,在 54.01 和 2.24 词元/秒之间波动;glm-5.3-flash 也呈现 -19.2% 的趋势,从 UTC 06:40 的 232.65 词元/秒降至 UTC 09:40 的 63.95 词元/秒。
  • deepseek-v4-flash 的样本数为零(预期 12 个中为 0 个,覆盖率 0.0%),因此其吞吐量未知;整体数据集覆盖率为 87.5%,共 84 个有效数据点,限制了比较的完整性。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • glm-5.3-flash 是最强模型,平均吞吐量为 129.76 词元/秒,峰值达 232.65 词元/秒;nemotron-3-ultra 最弱,平均为 20.39 词元/秒,从未超过 54.01 词元/秒。
  • glm-5.2 表现出对运营影响最大的波动性,从 06:00 的 145.7 词元/秒波动至 07:20 的 13.03 词元/秒,变异系数为 57.4%,趋势为 -32.3%;nemotron-3-ultra 在该时间窗口内也下降了 43.7%。
  • deepseek-v4-flash 在预期的 12 个采样间隔中报告了零个样本(覆盖率为 0%),使整体覆盖率降至 87.5%,96 个有效数据点中仅有 84 个,因此无法在该时间窗口内评估其吞吐量。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • glm-5.3-flash 是最强的模型,平均吞吐量为 133.57 词元/秒,在 UTC 06:40 达到峰值 232.65 词元/秒;nemotron-3-ultra 最弱,平均仅 25.10 词元/秒,从未超过 54.01 词元/秒。
  • glm-5.2 波动最大,从 05:00 的 155.72 词元/秒骤降至 07:20 的 13.03 词元/秒,变异系数为 66.4%,呈 36.5% 的下降趋势;glm-5.3-flash 则更为稳定,从未跌破 93.11 词元/秒。
  • deepseek-v4-flash 在预期的 12 个样本中报告为零,导致整体覆盖率为 87.5%(84 个有效数据点),因此无法评估其在该时间窗口内的吞吐量。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • glm-5.3-flash 是最强模型,平均吞吐量为 134.77 词元/秒,而 nemotron-3-ultra 最弱,为 30.90 词元/秒,minimax-m3 紧随其后,为 37.07 词元/秒。
  • glm-5.3 呈现最大的上升趋势,达 +51.9%,从窗口初期的大约 66 词元/秒攀升至 186.71 词元/秒的峰值,但其 58.3% 的变异系数使其波动性极高;nemotron-3-ultra 下降了 26.9%。
  • deepseek-v4-flash 在预期的 12 个样本中报告了 0 个,剩余 84 个有效数据点,总体覆盖率为 87.5%,因此其吞吐量未知,且全周期平均值不将其计入。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • glm-5.3-flash 是最强的模型,平均吞吐量为 121.98 词元/秒,峰值达 211.11 词元/秒;nemotron-3-ultra 最弱,平均为 32.18 词元/秒,从未超过 63.34 词元/秒。
  • glm-5.2 的波动性最高,变异系数为 57.5%,在 30.04 至 165.82 词元/秒之间波动;glm-5.3 的上升趋势最大,为 +22.6%,而 nemotron-3-ultra 下降了 -18.0%。
  • deepseek-v4-flash 在预期的 12 个样本中缺失全部样本,因此其吞吐量未知;整体数据集覆盖率为 87.5%,八个模型共有 84 个有效数据点。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • glm-5.3-flash 是平均吞吐量最强的模型,达 124.95 词元/秒,而 nemotron-3-ultra 最弱,为 33.41 词元/秒;gemma4:31b 和 deepseek-v4-pro 介于两者之间,分别为 97.79 和 92.99 词元/秒。
  • glm-5.2 的下降幅度最大,趋势为 -23.0%,吞吐量从 03:00 的 165.82 词元/秒峰值跌至 04:00 的 30.04 词元/秒;其变异系数也最高,达 54.8%,而 deepseek-v4-pro 的趋势为 -22.3%。
  • deepseek-v4-flash 报告的样本数为零(预期 12 个中的 0 个),因此其吞吐量未知;整体覆盖率为 87.5%,共 84 个有效数据点,限制了跨窗口的比较。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • glm-5.3-flash 是最强模型,平均速度为 130.84 词元/秒(峰值 226.83 词元/秒),而 nemotron-3-ultra 最弱,平均速度为 34.73 词元/秒(最低 10.17 词元/秒)。
  • glm-5.3 降幅最为明显,从 00:40 的 171.01 词元/秒降至 04:00 的 66.19 词元/秒,趋势为 -25.6%;glm-5.2 在 03:00 飙升至 165.82 词元/秒,随后在 04:00 之前降至 30.04 词元/秒。
  • deepseek-v4-flash 在全部 12 个预期时间段内均无样本(覆盖率为 0%),使整体覆盖率停留在 96 个数据点中的 84 个(87.5%),因此无法评估其吞吐量。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • glm-5.3-flash 是最强的模型,平均吞吐量为 134.4 词元/秒(峰值 226.83 词元/秒),而 nemotron-3-ultra 最弱,平均为 31.88 词元/秒(最低 10.17 词元/秒)。
  • glm-5.3 的运行波动最为剧烈,整体下降 44.8%,从 23:40 的 172.43 词元/秒峰值跌至 01:40 的 51.49 词元/秒,随后在 03:00 恢复至 152.08 词元/秒;glm-5.2 在其最新采样中飙升 138%,达到 165.82 词元/秒。
  • deepseek-v4-flash 在预期的 12 个采样中报告了 0 个(0% 覆盖率),使整体覆盖率降至 87.5%(84 个有效数据点),因此其在该时间窗口内的吞吐量未知。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • glm-5.3-flash 是最强的模型,平均吞吐量为 135.22 词元/秒(峰值达 226.83 词元/秒),而 nemotron-3-ultra 最弱,平均仅 28.97 词元/秒,从未超过 54.11 词元/秒。
  • 运营层面最显著的变动是 glm-5.3 在时间窗口末段的崩溃:从 22:20 到 01:00 期间它保持在 141.30–173.41 词元/秒,随后在最后三次观测中跌至 72.56、51.49 和 64.29 词元/秒。相反,glm-5.2 从 00:00 的 9.42 词元/秒低点回升至 02:00 的 89.62 词元/秒。
  • deepseek-v4-flash 在预期的 12 个样本中报告为零(0% 覆盖率),使整体有效数据点降至 96 个中的 84 个(87.5%);本周期无法评估其吞吐量。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • glm-5.3-flash 是最强的模型,平均吞吐量为 144.15 词元/秒(峰值达 226.83 词元/秒),而 nemotron-3-ultra 是最弱的,平均为 25.36 词元/秒,从未超过 54.11 词元/秒。
  • nemotron-3-ultra 的波动性最大,变异系数为 60.9%,在 9.88 至 54.11 词元/秒之间波动;glm-5.3 是最稳定的高性能模型,平均为 132.11 词元/秒,呈 21.6% 的上升趋势。
  • deepseek-v4-flash 没有样本(预期 12 个中的 0 个),因此其吞吐量未知;总体覆盖率为 87.5%(96 个有效数据点中的 84 个),限制了可比性。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • glm-5.3-flash 是最强模型,平均吞吐量为 127.67 词元/秒,略胜 124.99 词元/秒的 glm-5.3;nemotron-3-ultra 最弱,平均仅 21.11 词元/秒,低于 minimax-m3 的 56.78 词元/秒。
  • glm-5.2 降幅最明显,趋势为 -26.9%,从 20:20 的 74.07 词元/秒降至 00:00 的 9.42 词元/秒;minimax-m3 波动最大,范围在 17.91 至 127.68 词元/秒之间,变异系数为 47.8%。
  • deepseek-v4-flash 在预期的 12 个样本中报告为零(覆盖率为 0%),其吞吐量未知;整体覆盖率为 87.5%,共 84 个有效数据点,这限制了跨模型比较。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • glm-5.3 是平均吞吐量最强的模型,达到 117.92 词元/秒,略微领先于 glm-5.3-flash 的 115.26 词元/秒,而 nemotron-3-ultra 最弱,仅为 19.10 词元/秒,在任何观测中从未超过 28.63 词元/秒。
  • 波动性最显著的是 minimax-m3,其在 3.26 至 127.68 词元/秒之间波动,变异系数为 52.8%;glm-5.3-flash 呈现最陡峭的上升趋势,达 48.7%,其中包括在 UTC 22:00 飙升至 211.11 词元/秒的峰值。
  • deepseek-v4-flash 在全部 12 个预期时间段内报告的样本数为零,因此其吞吐量未知,整体覆盖率降至 87.5%(96 个有效数据点中的 84 个)。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • 平均吞吐量最强的是 glm-5.3-flash,达 105.05 词元/秒,在最后一次观测中峰值达 211.11 词元/秒;最弱的是 nemotron-3-ultra,为 18.14 词元/秒,从未超过 28.63 词元/秒。
  • 运营层面最显著的波动来自 glm-5.2,其在 7.14 至 196.32 词元/秒之间波动,变异系数为 86.2%,并呈 37.7% 的下降趋势;而 glm-5.3-flash 在 22:00 从 101.28 跃升至 211.11 词元/秒。
  • deepseek-v4-flash 在预期的 12 个样本中报告为零(覆盖率为 0%),使整体覆盖率降至 87.5%(84 个有效数据点),因此无法评估其在该时间窗口内的吞吐量。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • gemma4:31b 以 103.04 词元/秒的平均吞吐量表现最强,而 nemotron-3-ultra 最弱,仅为 18.62 词元/秒,在整个时间窗口内从未超过 28.63 词元/秒。
  • glm-5.2 表现出对运营影响最大的波动性,在 21.02 至 196.32 词元/秒之间摆动,变异系数为 80.0%,趋势为 -47.3%;glm-5.3 也在 18:40 一度跌至 8.52 词元/秒,随后在 20:40 恢复到 160.43 词元/秒。
  • deepseek-v4-flash 在预期的 12 个采样点中报告为零个样本,导致其吞吐量无法测量,并将整体覆盖率降至 87.5%(预期 96 个数据点中的 84 个),因此模型级比较将其完全排除在外。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • glm-5.3 是平均吞吐量最强的模型,达 90.31 词元/秒,略微领先于 gemma4:31b(89.87 词元/秒)和 deepseek-v4-pro(89.79 词元/秒);nemotron-3-ultra 最弱,为 19.01 词元/秒,峰值仅为 27.56 词元/秒。
  • 运营层面最显著的变化是 glm-5.3 在该时间窗口内下降了 35.8%,从 16:20 的 132.83 词元/秒降至 20:00 的 76.22 词元/秒,其中包括 18:40 低至 8.52 词元/秒的最低点;glm-5.2 波动幅度最大,范围在 11.59 至 203.8 词元/秒之间,变异系数为 93.6%。
  • deepseek-v4-flash 在预期的 12 个样本中报告了 0 个(覆盖率 0.0%),因此其吞吐量未知;整体覆盖率为 87.5%,共 84 个有效数据点,这限制了任何全集群范围的比较。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • gemma4:31b 是平均吞吐量最强的模型,达到 101.61 词元/秒,而 nemotron-3-ultra 最弱,仅为 22.13 词元/秒,约为领先者速度的五分之一。
  • glm-5.2 表现出对运营影响最显著的波动性,变异系数为 76.1%,在窗口期内吞吐量在 11.59 至 203.8 词元/秒之间波动;同期 glm-5.3 也下降了 21.7%,nemotron-3-ultra 下降了 37.0%。
  • deepseek-v4-flash 在全部 12 个预期观测值中报告的样本数为零,覆盖率为 0%,使整体数据集覆盖率降至 87.5%(96 个预期数据点中的 84 个),因此其吞吐量未予评估。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • glm-5.3 是最强的模型,平均吞吐量为 103.63 词元/秒(范围 65.39–139.09 词元/秒),而 nemotron-3-ultra 最弱,平均仅 22.80 词元/秒,峰值也仅为 43.98 词元/秒。
  • glm-5.2 表现出对运营影响最大的波动性,变异系数为 81.3%,吞吐量从 17:00 的 11.59 词元/秒波动到 16:40 的 203.80 词元/秒;minimax-m3 的波动范围也很宽,从 17.72 到 100.11 词元/秒。
  • deepseek-v4-flash 未报告任何样本(预期 12 个中的 0 个),使整体覆盖率降至 87.5%(预期 96 个数据点中的 84 个有效),因此该时间窗口内其吞吐量未知。