← 返回性能仪表板

每小时性能洞察

滚动四小时性能数据摘要

已保留 1199 条摘要
4 小时窗口 · 8 个数据点 · 覆盖率 8.3%
  • 平均吞吐量最强的是 deepseek-v4-flash,达 209.95 词元/秒,其次是 glm-5.3,为 183.7 词元/秒;最弱的是 nemotron-3-ultra,仅 19.47 词元/秒,比领先者慢约十一倍,minimax-m3 也较低,为 52.9 词元/秒。
  • 无法评估趋势或波动性:每个模型在 00:00 UTC 仅有单次观测,因此所有八个模型的 stddev_tps 和 cv_pct 均为 0.0,trend_pct 也为 0.0;唯一的运营信号是各模型之间的巨大差距,从 19.47 到 209.95 词元/秒。
  • 数据覆盖严重受限:每个模型仅有 1 个样本,而预期样本为 12 个,即 8.3% 的覆盖率,总计 8 个有效数据点,因此所有平均值、最小值、最大值和 p95 值均仅基于单次测量。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • glm-5.3-flash 是最强的模型,平均吞吐量为 143.89 词元/秒,略高于 gemma4:31b 的 141.11 词元/秒;nemotron-3-ultra 最弱,平均为 15.08 词元/秒,从未超过 46.23 词元/秒。
  • glm-5.3 在运营层面上的变化最为显著,在整个时间窗口内上升了 72.0%,从 06:00 之前的大约 61-77 词元/秒升至之后的 168.8-179.96 词元/秒;nemotron-3-ultra 波动最大,变异系数为 78.6%,在 1.41 至 46.23 词元/秒之间波动。
  • 不存在数据缺失的限制:全部八个模型均报告了 12 个样本中的 12 个,共 96 个有效数据点,覆盖率为 100.0%,因此该四小时时间窗口是完整的。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • gemma4:31b 是最强的模型,平均吞吐量为 147.1 词元/秒(峰值 189.36 词元/秒),而 nemotron-3-ultra 最弱,平均为 13.26 词元/秒,最低降至 1.41 词元/秒。
  • 运营层面最显著的波动来自 nemotron-3-ultra,其变异系数为 91.1%,波动范围从 1.41 到 46.23 词元/秒;glm-5.3 也表现出不稳定性,从 02:20 的 178.87 词元/秒降至窗口中段的 62.69 词元/秒低点,而 deepseek-v4-flash 呈 29.0% 的上升趋势。
  • 不存在缺失数据的限制:全部 96 个预期数据点均有效,每个模型都有 12 个样本中的 12 个,且在整个四小时窗口内覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • gemma4:31b 是平均吞吐量最高的模型,达到 149.78 词元/秒(峰值 202.96 词元/秒),而 nemotron-3-ultra 最弱,仅为 10.78 词元/秒,约为 gemma4:31b 平均值的十四分之一。
  • 运营层面最显著的变化是 nemotron-3-ultra 的恢复:它从 03:40 的 1.41 词元/秒低点攀升至 05:00 的 46.23 词元/秒,变异系数为 115.9%。glm-5.3 也在 02:20 飙升至 178.87 词元/秒,随后回落至 63.64 词元/秒附近。
  • 不存在数据缺失的限制:全部 96 个预期数据点均有效(覆盖率 100.0%),且每个模型都有 12 个样本中的 12 个,因此数据缺口不会影响这些数字。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • gemma4:31b 是最强的模型,平均吞吐量为 147.02 词元/秒,峰值达 202.96 词元/秒,而 nemotron-3-ultra 是最弱的模型,平均为 4.83 词元/秒,从未超过 7.89 词元/秒。
  • 运营层面最显著的变化是 deepseek-v4-pro 的 53.2% 上升趋势,从 00:20 的 22.18 词元/秒攀升至时间窗口后期的持续 109.93-120.16 词元/秒;glm-5.3 的波动性最高,变异系数为 54.2%,在 58.52 至 217.6 词元/秒之间波动。
  • 不存在数据缺失的限制:全部八个模型均报告了 12 个预期样本中的 12 个,在四小时的时间窗口内共有 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • gemma4:31b 是性能最强的模型,平均吞吐量为 140.57 词元/秒,略微领先于 glm-5.3-flash 的 139.99 词元/秒;nemotron-3-ultra 性能最弱,平均为 6.52 词元/秒,从未超过 14.47 词元/秒。
  • deepseek-v4-pro 的波动性在运营层面最为显著,呈 113.2% 的上升趋势,变异系数为 66.5%,并在 15.02 至 122.82 词元/秒之间波动;glm-5.3 同样不稳定,范围在 58.52 至 217.6 词元/秒之间,变异系数为 55.8%。
  • 不存在数据缺失的限制:全部八个模型均报告了 12 个预期样本中的 12 个,在四小时的时间窗口内共计 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • glm-5.3-flash 是最强的模型,平均吞吐量为 139.8 词元/秒,领先于 gemma4:31b 的 127.05 词元/秒;nemotron-3-ultra 最弱,平均为 8.05 词元/秒,从未超过 15.74 词元/秒。
  • deepseek-v4-flash 趋势最为陡峭,从 22:20 的 22.73 词元/秒上升 87.4%,在 00:40 达到 202.33 词元/秒的峰值;而 deepseek-v4-pro 波动最大,CV 为 61.3%,在 23:20 一度跌至 15.02 词元/秒;glm-5.2 的最新读数降至 10.55 词元/秒,而其最大值为 98.58 词元/秒。
  • 不存在数据缺失的限制:全部 8 个模型均有 12 个样本中的 12 个,在四小时的时间窗口内共有 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • glm-5.3-flash 是最强的模型,平均吞吐量为 133.81 词元/秒(p95 为 168.69 词元/秒),而 nemotron-3-ultra 最弱,平均仅 9.52 词元/秒,在整个时间窗口内峰值仅为 15.74 词元/秒。
  • deepseek-v4-pro 表现出对运营影响最大的波动性:变异系数为 73.8%,在 121.16 词元/秒和 15.02 词元/秒之间摆动,趋势为 -44.9%,最终收于 91.5 词元/秒;相比之下,deepseek-v4-flash 上升了 60.4%,最高达到 202.33 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均报告了 12 个预期样本中的 12 个,在四小时期间内拥有 96 个有效数据点和 100.0% 的覆盖率,因此这些数字反映了完整的观测结果。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • glm-5.3-flash 是最强的模型,平均速度为 126.73 词元/秒,p95 为 168.69 词元/秒,而 nemotron-3-ultra 最弱,平均仅 9.75 词元/秒,从未超过 15.74 词元/秒。
  • glm-5.3 的运行波动最大,范围从 58.26 到 198.77 词元/秒,变异系数为 52.5%;deepseek-v4-pro 在四小时窗口内也在 15.02 到 121.16 词元/秒之间波动。
  • 不存在数据缺失的限制:全部八个模型均交付了 12 个预期样本中的 12 个,产生 96 个有效数据点,在 20:03 至 00:03 UTC 期间覆盖率达到 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • gemma4:31b 的平均吞吐量最高,达 126.86 词元/秒,而 nemotron-3-ultra 最弱,为 8.04 词元/秒;glm-5.3-flash 以 113.13 词元/秒排名第二。
  • glm-5.2 是波动性最大的模型,变异系数为 68.2%,波动范围从 5.17 到 198.55 词元/秒;deepseek-v4-pro 从约 105 词元/秒在 22:00 前后跌至 21.63 词元/秒的低点,随后回升至 117.36 词元/秒,而 nemotron-3-ultra 上升 163%,达到 15.74 词元/秒。
  • 不存在数据缺失的限制:全部 8 个模型均记录了 12 个预期样本中的 12 个,在四小时的时间窗口内共产生 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • glm-5.3-flash 是最强模型,平均吞吐量为 117.72 词元/秒,领先于 gemma4:31b 的 114.96 词元/秒;nemotron-3-ultra 最弱,平均仅 5.56 词元/秒,峰值也仅为 14.75 词元/秒。
  • 运营层面最显著的变化是 deepseek-v4-pro 下降了 36.9%,从 20:00 的 124.57 词元/秒峰值跌至 22:00 的 21.63 词元/秒。glm-5.2 同样波动剧烈,在 21:00 跌至 5.17 词元/秒,随后在 21:20 飙升至 198.55 词元/秒。
  • 不存在数据缺失的限制:全部 8 个模型均拥有 12 个预期样本中的 12 个,在四小时窗口内共有 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 95 个数据点 · 覆盖率 99.0%
  • 平均吞吐量最高的是 gemma4:31b,达 122.12 词元/秒,p95 为 157.83 词元/秒;最低的是 nemotron-3-ultra,平均仅 3.33 词元/秒,峰值也仅为 7.34 词元/秒。
  • deepseek-v4-flash 的波动性最大,变异系数为 65.6%,在 21.75 至 165.31 词元/秒之间大幅波动,包括在 20:00 和 20:20 分别降至 25.22 和 21.75 词元/秒;glm-5.2 也在 21:00 降至 5.17 词元/秒。
  • deepseek-v4-pro 缺失一个观测值(12 个样本中有 11 个,覆盖率 91.7%,缺少 17:40 的数据点),因此整体 96 个数据点中有 95 个有效(覆盖率 99.0%)。
4 小时窗口 · 71 个数据点 · 覆盖率 74.0%
  • 平均吞吐量最强的是 gemma4:31b,达 118.93 词元/秒(峰值 160.04 词元/秒);最弱的是 nemotron-3-ultra,仅 2.58 词元/秒,在其九个样本中从未超过 4.21 词元/秒。
  • deepseek-v4-flash 波动性最大(变异系数 68.2%),在 24.33 至 165.31 词元/秒之间大幅摆动,在 19:00 达到 165.31 词元/秒后,紧接着在 20:00 降至 25.22 词元/秒;glm-5.3 也在 20:00 从约 60 词元/秒飙升至 160.9 词元/秒。
  • 数据集包含 96 个预期数据点中的 71 个(覆盖率 74.0%);deepseek-v4-pro 仅有 12 个样本中的 8 个(66.7%),且没有任何模型在 17:20 之前上报数据,导致早期时段未被观测到。
4 小时窗口 · 47 个数据点 · 覆盖率 49.0%
  • glm-5.3-flash 是最强的模型,平均吞吐量为 116.21 词元/秒,领先于 gemma4:31b 的 100.61 词元/秒;nemotron-3-ultra 最弱,平均仅为 2.22 词元/秒,最大值也只有 3.84 词元/秒。
  • deepseek-v4-flash 的波动性在运营层面最为显著,范围从 24.33 到 165.31 词元/秒,变异系数为 70.1%,趋势为 +253.6%,收尾时达到其 165.31 词元/秒的峰值;gemma4:31b 也从 154.57 降至 35.49 词元/秒(-49.5%)。
  • 72 个预期样本中仅有 47 个(49.0% 的覆盖率)存在;每个模型在 12 个预期观测值中只有 5 或 6 个,且 17:20 UTC 之前没有数据,因此平均值可能无法代表完整的四小时窗口。
4 小时窗口 · 23 个数据点 · 覆盖率 24.0%
  • gemma4:31b 是最强的模型,平均吞吐量为 133.74 词元/秒,峰值达 154.57 词元/秒;nemotron-3-ultra 最弱,平均仅 2.21 词元/秒,从未超过 3.02 词元/秒。
  • glm-5.2 降幅最为剧烈,从 79.82 降至 22.79 词元/秒(-58.7%),而 glm-5.3-flash 几乎翻倍,从 55.55 升至 124.82 词元/秒(+95.5%);deepseek-v4-pro 上升 30.4%,达到 106.11 词元/秒。
  • 覆盖率仅为 24.0%:八个模型预期共 96 个样本,实际仅有 23 个有效样本,所有观测数据集中在 17:20 至 18:00 UTC 之间,其中 deepseek-v4-pro 仅贡献 2 个样本(覆盖率 16.7%),导致更早的时段未被测量。
4 小时窗口 · 384 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强模型,平均吞吐量为 138.66 词元/秒(p95 为 192.93 词元/秒,最大值为 219.57 词元/秒),而 nemotron-3-ultra 最弱,平均仅为 2.43 词元/秒(p95 为 4.42 词元/秒,最大值为 6.63 词元/秒)。
  • 运营层面最显著的模式是 nemotron-3-ultra 的持续下滑,在整个时间窗口内下降 43.1%,于 UTC 15:10 达到 1.17 词元/秒的最低值,变异系数为 46.3%;glm-5.3 也出现了在 16.24 至 219.57 词元/秒之间的剧烈波动。
  • 不存在数据缺失的限制:全部八个模型均报告了预期的 48 个样本中的 48 个,共计 384 个有效数据点,在 UTC 12:03 至 16:03 的时间窗口内覆盖率达到 100.0%。
4 小时窗口 · 384 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强的模型,平均速度为 136.51 词元/秒(p95 为 192.32 词元/秒,最大值为 222.35 词元/秒),而 nemotron-3-ultra 是最弱的模型,平均速度仅为 2.66 词元/秒,峰值也仅为 6.63 词元/秒。
  • glm-5.3 表现出最具运营意义的波动性:尽管平均速度最高,它在 14:05 降至 16.24 词元/秒,在 11:40 降至 45.69 词元/秒,变异系数为 33.1%,趋势为 -12.9%;nemotron-3-ultra 也下降了 22.6%,到 15:00 降至 1.3 词元/秒。
  • 不存在数据缺失的限制:全部八个模型在 48 个预期样本中均拥有 48 个样本,共 384 个有效数据点,在四小时的时间窗口内覆盖率达到 100.0%。
4 小时窗口 · 384 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强的模型,平均速度为 144.30 词元/秒(峰值 222.35 词元/秒,出现在 UTC 11:25),而 nemotron-3-ultra 最弱,平均仅 3.28 词元/秒,慢了大约 44 倍。
  • 全部八个模型均呈下降趋势,其中 glm-5.3(-18.3%)和 glm-5.2(-17.8%)降幅最陡;UTC 13:05 出现的同步骤降使 glm-5.3 跌至 34.43 词元/秒、glm-5.2 跌至 13.32 词元/秒,而 nemotron-3-ultra 的波动性最高,变异系数(CV)为 42.6%。
  • 无缺失数据限制:每个模型均拥有 48 个样本中的全部 48 个,覆盖率为 100.0%,数据集在四小时窗口内共计 384 个有效数据点。
4 小时窗口 · 384 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强模型,平均吞吐量为 149.79 词元/秒(峰值 222.35 词元/秒,p95 为 198.57 词元/秒),而 nemotron-3-ultra 最弱,平均仅 3.85 词元/秒(峰值 7.37 词元/秒),大约比领先者慢 39 倍。
  • 最显著的变动是 nemotron-3-ultra 在该时段内下降了 36.3%,波动性最高(CV 44.0%),峰值从 7.37 词元/秒跌至 11:20 时的 1.46 词元/秒;glm-5.2 也下降了 20.6%,最新读数为 37.75 词元/秒。
  • 无缺失数据:全部八个模型均报告 48 个样本中的 48 个(384 个有效数据点,覆盖率 100.0%),因此唯一的局限是结果仅反映这一个四小时的时段。
4 小时窗口 · 384 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强的模型,平均吞吐量为 147.21 词元/秒,在 11:25 达到 222.35 词元/秒的峰值,而 nemotron-3-ultra 最弱,平均仅为 4.62 词元/秒,且从未超过 12.79 词元/秒。
  • 运营层面最显著的变化是 nemotron-3-ultra 下降了 40.2%,从 10:00 之前的大约 6-7 词元/秒跌至最后两个小时的 1.46 至 3.3 词元/秒之间;相反,glm-5.3-flash 呈上升趋势,上涨 35.2%,达到 97.12 词元/秒的平均值。
  • 不存在数据缺失的限制:全部八个模型均报告了预期的 48 个样本中的 48 个,共计 384 个有效数据点,在 08:03 至 12:03 UTC 时间窗口内覆盖率达到 100.0%。
4 小时窗口 · 384 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强模型,平均吞吐量为 142.36 词元/秒(p95 为 191.5 词元/秒,最大值为 233.42 词元/秒),而 nemotron-3-ultra 最弱,平均仅为 5.64 词元/秒,从未超过 12.79 词元/秒。
  • 运营层面最显著的波动是 glm-5.3 反复出现的急剧骤降:07:05 时为 233.42 词元/秒,07:10 时降至 60.9 词元/秒,并在 07:40 跌至 23.83 词元/秒的最低值,导致变异系数达 33.7%;glm-5.2 的相对波动最高,为 43.8%。
  • 不存在数据缺失的限制:全部 8 个模型均记录了 48 个预期样本中的 48 个,在四小时窗口内共计 384 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 384 个数据点 · 覆盖率 100.0%
  • glm-5.3 是平均吞吐量最强的模型,达 147.17 词元/秒(p95 为 179.18 词元/秒),而 nemotron-3-ultra 最弱,平均仅 6.07 词元/秒,峰值也只有 12.79 词元/秒。
  • 运营层面最显著的波动出现在 glm-5.2,其变异系数最高,达 46.7%,吞吐量从 06:45 的 11.21 词元/秒波动至 07:05 的 168.54 词元/秒;glm-5.3 也从 07:05 的 233.42 词元/秒降至 07:10 的 60.9 词元/秒,并在 07:40 降至 23.83 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均报告了预期 48 个样本中的 48 个,共有 384 个有效数据点,在四小时时间窗口内覆盖率为 100.0%。
4 小时窗口 · 384 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强的模型,平均吞吐量为 155.99 词元/秒(p95 为 181.82 词元/秒),而 nemotron-3-ultra 最弱,平均仅为 5.72 词元/秒,慢了大约 27 倍。
  • glm-5.3 表现出最剧烈的运行波动性:它在 UTC 07:05 飙升至 233.42 词元/秒,在 07:10 降至 60.9 词元/秒,并在 07:40 达到时段最低值 23.83 词元/秒;glm-5.2 的相对波动性最高,CV 为 48.3%。
  • 不存在数据缺失的限制:全部八个模型均报告了预期 48 个样本中的 48 个,在四小时窗口内共有 384 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 384 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强的模型,平均吞吐量为 162.71 词元/秒,峰值达 187.42 词元/秒,而 nemotron-3-ultra 最弱,平均仅 5.40 词元/秒,慢了大约 30 倍。
  • glm-5.3 同时也是最稳定的模型(CV 12.3%),而 gemma4:31b 在 37.67 至 186.13 词元/秒之间波动(CV 29.6%);minimax-m3 呈现 -16.3% 的趋势,并在 05:00 UTC 出现 112.27 词元/秒的峰值。
  • 无缺失数据:全部八个模型均报告 48 个样本中的 48 个,覆盖率为 100.0%(384 个有效数据点),因此唯一的局限是数据窗口为四小时,截止于 07:03 UTC。
4 小时窗口 · 384 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强的模型,平均速度为 163.33 词元/秒(p95 为 181.72 词元/秒,最大值为 187.42 词元/秒),而 nemotron-3-ultra 是最弱的模型,平均速度仅为 4.79 词元/秒,峰值也仅为 11.34 词元/秒。
  • 运营层面最显著的波动来自 gemma4:31b,其速度从 187.82 词元/秒的最大值骤降至 37.67 词元/秒的最小值(变异系数 28.6%),趋势为 -17.3%;deepseek-v4-pro 也在 03:50 一度跌至 21.01 词元/秒,随后才恢复。
  • 不存在数据缺失的限制:全部八个模型均报告了预期的 48 个样本中的 48 个,共 384 个有效数据点,覆盖率为 100.0%,不过该时间窗口仅覆盖四个小时。
4 小时窗口 · 384 个数据点 · 覆盖率 100.0%
  • glm-5.3 的平均吞吐量最强,达到 160.71 词元/秒,峰值为 187.42 词元/秒,而 nemotron-3-ultra 最弱,平均仅为 3.85 词元/秒,且从未超过 8.57 词元/秒。
  • 运营层面最显著的波动是 gemma4:31b 在后段窗口的崩溃:在 04:00 至 04:25 之间,其吞吐量从 65.36 词元/秒跌至 37.67 词元/秒的最低值,远低于其 144.11 词元/秒的平均水平,导致趋势为 -16.6%;deepseek-v4-pro 也在 03:50 一度跌至 21.01 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均报告了预期的 48 个样本中的 48 个,共计 384 个有效数据点,覆盖率为 100.0%,因此从 01:05 到 05:00 UTC 的每个五分钟间隔均有数据呈现。
4 小时窗口 · 384 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强的模型,平均吞吐量为 163.46 词元/秒,领先于 146.94 词元/秒的 gemma4:31b,而 nemotron-3-ultra 最弱,平均为 3.31 词元/秒,且从未超过 6.32 词元/秒。
  • minimax-m3 呈现出最具运营意义的模式:趋势为 -25.1%,变异系数为 40.4%,从 00:05 的 130.0 词元/秒下降至 03:25 的 17.22 词元/秒最低值;deepseek-v4-pro 同样在后期出现性能下降,在 03:50 降至 21.01 词元/秒,随后恢复至 96.24 词元/秒。
  • 不存在数据缺失的限制:在四小时的时间窗口内,全部八个模型均报告了 48 个预期样本中的 48 个,覆盖率为 100.0%。
4 小时窗口 · 384 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强的模型,平均吞吐量为 163.5 词元/秒,领先于 145.74 词元/秒的 gemma4:31b;nemotron-3-ultra 最弱,平均仅为 4.41 词元/秒,最大值仅为 15.71 词元/秒。
  • 最显著的波动是 glm-5.2 在 00:25 UTC 降至 6.37 词元/秒,随后在 00:45 恢复到 81.8 词元/秒;minimax-m3 呈现最陡峭的持续下降趋势,趋势为 -23.9%,从 00:05 的 130.0 词元/秒峰值跌至 02:30 的 17.98 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均报告了 48 个预期样本中的 48 个,共 384 个有效数据点,覆盖率为 100.0%,因此这四小时的时间窗口得到了完整呈现。
4 小时窗口 · 384 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强的模型,平均吞吐量为 158.82 词元/秒(p95 为 181.59 词元/秒,最大值为 185.08 词元/秒),而 nemotron-3-ultra 最弱,平均仅为 5.73 词元/秒,从未超过 15.74 词元/秒。
  • 运营层面最显著的模式是 nemotron-3-ultra 的持续下滑:在 23:00 之前约为 7-15 词元/秒,在 00:15 之后降至 1.67-4.64 词元/秒,趋势降幅达 64.8%,并且其波动性最高,cv 为 62.2%。
  • 不存在数据缺失的限制:全部八个模型均记录了 48 个预期样本中的 48 个,在四小时的时间窗口内共产生 384 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 384 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强模型,平均吞吐量为 161.20 词元/秒(p95 为 183.11 词元/秒),而 nemotron-3-ultra 最弱,平均仅 7.38 词元/秒,峰值也仅为 17.73 词元/秒。
  • 最显著的变动是 glm-5.3-flash 上升 37.6%,达到 86.93 词元/秒的平均值,收尾时接近 110 词元/秒;而 nemotron-3-ultra 下降 38.8%,降至 2.13 词元/秒;glm-5.2 波动最为剧烈(变异系数 44.1%),在 22:55 降至 4.74 词元/秒;minimax-m3 在 00:05 飙升至 130.0 词元/秒,而其平均值为 50.88 词元/秒。
  • 不存在缺失数据的限制:全部八个模型均报告 48 个样本中的 48 个,覆盖率为 100.0%,共 384 个有效数据点。
4 小时窗口 · 384 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强的模型,平均吞吐量为 156.22 词元/秒(峰值达 194.9 词元/秒),领先于 143.42 词元/秒的 gemma4:31b;nemotron-3-ultra 最弱,平均仅 7.86 词元/秒,从未超过 17.73 词元/秒。
  • glm-5.3-flash 呈现出最具运营意义的趋势,在整个时间窗口内攀升了 34.5%,从早期的大约 50-60 词元/秒上升至最后三次观测中的 120.64-125.55 词元/秒;glm-5.2 波动最大,在 4.74 至 95.24 词元/秒之间摆动,变异系数为 42.3%。
  • 不存在缺失数据的限制:全部八个模型均报告了预期 48 个样本中的 48 个,共计 384 个有效数据点,在四小时窗口内覆盖率达到 100.0%。
4 小时窗口 · 384 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强的模型,平均吞吐量为 155.26 词元/秒(最高 194.9 词元/秒),而 nemotron-3-ultra 最弱,平均仅为 6.57 词元/秒,从未超过 17.73 词元/秒。
  • glm-5.2 表现出最具运营意义的波动性,变异系数为 39.2%,并多次从约 70 词元/秒骤降至 22:55 的 4.74 词元/秒和 20:05 的 8.22 词元/秒;nemotron-3-ultra 在该时间窗口内也上升了 129.3%,但仍远低于其他模型。
  • 不存在数据缺失的限制:全部八个模型均报告了 48 个预期样本中的 48 个,覆盖率为 100.0%,共 384 个有效数据点,不过该数据集仅涵盖这四个小时的时间窗口。
4 小时窗口 · 384 个数据点 · 覆盖率 100.0%
  • glm-5.3 的平均吞吐量最高,达到 148.95 词元/秒(峰值 194.90 词元/秒),而 nemotron-3-ultra 最弱,平均仅为 5.27 词元/秒,大约比领先者慢 28 倍。
  • glm-5.3-flash 的下降幅度最为陡峭,从早期 120.40 词元/秒的峰值一路下滑 20.9%,跌至 42.11 词元/秒的低点;而 nemotron-3-ultra 波动性极高(变异系数 71.0%),在 1.54 至 17.73 词元/秒之间摇摆,并在 21:55 出现一次飙升至 17.54 词元/秒的后期峰值。
  • 不存在数据缺失的限制:全部八个模型均记录了预期的 48 个样本中的 48 个,覆盖率为 100.0%,在四小时窗口内共有 384 个有效数据点。
4 小时窗口 · 384 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强的模型,平均吞吐量为 147.54 词元/秒(p95 为 180.18 词元/秒),而 nemotron-3-ultra 是最弱的模型,平均为 3.77 词元/秒,大约比领先者慢 39 倍。
  • 运营层面最显著的波动出现在 glm-5.2 中,它反复从稳定的 60-80 词元/秒水平骤降至 8.22 词元/秒(20:05 时)和 13.8 词元/秒(20:40 时)等急剧低点,变异系数为 32.0%。glm-5.3-flash 也呈现 -13.6% 的趋势,最终降至其 42.11 词元/秒的最低值。
  • 不存在数据缺失的限制:全部八个模型均报告了 48 个预期样本中的 48 个,覆盖率为 100.0%,且数据集包含 384 个有效数据点,因此四小时的时间窗口是完整填充的。
4 小时窗口 · 384 个数据点 · 覆盖率 100.0%
  • glm-5.3 的平均吞吐量最强,达到 143.32 词元/秒(p95 为 177.22 词元/秒),而 nemotron-3-ultra 最弱,平均仅为 3.18 词元/秒,且从未超过 4.55 词元/秒。
  • glm-5.2 是波动最大的模型(变异系数 46.9%),在 16:05 至 16:40 期间吞吐量在 1.55 至 27.57 词元/秒之间波动,随后恢复到大部分处于 50-87 词元/秒的水平;glm-5.3 也记录了单次间隔的骤降,分别降至 31.06、46.25 和 55.12 词元/秒。
  • 不存在数据缺失问题:全部八个模型均报告了预期的 48 个样本中的 48 个,共计 384 个有效数据点,在四小时窗口内覆盖率达到 100.0%。
4 小时窗口 · 384 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强的模型,平均吞吐量为 136.18 词元/秒,峰值达 181.93 词元/秒;nemotron-3-ultra 最弱,平均为 3.02 词元/秒,从未超过 4.55 词元/秒。
  • glm-5.2 表现出最具运营意义的波动性,从 16:35 附近的 1.55 词元/秒低点波动至 18:55 的 86.94 词元/秒高点,变异系数为 57.3%,窗口期内趋势为 109.0%。
  • 不存在数据缺失的限制:全部八个模型均报告了 48 个预期样本中的 48 个,覆盖率为 100.0%,共 384 个有效数据点,因此四小时窗口期得到完整呈现。
4 小时窗口 · 384 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强的模型,平均吞吐量为 132.86 词元/秒(峰值 181.93 词元/秒,p95 为 176.54 词元/秒),而 nemotron-3-ultra 最弱,平均仅为 2.62 词元/秒,从未超过 4.55 词元/秒。
  • glm-5.2 表现出对运营影响最为显著的波动性:在 15:50 至 16:40 之间,其吞吐量从 14.73 词元/秒降至 1.55 词元/秒的低点,随后在 17:05 前恢复至 75.42 词元/秒,导致其变异系数达到 57.7%;glm-5.3 在整个时间窗口内也上升了 23.1%。
  • 不存在数据缺失的限制:全部八个模型均报告了 48 个预期样本中的 48 个,覆盖率为 100.0%,因此四小时的时间窗口得到了完整呈现。
4 小时窗口 · 384 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强的模型,平均吞吐量为 125.51 词元/秒,峰值达 174.03 词元/秒,而 nemotron-3-ultra 最弱,平均仅为 2.18 词元/秒,慢了约 58 倍。
  • 运营层面最显著的波动是 glm-5.2 在 UTC 时间 15:50 至 16:40 之间的骤降,吞吐量从 14.73 词元/秒跌至 1.55 词元/秒的低点,随后恢复至 67.78 词元/秒;其 58.3% 的变异系数和 -42.7% 的趋势远超其他所有模型。
  • 不存在数据缺失的限制:全部八个模型均报告了 48 个预期样本中的 48 个,覆盖率为 100.0%,在四小时窗口内共有 384 个有效数据点。
4 小时窗口 · 384 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强的模型,平均吞吐量为 130.49 词元/秒(峰值 173.13 词元/秒),而 nemotron-3-ultra 最弱,平均仅 2.11 词元/秒,在该时间窗口内从未超过 3.77 词元/秒。
  • glm-5.2 呈现出对运营影响最大的下滑,趋势为 -28.9%,16:00 时收于 5.76 词元/秒,而其最高值为 80.8 词元/秒;glm-5.3 也曾急剧跌至 28.11 词元/秒(14:05 时),随后回升至 124.28 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均报告了 48 个预期样本中的 48 个,共计 384 个有效数据点,在四个小时期间内覆盖率达到 100.0%。
4 小时窗口 · 384 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强的模型,平均吞吐量为 133.95 词元/秒(峰值 183.58 词元/秒,p95 为 172.51 词元/秒),而 nemotron-3-ultra 最弱,平均仅为 2.21 词元/秒,从未超过 3.43 词元/秒。
  • 运营层面最显著的波动是 glm-5.3 在 UTC 14:00 至 14:10 之间的急剧骤降,从 13:55 的 161.34 词元/秒跌至 14:05 的 28.11 词元/秒,随后在 14:15 恢复至 131.53 词元/秒;其整体趋势为 -20.9%。gemma4:31b 的波动也很大,在 37.51 至 160.23 词元/秒之间摆动,变异系数为 28.5%。
  • 该时间窗口内不存在数据缺失的限制:全部八个模型在 100.0% 的覆盖率下均报告了 48 个预期样本中的 48 个(384 个有效数据点),但四小时的跨度限制了对更长期情况的评估。
4 小时窗口 · 384 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强的模型,平均速度为 142.1 词元/秒,峰值为 183.58 词元/秒;而 nemotron-3-ultra 是最弱的模型,平均速度为 2.51 词元/秒,且从未超过 3.76 词元/秒。
  • 最具运营意义的变动是 nemotron-3-ultra 的持续下滑,在整个时间窗口内下降了 32.0%,最新速度为 2.02 词元/秒,最低为 1.23 词元/秒;glm-5.3 也在 14:00 骤降至 62.57 词元/秒,为其在该时段内的最低值。
  • 不存在数据缺失的限制:全部八个模型均报告了 48 个预期样本中的 48 个,共 384 个有效数据点,覆盖率为 100.0%,因此该四小时窗口的数据是完整观测的。
4 小时窗口 · 384 个数据点 · 覆盖率 100.0%
  • glm-5.3 是平均吞吐量最强的模型,达到 141.47 词元/秒,峰值为 183.58 词元/秒,p95 为 173.07 词元/秒;nemotron-3-ultra 最弱,平均仅 2.84 词元/秒,在整个时间窗口内从未超过 3.92 词元/秒。
  • glm-5.2 的波动性最高,CV 为 33.9%(标准差 17.12 词元/秒),在 12.18 至 78.4 词元/秒之间波动,而 nemotron-3-ultra 在四个小时内下降了 18.2%,最终为 2.9 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均报告了 48 个预期样本中的 48 个,覆盖率为 100%,共计 384 个有效数据点,因此数据缺口不会影响这些数值。
4 小时窗口 · 384 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强的模型,平均吞吐量为 136.42 词元/秒(峰值 183.58 词元/秒),而 nemotron-3-ultra 是最弱的模型,平均仅为 3.23 词元/秒,从未超过 4.91 词元/秒。
  • glm-5.3-flash 的提升最为显著,呈 39.8% 的上升趋势,从 23.02 词元/秒的低点攀升至 129.83 词元/秒的高点;glm-5.2 的波动性最大,变异系数为 35.9%,在 12.18 至 79.83 词元/秒之间波动。
  • 不存在数据缺失的限制:全部八个模型均报告了 48 个预期样本中的 48 个,共计 384 个有效数据点,在四小时的时间窗口内覆盖率达到 100.0%。
4 小时窗口 · 384 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强的模型,平均速度为 134.73 词元/秒,p95 为 169.32 词元/秒,而 nemotron-3-ultra 是最弱的模型,平均速度为 3.42 词元/秒,大约慢 39 倍。
  • 运营层面最显著的波动是 minimax-m3 在 09:35 骤降至 6.02 词元/秒,随后在 09:45 恢复至 58.58 词元/秒;glm-5.2 的相对变异性最高(变异系数 34.0%),在 18.14 和 79.83 词元/秒之间波动。
  • 不存在数据缺失的限制:全部八个模型均报告了 48 个预期样本中的 48 个,覆盖率为 100.0%(384 个有效数据点),因此这四小时的时间窗口得到了完整呈现。
4 小时窗口 · 384 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强的模型,平均吞吐量为 133.86 词元/秒(峰值达 183.75 词元/秒),而 nemotron-3-ultra 最弱,平均仅为 3.69 词元/秒,从未超过 7.01 词元/秒。
  • 运营层面最显著的波动是 minimax-m3 在 09:35 骤降至 6.02 词元/秒,随后在 09:45 回升至 58.58 词元/秒;glm-5.3 也在 09:50 降至 42.32 词元/秒,随后在 10:00 前恢复至 145.28 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均报告 48 个样本中的 48 个,覆盖率为 100.0%(384 个有效数据点),因此这四小时的时间窗口得到了完整观测。
4 小时窗口 · 384 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强的模型,平均吞吐量为 143.06 词元/秒(p95 为 174.33 词元/秒),而 nemotron-3-ultra 最弱,平均仅为 4.32 词元/秒,从未超过 8.74 词元/秒。
  • 在观察窗口期内,八个模型中有七个的吞吐量出现下降,其中 nemotron-3-ultra 下降 24.6%,minimax-m3 下降 16.3%;deepseek-v4-flash 是唯一增长的模型,增幅为 +10.5%。波动性最高的是 nemotron-3-ultra(CV 35.8%)和 glm-5.2(CV 29.4%),后者在 07:30 降至 18.65 词元/秒。
  • 不存在数据缺失的限制:所有八个模型均记录了预期的 48 个样本中的 48 个,覆盖率为 100.0%,valid_point_count 为 384,因此四小时的观察窗口期被完整观测。
4 小时窗口 · 384 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强的模型,平均吞吐量为 142.28 词元/秒(p95 为 179.37 词元/秒),而 nemotron-3-ultra 最弱,平均为 4.84 词元/秒,从未超过 9.57 词元/秒。
  • 运营层面最显著的变化是 nemotron-3-ultra 的持续下滑,在整个时间窗口内下降了 32.5%,最新读数为 4.76 词元/秒,最低曾降至 2.03 词元/秒;glm-5.3 的波动也很大,范围在 36.92 至 183.75 词元/秒之间。
  • 不存在数据缺失的限制:全部八个模型均报告了预期的 48 个样本中的 48 个,共计 384 个有效数据点,在四小时期间内覆盖率达到 100.0%。
4 小时窗口 · 384 个数据点 · 覆盖率 100.0%
  • glm-5.3 的平均吞吐量最强,达到 146.77 词元/秒(峰值 183.75 词元/秒),而 nemotron-3-ultra 最弱,仅为 5.44 词元/秒,大约低 27 倍。
  • 变动最显著的是 deepseek-v4-flash 的下行趋势,为 -13.7%,最终为 63.75 词元/秒,低于 90.64 词元/秒的平均值;glm-5.2 的波动性最高,变异系数为 31.9%,范围为 7.02 至 84.5 词元/秒。
  • 该时间窗口内不存在数据缺失的限制:全部八个模型均报告 48 个样本中的 48 个,覆盖率为 100.0%,共计 384 个有效数据点,但四小时的时间跨度限制了对更广泛结论的推断。
4 小时窗口 · 384 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强的模型,平均吞吐量为 152.93 词元/秒(p95 为 180.97 词元/秒),而 nemotron-3-ultra 最弱,平均仅为 5.45 词元/秒,峰值也仅有 9.57 词元/秒。
  • glm-5.2 波动性最高(CV 34.8%),在 03:35 降至 7.02 词元/秒,在 04:20 降至 10.8 词元/秒;glm-5.3 也在 04:20 骤降至 36.92 词元/秒。deepseek-v4-pro 是表现最稳定的模型(CV 16.1%,标准差 16.85 词元/秒)。
  • 不存在数据缺失的限制:全部八个模型均记录了 48 个预期样本中的 48 个,覆盖率为 100.0%,在四小时窗口内共有 384 个有效数据点。
4 小时窗口 · 384 个数据点 · 覆盖率 100.0%
  • glm-5.3 的平均吞吐量最高,达 152.71 词元/秒(峰值 185.15 词元/秒),而 nemotron-3-ultra 最弱,平均仅 5.4 词元/秒,从未超过 9.57 词元/秒。
  • glm-5.2 的波动性最为剧烈,变异系数为 40.0%,波动范围从 7.02 到 83.45 词元/秒;glm-5.3 和 glm-5.3-flash 均呈约 11% 的下降趋势(趋势分别为 -11.3% 和 -11.8%),而 deepseek-v4-flash 上升了 12.5%。
  • 不存在数据缺失的限制:全部八个模型均记录了 48 个预期样本中的 48 个,共计 384 个有效数据点,在四小时窗口内覆盖率达到 100.0%。