← 返回性能仪表板

每小时性能洞察

滚动四小时性能数据摘要

已保留 1191 条摘要
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • gemma4:31b 是表现最强的模型,平均吞吐量为 123.88 词元/秒(峰值达 173.39 词元/秒),而 nemotron-3-ultra 是表现最弱的模型,平均吞吐量为 42.92 词元/秒,波动范围在 5.24 至 89.59 词元/秒之间。
  • 波动最显著的是 glm-5.2 和 nemotron-3-ultra:glm-5.2 从 08:20 的 108.13 词元/秒降至 12:00 的 5.89 词元/秒(趋势为 -23.3%),而 nemotron-3-ultra 的变异系数为 55.8%,趋势为 -37.2%,最终收于 19.72 词元/秒。
  • deepseek-v4-flash 在预期的 12 个样本中报告为零个样本,导致整体覆盖率为 87.5%(84 个有效数据点),因此无法评估其在该时间窗口内的吞吐量。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • 平均吞吐量最高的是 gemma4:31b,达 128.19 词元/秒(峰值 173.39 词元/秒);最低的是 nemotron-3-ultra,为 47.10 词元/秒,该模型在 09:20 一度跌至 8.55 词元/秒。
  • glm-5.3-flash 是波动最大的模型,变异系数为 44.7%,在 50.40 至 172.07 词元/秒之间波动,其中包括在 10:20 至 10:40 之间从 172.07 降至 57.67 词元/秒;glm-5.3 呈下行趋势,下降 35.6%,从 161.37 降至 135.10 词元/秒。
  • deepseek-v4-flash 未产生任何样本(预期 12 个中为 0 个,覆盖率 0%),使整体覆盖率降至 87.5%,有效数据点为 84 个,该模型在此时间窗口内的吞吐量未知。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • glm-5.3 是平均吞吐量最强的模型,达到 124.02 词元/秒,略高于 gemma4:31b 的 120.47 词元/秒,而 nemotron-3-ultra 最弱,仅为 51.74 词元/秒,在任何观测中从未超过 89.59 词元/秒。
  • glm-5.3-flash 表现出最具运营意义的波动性,变异系数为 54.8%,在 13.34 至 185.16 词元/秒之间摆动,并呈现 36.8% 的下降趋势,其中包括从 05:20 的 184.90 词元/秒跌至 05:40 的 13.34 词元/秒。
  • deepseek-v4-flash 在预期的 12 个样本中报告了 0 个(覆盖率 0%),使整体覆盖率降至 87.5%,仅有 84 个有效数据点,因此无法评估其在该时间窗口内的吞吐量。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • glm-5.3 是最强的模型,平均吞吐量为 134.57 词元/秒(峰值达 186.42 词元/秒),而 nemotron-3-ultra 最弱,平均为 53.02 词元/秒,在整个时间窗口内从未超过 101.64 词元/秒。
  • glm-5.3-flash 的波动性最具运营意义,在 13.34 至 187.66 词元/秒之间波动,变异系数为 55.9%,趋势为 -29.4%,其中包括在 05:40 骤降至 13.34 词元/秒;相比之下,minimax-m3 上升了 43.4%,在 07:20 达到 176.75 词元/秒的峰值。
  • deepseek-v4-flash 未报告任何样本(预期 12 个中为 0 个,覆盖率为 0%),因此其吞吐量未知;整体数据集覆盖率为 87.5%(84 个有效数据点),这限制了对整个集群性能的结论。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • glm-5.3 是最强的模型,平均吞吐量为 127.27 词元/秒(峰值 186.42 词元/秒),而 nemotron-3-ultra 最弱,平均仅 50.47 词元/秒,从未超过 101.64 词元/秒。
  • glm-5.3-flash 波动最大,在 13.34 至 187.66 词元/秒之间摆动,变异系数为 53.3%,其中包括在 UTC 05:40 降至 13.34 词元/秒的情况;glm-5.3 同样呈现高低交替的周期性波动。
  • deepseek-v4-flash 没有任何采样(预期 12 个中为 0 个),使整体覆盖率降至 87.5%(84 个有效数据点),因此无法评估其在该时间窗口内的吞吐量。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • glm-5.3 的平均吞吐量最高,达 119.53 词元/秒(p95 为 175.08 词元/秒),而 nemotron-3-ultra 表现最弱,平均仅 43.96 词元/秒,最低为 1.91 词元/秒。
  • glm-5.3-flash 的波动最为剧烈,范围从 13.34 到 187.66 词元/秒,变异系数为 54.5%,其中包括在两次接近 185 词元/秒的读数之后,于 05:40 骤降至 13.34 词元/秒;nemotron-3-ultra 同样不稳定(变异系数 62.7%)。
  • deepseek-v4-flash 在预期的 12 个样本中报告为零(覆盖率 0%),使整体覆盖率降至 87.5%(84 个有效数据点),因此全集群范围的对比完全排除了该模型。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • glm-5.3 是平均吞吐量最强的模型,达到 121.08 词元/秒,而 nemotron-3-ultra 最弱,为 39.06 词元/秒;次低的平均值分别是 glm-5.2 的 59.71 词元/秒和 minimax-m3 的 86.79 词元/秒。
  • 运营层面最显著的波动来自 nemotron-3-ultra,其波动范围从 1.91 词元/秒的低点到 101.64 词元/秒的高点,变异系数为 72.6%,窗口期内趋势为 77.3%;gemma4:31b 也呈现持续下降趋势,趋势为 -22.4%,最终收于 56.93 词元/秒,而其峰值为 192.34 词元/秒。
  • deepseek-v4-flash 在预期的 12 个样本中报告了 0 个(覆盖率为 0%),因此其在该窗口期的吞吐量完全未知;整体数据集覆盖率为 87.5%,共有 84 个有效数据点。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • glm-5.3 的平均吞吐量最高,达 114.62 词元/秒,略微领先于 gemma4:31b 的 112.21 词元/秒,而 nemotron-3-ultra 表现最弱,平均为 30.29 词元/秒,最低值为 1.91 词元/秒。
  • glm-5.3 的波动也最大,在 66.52 至 183.72 词元/秒之间波动(变异系数 42.3%),glm-5.2 在整个时间窗口内下降了 34.1%,最终为 24.53 词元/秒;nemotron-3-ultra 在 02:40 降至 1.91 词元/秒。
  • deepseek-v4-flash 在预期的 12 个样本中报告了 0 个(覆盖率 0.0%),因此其吞吐量未知;整体覆盖率为 87.5%(96 个数据点中的 84 个),这限制了跨整个时间窗口的比较。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • glm-5.3 的平均吞吐量最高,达 115.21 词元/秒,领先于 gemma4:31b(111.87 词元/秒)和 glm-5.3-flash(110.96 词元/秒);nemotron-3-ultra 最弱,平均为 31.65 词元/秒,最低降至 1.91 词元/秒。
  • glm-5.3-flash 跌幅最大,从 00:20 的 201.63 词元/秒峰值到 03:00 的 71.44 词元/秒,趋势为 -30.4%;而 gemma4:31b 上涨 42.4%,尽管变异系数为 41.7%;deepseek-v4-pro 最为稳定,平均 109.31 词元/秒,变异系数为 8.8%。
  • deepseek-v4-flash 在预期的 12 个样本中报告了 0 个,导致 96 个预期数据点中仅剩 84 个(覆盖率 87.5%),因此其吞吐量在整个时间窗口内未知。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • gemma4:31b 的平均吞吐量最高,达到 116.59 词元/秒,峰值达 192.34 词元/秒,以微弱优势领先于 glm-5.3-flash 的 116.00 词元/秒;nemotron-3-ultra 表现最弱,平均仅为 33.27 词元/秒,在 UTC 00:00 时一度低至 4.57 词元/秒。
  • glm-5.3 和 glm-5.3-flash 表现出对运营影响最大的波动性,变异系数分别为 44.7% 和 43.7%,在二十分钟的时间间隔内分别在约 65 至 184 词元/秒和 62 至 202 词元/秒之间波动。
  • deepseek-v4-flash 在其预期的 12 个采样中报告了零个(0% 覆盖率),使得 96 个预期数据点中仅有 84 个有效(总体覆盖率为 87.5%),因此无法评估其在该时间窗口内的吞吐量。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • glm-5.3-flash 是最强的模型,平均吞吐量为 114.38 词元/秒,峰值达 201.63 词元/秒,而 nemotron-3-ultra 最弱,平均为 33.73 词元/秒,最低降至 4.57 词元/秒。
  • glm-5.3 的波动性对运营影响最大,在约 65 至 184 词元/秒之间波动,变异系数为 46.5%;gemma4:31b 在整个时间窗口内下降了 20.2%,最终为 41.79 词元/秒,而其平均值为 104.01 词元/秒。
  • deepseek-v4-flash 未返回任何样本(预期 12 个中返回 0 个,覆盖率为 0%),使整体覆盖率停留在 87.5%(96 个有效数据点中的 84 个),因此无法评估其在该期间的吞吐量。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • glm-5.3 的平均吞吐量最高,达 112.03 词元/秒(峰值 181.05 词元/秒),而 nemotron-3-ultra 最弱,平均仅 30.94 词元/秒,最低降至 3.22 词元/秒。
  • 运营层面最显著的变化是 gemma4:31b 的上升趋势达 94.1%,从 19:20 的 29.98 词元/秒攀升至 22:40 的 161.38 词元/秒峰值,不过到 23:00 又回落至 66.53 词元/秒;glm-5.3 也在 64.28 至 181.05 词元/秒之间剧烈波动(标准差 46.84,变异系数 41.8%)。
  • deepseek-v4-flash 报告的样本数为零(预期 12 个中为 0 个,覆盖率 0.0%),因此其吞吐量在本时间窗口内未测得;整体数据集覆盖率为 87.5%,共 84 个有效数据点,这限制了对该模型的任何结论。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • glm-5.3 是最强模型,平均吞吐量为 113.05 词元/秒,而 nemotron-3-ultra 最弱,平均为 27.33 词元/秒,约为领先者速度的四分之一。
  • glm-5.2 呈现出最具运营意义的下滑,趋势为 -51.0%,从 18:20 的 87.92 词元/秒降至 22:00 的 70.42 词元/秒,其中包括在 20:20 降至 5.53 词元/秒,以及从 20:20 到 21:40 连续五个时间段的读数低于 36 词元/秒。
  • deepseek-v4-flash 未报告任何样本(预期 12 个中为 0 个,覆盖率 0.0%),因此其吞吐量未知;整体覆盖率为 87.5%,共有 84 个有效数据点。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • glm-5.3 是最强模型,平均吞吐量为 119.52 词元/秒,而 nemotron-3-ultra 最弱,平均为 26.72 词元/秒,在 20:20 低至 3.22 词元/秒。
  • glm-5.2 的波动性最高,变异系数为 50.1%,在 20:20 降至 5.53 词元/秒,而 deepseek-v4-flash 呈上升趋势,上升了 43.2%,并在 20:00 飙升至 182.29 词元/秒。
  • deepseek-v4-flash 在全部 12 个预期观测中报告的样本数为零,导致其吞吐量无法测量,整体覆盖率降至 87.5%,仅有 84 个有效数据点。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • glm-5.3 的平均吞吐量最高,达 111.39 词元/秒(19:40 时峰值为 181.05 词元/秒),而 nemotron-3-ultra 表现最弱,平均仅 30.88 词元/秒,峰值仅为 56.94 词元/秒。
  • 波动最剧烈的是 glm-5.3-flash,其吞吐量从 19:00 的 16.24 词元/秒波动至 20:00 的 182.29 词元/秒;minimax-m3 在整个时间窗口内也呈 21.1% 的下降趋势,尽管其在 18:00 达到了 145.78 词元/秒的峰值。
  • deepseek-v4-flash 在预期的 12 个样本中报告为零(覆盖率为 0%),使整体覆盖率降至 87.5%,仅有 84 个有效数据点,因此该时段其吞吐量未知。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • glm-5.3 的平均吞吐量最强,达到 97.26 词元/秒(18:00 时峰值为 165.61 词元/秒),而 nemotron-3-ultra 最弱,平均仅为 29.01 词元/秒,从未超过 56.94 词元/秒。
  • 波动性是主要的运行信号:deepseek-v4-pro 在 17.11 至 115.76 词元/秒之间波动(变异系数 46.8%),glm-5.3 则呈现最陡峭的趋势,增幅达 +40.6%,从窗口期初期的约 70 词元/秒攀升至 18:00 的 165.61 词元/秒,随后回落稳定在 115.84 词元/秒。
  • deepseek-v4-flash 在预期的 12 个样本中报告了零个样本(覆盖率 0%),因此其吞吐量未知;整体覆盖率为 87.5%(预期 96 个数据点中的 84 个),这限制了对整个集群性能的结论。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • minimax-m3 以 100.32 词元/秒的平均吞吐量领先(12 个样本中的 12 个),略高于 glm-5.3 的 96.05 词元/秒和 gemma4:31b 的 95.18 词元/秒;nemotron-3-ultra 最弱,为 34.67 词元/秒,低于 glm-5.2 的 48.55 词元/秒。
  • glm-5.3 呈现最强劲的上升趋势,达 +29.0%,在 18:00 收于 165.61 词元/秒,而 deepseek-v4-pro 下跌 -24.9%,至期间最低的 17.11 词元/秒;deepseek-v4-pro 的波动性也最高,变异系数为 41.2%。
  • deepseek-v4-flash 报告的 12 个样本中有效样本为 0(覆盖率 0%),使整体覆盖率降至 87.5%(84 个有效数据点),因此其吞吐量未知,排名中不包含该模型。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • 平均吞吐量最强的是 gemma4:31b,达 96.61 词元/秒;最弱的是 nemotron-3-ultra,为 39.56 词元/秒,且其波动范围也很大,从 5.64 到 91.22 词元/秒。
  • 运行态势变化最剧烈的是 glm-5.3-flash,从 13:20 的 192.62 词元/秒峰值下降 38.0%,至 17:00 的 61.47 词元/秒;而 minimax-m3 提升了 24.6%,达到 110.38 词元/秒;nemotron-3-ultra 是波动最大的模型,变异系数为 57.5%。
  • deepseek-v4-flash 在预期的 12 个样本中返回了 0 个(覆盖率 0%),使整体覆盖率降至 87.5%,仅有 84 个有效数据点,因此该时间窗口内其吞吐量未知。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • gemma4:31b 的平均吞吐量最高,达 111.26 词元/秒,而 nemotron-3-ultra 最弱,为 43.39 词元/秒;glm-5.2 的平均值也较低,为 50.81 词元/秒。
  • 运行波动最剧烈的是 glm-5.3-flash,在观测时段内下降 53.7%,从 192.62 词元/秒的峰值跌至最后一小时的约 56.83–80.49 词元/秒;nemotron-3-ultra 下降 41.0%,并在 14:00 触及 5.64 词元/秒的低点。glm-5.3 保持平稳,为 +0.7%。
  • deepseek-v4-flash 在预期的 12 个样本中报告为零(0% 覆盖率),导致 96 个预期数据点中仅 84 个有效(87.5% 覆盖率),无法对该模型进行任何吞吐量评估。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • gemma4:31b 的平均吞吐量最高,为 113.88 词元/秒,而 nemotron-3-ultra 最弱,为 50.12 词元/秒;deepseek-v4-flash 因未报告任何样本而无法排名。
  • 最显著的变动是 minimax-m3 在该时间窗口内下降了 36.5%,从 12:20 的 208.7 词元/秒峰值跌至 15:00 的 85.39 词元/秒;glm-5.2 也在 26.12 至 132.35 词元/秒之间大幅波动,变异系数为 56.5%。
  • deepseek-v4-flash 在预期的 12 个样本中返回了 0 个(覆盖率为 0%),使整体数据集覆盖率降至 87.5%,仅有 84 个有效数据点,因此车队级比较完全排除了该模型。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • minimax-m3 是最强模型,平均吞吐量为 112.84 词元/秒,略胜 gemma4:31b(111.79 词元/秒)和 glm-5.3(110.17 词元/秒);glm-5.2 最弱,平均为 48.84 词元/秒,低于 nemotron-3-ultra 的 51.11 词元/秒。
  • glm-5.3-flash 的波动最为剧烈,呈 138.1% 的上升趋势,从 12:00 的 46.99 词元/秒摆动至 13:20 的 192.62 词元/秒,而 glm-5.3 下跌了 39.3%,glm-5.2 的波动性最高,变异系数达 62.0%。
  • deepseek-v4-flash 未返回任何样本(预期 12 个中返回 0 个,覆盖率 0.0%),因此其吞吐量未知;整体覆盖率为 87.5%,即预期 96 个数据点中有 84 个,这限制了全集群范围的结论。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • 平均吞吐量最强的是 gemma4:31b,达 121.0 词元/秒(峰值 177.4 词元/秒),而 glm-5.2 最弱,平均仅 48.89 词元/秒,从未超过 78.38 词元/秒。
  • 波动性是主要的运行信号:glm-5.3-flash 在 46.99 至 187.11 词元/秒之间波动(变异系数 49.0%),minimax-m3 的范围为 29.23 至 208.7 词元/秒(变异系数 44.0%),这使得针对这些模型的容量规划不可靠。
  • deepseek-v4-flash 在预期的 12 个样本中报告为零(覆盖率 0.0%),因此其吞吐量未知;整体数据集覆盖率为 87.5%,共 84 个有效数据点,这限制了对整个集群行为的结论。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • glm-5.3 是平均吞吐量最强的模型,达到 134.6 词元/秒(p95 为 183.96 词元/秒),而 glm-5.2 最弱,平均仅为 48.91 词元/秒,在整个时间窗口内从未超过 78.38 词元/秒。
  • 运营层面最显著的波动来自 glm-5.3-flash,其在时间窗口内下降了 44.5%,从 08:20 的 186.42 词元/秒跌至 12:00 的 46.99 词元/秒,且在所有模型中变异性最高(变异系数 51.7%,标准差 44.41 词元/秒)。minimax-m3 也在 29.23 至 210.64 词元/秒之间大幅波动。
  • deepseek-v4-flash 在预期的 12 个样本中报告为零(覆盖率 0%),使整体数据集覆盖率降至 87.5%(预期 96 个数据点中的 84 个),因此无法评估其在该时段的吞吐量。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • glm-5.3 是最强模型,平均吞吐量为 140.71 词元/秒(p95 为 183.96 词元/秒);nemotron-3-ultra 最弱,平均为 49.21 词元/秒,最低值为 3.6 词元/秒。
  • 运营层面最显著的变化是 nemotron-3-ultra 的 110.4% 上升趋势,从 08:00 的 3.6 词元/秒升至 09:20 的 93.09 词元/秒峰值;glm-5.3-flash 的波动性最高,变异系数为 54.1%。
  • deepseek-v4-flash 在预期的 12 个采样区间中返回了零个样本(覆盖率为 0%),使整体覆盖率降至 87.5%(96 个有效点中的 84 个),因此本周期无法评估其吞吐量。
4 小时窗口 · 87 个数据点 · 覆盖率 90.6%
  • glm-5.3 是平均吞吐量最强的模型,达 117.29 词元/秒,而 nemotron-3-ultra 最弱,为 52.75 词元/秒;glm-5.3-flash 和 gemma4:31b 分别以 109.80 和 103.04 词元/秒紧随其后。
  • 运营层面最显著的变化是 nemotron-3-ultra 从 08:00 的 3.6 词元/秒恢复至 10:00 的 90.25 词元/秒,趋势增幅达 86.0%,且其变异系数为整个数据集中最高,达 55.4%;minimax-m3 在其最新样本中也急剧下降至 29.23 词元/秒。
  • deepseek-v4-flash 在预期的 12 个样本中仅有 3 个(25.0% 的覆盖率),因此其 98.14 词元/秒的平均值不可靠;整体覆盖率为 90.6%,共有 87 个有效数据点。
4 小时窗口 · 90 个数据点 · 覆盖率 93.8%
  • 平均吞吐量最强的是 glm-5.3,达 115.06 词元/秒,略胜 minimax-m3 的 108.52 词元/秒,而 nemotron-3-ultra 最弱,仅为 38.64 词元/秒,低于 glm-5.2(53.74)和 deepseek-v4-pro(53.97 词元/秒)。
  • 变动最显著的是 glm-5.3 上升了 95.2%,从 06:00 的 23.09 词元/秒低点升至 08:20 的 183.08 词元/秒,并在 09:00 保持 143.17 词元/秒;nemotron-3-ultra 下跌 30.4%,波动性最高(变异系数 62.5%),最低值为 3.6 词元/秒。
  • deepseek-v4-flash 仅报告了预期 12 个样本中的 6 个(覆盖率 50.0%),07:00 之后无任何观测数据,因此其 75.33 词元/秒的平均值不可靠;整体覆盖率为 93.8%(90 个有效数据点)。
4 小时窗口 · 93 个数据点 · 覆盖率 96.9%
  • glm-5.3 的平均吞吐量最高,达 116.43 词元/秒,而 nemotron-3-ultra 最弱,为 44.78 词元/秒;gemma4:31b 和 minimax-m3 分别以 102.93 和 99.03 词元/秒紧随其后。
  • glm-5.3 的运行波动最为剧烈:在 05:20 之前接近 171-176 词元/秒,06:00 骤降至 23.09 词元/秒,随后在 08:00 恢复至 176.17 词元/秒;nemotron-3-ultra 的范围为 3.6 至 95.15 词元/秒,CV 为 72.1%。
  • deepseek-v4-flash 仅有 12 个样本中的 9 个(75% 覆盖率),且 07:00 之后无观测数据,因此其 65.3 词元/秒的平均值可能无法代表整个时间窗口;整个数据集的有效数据点总计为 96 个中的 93 个。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • gemma4:31b 是平均吞吐量最强的模型,达 116.26 词元/秒,领先于 109.32 词元/秒的 glm-5.3;nemotron-3-ultra 最弱,为 52.70 词元/秒,低于 63.88 词元/秒的 deepseek-v4-flash。
  • 最显著的事件是 05:40 UTC 之后出现的大范围吞吐量骤降:glm-5.3 从 05:20 的 171.75 词元/秒跌至 06:00 的 23.09 词元/秒,deepseek-v4-pro 最终收于 6.35 词元/秒,而 glm-5.2 波动性最高,变异系数为 75.7%。
  • 不存在数据缺失的限制:全部 96 个预期数据点均有效,覆盖率为 100.0%,且八个模型中的每一个都有 12 个样本中的 12 个。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • gemma4:31b 是表现最强的模型,平均吞吐量为 129.46 词元/秒,峰值达 163.86 词元/秒;nemotron-3-ultra 最弱,平均为 42.74 词元/秒,波动范围在 9.95 至 95.15 词元/秒之间。
  • glm-5.2 波动性最高(变异系数 75.4%,标准差 45.09 词元/秒),从 04:00 的 202.82 词元/秒骤降至 06:00 的 24.84 词元/秒;大多数模型在 06:00 也出现大幅下滑,例如 glm-5.3 降至 23.09 词元/秒。
  • 无缺失数据限制:全部八个模型均有 12 个样本中的 12 个,共 96 个有效数据点,在四小时时间窗口内覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • glm-5.3 的平均吞吐量最高,达 129.42 词元/秒(峰值 184.08 词元/秒),略微领先于 gemma4:31b 的 127.19 词元/秒,而 nemotron-3-ultra 最弱,平均仅 42.12 词元/秒,尽管在最后一个采样点回升至 95.15 词元/秒。
  • deepseek-v4-flash 表现出对运行影响最为显著的波动,从 01:20 的 118.77 词元/秒降至 05:00 的 35.99 词元/秒(趋势 -47.4%,变异系数 48.6%);glm-5.2 也从 04:00 的 202.82 词元/秒峰值骤降至 05:00 的 32.18 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均有 12 个采样中的 12 个样本,共 96 个有效数据点,在四小时窗口内覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • gemma4:31b 是平均吞吐量最强的模型,达到 128.71 词元/秒(范围 64.11–163.86 词元/秒),而 nemotron-3-ultra 最弱,仅为 39.22 词元/秒,最低降至 9.95 词元/秒。
  • glm-5.2 表现出对运营影响最大的波动性:其变异系数为 74.4%,且其最终观测值从 32.85 跃升至 202.82 词元/秒,这一单样本峰值远高于其 62.0 词元/秒的平均值。
  • 不存在数据缺失的限制:全部八个模型均记录了 12 个预期样本中的 12 个,总体覆盖率为 100.0%,共 96 个有效数据点,因此四小时的时间窗口得到了完整呈现。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • 平均吞吐量最高的是 gemma4:31b,达 124.22 词元/秒(峰值 162.63 词元/秒);最低的是 nemotron-3-ultra,为 37.68 词元/秒,下限为 9.95 词元/秒,约为领先者平均值的三分之一。
  • 运营层面最显著的模式是 02:00 UTC 出现同步下滑,gemma4:31b 降至 64.11 词元/秒,deepseek-v4-flash 降至 41.75 词元/秒;glm-5.3 是波动最大的模型(变异系数 51.9%),波动范围在 18.34 至 178.32 词元/秒之间,而 nemotron-3-ultra 呈下行趋势,下降 52.1% 至 35.33 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均交付了 12 个预期样本中的 12 个,产生 96 个有效数据点,覆盖率达 100.0%,因此每一项百分比和平均值均基于完整数据。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • gemma4:31b 是平均吞吐量最强的模型,达 124.05 词元/秒(峰值 154.25 词元/秒),而 nemotron-3-ultra 最弱,为 41.48 词元/秒,约为领先者平均值的三分之一。
  • glm-5.2 表现出对运行影响最显著的波动性,变异系数为 59.7%,趋势为 -43.7%,在 150.11 与 29.51 词元/秒之间摆动;glm-5.3 同样不稳定,变异系数为 55.4%,在 00:20 时降至 18.34 词元/秒。
  • 本时间窗口内不存在数据缺失的限制:全部 8 个模型均报告了 12 个预期样本中的 12 个,共 96 个有效数据点,在四小时期间内覆盖率达到 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • gemma4:31b 是最强的模型,平均吞吐量为 120.22 词元/秒,而 nemotron-3-ultra 最弱,平均为 43.48 词元/秒;deepseek-v4-flash 位居第二,为 90.26 词元/秒。
  • glm-5.3 波动最为剧烈:它在 23:00 从 68.34 词元/秒跃升至 23:40 的 178.32 词元/秒,随后在 00:20 跌至 18.34 词元/秒,而 glm-5.2 的变异系数最高,达 70.0%。
  • 不存在数据缺失的限制:所有八个模型均拥有 12 个预期样本中的 12 个,valid_point_count 为 96,覆盖率为 100.0%,因此四小时的时间窗口被完全覆盖。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • gemma4:31b 是表现最强的模型,平均吞吐量为 119.74 词元/秒,而 nemotron-3-ultra 表现最弱,平均为 47.76 词元/秒,在 23:00 UTC 时低至 7.27 词元/秒。
  • glm-5.2 呈现最具运营意义的波动性:变异系数为 69.6%,从 21:40 的 15.29 词元/秒摆动至 22:40 的 150.11 词元/秒,并以 148.55 词元/秒收尾,趋势为 133.5%;nemotron-3-ultra 也下降了 35.8%,至 17.92 词元/秒。
  • 不存在缺失数据的限制:全部八个模型均报告 12 个样本中的 12 个,共 96 个有效数据点,在四小时时间窗口内覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • 四小时窗口期内平均吞吐量最强:gemma4:31b 达 110.39 词元/秒;最弱:glm-5.2 为 50.76 词元/秒,nemotron-3-ultra 紧随其后,为 53.16 词元/秒。
  • glm-5.2 呈现最急剧的下降趋势,在 22:00 时降至 -42.0%,为 26.15 词元/秒;而 nemotron-3-ultra 波动最大(变异系数 64.2%,范围 11.58–113.27 词元/秒);glm-5.3-flash 和 deepseek-v4-flash 分别提升了 22.1% 和 24.7%。
  • 不存在数据缺失的限制:全部 8 个模型均交付了 12 个预期样本中的 12 个,共获得 96 个有效数据点,覆盖率达 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • 平均吞吐量最高的是 gemma4:31b,达 114.01 词元/秒(p95 为 157.09 词元/秒);最低的是 nemotron-3-ultra,为 59.26 词元/秒,波动范围在 11.58 至 113.27 词元/秒之间。
  • 最显著的趋势是 glm-5.3 在观测后期的加速:整体提升 49.7%,平均达 97.52 词元/秒,在 19:00 UTC 之后持续保持在 125.67 至 142.75 词元/秒之间,而 glm-5.2 则下降 10.4%,平均为 64.58 词元/秒。波动性依然较高,nemotron-3-ultra 的变异系数达 56.0%,minimax-m3 在 25.96 至 153.01 词元/秒之间大幅波动。
  • 不存在数据缺失的限制:全部八个模型均报告了 12 个预期样本中的 12 个,共计 96 个有效数据点,覆盖率达 100.0%,因此没有任何数值受到数据缺口的影响。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • 平均吞吐量最强的是 gemma4:31b,在 12 个样本中达到 116.76 词元/秒(范围 55.05 至 168.89 词元/秒);最弱的是 nemotron-3-ultra,为 46.08 词元/秒(范围 17.66 至 88.83 词元/秒)。
  • 运营层面最显著的波动性来自 nemotron-3-ultra,其变异系数为 55.4%,低点在 17.66 至 25.88 词元/秒之间摆动,高点在 71.82 至 88.83 词元/秒之间摆动;deepseek-v4-flash 同样从 33.63 摆动至 120.71 词元/秒,波动幅度为 48.4%,趋势为 49.0%。
  • 不存在数据缺失的限制:全部 8 个模型均报告了 12 个预期样本中的 12 个,产生 96 个有效数据点,在四小时时间窗口内覆盖率达到 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • 平均吞吐量最高的是 gemma4:31b,达 116.44 词元/秒;最低的是 nemotron-3-ultra,为 36.77 词元/秒,约为领先者速率的三分之一。
  • glm-5.3 的下滑最为急剧,从 14:40 的 175.58 词元/秒峰值降至 18:00 的 63.62 词元/秒,趋势为 -56.9%;而 nemotron-3-ultra 波动最大,变异系数为 69.8%,波动范围为 6.98 至 88.83 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均交付了 12 个预期样本中的 12 个,在四小时的时间窗口内共有 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • 平均吞吐量最高的是 gemma4:31b,达 116.38 词元/秒;最低的是 nemotron-3-ultra,为 24.96 词元/秒,glm-5.2 也接近垫底,为 43.39 词元/秒。
  • glm-5.3 的恶化最为急剧,从 13:20 的 139.25 词元/秒降至 17:00 的 59.15 词元/秒,趋势为 -45.1%,其中包括 16:20 的低点 13.27 词元/秒;minimax-m3 波动最大,CV 为 45.2%,在 179.88 和 50.72 词元/秒之间摆动。
  • 不存在缺失数据的限制:全部 8 个模型均有 12 个样本中的 12 个,共 96 个有效数据点,在四小时窗口内覆盖率达到 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强的模型,平均吞吐量为 127.76 词元/秒,领先于 112.19 词元/秒的 gemma4:31b,而 nemotron-3-ultra 最弱,平均为 18.81 词元/秒,且从未超过 36.15 词元/秒。
  • deepseek-v4-flash 呈现最急剧的性能恶化,从 12:40 的 129.22 词元/秒峰值下降 49.6% 至 16:00 的 45.26 词元/秒;glm-5.2 波动性最大,变异系数为 60.5%,在 13.06 至 92.01 词元/秒之间波动。
  • 不存在数据缺失的限制:全部八个模型均有 12 个样本中的 12 个,数据集记录了 96 个有效数据点,在四小时窗口内覆盖率达到 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强的模型,平均吞吐量为 128.58 词元/秒(p95 为 176.25 词元/秒),而 nemotron-3-ultra 最弱,平均仅为 14.35 词元/秒,从未超过 30.07 词元/秒。
  • 运营层面最显著的波动是 deepseek-v4-pro 在 12:00 降至 7.08 词元/秒、在 14:00 降至 8.45 词元/秒,尽管其最高值达到 83.08 词元/秒;glm-5.2 的相对波动性最高,CV 为 51.1%,而 deepseek-v4-flash 在该时间窗口内下降了 28.6%。
  • 不存在数据缺失的限制:全部 8 个模型均记录了 12 个样本中的 12 个,在四小时窗口内共有 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强模型,平均吞吐量为 111.45 词元/秒,在 14:00 达到峰值 177.07 词元/秒;nemotron-3-ultra 最弱,平均为 16.02 词元/秒,从未超过 30.07 词元/秒。
  • deepseek-v4-pro 表现出对运营影响最大的波动性,在 12:00 降至 7.08 词元/秒,在 14:00 降至 8.45 词元/秒,而其最大值为 85.3 词元/秒;minimax-m3 也从早期的大约 72 词元/秒波动至 13:20 的 179.88 词元/秒,趋势变化为 35.0%。
  • 不存在数据缺失的限制:全部八个模型均交付了 12 个预期样本中的 12 个,覆盖率为 100.0%,且 96 个有效数据点与四小时时间窗口内的完全覆盖相吻合。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • glm-5.3 的平均吞吐量最高,达 95.49 词元/秒,略微领先于 gemma4:31b 的 95.02 词元/秒,而 nemotron-3-ultra 表现最弱,仅为 14.29 词元/秒,约为领先者速度的七分之一。
  • glm-5.3 的运行波动最为剧烈,范围从 41.73 到 151.27 词元/秒,变异系数为 40.7%,其中包括在 12:40 降至 41.73 词元/秒,随后恢复至 134.02 词元/秒;deepseek-v4-pro 也在 12:00 骤降至 7.08 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均记录了 12 个样本中的 12 个,在四小时的时间窗口内共有 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • 平均吞吐量最强的是 gemma4:31b,达 103.49 词元/秒(峰值 157.36 词元/秒),而 nemotron-3-ultra 最弱,仅 14.29 词元/秒,且从未超过 30.49 词元/秒。
  • 运营层面最重大的事件是 deepseek-v4-pro 从 11:40 的 83.08 词元/秒骤降至 12:00 的 7.08 词元/秒(其区间最低值);glm-5.3-flash 也从 09:20 的 195.03 词元/秒峰值回落至 11:20 的 55.53 词元/秒,趋势为 -35.9%。
  • 不存在缺失数据:全部 8 个模型均报告 12 个样本中的 12 个,共 96 个有效数据点,覆盖率为 100.0%;其局限在于结果仅覆盖这一以 20 分钟为间隔的四小时时间窗口。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • gemma4:31b 是表现最强的模型,平均吞吐量为 103.2 词元/秒,领先于 98.13 词元/秒的 glm-5.3-flash 和 91.05 词元/秒的 glm-5.3;nemotron-3-ultra 表现最弱,平均仅 14.08 词元/秒,约为 gemma4:31b 的七分之一。
  • glm-5.3-flash 的波动幅度最大(变异系数 46.6%),在 52.25 至 195.03 词元/秒之间波动,而 glm-5.3 从 08:40 的 153.55 词元/秒峰值降至 10:40 的 59.16 词元/秒,随后在 11:00 回升至 141.31 词元/秒;gemma4:31b 也在 09:20 骤降至 36.33 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均有 12 个样本中的 12 个,共 96 个有效数据点,在四小时时间窗口内覆盖率达到 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • gemma4:31b 是性能最强的模型,平均吞吐量为 104.29 词元/秒,峰值达 155.77 词元/秒,而 nemotron-3-ultra 性能最弱,平均仅 15.93 词元/秒,且从未超过 38.0 词元/秒。
  • glm-5.3-flash 的波动性最为剧烈,从 07:40 的 52.25 词元/秒飙升至 09:20 的 195.03 词元/秒,又在 10:00 前回落至 65.19 词元/秒,变异系数为 48.3%;nemotron-3-ultra 在该时间窗口内也下降了 28.3%。
  • 不存在数据缺失的限制:全部八个模型均有 12 个样本中的 12 个,覆盖率达 100.0%,共有 96 个有效数据点,因此主要限制在于四小时的时间窗口本身。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • gemma4:31b 是最强的模型,平均吞吐量为 120.45 词元/秒,领先于 97.45 词元/秒的 glm-5.3;nemotron-3-ultra 最弱,平均仅为 20.18 词元/秒,最大值也仅有 38.0 词元/秒。
  • glm-5.3 的波动性最高(变异系数 50.5%),在 16.28 至 183.18 词元/秒之间大幅波动,而 deepseek-v4-flash 录得最陡峭的上升趋势,达 +67.4%,最终为 88.56 词元/秒;nemotron-3-ultra 下跌 42.0%,至 5.95 词元/秒。
  • 不存在缺失数据的限制:全部八个模型均交付了 12 个预期样本中的 12 个,在四小时的时间窗口内共计 96 个有效数据点,覆盖率达 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • 平均吞吐量最强的是 gemma4:31b,达 119.61 词元/秒(峰值 162.1 词元/秒);最弱的是 nemotron-3-ultra,为 21.46 词元/秒(峰值 38.0 词元/秒)。
  • glm-5.3 是波动最大的模型,变异系数为 51.3%,波动范围从 16.28 到 183.18 词元/秒;deepseek-v4-flash 同样不稳定,变异系数为 51.4%,范围在 24.81 到 128.82 词元/秒之间。
  • 不存在数据缺失的限制:全部八个模型均交付了 12 个预期样本中的 12 个,在四小时的时间窗口内提供了 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • gemma4:31b 是最强的模型,平均吞吐量为 122.49 词元/秒,领先于 102.07 词元/秒的 glm-5.3;nemotron-3-ultra 最弱,平均为 27.83 词元/秒,从未超过 55.94 词元/秒。
  • deepseek-v4-flash 呈现最陡峭的下降趋势,趋势为 -40.1%,deepseek-v4-pro 在 07:00 降至 11.76 词元/秒;glm-5.3 和 deepseek-v4-flash 并列最高波动性,变异系数为 51.9%。
  • 不存在数据缺失的限制:全部八个模型均有 12 个样本中的 12 个,valid_point_count 为 96,覆盖率为 100.0%。