← 返回性能仪表板

每小时性能洞察

滚动四小时性能数据摘要

已保留 1198 条摘要
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4-flash 是最强的模型,平均吞吐量为 114.27 词元/秒,领先于 deepseek-v4-pro(107.36 词元/秒)和 gemma4:31b(105.74 词元/秒);nemotron-3-ultra 最弱,平均为 2.67 词元/秒,从未超过 3.94 词元/秒。
  • 运营层面最显著的变化是 minimax-m3 在整个时间窗口内下降了 38.6%,从 00:40 的 120.57 词元/秒峰值降至 04:00 的 37.39 词元/秒;deepseek-v4-flash 也在 43.15 至 192.88 词元/秒之间大幅波动。
  • 不存在数据缺失的限制:全部八个模型均报告了 12 个预期样本中的 12 个,在四小时的时间窗口内共计 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4-flash 是最强的模型,平均吞吐量为 116.95 词元/秒,峰值达 192.88 词元/秒,而 nemotron-3-ultra 最弱,平均仅 5.85 词元/秒,最大值仅为 21.97 词元/秒。
  • nemotron-3-ultra 表现出对运营影响最大的波动性,变异系数为 112.2%,趋势为 -66.9%,从 23:40 的 21.97 词元/秒下降至 03:00 的 3.22 词元/秒;minimax-m3 也下降了 36.8%,至 38.91 词元/秒,而 deepseek-v4-pro 提升了 25.5%,达到 108.65 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均有 12 个样本中的 12 个,在四小时的时间窗口内共有 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4-flash 是最强模型,平均吞吐量为 130.25 词元/秒,而 nemotron-3-ultra 最弱,平均为 8.59 词元/秒,大约比领先者慢 15 倍。
  • 运营层面最重大的变动是 nemotron-3-ultra 的崩溃:它在 23:40 UTC 达到 21.97 词元/秒的峰值,随后在 00:40 跌至 1.49 词元/秒,最终收于 1.9 词元/秒,在整个时间窗口内下降了 82.5%。glm-5.3-flash 也下降了 40.9%,从 167.64 词元/秒的高点降至 59.61 词元/秒。
  • 不存在数据缺失的限制:全部八个模型都有 12 个预期样本中的 12 个,共 96 个有效数据点,在四个小时期间内覆盖率达到 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4-flash 是最强的模型,平均吞吐量为 142.85 词元/秒(范围在 96.27 至 192.88 词元/秒之间),而 nemotron-3-ultra 最弱,平均为 9.08 词元/秒,峰值仅为 21.97 词元/秒。
  • glm-5.3-flash 降幅最为明显,从 21:20 的 168.28 词元/秒下降至 01:00 的 49.37 词元/秒,降幅达 36.6%,其中包括 00:40 的 22.34 词元/秒低点;glm-5.3 也在 65.45 至 203.52 词元/秒之间波动。
  • 无缺失数据限制:全部 8 个模型均报告了 12 个样本中的 12 个,在四小时窗口内共有 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4-flash 是平均吞吐量最高的模型,达到 135.74 词元/秒(范围 101.32–192.84 词元/秒),而 nemotron-3-ultra 最弱,平均仅为 9.47 词元/秒,峰值也仅有 21.97 词元/秒。
  • 运营层面最显著的波动来自 glm-5.3,其在整个时间窗口内大约在 65 至 200 词元/秒之间波动(变异系数 45.0%),包括在 20:20 降至 63.95 词元/秒,以及在 00:00 飙升至 203.52 词元/秒;deepseek-v4-pro 也在 23:40 一度跌至 20.24 词元/秒,随后回升至 117.54 词元/秒。
  • 不存在数据缺失的限制:全部 96 个预期数据点均有效(覆盖率 100.0%),且每个模型都有 12 个样本中的全部 12 个。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4-flash 是最强的模型,平均吞吐量为 125.65 词元/秒(范围 100.1–158.48 词元/秒),而 nemotron-3-ultra 是最弱的模型,平均为 3.52 词元/秒,从未超过 7.77 词元/秒。
  • glm-5.3 的变化最为显著,从窗口初期的大约 63 词元/秒上升到 22:00 的 174.08 词元/秒,涨幅达 89.8%,不过它也是波动最大的模型,变异系数为 47.1%;gemma4:31b 下降了 23.2%,在 21:20 降至 35.64 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均报告了 12 个预期样本中的 12 个,在四小时窗口内共计 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • gemma4:31b 是平均吞吐量最强的模型,达到 118.59 词元/秒,只有在采用最新数值的情况下才领先于达到 128.04 词元/秒的 deepseek-v4-flash,而 nemotron-3-ultra 是最弱的模型,平均仅为 2.82 词元/秒,峰值也仅有 5.89 词元/秒。
  • glm-5.3 表现出对运营影响最显著的波动性,变异系数为 50.2%,波动范围从 54.02 到 199.8 词元/秒,其中包括在 17:20 至 17:40 之间从 199.8 降至 77.83 词元/秒;minimax-m3 也在 20:20 一度跌至 22.02 词元/秒。
  • 该时间窗口内不存在数据缺失的限制:全部 8 个模型均报告了 12 个预期样本中的 12 个,valid_point_count 为 96,覆盖率为 100.0%,因此从 17:20 到 21:00 UTC 的每二十分钟观测值均完整存在。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4-flash 是最强模型,平均吞吐量为 124.27 词元/秒,峰值达 158.48 词元/秒;nemotron-3-ultra 最弱,平均为 2.36 词元/秒,从未超过 4.07 词元/秒。
  • glm-5.3 表现出对运营影响最大的波动性:17:20 UTC 飙升至 199.8 词元/秒,随后在 18:00 降至 54.02 词元/秒,变异系数为 46.5%,窗口期内趋势为 -28.6%。
  • 不存在缺失数据的限制:全部八个模型均有 12 个样本中的 12 个,valid_point_count 为 96,覆盖率为 100.0%,因此四小时窗口期得到完整呈现。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4-flash 是最强的模型,平均吞吐量为 120.47 词元/秒(范围 84.72–153.83 词元/秒),领先于 111.06 词元/秒的 gemma4:31b;nemotron-3-ultra 最弱,平均仅 2.46 词元/秒,从未超过 4.86 词元/秒。
  • glm-5.3 下降最为急剧,从 15:20 至 16:00 期间的大约 142–146 词元/秒降至 18:00 之后的 54.02–63.57 词元/秒,趋势为 -25.4%;minimax-m3 波动最大,在 16:00 飙升至 147.75 词元/秒,而低点为 37.88 词元/秒,变异系数为 50.3%。
  • 不存在数据缺失的限制:全部八个模型均报告了预期 12 个样本中的 12 个,在四小时窗口内共计 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4-flash 是最强的模型,平均吞吐量为 114.1 词元/秒,略胜 glm-5.3 的 106.18 词元/秒,而 nemotron-3-ultra 最弱,平均仅 3.32 词元/秒,在任何一次观测中都从未超过 14.68 词元/秒。
  • 运营层面最显著的波动是 nemotron-3-ultra 高达 106.7% 的变异系数和 -57.6% 的趋势,此外 minimax-m3 在 16:00 出现单次 147.75 词元/秒的峰值,远高于其 54.05 词元/秒的平均值,这表明是不稳定的容量而非持续的性能退化。
  • 不存在数据缺失的限制:全部 8 个模型均报告了 12 个预期样本中的 12 个,在四小时的时间窗口内共有 96 个有效数据点和 100.0% 的覆盖率,因此每一个百分比和计数都得到数据集的完全支持。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强的模型,平均吞吐量为 102.8 词元/秒(12 个样本,范围 27.65–175.53 词元/秒),而 nemotron-3-ultra 最弱,平均仅 3.37 词元/秒,从未超过 14.68 词元/秒。
  • 波动最显著的是 nemotron-3-ultra,其变异系数为 104.7%,glm-5.2 降幅最陡,从 128.66 降至 19.46 词元/秒,下降 57.2%;deepseek-v4-flash 尽管在 14:20 一度跌至 14.58 词元/秒,仍提升了 40.7%。
  • 无缺失数据:全部 8 个模型均报告 12 个样本中的 12 个,共 96 个有效数据点,覆盖率为 100.0%;局限性在于观测窗口仅四小时,每个模型只有 12 次观测。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • 平均吞吐量最强的是 glm-5.3,达 112.91 词元/秒(p95 为 169.71 词元/秒,最大值 175.53 词元/秒);最弱的是 nemotron-3-ultra,平均 3.41 词元/秒,从未超过 14.68 词元/秒。
  • 运营层面最显著的波动是 minimax-m3 从 15:40 的 47.58 词元/秒跃升至 16:00 的 147.75 词元/秒,约为其 47.15 词元/秒平均值的三倍(变异系数 66.1%),而 glm-5.2 则从 13:40 的 155.03 词元/秒峰值降至 16:00 的 13.08 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均报告了 12 个样本中的 12 个,共计 96 个有效数据点,在四小时时间窗口内覆盖率达到 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • glm-5.3-flash 是最强的模型,平均吞吐量为 103.71 词元/秒,领先于 glm-5.3(99.83 词元/秒)和 gemma4:31b(90.9 词元/秒);nemotron-3-ultra 最弱,平均仅为 3.17 词元/秒,远低于其他所有模型。
  • glm-5.3 的波动性最大,变异系数为 49.2%,波动区间介于 27.65 至 175.53 词元/秒之间;deepseek-v4-flash 在 14:20 降至 14.58 词元/秒,随后在 14:40 恢复至 143.5 词元/秒,而 deepseek-v4-pro 整体下降了 30.9%。
  • 不存在数据缺失的限制:全部八个模型均拥有 12 个样本中的 12 个,在四小时的时间窗口内共有 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • glm-5.3-flash 是最强的模型,平均吞吐量为 108.32 词元/秒,领先于 103.96 词元/秒的 deepseek-v4-flash;nemotron-3-ultra 最弱,平均为 2.68 词元/秒,大约比领先者慢 40 倍。
  • glm-5.3 的波动性对运营影响最大,变异系数为 50.3%,波动范围从 27.65 到 175.53 词元/秒,其中包括在 UTC 14:00 降至最低值;deepseek-v4-flash 在该时段内下降了 19.3%,最终为 66.32 词元/秒。
  • 无缺失数据限制:全部八个模型均有 12 个样本中的 12 个,共 96 个有效数据点,在四小时时段内覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • glm-5.3-flash 是最强的模型,平均吞吐量为 115.86 词元/秒,领先于 deepseek-v4-flash(107.38 词元/秒);nemotron-3-ultra 最弱,平均仅 2.85 词元/秒,峰值也仅为 5.67 词元/秒。
  • glm-5.3 的波动性对运营影响最大,其吞吐量在 11.63 至 164.94 词元/秒之间波动,变异系数为 51.2%,趋势为 +56.0%;gemma4:31b 也在 62.08 至 157.65 词元/秒之间大幅波动。
  • 无缺失数据限制:全部 8 个模型均交付了 12 个预期样本中的 12 个,在四小时窗口内共有 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4-flash 是最强的模型,平均吞吐量为 113.83 词元/秒,略微领先于 glm-5.3-flash 的 112.87 词元/秒;nemotron-3-ultra 最弱,平均为 2.80 词元/秒,从未超过 5.67 词元/秒。
  • gemma4:31b 降幅最陡,从 08:20 的 118.54 词元/秒下降至 12:00 的 70.34 词元/秒,降幅达 34.8%;而 glm-5.3 波动最大,在 11.63 至 160.44 词元/秒之间摆动,变异系数为 45.9%。
  • 不存在缺失数据的限制:全部 8 个模型均记录了 12 个预期样本中的 12 个,在四小时窗口内共计 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • gemma4:31b 是平均吞吐量最强的模型,达到 113.25 词元/秒,略微领先于 deepseek-v4-flash 的 113.34 词元/秒……更正:deepseek-v4-flash 以 113.34 词元/秒领先,gemma4:31b 为 113.25 词元/秒;nemotron-3-ultra 最弱,平均为 2.68 词元/秒。
  • 波动性是主要的运行信号:minimax-m3 的相对变异性最高(变异系数 55.1%,波动范围在 14.4 至 93.2 词元/秒之间),而 glm-5.3 在该时间窗口内下降了 22.7%,从 157.48 词元/秒的峰值跌至最新采样时的 76.37 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均拥有 12 个预期样本中的 12 个,在四小时窗口内共有 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4-flash 是最强模型,平均吞吐量为 118.55 词元/秒,领先于 glm-5.3-flash(103.75 词元/秒)和 glm-5.3(101.23 词元/秒);nemotron-3-ultra 是最弱模型,平均仅 2.09 词元/秒,从未超过 4.07 词元/秒。
  • glm-5.3 的下降最为急剧,趋势为 -48.9%,从 06:40 的 174.45 词元/秒最大值降至 09:40 的 11.63 词元/秒,随后回升至 120.26 词元/秒;minimax-m3 是波动性最大的模型(变异系数 57.7%),波动范围在 14.4 至 93.2 词元/秒之间。
  • 不存在数据缺失的限制:全部八个模型均记录了 12 个样本中的 12 个,valid_point_count 为 96,覆盖率为 100.0%,因此每一项预期观测数据均完整存在。
4 小时窗口 · 88 个数据点 · 覆盖率 91.7%
  • glm-5.3-flash 是性能最强的模型,平均吞吐量为 133.32 词元/秒(峰值 157.71 词元/秒),而 nemotron-3-ultra 是性能最弱的模型,平均仅为 2.11 词元/秒,在整个时间窗口内从未超过 3.58 词元/秒。
  • 08:00 UTC 的观测数据显示一次同步下滑:glm-5.2 降至 12.31 词元/秒,minimax-m3 降至 14.4 词元/秒,glm-5.3-flash 降至 19.86 词元/秒。glm-5.3 整体也下降了 28.7%,从 06:40 的 174.45 词元/秒峰值滑落至 08:40 的 61.65 词元/秒。
  • 每个模型在预期的 12 个样本中均记录了 11 个(91.7% 的覆盖率,88 个有效数据点),因此每个序列都缺失一个观测值,这限制了对区间级比较的置信度。
4 小时窗口 · 88 个数据点 · 覆盖率 91.7%
  • 平均吞吐量最强的是 deepseek-v4-flash,达 128.76 词元/秒(峰值 157.71 词元/秒),以微弱优势领先于 128.45 词元/秒的 glm-5.3;最弱的是 nemotron-3-ultra,仅 2.77 词元/秒,从未超过 5.39 词元/秒。
  • 运营层面最显著的变化是 nemotron-3-ultra 下降了 44.4%,在 07:00 跌至 1.06 词元/秒,而 glm-5.2 从 04:40 的 10.4 词元/秒低点回升了 66.0%,在 07:00 达到 111.52 词元/秒;glm-5.3 也在 67.85 至 191.28 词元/秒之间波动。
  • 每个模型均记录了 12 个预期样本中的 11 个(覆盖率 91.7%,88 个有效数据点),因此每个模型都缺失一个时间间隔,平均值可能无法反映完整的四小时窗口。
4 小时窗口 · 88 个数据点 · 覆盖率 91.7%
  • glm-5.3 是最强的模型,平均吞吐量为 121.63 词元/秒,峰值为 191.28 词元/秒;nemotron-3-ultra 最弱,平均仅为 3.83 词元/秒,从未超过 7.88 词元/秒。
  • glm-5.2 的运行波动最为剧烈,从 04:20 的 67.05 词元/秒降至 04:40 的 10.4 词元/秒和 05:00 的 13.56 词元/秒,随后在 06:00 恢复至 107.7 词元/秒(趋势为 52.5%);glm-5.3 同样波动较大,变异系数为 40.2%。
  • 每个模型在预期的 12 个样本中拥有 11 个(覆盖率为 91.7%),共计 88 个有效数据点,因此在 03:03–07:03 UTC 时间窗口内,每个模型各缺失一次 20 分钟的观测。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4-flash 是平均吞吐量最强的模型,达 123.69 词元/秒,峰值 163.24 词元/秒;而 nemotron-3-ultra 最弱,平均仅 4.05 词元/秒,从未超过 7.88 词元/秒。
  • glm-5.2 表现出对运行影响最显著的波动性(CV 49.8%),从 04:20 的 67.05 词元/秒骤降至 04:40 的 10.4 词元/秒和 05:00 的 13.56 词元/秒,随后在 06:00 前恢复至 107.7 词元/秒;gemma4:31b 也在 03:20 一度跌至 4.06 词元/秒。
  • 不存在缺失数据的限制:全部八个模型均报告 12 个预期样本中的 12 个,在四小时窗口内共有 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4-flash 是平均吞吐量最强的模型,达 115.56 词元/秒(峰值 163.24 词元/秒),而 nemotron-3-ultra 最弱,平均仅 4.0 词元/秒,从未超过 7.88 词元/秒。
  • 波动最显著的是 glm-5.2,其变异系数为 45.7%;它从 04:20 的 67.05 词元/秒跌至 04:40 的 10.4 词元/秒,最终收于 13.56 词元/秒。glm-5.3-flash 也从 04:20 的 17.95 词元/秒大幅波动至 05:00 的 166.97 词元/秒。
  • 不存在数据缺失的限制:全部 8 个模型均交付了 12 个预期样本中的 12 个,在四小时窗口内共有 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • gemma4:31b 是平均吞吐量最强的模型,为 108.79 词元/秒,略微领先于 deepseek-v4-flash 的 112.31 词元/秒……更正:deepseek-v4-flash 以 112.31 词元/秒领先,gemma4:31b 以 108.79 词元/秒位居第二;nemotron-3-ultra 最弱,为 3.94 词元/秒。
  • 运营层面最显著的波动来自 gemma4:31b,其在 03:20 的低点 4.06 词元/秒与峰值 153.82 词元/秒之间大幅波动,变异系数为 38.7%,窗口期内趋势为 -24.7%;glm-5.3 在 64.84 至 166.93 词元/秒之间表现出类似的波动。
  • 不存在数据缺失的限制:全部 8 个模型均报告了 12 个预期样本中的 12 个,在四小时窗口期内共有 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4-flash 以 117.11 词元/秒的平均吞吐量位居第一,略高于 gemma4:31b 的 116.02 词元/秒,而 nemotron-3-ultra 最弱,仅为 7.01 词元/秒,远低于倒数第二的 minimax-m3 的 39.89 词元/秒。
  • 变动最显著的是 nemotron-3-ultra 的 70.3% 降幅,从 23:40 的 26.8 词元/秒峰值降至 03:00 的 4.05 词元/秒,变异系数为 105.6%;glm-5.3 同样波动较大,在 64.41 至 196.0 词元/秒之间摆动,变异系数为 40.9%。
  • 不存在缺失数据的限制:全部八个模型均报告了 12 个预期样本中的 12 个,共 96 个有效数据点,在四小时窗口内覆盖率达到 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • 平均吞吐量最强的是 gemma4:31b,达 131.55 词元/秒(峰值 174.53 词元/秒);最弱的是 nemotron-3-ultra,为 10.65 词元/秒,在 01:40 时一度跌至 1.48 词元/秒。
  • 在整个时间窗口内,所有模型均呈下降趋势,其中 nemotron-3-ultra 暴跌 81.8%,到 02:00 时降至 3.75 词元/秒。波动性最高的是 glm-5.3(变异系数 40.7%,范围 64.41–196.0 词元/秒)和 deepseek-v4-flash(变异系数 39.9%,范围 43.3–188.6 词元/秒)。
  • 不存在数据缺失的限制:全部 96 个预期数据点均有效,覆盖率为 100.0%,且八个模型中的每一个都拥有 12 个样本中的全部 12 个。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • glm-5.3 的平均吞吐量最高,达到 136.32 词元/秒,峰值为 235.48 词元/秒,而 nemotron-3-ultra 最弱,平均仅为 12.71 词元/秒,最终仅为 2.17 词元/秒。
  • glm-5.3 呈现最急剧的下降趋势,下行 35.8%,并在 235.48 与 64.41 词元/秒之间波动;nemotron-3-ultra 波动性最大,其 12 个样本的变异系数为 91.8%。
  • 不存在缺失数据的限制:全部八个模型均拥有 12 个预期样本中的 12 个、96 个有效数据点以及 100.0% 的覆盖率,因此四小时时间窗口的数据是完整的。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • glm-5.3 是平均吞吐量最强的模型,达到 144.41 词元/秒,峰值为 235.48 词元/秒,而 nemotron-3-ultra 最弱,平均仅为 12.62 词元/秒,从未超过 43.56 词元/秒。
  • glm-5.3 的波动性对运营影响最大,在 64.41 至 235.48 词元/秒之间波动(标准差 53.68,变异系数 37.2%),并呈现 28.0% 的下降趋势;nemotron-3-ultra 则更不稳定(变异系数 92.8%),在起始接近 3.3 词元/秒后,于 23:00 飙升至 43.56 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均有 12 个样本中的 12 个,valid_point_count 为 96,在四小时窗口内覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强的模型,平均输出吞吐量为 148.24 词元/秒,在 UTC 22:00 达到峰值 235.48 词元/秒;nemotron-3-ultra 最弱,平均为 8.98 词元/秒,波动范围在 1.76 至 43.56 词元/秒之间。
  • 运营层面最显著的波动是 gemma4:31b 在 UTC 21:00 从早先的大约 130 词元/秒骤降至 44.74 词元/秒,随后在 UTC 22:20 恢复至 174.12 词元/秒;glm-5.3 在该时间窗口内也在 72.31 至 235.48 词元/秒之间大幅波动。
  • 不存在数据缺失的限制:全部八个模型均有 12 个样本中的 12 个,数据集在四小时窗口内共有 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强的模型,平均吞吐量为 140.64 词元/秒,在 22:00 UTC 达到 235.48 词元/秒的峰值;nemotron-3-ultra 最弱,平均仅为 5.46 词元/秒,从未超过 17.52 词元/秒。
  • 最显著的波动性是 nemotron-3-ultra 的变异系数 74.0%,同时伴随 96.6% 的上升趋势;而 glm-5.3 显示出最大的绝对波动幅度,在观测窗口内范围为 67.36 至 235.48 词元/秒,趋势为 48.1%。
  • 不存在缺失数据的限制:所有八个模型均报告了 12 个预期样本中的 12 个,数据集在四小时期间内共有 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强模型,平均吞吐量为 123.43 词元/秒,领先于 glm-5.3-flash 的 110.05 词元/秒;nemotron-3-ultra 最弱,平均为 3.37 词元/秒,从未超过 4.34 词元/秒。
  • glm-5.3 同时也是波动最大的模型,变异系数为 45.1%,在窗口期内于 67.36 至 244.23 词元/秒之间波动;deepseek-v4-flash 的范围为 29.48 至 153.69 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均报告了 12 个预期样本中的 12 个,在四小时期间内共有 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • glm-5.3 是平均吞吐量最强的模型,达 116.77 词元/秒(p95 为 214.86 词元/秒),而 nemotron-3-ultra 最弱,平均仅 2.94 词元/秒,从未超过 4.34 词元/秒。
  • glm-5.3 的波动性也最高,变异系数为 47.3%,在 67.36 至 244.23 词元/秒之间波动;deepseek-v4-pro 在该时段内下降了 14.3%,于 UTC 19:00 降至 49.14 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均有 12/12 个样本、96 个有效数据点,在四小时窗口内覆盖率达到 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4-flash 是最强的模型,平均吞吐量为 120.77 词元/秒(峰值 165.34 词元/秒),而 nemotron-3-ultra 最弱,平均为 2.56 词元/秒,慢了大约 47 倍。
  • glm-5.3 波动性最高(变异系数 50.7%),在 57.98 到 244.23 词元/秒之间大幅波动,包括在 UTC 17:20 出现的 244.23 词元/秒的峰值;deepseek-v4-flash 也在 17:20 一度跌至 29.48 词元/秒,随后在 19:00 之前恢复到 143.08 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均有 12 个样本中的 12 个,valid_point_count 为 96,在四小时窗口内覆盖率为 100.0%,因此平均值基于完整数据。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4-flash 是最强的模型,平均吞吐量为 112.13 词元/秒,略领先于 glm-5.3-flash 的 103.81 词元/秒;nemotron-3-ultra 最弱,平均为 2.15 词元/秒,从未超过 3.23 词元/秒。
  • glm-5.3 表现出对运营影响最大的波动性,变异系数为 60.7%,在 15:00 低至 19.23 词元/秒,并在 17:20 飙升至 244.23 词元/秒;deepseek-v4-pro 整体也攀升了 42.2%,从 14:20 的 37.97 词元/秒升至 18:00 的 86.82 词元/秒。
  • 该时间窗口内不存在数据缺失的限制:全部八个模型均有 12 个样本中的 12 个,共 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4-flash 是最强的模型,平均吞吐量为 118.78 词元/秒(范围为 82.26–165.34 词元/秒),而 nemotron-3-ultra 最弱,平均仅 2.04 词元/秒,从未超过 3.1 词元/秒。
  • 最显著的变化是 deepseek-v4-pro 高达 94.3% 的上升趋势,从 14:40 前后 31.02 词元/秒的低点攀升至 15:40 的 122.52 词元/秒峰值,并在 17:00 保持接近 98.59 词元/秒;glm-5.3 也在 19.23 至 156.41 词元/秒之间波动。
  • 不存在数据缺失的限制:所有八个模型均有 12 个样本中的 12 个、96 个有效数据点以及 100.0% 的覆盖率,不过该时间窗口仅覆盖四个小时。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • 平均吞吐量最强的是 glm-5.3-flash,达 104.88 词元/秒(峰值 134.55 词元/秒),略微领先于 104.75 词元/秒的 deepseek-v4-flash;最弱的是 nemotron-3-ultra,仅 2.43 词元/秒,最大值也只有 3.38 词元/秒。
  • gemma4:31b 波动性最大,变异系数为 57.7%,从 12:20 的 157.85 词元/秒骤降至 13:00 的 13.7 词元/秒;glm-5.3 整体下降 29.1%,其中包括 15:00 低至 19.23 词元/秒的最低点。
  • 不存在数据缺失的限制:全部八个模型均有 12 个样本中的 12 个,valid_point_count 为 96,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • 平均吞吐量最强:deepseek-v4-flash 达 104.30 词元/秒,略微领先于 glm-5.3-flash 的 102.90 词元/秒;最弱的是 nemotron-3-ultra,为 3.32 词元/秒,大约比领先者慢 31 倍。
  • 波动最显著:glm-5.3 从 11:20 的 173.56 词元/秒降至 15:00 的 19.23 词元/秒(趋势 -44.0%),而 gemma4:31b 在 157.85 和 13.7 词元/秒之间波动(变异系数 58.3%)。
  • 无缺失数据限制:全部八个模型均有 12 个样本中的 12 个,共 96 个有效数据点,在四小时时间窗口内覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强模型,平均速度为 113.46 词元/秒,略微领先于 deepseek-v4-flash(113.44 词元/秒)和 glm-5.3-flash(113.37 词元/秒);nemotron-3-ultra 最弱,平均速度为 4.29 词元/秒,从未超过 6.89 词元/秒。
  • 波动性是该时间窗口的主要特征:gemma4:31b 的波动范围为 13.7 至 176.08 词元/秒(变异系数 49.8%),deepseek-v4-flash 在 12:40 跌至 34.25 词元/秒,随后在 13:00 回升至 130.99 词元/秒;glm-5.3 涨幅最为陡峭,上升了 35.2%。
  • 不存在数据缺失的限制:全部 96 个预期数据点均有效(覆盖率 100%),八个模型中的每一个在四小时窗口内均报告了 12 个样本中的全部 12 个。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • 平均吞吐量最强的是 deepseek-v4-flash,达 118.17 词元/秒,峰值在 11:00 达到 194.85 词元/秒;最弱的是 nemotron-3-ultra,为 4.52 词元/秒,低了约 26 倍。
  • gemma4:31b 表现出最急剧的劣化,趋势为 -33.7%,变异系数为 40.7%,波动区间在 176.08 至 46.36 词元/秒之间;glm-5.2 整体趋势为 +119.7%,但在最后一次观测中降至 14.4 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均报告了 12 个预期样本中的 12 个,共 96 个有效数据点,在四小时窗口内覆盖率达到 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • 平均吞吐量最强的是 deepseek-v4-flash,达 117.83 词元/秒,峰值达 194.85 词元/秒;最弱的是 nemotron-3-ultra,为 4.95 词元/秒,从未超过 9.23 词元/秒。
  • 运营层面最显著的变动是 gemma4:31b 在时间窗口后段的崩溃,从 09:20 的 176.08 词元/秒跌至 11:00 的 46.36 词元/秒,趋势为 -21.0%;glm-5.2 同样表现出较高的相对波动性,cv 为 63.4%,在 09:00 一度跌至 3.06 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均记录了 12 个预期样本中的 12 个,valid_point_count 为 96,在四小时窗口内覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • gemma4:31b 是最强的模型,平均吞吐量为 120.35 词元/秒,领先于 112.66 词元/秒的 glm-5.3 和 112.43 词元/秒的 glm-5.3-flash;nemotron-3-ultra 最弱,平均为 5.77 词元/秒,从未超过 14.11 词元/秒。
  • glm-5.2 下降最为急剧,在 09:00 UTC 时降至 3.06 词元/秒的低点,跌幅达 56.7%;而 minimax-m3 波动最大,变异系数为 61.8%,范围在 21.12 至 122.93 词元/秒之间。
  • 不存在缺失数据的限制:全部八个模型均交付了 12 个预期样本中的 12 个,在四小时的时间窗口内提供了 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4-flash 在平均吞吐量方面领先,达到 117.44 词元/秒,领先于 gemma4:31b(113.72 词元/秒)和 glm-5.3-flash(112.63 词元/秒);nemotron-3-ultra 表现最弱,平均仅为 14.20 词元/秒,峰值也仅有 41.74 词元/秒。
  • 运营层面最显著的变化是 nemotron-3-ultra 从 06:00 的 41.74 词元/秒骤降至 09:00 的 4.21 词元/秒,降幅达 75.4%,其变异系数高达 99.6%,波动性最高;glm-5.2 尽管平均值为 44.48 词元/秒,最终也降至 3.06 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均报告 12 个样本中的 12 个,共 96 个有效数据点,在四小时窗口内覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强的模型,平均吞吐量为 127.05 词元/秒(峰值 246.11 词元/秒),而 nemotron-3-ultra 最弱,平均为 22.82 词元/秒(最低 3.3 词元/秒)。
  • 运营层面最重大的变化是 nemotron-3-ultra 在 06:20 UTC 之后性能崩溃,从 51.95 词元/秒的峰值降至 3.3 至 14.11 词元/秒之间的读数,最终收于 4.09 词元/秒,降幅达 81.0%;它还表现出最高的波动性,CV 为 73.7%。
  • 不存在数据缺失的限制:全部八个模型均有 12 个样本中的 12 个,共 96 个有效数据点,覆盖率为 100.0%,但四小时的时间窗口限制了对更长期表现的评估。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • glm-5.3 的平均吞吐量最高,达 131.0 词元/秒,而 nemotron-3-ultra 最弱,为 34.34 词元/秒;glm-5.3-flash 平均 115.95 词元/秒,gemma4:31b 为 112.52 词元/秒。
  • 运营层面最显著的变化是 nemotron-3-ultra 的持续下滑,在整个时间窗口内下降 50.3%,在 07:00 低至 3.3 词元/秒;glm-5.3 也在 62.54 至 246.11 词元/秒之间大幅波动,变异系数为 46.4%。
  • 不存在数据缺失的限制:全部八个模型均记录了 12 个预期样本中的 12 个,产生 96 个有效数据点,在四小时窗口内覆盖率达到 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • glm-5.3 的平均吞吐量最高,达 132.17 词元/秒,而 nemotron-3-ultra 最弱,仅为 35.84 词元/秒;deepseek-v4-flash(114.04 词元/秒)和 gemma4:31b(123.01 词元/秒)也位居前列。
  • 变动最显著的是 deepseek-v4-flash,呈上升趋势,涨幅达 47.8%,从 03:40 的 49.83 词元/秒低点攀升至 05:40 的 189.78 词元/秒峰值;glm-5.3 波动性极高,波动范围为 62.54 至 246.11 词元/秒,变异系数为 45.1%。
  • 不存在缺失数据的限制:全部 8 个模型均交付了 12 个预期样本中的 12 个,在四小时窗口内共计 96 个有效数据点,覆盖率达 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • gemma4:31b 是最强的模型,平均吞吐量为 142.79 词元/秒,峰值达 184.71 词元/秒;nemotron-3-ultra 最弱,平均为 28.04 词元/秒,最低为 4.38 词元/秒。
  • nemotron-3-ultra 波动最为剧烈(变异系数 89.3%),在 03:20 从 4.38 跃升至 96.70 词元/秒,而 glm-5.3 在 62.82 至 246.11 词元/秒之间波动(变异系数 45.2%),且呈 55.7% 的上升趋势。
  • 不存在数据缺失的限制:全部八个模型均有 12 个样本中的 12 个,共 96 个有效数据点,在四小时窗口内覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • gemma4:31b 是最强的模型,平均吞吐量为 155.66 词元/秒,而 nemotron-3-ultra 最弱,平均为 20.62 词元/秒,峰值仅为 96.7 词元/秒。
  • glm-5.3 表现出对运行影响最显著的波动性,在 60.82 至 195.89 词元/秒之间摆动,变异系数为 48.8%;minimax-m3 整体也下降了 41.9%,从 74.97 降至 40.57 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均有 12 个样本中的 12 个,且数据集显示有 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 80 个数据点 · 覆盖率 83.3%
  • 平均吞吐量最高的是 gemma4:31b,达 156.45 词元/秒;最低的是 nemotron-3-ultra,为 10.76 词元/秒,deepseek-v4-flash 以 126.73 词元/秒位居第二。
  • 运营层面最显著的变化是 minimax-m3 的持续下滑,从 00:20 的 74.97 词元/秒峰值到 03:00 的 30.67 词元/秒,趋势为 -27.2%;glm-5.3 也在 60.82 至 195.89 词元/秒之间大幅波动(变异系数 48.5%)。
  • 每个模型仅采集到 12 个预期样本中的 10 个(覆盖率 83.3%),总计 80 个有效数据点,因此每个模型缺失两次二十分钟的观测,平均值可能无法完全代表这四小时的时间窗口。
4 小时窗口 · 56 个数据点 · 覆盖率 58.3%
  • gemma4:31b 是表现最强的模型,平均吞吐量为 155.75 词元/秒,峰值达 189.38 词元/秒,而 nemotron-3-ultra 表现最弱,平均仅为 9.56 词元/秒,其最新采样中仅为 4.81 词元/秒。
  • glm-5.3 的波动性对运营影响最大:它在 00:20 时从 195.89 词元/秒跌至 00:40-01:40 期间的大约 60-69 词元/秒,随后回升至 171.36 词元/秒,变异系数为 50.9%。deepseek-v4-flash 同样在 209.95 和 53.9 词元/秒之间大幅波动。
  • 每个模型在预期的 12 个采样中仅记录到 7 个,覆盖率为 58.3%,总计 56 个有效数据点,因此 22:03-23:40 UTC 时间段缺失,平均值可能无法代表完整的四个小时。
4 小时窗口 · 8 个数据点 · 覆盖率 8.3%
  • 平均吞吐量最强的是 deepseek-v4-flash,达 209.95 词元/秒,其次是 glm-5.3,为 183.7 词元/秒;最弱的是 nemotron-3-ultra,仅 19.47 词元/秒,比领先者慢约十一倍,minimax-m3 也较低,为 52.9 词元/秒。
  • 无法评估趋势或波动性:每个模型在 00:00 UTC 仅有单次观测,因此所有八个模型的 stddev_tps 和 cv_pct 均为 0.0,trend_pct 也为 0.0;唯一的运营信号是各模型之间的巨大差距,从 19.47 到 209.95 词元/秒。
  • 数据覆盖严重受限:每个模型仅有 1 个样本,而预期样本为 12 个,即 8.3% 的覆盖率,总计 8 个有效数据点,因此所有平均值、最小值、最大值和 p95 值均仅基于单次测量。