← 返回性能仪表板

每小时性能洞察

滚动四小时性能数据摘要

已保留 1188 条摘要
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4.1-flash 是平均吞吐量最强的模型,达 161.69 词元/秒(p95 为 228.39 词元/秒),而 nemotron-3-ultra 最弱,平均仅 24.56 词元/秒,峰值也仅为 52.47 词元/秒。
  • 运维层面最显著的变化是 gemma4:31b 从 00:20 的 159.5 词元/秒持续下降至 04:00 的 42.72 词元/秒,呈 35% 的下行趋势,其最后三个采样点分别为 73.48、103.13、56.64 和 42.72 词元/秒。glm-5.2 同样表现出极大的波动性,范围在 13.44 至 195.72 词元/秒之间,变异系数达 70.5%。
  • 不存在数据缺失的限制:全部八个模型在四小时窗口内均获得了 12 个预期采样中的 12 个,共 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • 平均吞吐量最强的是 deepseek-v4.1-flash,达 163.39 词元/秒(p95 为 226.74 词元/秒);最弱的是 nemotron-3-ultra,为 26.61 词元/秒(p95 为 47.12 词元/秒),平均速度大约慢六倍。
  • 运营层面最显著的波动:deepseek-v4.1-flash 从 01:00 的 219.23 词元/秒降至 01:40 的 40.8 词元/秒,随后回升至 172.35 词元/秒;glm-5.3 也在 182.85 和 60.98 词元/秒之间大幅波动(cv 41.3%)。
  • 无缺失数据:全部八个模型均报告 12 个样本中的 12 个,96 个有效数据点,100.0% 的覆盖率;局限在于观测时间仅有四小时,因此短暂的下降可能无法反映稳态吞吐量。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4.1-flash 是最强的模型,平均速度为 184.46 词元/秒(峰值达 235.93 词元/秒),而 nemotron-3-ultra 最弱,平均速度仅为 25.54 词元/秒,从未超过 52.47 词元/秒。
  • glm-5.2 表现出对运行影响最大的波动性,变异系数为 64.2%,在四小时内速度在 10.78 至 96.62 词元/秒之间摆动;nemotron-3-ultra 同样不稳定,变异系数为 57.9%。
  • 不存在数据缺失的限制:全部八个模型均报告了 12 个预期样本中的 12 个,在整个期间共有 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4.1-flash 是最强模型,平均吞吐量为 186.75 词元/秒(峰值 235.93 词元/秒),而 nemotron-3-ultra 最弱,平均为 22.48 词元/秒(最低 3.15 词元/秒)。
  • glm-5.2 波动最为剧烈,范围从 10.78 到 216.7 词元/秒,变异系数达 94.6%;gemma4:31b 在时间窗口后期也从 146.13 骤降至 43.95 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均报告了 12 个预期样本中的 12 个,共 96 个有效数据点,在四小时窗口内覆盖率达到 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • 平均吞吐量最强的是 deepseek-v4.1-flash,达 193.04 词元/秒(峰值 235.93 词元/秒),而 nemotron-3-ultra 最弱,仅 21.48 词元/秒,从未超过 42.75 词元/秒。
  • glm-5.2 的波动性最为极端,变异系数达 96.7%:它在 20:40 飙升至 216.7 词元/秒,随后在 21:20 跌至 10.78 词元/秒;除 deepseek-v4-pro(+3.9%)和 nemotron-3-ultra(+27.3%)外,所有模型均呈下降趋势。
  • 不存在数据缺失的限制:全部 8 个模型均交付了 12 个预期样本中的 12 个,数据集实现了 100.0% 的覆盖率,共 96 个有效数据点中的 96 个。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4.1-flash 是最强的模型,平均吞吐量为 186.07 词元/秒,峰值达 230.07 词元/秒,而 nemotron-3-ultra 最弱,平均为 20.1 词元/秒,最大值仅为 40.72 词元/秒。
  • glm-5.2 表现出对运营影响最为显著的波动性,范围从 10.78 到 216.7 词元/秒,变异系数为 105.7%,其中包括在 UTC 20:40 飙升至 216.7 词元/秒,随后在 UTC 21:20 骤降至 10.78 词元/秒;deepseek-v4.1-flash 也呈 9.3% 的上升趋势。
  • 不存在缺失数据的限制:所有八个模型均有 12 个样本中的 12 个,valid_point_count 为 96,在四小时窗口内覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4.1-flash 是最强的模型,平均吞吐量为 184.08 词元/秒,峰值达 230.07 词元/秒,而 nemotron-3-ultra 最弱,平均为 21.36 词元/秒,最低降至 4.27 词元/秒。
  • glm-5.2 波动最为剧烈,范围从 11.04 到 216.7 词元/秒,变异系数为 96.0%;glm-5.3 的攀升最为陡峭,上升 52.0%,在 20:20 达到 175.32 词元/秒的峰值。
  • 本时间窗口内不存在数据缺失的限制:全部八个模型均交付了 12 个预期样本中的 12 个,共有 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4.1-flash 是最强的模型,平均吞吐量为 181.27 词元/秒(峰值 228.81 词元/秒),而 nemotron-3-ultra 最弱,平均仅为 20.47 词元/秒,从未超过 40.72 词元/秒。
  • glm-5.2 表现出对运行影响最显著的波动性,变异系数为 70.2%,波动范围从 13.18 到 134.30 词元/秒;glm-5.3 的范围同样为 16.72 到 163.17 词元/秒,表明两者的吞吐量均不稳定。
  • 无缺失数据:全部八个模型均有 12 个样本中的 12 个,覆盖率为 100.0%,共 96 个有效数据点,因此唯一的局限是仅四小时的短时间窗口,可能无法代表长期表现。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4.1-flash 是最强模型,平均吞吐量为 164.93 词元/秒,峰值达 228.81 词元/秒;nemotron-3-ultra 最弱,平均为 20.23 词元/秒,从未超过 40.72 词元/秒。
  • glm-5.2 表现出对运行影响最大的波动性,变异系数为 68.5%,在 13.18 至 134.3 词元/秒之间波动;glm-5.3 同样在 16.72 至 142.96 词元/秒之间波动,表明吞吐量不稳定。
  • 不存在数据缺失的限制:全部八个模型均记录了 12 个预期样本中的 12 个,在四小时窗口内共计 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4.1-flash 是性能最强的模型,平均吞吐量为 162.24 词元/秒(峰值 228.81 词元/秒),而 nemotron-3-ultra 性能最弱,平均为 19.68 词元/秒(最低 7.74 词元/秒)。
  • glm-5.2 表现出对运营影响最大的波动性,变异系数为 80.5%,波动范围从 16.12 到 195.22 词元/秒,趋势为 -44.6%;deepseek-v4.1-flash 呈上升趋势,涨幅 32.2%,收于 185.94 词元/秒。
  • 不存在数据缺失的限制:全部八个模型在四小时窗口内均有 12 个样本中的 12 个、96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4.1-flash 是最强模型,平均吞吐量为 166.42 词元/秒,峰值达 229.21 词元/秒;nemotron-3-ultra 最弱,平均为 19.27 词元/秒,从未超过 33.31 词元/秒。
  • glm-5.2 表现出对运行影响最为显著的波动性,变异系数为 80.0%,波动范围为 16.12 至 195.22 词元/秒,且趋势为 -42.2%;deepseek-v4.1-flash 则更为稳定,尽管波动范围为 229.21 至 85.42 词元/秒,但变异仅为 27.8%。
  • 不存在数据缺失的限制:全部八个模型均有 12 个样本中的 12 个,valid_point_count 为 96,覆盖率为 100.0%,因此四小时的时间窗口得到了完整呈现。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4.1-flash 是最强的模型,平均吞吐量为 160.42 词元/秒(峰值 229.21 词元/秒),而 nemotron-3-ultra 最弱,平均为 18.01 词元/秒(峰值 33.31 词元/秒)。
  • glm-5.2 波动最大,变异系数为 86.5%,在 7.84 至 195.22 词元/秒之间波动;UTC 时间 14:00 附近的大范围低谷几乎影响了所有模型,包括 minimax-m3 的 4.59 词元/秒和 gemma4:31b 的 47.71 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均有 12 个样本中的 12 个,共 96 个有效数据点,覆盖率为 100%,但仅凭这四小时的时间窗口无法确认 14:00 的低谷是否反复出现。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4.1-flash 是最强的模型,平均吞吐量为 169.92 词元/秒(峰值 229.21 词元/秒),而 nemotron-3-ultra 是最弱的模型,平均为 19.01 词元/秒(峰值 33.31 词元/秒)。
  • 14:00 UTC 的观测数据显示一次同步下跌:gemma4:31b 降至 47.71 词元/秒,minimax-m3 降至 4.59 词元/秒,deepseek-v4-pro 降至 23.05 词元/秒;glm-5.2 是波动最大的模型,变异系数为 79.8%,在 7.84 至 195.97 词元/秒之间波动。
  • 不存在数据缺失的限制:全部八个模型均有 12 个样本中的 12 个,数据集报告了 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4.1-flash 是最强的模型,平均吞吐量为 182.63 词元/秒(峰值 230.12 词元/秒),而 nemotron-3-ultra 最弱,平均为 18.48 词元/秒(峰值 33.31 词元/秒)。
  • 最显著的趋势是 minimax-m3 在该时间窗口内下降了 55.1%,最终为 4.59 词元/秒;glm-5.2 波动性最高,在 4.76 至 195.97 词元/秒之间波动,变异系数为 85.0%。
  • 无缺失数据限制:全部 8 个模型均报告了 12 个预期样本中的 12 个,共 96 个有效数据点,覆盖率为 100.0%,因此该四小时窗口是完整的。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4.1-flash 是最强的模型,平均吞吐量为 169.36 词元/秒(峰值 230.12 词元/秒),而 nemotron-3-ultra 最弱,平均为 17.71 词元/秒(峰值 25.64 词元/秒),两者之间存在约十倍的差距。
  • glm-5.2 表现出对运行影响最为显著的波动性,变异系数为 83.5%,在 11:00 时低至 4.76 词元/秒,在 10:00 时高达 211.18 词元/秒,其间包括 12:40 时降至 7.84 词元/秒的后期低谷,随后回升至 116.02 词元/秒。
  • 该时间窗口内不存在数据缺失的限制:全部 8 个模型均报告了 12 个预期样本中的 12 个,在四小时期间内共产生 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4.1-flash 是最强模型,平均吞吐量为 174.26 词元/秒,峰值达 230.12 词元/秒;nemotron-3-ultra 最弱,平均为 19.79 词元/秒,从未超过 26.99 词元/秒。
  • glm-5.2 表现出对运行影响最为显著的波动性,变异系数为 78.4%,在 11:00 时低至 4.76 词元/秒,在 10:00 时高达 211.18 词元/秒;minimax-m3 的波动范围也在 12.2 至 74.93 词元/秒之间。
  • 不存在数据缺失的限制:全部八个模型均报告了 12 个样本中的 12 个,在四小时的时间窗口内共有 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4.1-flash 是最强的模型,平均吞吐量为 172.39 词元/秒,峰值达 237.96 词元/秒;nemotron-3-ultra 最弱,平均为 22.34 词元/秒,从未超过 32.73 词元/秒。
  • glm-5.2 波动最大(CV 为 77.7%),在 UTC 10:00 飙升至 211.18 词元/秒,随后在 UTC 11:00 骤降至 4.76 词元/秒;deepseek-v4.1-flash 也在 UTC 09:40 跌至 63.63 词元/秒,低于其 172.39 词元/秒的平均值。
  • 不存在缺失数据的限制:全部八个模型均报告 12 个样本中的 12 个、96 个有效数据点,并在四小时窗口内实现 100.0% 的覆盖率。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4.1-flash 是最强的模型,平均吞吐量为 167.71 词元/秒,峰值达 237.96 词元/秒,而 nemotron-3-ultra 最弱,平均仅 23.73 词元/秒,最大值仅为 34.38 词元/秒。
  • glm-5.2 波动最大,变异系数为 61.5%,波动范围从 15.88 到 211.18 词元/秒,包括在最后一个 10:00 UTC 采样点飙升至最大值;gemma4:31b 在该时间窗口内下降了 19.8%。
  • 不存在数据缺失的限制:全部八个模型均有 12 个样本中的 12 个,在四小时的时间窗口内共有 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4.1-flash 是最强的模型,平均吞吐量为 189.86 词元/秒(峰值 237.96 词元/秒),而 nemotron-3-ultra 最弱,平均为 25.15 词元/秒(峰值 34.38 词元/秒)。
  • 波动性是主要的运营问题:glm-5.2 的变异系数为 56.5%,波动范围从 12.61 到 140.36 词元/秒,minimax-m3 在 07:00 降至 5.15 词元/秒;glm-5.3 是唯一明显提升的模型,在 09:00 提升 14.2%,达到 145.77 词元/秒。
  • 无缺失数据限制:全部 8 个模型均有 12 个样本中的 12 个,共 96 个有效数据点,在四小时窗口内覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4.1-flash 是最强的模型,平均吞吐量为 184.76 词元/秒(峰值达 237.96 词元/秒),而 nemotron-3-ultra 最弱,平均仅 23.7 词元/秒,在整个时间窗口内从未超过 34.38 词元/秒。
  • 波动最显著的是 glm-5.3,其变异系数为 42.3%,从 04:40 的 171.53 词元/秒骤降至 06:00 的 6.45 词元/秒;glm-5.2 趋势最为陡峭,从 12.61 词元/秒的低点升至 140.36 词元/秒的峰值,涨幅达 95.8%。
  • 不存在数据缺失的限制:全部八个模型均交付了 12 个预期样本中的 12 个,在四小时内共有 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4.1-flash 是最强模型,平均吞吐量达 197.65 词元/秒(峰值 231.48 词元/秒),而 nemotron-3-ultra 最弱,平均仅 24.70 词元/秒,从未超过 36.63 词元/秒。
  • glm-5.2 波动最大,变异系数为 73.3%,在 12.61 至 218.07 词元/秒之间大幅波动;minimax-m3 也在 07:00 骤降至 5.15 词元/秒,为其最低读数。
  • 不存在数据缺失问题:全部八个模型均有 12 个预期样本中的 12 个,valid_point_count 为 96,在四小时窗口内覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4.1-flash 是最强的模型,平均吞吐量为 189.69 词元/秒(峰值达 229.56 词元/秒),而 nemotron-3-ultra 最弱,平均为 24.74 词元/秒,大约慢八倍。
  • glm-5.2 波动最大,变异系数为 89.5%,从 04:00 的 218.07 词元/秒骤降至 05:20 的 12.61 词元/秒;glm-5.3 在最后 06:00 的观测中也急剧下降至 6.45 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均有 12 个样本中的 12 个,valid_point_count 为 96,在四小时窗口内覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4.1-flash 是最强的模型,平均吞吐量为 177.60 词元/秒(范围 122.23 至 229.51 词元/秒),而 nemotron-3-ultra 最弱,平均为 26.83 词元/秒(范围 10.18 至 36.63 词元/秒)。
  • glm-5.2 的波动性对运营影响最大,变异系数为 78.9%,从 03:00 的 20.74 词元/秒波动至 04:00 的 218.07 词元/秒;deepseek-v4.1-flash 最为稳定,为 18.4%。
  • 不存在数据缺失的限制:全部八个模型均有 12 个样本中的 12 个,数据集记录了 96 个有效数据点,覆盖率为 100.0%,但其仅覆盖这四个小时的时间窗口。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4.1-flash 是最强的模型,平均吞吐量为 186.86 词元/秒,峰值达 229.51 词元/秒,而 nemotron-3-ultra 最弱,平均为 29.10 词元/秒,从未超过 36.63 词元/秒。
  • glm-5.2 表现出对运营影响最大的波动性,变异系数为 73.9%,波动范围从 20.74 到 218.07 词元/秒;它在该时间窗口内还下降了 26.3%,glm-5.3 下降了 35.4%。
  • 不存在数据缺失的限制:全部八个模型均记录了 12 个预期样本中的 12 个,产生 96 个有效数据点,在四小时窗口内覆盖率达到 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4.1-flash 是最强模型,平均吞吐量为 175.25 词元/秒(峰值 211.09 词元/秒),而 nemotron-3-ultra 最弱,平均仅为 31.75 词元/秒,峰值只有 58.87 词元/秒。
  • glm-5.3 下降最为急剧,从窗口初期约 180 词元/秒的走势下滑 -37.8%,在 02:20 降至 53.18 词元/秒的低点;glm-5.2 波动性最大,变异系数达 75.7%,波动范围介于 11.08 至 198.51 词元/秒之间。
  • 不存在缺失数据的限制:全部八个模型均有 12 个样本中的 12 个、96 个有效数据点,在四小时窗口内覆盖率达到 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4.1-flash 是最强的模型,平均吞吐量为 182.38 词元/秒(峰值达 213.39 词元/秒),而 nemotron-3-ultra 最弱,平均为 32.17 词元/秒(最低 11.42 词元/秒)。
  • glm-5.2 波动最大,变异系数为 69.3%,波动范围从 11.08 到 198.51 词元/秒,包括 41.0% 的上升趋势;相比之下,deepseek-v4.1-flash 保持稳定,变异仅为 13.5%。
  • 不存在数据缺失的限制:所有 8 个模型均有 12 个样本中的 12 个,valid_point_count 为 96,在四小时窗口内覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4.1-flash 是最强的模型,平均吞吐量为 184.68 词元/秒(峰值 213.39 词元/秒),而 nemotron-3-ultra 最弱,平均为 29.10 词元/秒,大约慢六倍。
  • glm-5.3 表现出最稳定的提升,上升 33.4% 至平均 153.15 词元/秒,变异系数仅为 19.5%;而 glm-5.2 波动最大,变异系数为 86.1%,在 11.08 至 198.51 词元/秒之间波动。
  • 不存在数据缺失的限制:全部八个模型均交付了 12 个预期样本中的 12 个,在四小时的时间窗口内共有 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4.1-flash 是最强的模型,平均吞吐量为 180.61 词元/秒(p95 215.23 词元/秒,最大 217.48 词元/秒),而 nemotron-3-ultra 最弱,平均为 27.23 词元/秒,峰值仅为 58.87 词元/秒。
  • glm-5.2 波动最大,变异系数为 77.7%,从 00:00 的 11.08 词元/秒波动到 22:20 的 191.19 词元/秒峰值;glm-5.3-flash 在该时间窗口内也在 34.83 至 185.87 词元/秒之间波动。
  • 不存在数据缺失的限制:全部八个模型均有 12 个预期样本中的 12 个,valid_point_count 为 96,在四小时期间覆盖率为 100.0%,因此数据集是完整的。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4.1-flash 是最强的模型,平均吞吐量为 183.38 词元/秒(峰值 227.33 词元/秒),而 nemotron-3-ultra 最弱,平均为 21.14 词元/秒,约为领先者的九分之一。
  • glm-5.2 表现出对运营影响最大的波动性,变异系数为 73.7%,从 21:40 的 19.99 词元/秒波动到 22:20 的 191.19 词元/秒;gemma4:31b 也在 20:40 前后跌至 50.18 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均有 12 个样本中的 12 个,覆盖率为 100.0%,总计 96 个有效数据点,因此四小时的时间窗口得到了完整呈现。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4.1-flash 是最强的模型,平均吞吐量为 180.13 词元/秒(范围 129.09–227.33 词元/秒),而 nemotron-3-ultra 最弱,平均为 21.11 词元/秒,从未超过 41.32 词元/秒。
  • glm-5.3 增长最为稳定,呈 +19.0% 的上升趋势,平均达到 123.86 词元/秒,且波动性最低(变异系数 22.4%);glm-5.2 波动性最大(变异系数 57.4%),在 19.99 至 125.78 词元/秒之间摆动,minimax-m3 在 19:20 降至 6.95 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均有 12 个样本中的 12 个,共 96 个有效数据点,覆盖率为 100.0%,因此四小时的时间窗口得到了完整呈现。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4.1-flash 是最强的模型,平均吞吐量为 163.48 词元/秒,峰值达 227.33 词元/秒,而 nemotron-3-ultra 最弱,平均为 20.78 词元/秒,且从未超过 38.18 词元/秒。
  • 运营层面最显著的趋势是 glm-5.3 上升了 78.7%,从 18:00 的 49.21 词元/秒升至 20:00 的 143.23 词元/秒;glm-5.2 波动性最大,变异系数为 48.3%,在 31.0 至 125.78 词元/秒之间波动。
  • 不存在数据缺失的限制:全部八个模型均有 12 个样本中的 12 个,共 96 个有效数据点,覆盖率为 100.0%,因此各项数据代表完整的四小时时间窗口。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4.1-flash 是最强的模型,平均吞吐量为 138.64 词元/秒,在 19:40 达到峰值 227.33 词元/秒;nemotron-3-ultra 最弱,平均吞吐量为 22.01 词元/秒,在整个时间窗口内从未超过 39.76 词元/秒。
  • 运营层面最显著的变动是 glm-5.3 的后期激增,从 18:00 的 49.21 词元/秒攀升至 20:00 的 143.23 词元/秒,趋势增幅达 63.4%,而 glm-5.2 的相对波动性最高(变异系数 56.8%),minimax-m3 在 19:20 一度跌至 6.95 词元/秒。
  • 不存在数据缺失的限制:全部 96 个预期数据点均有效(覆盖率 100.0%),且在四小时的时间窗口内,八个模型中的每一个都报告了 12 个样本中的全部 12 个。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4.1-flash 是最强的模型,平均吞吐量为 121.33 词元/秒,峰值达 199.80 词元/秒,而 nemotron-3-ultra 最弱,平均为 23.46 词元/秒,且从未超过 39.76 词元/秒。
  • glm-5.3 表现出最具运营意义的波动性,从 15:20 的 146.03 词元/秒骤降至 17:00 的 21.87 词元/秒,变异系数为 45.0%,趋势为 -23.6%;deepseek-v4.1-flash 也在 38.85 至 199.80 词元/秒之间剧烈震荡。
  • 不存在数据缺失的限制:全部八个模型均报告了预期的 12 个样本中的 12 个,在四小时的时间窗口内共有 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • 平均吞吐量最强的是 deepseek-v4.1-flash,达 111.66 词元/秒,领先于 103.83 词元/秒的 gemma4:31b;最弱的是 nemotron-3-ultra,为 24.99 词元/秒,低于 43.90 词元/秒的 minimax-m3。
  • glm-5.2 表现出最剧烈的波动性,范围从 9.97 到 239.87 词元/秒,变异系数为 90.7%,而 glm-5.3 出现了最陡峭的下降,从 14:20 的 145.53 词元/秒跌至 18:00 的 49.21 词元/秒,降幅达 46.4%。
  • 不存在数据缺失的限制:全部八个模型均交付了 12 个预期样本中的 12 个,产生 96 个有效数据点和 100.0% 的覆盖率,不过该时间窗口仅覆盖四个小时。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • glm-5.3 的平均吞吐量最高,达 114.93 词元/秒(峰值 154.09 词元/秒),而 nemotron-3-ultra 表现最弱,平均仅 23.15 词元/秒,从未超过 60.23 词元/秒。
  • glm-5.2 的波动性最具运营意义,在 9.97 至 239.87 词元/秒之间波动,变异系数为 102.5%;deepseek-v4.1-flash 也在 15:40 飙升至 199.8 词元/秒,随后在 16:40 回落至 38.85 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均报告 12 个样本中的 12 个,在四小时窗口内共有 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • 平均吞吐量最强的是 deepseek-v4.1-flash,达 126.29 词元/秒(p95 为 190.37 词元/秒);最弱的是 nemotron-3-ultra,为 23.42 词元/秒,峰值仅为 60.23 词元/秒。
  • glm-5.2 表现出对运营影响最大的波动性,变异系数为 95.3%,在 9.97 至 239.87 词元/秒之间波动,趋势为 -35.1%;glm-5.3 上升了 48.5%,平均达到 108.11 词元/秒。
  • 无缺失数据限制:全部 8 个模型均交付了 12 个预期样本中的 12 个,共 96 个有效数据点,在 12:20–16:00 UTC 观测期间覆盖率达到 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4.1-flash 是最强的模型,平均吞吐量为 135.61 词元/秒(最高 182.65 词元/秒),而 nemotron-3-ultra 最弱,平均仅为 21.70 词元/秒,峰值也仅有 60.23 词元/秒。
  • glm-5.2 表现出对运营影响最大的波动性,在 9.97 至 239.87 词元/秒之间摆动,变异系数为 85.4%,其中包括在 14:20 降至 9.97 词元/秒,随后在 15:00 飙升至 239.87 词元/秒;deepseek-v4.1-flash 在该时间窗口内也下降了 18.2%。
  • 本数据集不存在缺失数据的局限:全部八个模型均记录了 12 个预期样本中的 12 个,产生 96 个有效数据点,在四小时期间内覆盖率达到 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4.1-flash 是最强的模型,平均吞吐量为 149.56 词元/秒(峰值达 212.23 词元/秒),而 nemotron-3-ultra 最弱,平均仅 17.34 词元/秒,从未超过 29.54 词元/秒。
  • glm-5.2 表现出对运营影响最大的波动性,变异系数为 76.8%,从 11:00 的 27.27 词元/秒到 13:40 的 224.82 词元/秒大幅波动;deepseek-v4-pro 也在 14:00 降至 11.72 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均记录了 12 个预期样本中的 12 个,在四小时的时间窗口内共产生 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4.1-flash 是平均吞吐量最强的模型,达 154.26 词元/秒,而 nemotron-3-ultra 最弱,为 17.55 词元/秒,低了约九倍。
  • glm-5.2 的波动性最具运营意义,变异系数为 81.9%,趋势为 +106.1%;其吞吐量从 09:20 的 25.95 词元/秒摆动至 13:00 的 193.32 词元/秒峰值,其中包括在 12:00 达到 177.64 词元/秒后,于 12:20 跌至 45.18 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均拥有 12 个预期样本中的 12 个,数据集报告了 96 个有效数据点,在四小时时间窗口内覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4.1-flash 是性能最强的模型,平均吞吐量为 152.58 词元/秒,而 nemotron-3-ultra 是性能最弱的模型,平均为 17.79 词元/秒。
  • 运行层面最显著的波动来自 glm-5.2,其变异系数为 64.8%;该模型从 25.95 词元/秒的低点波动至 12:00 UTC 时的 177.64 词元/秒,而 deepseek-v4-pro 在最后一次采样中骤降至 16.83 词元/秒,远低于其 93.28 词元/秒的平均值。
  • 不存在数据缺失的限制:全部八个模型均交付了 12 个预期采样中的 12 个,在四小时的时间窗口内共有 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4.1-flash 是最强模型,平均吞吐量为 146.78 词元/秒,峰值达 212.23 词元/秒;nemotron-3-ultra 最弱,平均为 17.57 词元/秒,从未超过 28.73 词元/秒。
  • glm-5.3-flash 表现出对运营影响最大的波动性,变异系数为 45.1%,波动范围在 53.66 至 232.91 词元/秒之间,包括在 08:40 从 232.91 词元/秒骤降至 09:00 的 53.66 词元/秒;glm-5.3 呈上升趋势,涨幅 42.5%。
  • 不存在数据缺失的限制:全部八个模型均有 12 个样本中的 12 个,valid_point_count 为 96,覆盖率为 100.0%,因此四小时的时间窗口得到完整呈现。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • 平均吞吐量最强的是 deepseek-v4.1-flash,达 142.14 词元/秒(p95 为 176.22 词元/秒);最弱的是 nemotron-3-ultra,为 18.32 词元/秒,从未超过 28.73 词元/秒。
  • glm-5.3-flash 是波动性最大的模型,变异系数为 46.0%,在 53.66 至 232.91 词元/秒之间波动;glm-5.3 呈现最陡峭的下降趋势,从 06:20 的 170.48 词元/秒降至 10:00 的 110.28 词元/秒,趋势为 -28.7%。
  • 不存在数据缺失的限制:全部八个模型均有 12 个样本中的 12 个,共 96 个有效数据点,在四小时时间窗口内覆盖率达到 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • gemma4:31b 是平均吞吐量最强的模型,为 129.35 词元/秒,领先于 deepseek-v4.1-flash 的 148.87 词元/秒……更正:deepseek-v4.1-flash 以 148.87 词元/秒领先,gemma4:31b 以 129.35 词元/秒位居第二;nemotron-3-ultra 最弱,为 21.35 词元/秒。
  • glm-5.3 降幅最为剧烈,从 06:20 的 170.48 词元/秒峰值下降 33.3% 至 09:00 的 69.86 词元/秒,而 glm-5.3-flash 上升了 19.7%,并在 08:40 飙升至 232.91 词元/秒,随后在 09:00 回落至 53.66 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均拥有 12 个预期样本中的 12 个,在四小时的时间窗口内共有 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • 平均吞吐量最强的是 deepseek-v4.1-flash,达 128.78 词元/秒;最弱的是 nemotron-3-ultra,为 24.57 词元/秒,约为领先者速率的五分之一。
  • deepseek-v4.1-flash 的波动幅度也最大,范围从 14.9 到 186.13 词元/秒,变异系数为 44.2%;而 glm-5.3 整体攀升 41.0%,在回落至 112.79 词元/秒之前达到 170.48 词元/秒的峰值。
  • 不存在数据缺失的限制:全部八个模型均交付了 12 个预期样本中的 12 个,在四小时的时间窗口内共产生 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4.1-flash 是最强模型,平均吞吐量为 135.35 词元/秒,峰值达 209.48 词元/秒;nemotron-3-ultra 最弱,平均为 23.57 词元/秒,从未超过 46.49 词元/秒。
  • 运营层面最显著的变动是 deepseek-v4.1-flash 的 52.5% 上升趋势,其中包括在 05:00 降至 14.9 词元/秒的低谷,随后在 07:00 前恢复至 165.38 词元/秒;glm-5.2 的波动性最高,变异系数为 65.6%。
  • 不存在数据缺失的限制:全部八个模型均有 12/12 个样本,valid_point_count 为 96,覆盖率为 100.0%,因此该四小时时间窗口得到完整呈现。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • 平均吞吐量最高的是 deepseek-v4.1-flash,达 122.44 词元/秒,略高于 glm-5.3-flash(122.37 词元/秒)和 gemma4:31b(119.24 词元/秒);最低的是 nemotron-3-ultra,为 30.60 词元/秒,低于 minimax-m3 的 37.69 词元/秒。
  • glm-5.2 的波动性最为剧烈,变异系数达 82.8%,在 02:00 出现 202.79 词元/秒的峰值与 04:40 出现 21.44 词元/秒的低谷之间大幅波动;deepseek-v4-pro 呈上升趋势,涨幅 53.1%,而 glm-5.3-flash 下降 24.6%。
  • 不存在数据缺失的限制:全部八个模型均提供了 12 个样本中的 12 个,共有 96 个有效数据点,覆盖率为 100.0%,不过该时间窗口仅跨越四个小时。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • 平均吞吐量最高的是 gemma4:31b,在 12 个样本中达到 133.1 词元/秒(范围从 81.25 到 170.9 词元/秒),而 nemotron-3-ultra 最低,为 27.93 词元/秒,从未超过 54.07 词元/秒。
  • glm-5.2 表现出对运行影响最显著的波动性,变异系数为 70.5%,在 24.83 和 202.79 词元/秒之间摆动,趋势为 -31.2%;deepseek-v4.1-flash 也在 24.14 和 226.05 词元/秒之间摆动。
  • 不存在数据缺失的限制:全部 8 个模型均报告了 12 个预期样本中的 12 个,在四小时窗口内提供 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4.1-flash 是最强的模型,平均吞吐量为 150.73 词元/秒,领先于 gemma4:31b 的 132.85 词元/秒和 glm-5.3-flash 的 131.83 词元/秒;nemotron-3-ultra 最弱,平均为 39.67 词元/秒,低于 minimax-m3 的 48.47 词元/秒。
  • glm-5.2 的波动性最大,变异系数为 74.2%,范围从 24.52 到 202.79 词元/秒,其中包括在 02:00 UTC 飙升至 202.79 词元/秒;deepseek-v4.1-flash 同样波动剧烈,在 00:40 达到峰值 226.05 词元/秒后,于 01:20 跌至 24.14 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均有 12 个样本中的 12 个,valid_point_count 为 96,在四小时窗口内覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4.1-flash 是平均吞吐量最强的模型,达到 140.56 词元/秒,略微领先于 gemma4:31b 的 140.37 词元/秒;nemotron-3-ultra 最弱,为 44.39 词元/秒,低于 minimax-m3 的 55.41 词元/秒。
  • glm-5.2 波动最为剧烈,在窗口期内上升 123.0%,在 00:00 跌至 24.52 词元/秒后,于 02:00 达到 202.79 词元/秒的峰值,变异系数高达 72.8%,波动性最高;minimax-m3 下跌 48.6%,降至 11.73 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均交付了 12 个预期样本中的 12 个,数据集记录了 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • gemma4:31b 是平均吞吐量最强的模型,达到 143.44 词元/秒,领先于 deepseek-v4.1-flash 的 135.52 词元/秒;nemotron-3-ultra 最弱,平均为 46.7 词元/秒,低于 minimax-m3 的 62.55 词元/秒。
  • 运营上最显著的波动性来自 glm-5.3,其在 19.0 至 180.67 词元/秒之间波动(cv 50.8%),包括在 00:00 降至 19.0 词元/秒;deepseek-v4.1-flash 呈现最陡峭的上升趋势,达 +52.8%,在 00:40 达到峰值 226.05 词元/秒。
  • 不存在数据缺失的限制:全部 8 个模型均有 12 个样本中的 12 个,valid_point_count 为 96,覆盖率为 100.0%,因此四小时的时间窗口得到完整呈现。