← 返回性能仪表板

每小时性能洞察

滚动四小时性能数据摘要

已保留 1191 条摘要
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • gemma4:31b 是性能最强的模型,平均吞吐量为 123.66 词元/秒,而 nemotron-3-ultra 是性能最弱的模型,平均为 26.74 词元/秒,两者差距约为 4.6 倍。
  • glm-5.3 的波动性对运营影响最大,在 05:20 的 183.18 词元/秒与 06:00 的 16.28 词元/秒之间波动,变异系数为 46.6%;deepseek-v4-flash 同样不稳定,为 53.1%。
  • 不存在数据缺失的限制:所有 8 个模型均有 12 个样本中的 12 个,valid_point_count 为 96,在四小时时间窗口内覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • gemma4:31b 是最强的模型,平均吞吐量为 121.22 词元/秒,峰值达 147.35 词元/秒;nemotron-3-ultra 最弱,平均为 27.43 词元/秒,从未超过 55.94 词元/秒。
  • deepseek-v4-flash 波动性最高(变异系数 46.3%),在 22.59 至 128.82 词元/秒之间大幅波动,而 glm-5.3 在约 58-79 与 147-171 词元/秒之间剧烈交替,并以其最大值 171.17 词元/秒收尾。
  • 不存在数据缺失的限制:全部八个模型均有 12 个样本中的 12 个,覆盖率为 100.0%,总计 96 个有效数据点。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • glm-5.3 是平均吞吐量最强的模型,达到 113.2 词元/秒,略微领先于 gemma4:31b 的 112.22 词元/秒,而 nemotron-3-ultra 最弱,平均仅为 25.3 词元/秒,峰值也仅有 50.73 词元/秒。
  • 运行层面最显著的波动来自 glm-5.3-flash,其变异系数为 46.4%,波动范围从 52.72 到 192.31 词元/秒;glm-5.3 也在 55.26 和 181.11 词元/秒之间波动,deepseek-v4-flash 在经历 -27.2% 的趋势后收于 22.59 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均有 12 个样本中的 12 个,valid_point_count 为 96,在四小时窗口内覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • gemma4:31b 是最强模型,平均吞吐量为 113.08 词元/秒,峰值达 165.05 词元/秒;nemotron-3-ultra 最弱,平均为 25.44 词元/秒,从未超过 50.73 词元/秒。
  • glm-5.3-flash 降幅最陡,从 22:20 的 171.63 词元/秒降至 02:00 的 65.43 词元/秒,下降 38.0%;而 glm-5.3 波动最大,变异系数为 44.6%,在该时间窗口内于 181.11 和 55.26 词元/秒之间摆动。
  • 不存在数据缺失的限制:全部八个模型均报告了 12 个预期样本中的 12 个,且在 96 个有效数据点上总体覆盖率为 100.0%,因此这四小时的情况是完整的。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • gemma4:31b 是表现最强的模型,平均吞吐量为 107.85 词元/秒,而 nemotron-3-ultra 是表现最弱的模型,平均为 21.78 词元/秒,约为领先者的五分之一。
  • glm-5.3 表现出对运行影响最显著的波动性,变异系数为 43.5%,从 22:00 的 60.47 词元/秒升至 00:40 的 181.11 词元/秒,随后在 01:00 降至 55.26 词元/秒;deepseek-v4-pro 也在 23:00 一度跌至 10.5 词元/秒。
  • 不存在数据缺失的限制:全部 8 个模型均有 12 个样本中的 12 个,valid_point_count 为 96,在四小时时间窗口内覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • gemma4:31b 是最强的模型,平均吞吐量为 112.08 词元/秒,领先于 107.43 词元/秒的 glm-5.3-flash 和 100.5 词元/秒的 glm-5.3;nemotron-3-ultra 最弱,平均仅 22.48 词元/秒,峰值也仅为 50.73 词元/秒。
  • 波动最显著的是 deepseek-v4-pro,其在 23:00 的低点 10.5 词元/秒与 21:40 的 126.0 词元/秒之间大幅波动,而 glm-5.3-flash 的变异系数最高,达 41.7%;deepseek-v4-flash 呈现最陡峭的上升趋势,为 34.4%。
  • 不存在数据缺失的限制:全部八个模型均有 12 个样本中的 12 个,且在 96 个有效数据点上整体覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • gemma4:31b 的平均吞吐量最高,达 110.03 词元/秒,峰值为 165.05 词元/秒,而 nemotron-3-ultra 最弱,平均仅 18.57 词元/秒,从未超过 30.12 词元/秒。
  • 运营层面最显著的波动是 deepseek-v4-pro 在 21:40 达到 126.0 词元/秒后,于 23:00 骤降至 10.5 词元/秒;glm-5.3-flash 同样剧烈波动(变异系数 45.4%),波动范围为 57.72 至 181.6 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均报告 12 个样本中的 12 个,在四小时窗口内共有 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • gemma4:31b 是表现最强的模型,平均吞吐量为 110.75 词元/秒,而 nemotron-3-ultra 最弱,平均为 17.42 词元/秒,速度大约慢六倍。
  • glm-5.3-flash 波动最为剧烈,从 19:00 的 53.99 词元/秒飙升至 20:40 的 181.6 词元/秒,随后在 21:00 回落至 58.43 词元/秒;其变异系数为 47.3%。
  • 不存在数据缺失的限制:全部 8 个模型均交付了 12 个预期样本中的 12 个,在四小时窗口内共有 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • 平均吞吐量最强的是 gemma4:31b,达 115.24 词元/秒(峰值 154.14 词元/秒),而 nemotron-3-ultra 最弱,仅 17.40 词元/秒,从未超过 30.12 词元/秒。
  • 运行波动最剧烈的是 glm-5.3-flash,其吞吐量从 20:00 的 59.72 词元/秒跃升至 20:40 的 181.60 词元/秒,随后在 21:00 回落至 58.43 词元/秒;glm-5.2 也在 7.07 至 87.64 词元/秒之间大幅波动,变异系数为 58.0%。
  • 不存在数据缺失的限制:全部八个模型均记录了预期 12 个样本中的 12 个,共计 96 个有效数据点,覆盖率达 100.0%,因此这四小时的时间窗口得到了完整呈现。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • 平均吞吐量最强的是 gemma4:31b,达到 106.21 词元/秒(峰值 151.86 词元/秒),而 nemotron-3-ultra 最弱,仅为 16.57 词元/秒,从未超过 33.72 词元/秒。
  • deepseek-v4-pro 表现出对运行影响最为显著的波动性,变异系数为 59.2%,波动范围从 5.68 到 95.96 词元/秒;glm-5.2 同样不稳定,为 54.5%,在 19:00 UTC 时降至 7.07 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均记录了 12 个预期样本中的 12 个,共有 96 个有效数据点,覆盖率为 100.0%,因此结果反映了四小时窗口内完整的二十分钟观测。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • gemma4:31b 是表现最强的模型,平均吞吐量为 97.33 词元/秒(峰值 146.95 词元/秒),而 nemotron-3-ultra 最弱,平均仅为 15.79 词元/秒,在整个时间窗口内从未超过 33.72 词元/秒。
  • 波动性是主要的运行信号:deepseek-v4-pro 从 15:20 的 106.62 词元/秒骤降至 19:00 的 5.68 词元/秒(变异系数 56.6%),glm-5.3 则在 160.6 至 55.89 词元/秒之间波动,表明多个模型存在严重的吞吐量不稳定问题。
  • 不存在数据缺失的限制:全部 8 个模型均交付了 12 个预期样本中的 12 个,共有 96 个有效数据点,覆盖率为 100.0%,因此尽管出现单个时间间隔的急剧下降,四小时窗口的数据是完整的。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • gemma4:31b 是最强的模型,平均吞吐量为 97.43 词元/秒,领先于 92.47 词元/秒的 glm-5.3;nemotron-3-ultra 最弱,为 16.28 词元/秒,在任何样本中均未超过 33.72 词元/秒。
  • deepseek-v4-flash 趋势最陡,上升 54.6% 至最新的 64.8 词元/秒,而 deepseek-v4-pro 波动最大,变异系数为 54.9%,在 9.11 至 106.62 词元/秒之间波动,降幅为 17.9%。
  • 不存在缺失数据的限制:全部八个模型均拥有 12 个预期样本中的 12 个,在四小时窗口内共计 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • 平均吞吐量最强的是 glm-5.3,达 102.37 词元/秒(在 16:40 达到峰值 160.60 词元/秒);最弱的是 nemotron-3-ultra,为 16.33 词元/秒,并在 17:00 以 1.83 词元/秒收尾。
  • 波动最显著:glm-5.3-flash 从 13:20 的 156.48 词元/秒降至 14:40 的 6.19 词元/秒,变异系数为 50.8%,趋势为 -31.7%;gemma4:31b 也下降了 -29.1%,收于 38.99 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均记录了 12 个样本中的 12 个,产生 96 个有效数据点,在四小时时间窗口内覆盖率达到 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • 平均吞吐量最强的是 gemma4:31b,达 112.33 词元/秒(峰值 159.45 词元/秒);最弱的是 nemotron-3-ultra,为 14.22 词元/秒,从未超过 22.69 词元/秒。
  • 运营层面最显著的波动:glm-5.3-flash(变异系数 48.6%)在 13:20 达到峰值 156.48 词元/秒后,于 14:40 跌至 6.19 词元/秒;gemma4:31b 整体下降 28.0%,收于 59.99 词元/秒。
  • 无缺失数据:全部八个模型均报告 12 个样本中的 12 个,共 96 个有效数据点,覆盖率为 100.0%;唯一的局限是观测窗口仅跨越四个小时。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • gemma4:31b 的平均吞吐量最高,达 120.24 词元/秒(峰值 159.45 词元/秒),而 nemotron-3-ultra 最弱,平均仅 14.02 词元/秒,峰值仅为 22.69 词元/秒。
  • glm-5.3-flash 波动最为剧烈,范围从 6.19 到 156.48 词元/秒,变异系数为 49.2%,且在最后一次观测中多个模型出现急剧下降:glm-5.2 降至 8.61 词元/秒,deepseek-v4-pro 在 15:00 UTC 降至 9.89 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均记录了 12 个预期样本中的 12 个,在四小时窗口内共有 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • 平均输出吞吐量最高的是 gemma4:31b,达到 130.05 词元/秒(峰值 159.45 词元/秒),而 nemotron-3-ultra 最弱,仅为 17.49 词元/秒,从未超过 74.74 词元/秒。
  • 运营层面最显著的波动来自 nemotron-3-ultra,其变异系数为 106.7%,趋势为 -50.4%,并在 10:20 时从 74.74 词元/秒跌至 13:00 时的 13.37 词元/秒;deepseek-v4-flash 也在 128.56 和 27.43 词元/秒之间大幅波动。
  • 不存在数据缺失的限制:全部 8 个模型均交付了 12 个预期样本中的 12 个,在四小时的时间窗口内共有 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • gemma4:31b 是最强模型,平均吞吐量为 119.16 词元/秒,领先于 glm-5.3 的 103.05 词元/秒,而 nemotron-3-ultra 最弱,平均仅为 22.5 词元/秒,在任何时间区间内都从未超过 74.74 词元/秒。
  • nemotron-3-ultra 表现出最剧烈的波动性,变异系数为 88.5%,从 10:00 的 2.46 词元/秒波动至 10:20 的 74.74 词元/秒;minimax-m3 也在 11:00 飙升至 169.37 词元/秒,而其平均值为 73.64 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均有 12 个样本中的 12 个,valid_point_count 为 96,在四小时窗口内覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • gemma4:31b 是平均吞吐量最强的模型,达到 115.36 词元/秒,领先于 100.75 词元/秒的 glm-5.3,而 nemotron-3-ultra 最弱,仅为 21.18 词元/秒,其最低值仅为 2.46 词元/秒。
  • 运营层面最显著的波动性来自 nemotron-3-ultra,其变异系数为 96.5%,在 2.46 至 74.74 词元/秒之间波动;minimax-m3 在平均 64.19 词元/秒之后,也于 11:00 飙升至 169.37 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均拥有 12 个预期样本中的 12 个,valid_point_count 为 96,并且在 07:03 至 11:03 UTC 的完整时间窗口内覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • gemma4:31b 是性能最强的模型,平均吞吐量为 110.67 词元/秒,峰值达 158.15 词元/秒,而 nemotron-3-ultra 性能最弱,平均为 16.61 词元/秒,从未超过 45.55 词元/秒。
  • deepseek-v4-flash 呈现最急剧的趋势,从 30.8 词元/秒的低点攀升 74.7% 至 09:40 时的 128.56 词元/秒,而 deepseek-v4-pro 是大型模型中波动最大的,在 4.58 至 111.1 词元/秒之间波动(变异系数 51.9%)。
  • 无缺失数据限制:全部 8 个模型均有 12 个样本中的 12 个,共 96 个有效数据点,覆盖率 100%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • 平均吞吐量最高的是 gemma4:31b,达 109.02 词元/秒(峰值 158.15 词元/秒),而 nemotron-3-ultra 最弱,平均仅 15.80 词元/秒,从未超过 45.55 词元/秒。
  • 运营层面最显著的波动是 nemotron-3-ultra 高达 78.9% 的变异系数,同时 deepseek-v4-pro 的吞吐量从 07:20 的 111.10 词元/秒骤降至 09:00 的 4.58 词元/秒;deepseek-v4-flash 的降幅最为陡峭,为 -30.9%。
  • 不存在数据缺失的限制:全部八个模型均报告了 12 个样本中的 12 个,在四小时的时间窗口内共有 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • 平均吞吐量最强的是 gemma4:31b,达 111.84 词元/秒(峰值 158.15 词元/秒);最弱的是 nemotron-3-ultra,为 17.12 词元/秒,其峰值仅为 64.11 词元/秒,最终收于 7.27 词元/秒。
  • 所有模型在观测窗口内均出现下滑;deepseek-v4-flash 跌幅最大,为 -54.3%,从 118.59 降至 32.55 词元/秒,而 glm-5.2 下跌 -35.2%。nemotron-3-ultra 波动性最大,在 5.09 至 64.11 词元/秒的范围内变异系数达 90.4%。
  • 不存在数据缺失的限制:全部八个模型均记录了 12 个预期样本中的 12 个,在四小时期间内共获得 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • gemma4:31b 是表现最强的模型,平均吞吐量为 124.92 词元/秒,而 nemotron-3-ultra 是表现最弱的模型,平均为 24.53 词元/秒,约为领先者速度的五分之一。
  • 运营层面最显著的波动来自 nemotron-3-ultra,其吞吐量在该时间窗口内下降了 65.4%(变异系数为 81.5%),在 06:00 UTC 时降至 5.09 词元/秒;glm-5.3-flash 也在 187.08 和 53.74 词元/秒之间大幅波动。
  • 不存在数据缺失的限制:全部 8 个模型均报告了 12 个预期样本中的 12 个,在四小时的时间窗口内共有 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • gemma4:31b 是平均吞吐量最强的模型,达到 117.4 词元/秒(p95 为 170.54 词元/秒);nemotron-3-ultra 最弱,平均仅 24.53 词元/秒,从未超过 68.35 词元/秒。
  • nemotron-3-ultra 表现出对运营影响最大的波动性,范围在 3.91 至 68.35 词元/秒之间,CV 为 85.9%,且收尾接近 5 词元/秒;deepseek-v4-flash 呈现最陡峭的上升(趋势 +80.2%,从 30.44 升至 118.59 词元/秒),而 glm-5.3 下降了 25.1%。
  • 不存在数据缺失的限制:每个模型都交付了 12 个样本中的全部 12 个,在四小时窗口内提供了 96 个有效数据点和 100.0% 的覆盖率。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • glm-5.3 的平均吞吐量最高,达到 129.1 词元/秒(峰值达 179.12 词元/秒),而 nemotron-3-ultra 最弱,平均仅为 32.65 词元/秒,在 02:20 一度低至 3.91 词元/秒。
  • 最显著的趋势是 glm-5.2 下降了 37.9%,从 00:20 的 100.34 词元/秒降至 04:00 的 43.0 词元/秒;deepseek-v4-flash 下降了 35.9%,降至 51.66 词元/秒。nemotron-3-ultra 的波动性最高,变异系数为 61.1%。
  • 不存在数据缺失的限制:全部八个模型均记录了 12 个预期样本中的 12 个,数据集报告了 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • glm-5.3 是平均吞吐量最强的模型,达到 125.11 词元/秒,略微领先于 gemma4:31b 的 122.71 词元/秒;nemotron-3-ultra 最弱,平均为 34.33 词元/秒,最低值在 02:20 时为 3.91 词元/秒。
  • 运营层面最显著的波动是 nemotron-3-ultra 的变异系数达 78.9%,在 3.91 至 102.82 词元/秒之间摆动;deepseek-v4-flash 呈现最陡峭的下降,降幅为 -45.9%,从 23:40 时的 119.47 词元/秒降至 03:00 时的 54.18 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均有 12 个样本中的 12 个,valid_point_count 为 96,覆盖率达 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • gemma4:31b 是表现最强的模型,平均吞吐量为 128.06 词元/秒,而 nemotron-3-ultra 表现最弱,为 37.38 词元/秒,约为 gemma4:31b 平均值的 29%。
  • glm-5.3 变动最为显著,在统计窗口内上升 103.7%,最新达到 179.12 词元/秒,但变异系数为 53.3%;minimax-m3 下降 34.3% 至 47.53 词元/秒,而 nemotron-3-ultra 高达 76.0% 的变异系数使其成为波动最大的模型。
  • 不存在数据缺失的限制:全部八个模型均有 12 个样本中的 12 个,覆盖率为 100.0%,共有 96 个有效数据点;唯一的限制是四小时的统计窗口本身。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • 平均吞吐量最强的是 gemma4:31b,达 133.9 词元/秒(p95 为 159.85,最大值为 160.99 词元/秒);最弱的是 nemotron-3-ultra,为 31.85 词元/秒,在整个时间窗口内波动范围为 2.62 至 102.82 词元/秒。
  • 运营层面最显著的波动是 nemotron-3-ultra 高达 93.5% 的变异系数,在 2.62 至 102.82 词元/秒之间摆动;glm-5.3 呈现 63.9% 的上升趋势,收于 172.22 词元/秒,而 glm-5.3-flash 则较其 193.02 词元/秒的峰值下降了 35.4%。
  • 不存在数据缺失的限制:全部八个模型均记录了 12 个预期样本中的 12 个,共计 96 个有效数据点,在四小时期间内覆盖率达到 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • gemma4:31b 是表现最强的模型,平均吞吐量为 133.33 词元/秒,而 nemotron-3-ultra 是表现最弱的模型,为 24.38 词元/秒,低了约 5.5 倍。
  • nemotron-3-ultra 的波动性最大,范围从 2.62 到 102.82 词元/秒,变异系数为 121.0%;glm-5.3 的下降幅度最陡,趋势为 -34.1%,从 141.89 词元/秒的峰值跌至 69.56 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均拥有 12 个预期样本中的 12 个,在四小时的时间窗口内共有 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • gemma4:31b 是表现最强的模型,平均吞吐量为 127.66 词元/秒(峰值 161.53 词元/秒),而 nemotron-3-ultra 是表现最弱的模型,平均为 14.26 词元/秒,在任何观测中均未超过 70.12 词元/秒。
  • 运营层面最显著的波动性来自 nemotron-3-ultra,其变异系数为 126.1%,在 2.62 至 70.12 词元/秒之间波动;glm-5.3-flash 和 deepseek-v4-flash 呈现最陡峭的上升趋势,分别为 51.9% 和 51.3%。
  • 不存在数据缺失的限制:全部 8 个模型均报告了 12 个样本中的 12 个,在四小时的时间窗口内共有 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • gemma4:31b 是最强的模型,平均吞吐量为 130.49 词元/秒,而 nemotron-3-ultra 最弱,仅为 11.83 词元/秒,大约是领先者速度的十分之一。
  • 运营层面最显著的波动来自 nemotron-3-ultra 的 105.9% 变异系数,其速度在 2.62 至 48.14 词元/秒之间波动。minimax-m3 也从 20:40 的 74.10 词元/秒跃升至 21:00 的 170.35 词元/秒,glm-5.3-flash 则在 21:20 飙升至 193.02 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均报告了 12 个样本中的 12 个,在四小时的时间窗口内共有 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • gemma4:31b 是平均吞吐量最强的模型,达到 131.19 词元/秒(峰值 161.53 词元/秒),而 nemotron-3-ultra 最弱,平均仅 12.51 词元/秒,从未超过 48.14 词元/秒,最终收于 5.21 词元/秒。
  • 运营层面最显著的变动是 minimax-m3 的持续下滑:从 17:20 的 183.32 词元/秒跌至 20:00 的 56.41 词元/秒低点,在数小时内维持在 70-76 词元/秒附近,随后于 21:00 恢复至 170.35 词元/秒,变异系数为 43.3%,负向趋势为 18.6%。
  • 该时间窗口内不存在数据缺失的限制:全部八个模型均交付了 12 个预期样本中的 12 个,数据集报告了 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • 平均吞吐量最强的是 gemma4:31b,达 123.86 词元/秒;最弱的是 nemotron-3-ultra,为 14.49 词元/秒,低了约 8.5 倍,最新读数为 8.63 词元/秒。
  • 运营层面最显著的波动是 nemotron-3-ultra 高达 98.7% 的变异系数,在 2.98 至 48.14 词元/秒之间摆动;deepseek-v4-flash 呈现最陡峭的趋势,达 +100.2%,而 minimax-m3 下降了 31.9%,最新为 56.41 词元/秒。
  • 不存在数据缺失的限制:96 个预期数据点中有 96 个有效,覆盖率为 100.0%,每个模型在四小时窗口内均报告了 12 个样本中的 12 个。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • gemma4:31b 是最强的模型,平均吞吐量为 115.74 词元/秒,领先于 minimax-m3 的 93.62 词元/秒;nemotron-3-ultra 最弱,平均为 14.49 词元/秒,最低为 2.55 词元/秒。
  • glm-5.3-flash 在大部分时间窗口内保持在接近 65 词元/秒,随后在 19:00 跳升至其最大值 174.61 词元/秒;glm-5.3 波动幅度最大,范围在 15.28 至 148.30 词元/秒之间,变异系数为 58.1%。
  • 无缺失数据限制:全部 8 个模型均交付了 12 个预期样本中的 12 个,在四小时窗口内共产生 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • 平均吞吐量最强的是 minimax-m3,为 108.59 词元/秒(峰值 183.32 词元/秒);最弱的是 nemotron-3-ultra,为 16.23 词元/秒,最大值仅为 47.12 词元/秒。
  • 运营层面最显著的波动性出现在 nemotron-3-ultra(变异系数 86.9%)和 glm-5.2(变异系数 66.5%);deepseek-v4-pro 在 16:40 时达到 112.57 词元/秒,在 16:00 时降至 4.33 词元/秒,最终收于 5.23 词元/秒。
  • 本时间窗口内不存在数据缺失的限制:全部八个模型均记录了 12 个预期样本中的 12 个,共 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • gemma4:31b 是表现最强的模型,平均吞吐量为 103.55 词元/秒,领先于 minimax-m3 的 98.72 词元/秒;nemotron-3-ultra 表现最弱,平均仅为 15.96 词元/秒,最大值仅为 47.12 词元/秒。
  • 最显著的变化是窗口后期的性能下降:minimax-m3 在 17:00 下降 31.7% 至 56.41 词元/秒,glm-5.3 下降 48.9% 至 15.28 词元/秒;glm-5.2 波动最大,范围在 13.06 至 173.59 词元/秒之间,变异系数为 84.7%。
  • 不存在数据缺失的限制:全部 8 个模型均记录了 12 个预期样本中的 12 个,在四小时窗口内共获得 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • gemma4:31b 是性能最强的模型,平均吞吐量为 107.84 词元/秒,略微领先于 minimax-m3 的 106.76 词元/秒;nemotron-3-ultra 性能最弱,平均仅为 16.53 词元/秒,最大值仅为 51.54 词元/秒。
  • glm-5.2 的波动性最为极端,范围从 8.92 到 173.59 词元/秒,变异系数为 96.9%,其中包括在 UTC 15:00 飙升至 173.59 词元/秒;deepseek-v4-pro 也在 UTC 16:00 降至 4.33 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均有 12 个样本中的 12 个,valid_point_count 为 96,在四小时时间窗口内覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • 平均吞吐量最强的是 gemma4:31b,达 113.26 词元/秒(12:40 时峰值为 153.26 词元/秒),而 nemotron-3-ultra 最弱,仅为 25.61 词元/秒,在任何时间段内都从未超过 55.49 词元/秒。
  • glm-5.2 的波动性最为极端,变异系数达 115.0%:其平均值为 47.79 词元/秒,但在该时间窗口的大部分时间内维持在接近 13-26 词元/秒的水平后,于 15:00 飙升至 173.59 词元/秒;nemotron-3-ultra 也在 13:00 骤降至 1.78 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均提供了 12 个预期样本中的 12 个,在四小时窗口内共产生 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • gemma4:31b 是平均吞吐量最强的模型,达到 120.59 词元/秒,而 nemotron-3-ultra 最弱,平均为 19.93 词元/秒。
  • glm-5.2 呈现出最具运营意义的趋势,在观测窗口内下降 61.7%,最新值为 13.06 词元/秒,且波动极为剧烈(变异系数 100.6%,范围 8.92 至 161.74 词元/秒);deepseek-v4-pro 也在 14:00 降至 7.63 词元/秒。
  • 本窗口内不存在数据缺失的限制:全部八个模型均有 12 个样本中的 12 个,共 96 个有效数据点,覆盖率为 100%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • gemma4:31b 是最强的模型,平均吞吐量为 108.88 词元/秒(范围 55.13–164.94 词元/秒),而 nemotron-3-ultra 是最弱的模型,平均为 32.75 词元/秒(范围 2.56–72.75 词元/秒)。
  • 运营层面最显著的变化是 nemotron-3-ultra 呈下降趋势,降幅为 -41.5%,其中包括在 11:00 UTC 低至 2.56 词元/秒的低点。glm-5.2 的波动性最高(变异系数 70.3%),从 11:40 的 12.4 词元/秒摆动到 12:00 的 161.74 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均拥有 12 个预期样本中的 12 个,valid_point_count 为 96,在四小时的时间窗口内覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • gemma4:31b 是最强模型,平均吞吐量为 114.5 词元/秒,大幅领先第二名 glm-5.3 的 90.24 词元/秒;nemotron-3-ultra 最弱,平均为 30.84 词元/秒,最低值为 2.56 词元/秒。
  • 运营层面最显著的变化是 nemotron-3-ultra 下降了 43.5%,从 72.75 词元/秒的峰值跌至 UTC 时间 11:00 的 2.56 词元/秒;glm-5.3-flash 同样表现出高波动性,变异系数为 58.7%,并在 08:40 一度跌至 9.94 词元/秒。
  • 不存在数据缺失的限制:全部 8 个模型均有 12 个样本中的 12 个,数据集报告了 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • 平均吞吐量最强的是 gemma4:31b,达 120.08 词元/秒,峰值达 164.94 词元/秒;最弱的是 nemotron-3-ultra,为 32.14 词元/秒,最低降至 2.98 词元/秒。
  • 波动性是主要的运维隐忧:glm-5.3-flash 在 9.94 至 163.78 词元/秒之间波动(变异系数 57.7%),nemotron-3-ultra 的变异系数为 69.9%;在 10:00 UTC 时,deepseek-v4-pro 降至 9.21 词元/秒,glm-5.3-flash 降至 14.79 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均有 12 个样本中的 12 个,在四小时窗口内共有 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • 平均吞吐量最强的是 gemma4:31b,达 130.59 词元/秒(峰值 164.94 词元/秒),而 nemotron-3-ultra 最弱,为 27.76 词元/秒(最低 2.98 词元/秒)。
  • minimax-m3 呈现最陡峭的下降趋势,趋势为 -35.9%,从 05:20 的 87.86 词元/秒降至 09:00 的 60.56 词元/秒,并在 08:40 触及 27.03 词元/秒的低点;nemotron-3-ultra 波动性最大,变异系数为 79.2%。
  • 不存在数据缺失的限制:全部八个模型均交付了 12 个预期样本中的 12 个,在四小时的时间窗口内共产生 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • 平均吞吐量最强的是 gemma4:31b,达 138.29 词元/秒(峰值 162.26 词元/秒);最弱的是 nemotron-3-ultra,为 27.15 词元/秒,最低仅 1.93 词元/秒。
  • 运营层面最显著的变化是 minimax-m3 下降 18.9%,收于 46.88 词元/秒,同时 glm-5.3 上升 25.5%,达到 123.32 词元/秒;nemotron-3-ultra 波动极为剧烈,变异系数达 89.7%,波动区间为 1.93 至 77.99 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均记录了 12 个样本中的 12 个,共计 96 个有效数据点,在四小时窗口内覆盖率达到 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • 平均吞吐量最强的是 gemma4:31b,在 12 个样本中达到 134.21 词元/秒(范围 99.74 至 156.96 词元/秒);最弱的是 nemotron-3-ultra,为 22.89 词元/秒,其峰值仅为 77.99 词元/秒,并在窗口结束时降至 4.51 词元/秒。
  • 运营层面最显著的波动来自 nemotron-3-ultra,在 1.93 至 77.99 词元/秒之间波动,变异系数为 96.0%;deepseek-v4-pro 呈现最陡峭的下降趋势,为 -31.1%,在 06:00 降至 10.99 词元/秒;glm-5.3-flash 表现不稳定,变异系数为 53.4%,并出现 194.31 词元/秒的峰值。
  • 不存在数据缺失的限制:全部八个模型均报告了 12 个预期样本中的 12 个、96 个有效数据点,并在四小时窗口内实现 100.0% 的覆盖率。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • gemma4:31b 是性能最强的模型,平均吞吐量为 136.02 词元/秒(p95 为 160.99 词元/秒),而 nemotron-3-ultra 是性能最弱的模型,平均为 32.72 词元/秒,从未超过 77.99 词元/秒。
  • 运营层面最显著的波动出现在 glm-5.3-flash,其吞吐量在 45.94 至 194.31 词元/秒之间波动,变异系数为 55.5%;glm-5.3 也在 05:20 降至 5.72 词元/秒,deepseek-v4-pro 在 06:00 降至 10.99 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均有 12 个样本中的 12 个,valid_point_count 为 96,在四小时时间窗口内的覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • gemma4:31b 是平均吞吐量最高的模型,达 132.43 词元/秒,而 nemotron-3-ultra 最低,为 33.89 词元/秒;deepseek-v4-flash 和 glm-5.2 同样处于低位,分别为 56.95 和 59.02 词元/秒。
  • 运营层面最显著的波动来自 nemotron-3-ultra,其吞吐量在 1.93 至 77.99 词元/秒之间波动,变异系数为 74.4%;minimax-m3 呈现最明显的上升趋势,达 31.4%,从 44.23 升至 88.4 词元/秒,而 deepseek-v4-pro 下降了 25.5%。
  • 不存在数据缺失的限制:全部八个模型均有 12 个样本中的 12 个,共 96 个有效数据点,在四小时窗口内覆盖率为 100.0%。
4 小时窗口 · 88 个数据点 · 覆盖率 91.7%
  • 平均吞吐量最强的是 gemma4:31b,达 130.97 词元/秒(峰值 167.44 词元/秒),而 nemotron-3-ultra 最弱,为 34.27 词元/秒,从未超过 66.28 词元/秒。
  • glm-5.3-flash 波动幅度最大,范围在 57.4 至 188.92 词元/秒之间,变异系数为 42.8%,而 deepseek-v4-flash 在该时间窗口内下降了 30.0%,在 01:00 达到 120.54 词元/秒后,最终收于 30.73 词元/秒。
  • 八个模型均记录了 12 个预期样本中的 11 个,得到 88 个有效数据点和 91.7% 的覆盖率,因此每个模型缺失一次 20 分钟的观测,限制了趋势的可靠性。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • 平均吞吐量最强的是 gemma4:31b,达 127.28 词元/秒(峰值 167.44 词元/秒);最弱的是 nemotron-3-ultra,为 37.37 词元/秒,最低仅 3.87 词元/秒。
  • Nemotron-3-ultra 波动最大,变异系数为 86.5%,在 3.87 至 112.61 词元/秒之间波动;glm-5.3 从 23:20 的 158.15 词元/秒降至 02:00 的 18.43 词元/秒,呈 31.6% 的负向趋势。
  • 不存在数据缺失限制:全部八个模型均有 12 个样本中的 12 个,共 96 个有效数据点,覆盖率为 100.0%,但该时间窗口仅覆盖四个小时。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • gemma4:31b 是最强模型,平均吞吐量为 124.79 词元/秒;nemotron-3-ultra 最弱,平均为 37.77 词元/秒,最低为 3.19 词元/秒。
  • glm-5.3 下降幅度最大,从 21:20 的 142.52 词元/秒降至 01:00 的 92.24 词元/秒,趋势为 -32.4%;而 nemotron-3-ultra 波动最大(变异系数 81.9%,范围 3.19–112.61 词元/秒);deepseek-v4-flash 上升 27.5%,达到 120.54 词元/秒。
  • 无缺失数据限制:全部 8 个模型均有 12/12 个样本,valid_point_count 为 96,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • 平均吞吐量最强:gemma4:31b 达 105.73 词元/秒(峰值 167.44 词元/秒);最弱:nemotron-3-ultra 为 31.70 词元/秒,约为领先者的三分之一。
  • 运营层面最显著的波动性:nemotron-3-ultra 在 3.19 至 112.61 词元/秒之间波动,变异系数为 99.1%,而 deepseek-v4-flash 呈现最陡峭的攀升,从 45.08 升至 120.38 词元/秒,趋势为 77.8%。
  • 无缺失数据限制:全部八个模型均报告 12 个样本中的 12 个,覆盖率为 100.0%,且数据集的 96 个有效数据点与预期数量相符。