← 返回性能仪表板

每小时性能洞察

滚动四小时性能数据摘要

已保留 1192 条摘要
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • 平均吞吐量最强:gemma4:31b 达 105.73 词元/秒(峰值 167.44 词元/秒);最弱:nemotron-3-ultra 为 31.70 词元/秒,约为领先者的三分之一。
  • 运营层面最显著的波动性:nemotron-3-ultra 在 3.19 至 112.61 词元/秒之间波动,变异系数为 99.1%,而 deepseek-v4-flash 呈现最陡峭的攀升,从 45.08 升至 120.38 词元/秒,趋势为 77.8%。
  • 无缺失数据限制:全部八个模型均报告 12 个样本中的 12 个,覆盖率为 100.0%,且数据集的 96 个有效数据点与预期数量相符。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • glm-5.3 的平均吞吐量最高,达到 99.77 词元/秒,领先于 gemma4:31b 的 90.56 词元/秒,而 nemotron-3-ultra 表现最弱,仅为 27.28 词元/秒,远低于 deepseek-v4-flash 的 65.72 词元/秒。
  • nemotron-3-ultra 波动极为剧烈,范围从 3.19 到 112.61 词元/秒,变异系数为 116.2%,而 glm-5.3-flash 从 21:40 的峰值 188.17 词元/秒骤降至 22:00 的 11.77 词元/秒。
  • 不存在数据缺失的限制:全部 96 个预期数据点均有效,覆盖率为 100.0%,且每个模型都拥有 12 个样本中的全部 12 个,因此这四小时的时间窗口数据完整无缺。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • glm-5.3-flash 是平均吞吐量最强的模型,达到 103.79 词元/秒,峰值为 203.49 词元/秒,而 nemotron-3-ultra 最弱,平均仅 16.53 词元/秒,从未超过 40.67 词元/秒。
  • 运营层面最显著的波动性来自 glm-5.3-flash,其吞吐量在 11.77 至 203.49 词元/秒之间波动,变异系数为 59.6%,且其最后 22:00 的读数骤降至 11.77 词元/秒;nemotron-3-ultra 甚至更不稳定,变异系数达 87.6%,在 3.19 至 40.67 词元/秒之间震荡。
  • 此时间窗口内不存在数据缺失的限制:全部 8 个模型均报告了 12 个预期样本中的 12 个,在四小时内共产生 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • 平均吞吐量最强的是 minimax-m3,在 12 个样本中达到 102.6 词元/秒(范围 65.34 至 166.2 词元/秒);最弱的是 nemotron-3-ultra,为 15.69 词元/秒(范围 3.05 至 56.32 词元/秒)。
  • glm-5.3-flash 表现出对运营影响最大的波动性:在 18:20 之前维持在约 45 至 71 词元/秒,随后在 18:40 飙升至 187.86 词元/秒,并在 19:00 达到 203.49 词元/秒,最终收于 150.42 词元/秒,趋势为 93%,变异系数为 58.8%;nemotron-3-ultra 同样不稳定,达到 100.1%。
  • 不存在数据缺失的限制:所有八个模型均报告了 12 个预期样本中的 12 个,共计 96 个有效数据点,在四小时窗口内覆盖率达到 100%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • 平均吞吐量最高的是 minimax-m3,达 110.17 词元/秒;最低的是 nemotron-3-ultra,为 20.18 词元/秒,约为领先者的五分之一。
  • glm-5.3-flash 波动最为剧烈,在 17:20 降至 45.78 词元/秒,随后在 19:00 攀升至 203.49 词元/秒;nemotron-3-ultra 整体波动性最强,变异系数为 85.9%,读数范围在 3.05 至 56.32 词元/秒之间。
  • 不存在数据缺失的限制:全部八个模型均交付了 12 个预期样本中的 12 个,共产生 96 个有效数据点,在四小时窗口内覆盖率达到 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • minimax-m3 是平均吞吐量最强的模型,达 109.03 词元/秒,领先于 gemma4:31b 的 95.7 词元/秒;nemotron-3-ultra 最弱,为 16.36 词元/秒,最低值为 1.36 词元/秒。
  • 运营层面最显著的波动是 nemotron-3-ultra 的变异系数达 104.4%,波动范围从 1.36 到 56.32 词元/秒;deepseek-v4-pro 呈现最陡峭的趋势,达 +74.2%,从 16:20 的 10.59 词元/秒恢复至 17:40 的 126.46 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均拥有 12 个预期样本中的 12 个、96 个有效数据点,在四小时时间窗口内覆盖率达 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • 平均吞吐量最高的是 minimax-m3,达 105.91 词元/秒;最低的是 nemotron-3-ultra,为 13.12 词元/秒,glm-5.2 也较低,为 40.04 词元/秒。
  • 波动性是主要的运维问题:nemotron-3-ultra 在 1.36 至 39.27 词元/秒之间波动(变异系数为 105.0%),deepseek-v4-pro 的范围为 10.59 至 102.45 词元/秒(变异系数为 69.1%),而 glm-5.3-flash 最为稳定,变异系数为 32.3%。
  • 不存在数据缺失的限制:全部 8 个模型均交付了 12 个预期样本中的 12 个,在四小时窗口内共产生 96 个有效数据点,覆盖率达 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • minimax-m3 是平均吞吐量最强的模型,达 96.04 词元/秒,略高于 gemma4:31b 的 92.81 词元/秒,而 nemotron-3-ultra 最弱,平均为 15.65 词元/秒,其中包括 1.36 词元/秒的低点。
  • glm-5.3 的波动性对运行影响最大,变异系数为 53.5%,在 12:20 UTC 时为 144.61 词元/秒,到 14:00 UTC 降至 5.17 词元/秒,随后在 16:00 UTC 恢复至 142.01 词元/秒;deepseek-v4-pro 同样不稳定,CV 为 65.8%。
  • 不存在数据缺失的限制:全部八个模型均有 12 个样本中的 12 个,共 96 个有效数据点,在四小时窗口内覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • gemma4:31b 是最强模型,平均吞吐量为 104.78 词元/秒,峰值达 157.31 词元/秒;nemotron-3-ultra 最弱,平均为 16.89 词元/秒,从未超过 54.66 词元/秒。
  • glm-5.3 表现出对运行影响最大的波动性,从 11:20 的 162.0 词元/秒降至 14:00 的 5.17 词元/秒,趋势为 -57.5%,变异系数为 55.2%;deepseek-v4-pro 同样不稳定,变异系数为 71.8%,范围在 3.86 至 83.41 词元/秒之间。
  • 不存在数据缺失的限制:全部八个模型均记录了 12 个预期样本中的 12 个,产生 96 个有效数据点,在四小时窗口内覆盖率达到 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • 平均吞吐量最强的是 glm-5.3,达 106.17 词元/秒,略微领先于 104.77 词元/秒的 gemma4:31b;最弱的是 nemotron-3-ultra,仅 16.82 词元/秒,最大值也只有 54.66 词元/秒。
  • 最显著的波动是 glm-5.3 后期的崩溃:从 11:20 的 162.0 词元/秒峰值跌至 14:00 的 5.17 词元/秒,趋势为 -40.3%。nemotron-3-ultra(变异系数 88.0%)和 deepseek-v4-pro(变异系数 59.7%,12:00 时低至 3.86 词元/秒)也出现了不稳定的摆动。
  • 不存在数据缺失的限制:全部 8 个模型均提供了 12 个样本中的 12 个,在四小时窗口内共产生 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • gemma4:31b 是平均吞吐量最强的模型,达 113.08 词元/秒,领先于 108.38 词元/秒的 glm-5.3;nemotron-3-ultra 最弱,仅为 16.58 词元/秒,最大值也只有 54.66 词元/秒。
  • 运营层面最显著的波动是 nemotron-3-ultra 高达 85.2% 的变异系数,在 2.55 至 54.66 词元/秒之间剧烈摆动,而 deepseek-v4-pro 则呈现最陡峭的下滑趋势,为 -33.9%,在 UTC 12:00 时跌至 3.86 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均拥有 12 个预期样本中的 12 个,在四小时的时间窗口内共有 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • gemma4:31b 是最强的模型,平均吞吐量为 123.55 词元/秒,峰值达 171.75 词元/秒,而 nemotron-3-ultra 最弱,平均为 18.44 词元/秒,从未超过 54.66 词元/秒。
  • 波动性是主要的运行信号:nemotron-3-ultra 在 2.55 至 54.66 词元/秒之间波动(变异系数 89.7%),deepseek-v4-pro 最终为 3.86 词元/秒,而其最大值为 112.86 词元/秒,glm-5.3 则呈现最强的上升趋势,达 +46.3%,收于 151.78 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均报告 12 个样本中的 12 个,96 个有效数据点,在四小时窗口内覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • gemma4:31b 是平均吞吐量最强的模型,达到 116.16 词元/秒,远高于 glm-5.3 的 97.27 词元/秒,而 nemotron-3-ultra 最弱,仅为 20.79 词元/秒,远低于倒数第二的 deepseek-v4-flash 的 53.09 词元/秒。
  • 运营层面最显著的变化是 nemotron-3-ultra 的持续下滑,从 07:20 的 68.29 词元/秒跌至 11:00 的 2.55 词元/秒,降幅达 68.4%,变异系数波动性为 102.9%;deepseek-v4-flash 也下降了 41.4%,最终为 9.18 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均报告 12 个预期样本中的 12 个,在四小时的时间窗口内共有 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • gemma4:31b 是性能最强的模型,平均吞吐量达 128.18 词元/秒,远超 glm-5.3 的 92.89 词元/秒;nemotron-3-ultra 最弱,为 21.22 词元/秒,最低值为 0.64 词元/秒。
  • deepseek-v4-flash 降幅最陡,趋势为 -50.5%,从 07:20 的 113.78 词元/秒峰值跌至 10:00 的 59.57 词元/秒;nemotron-3-ultra 波动最大,变异系数为 100.0%,在 0.64 至 68.29 词元/秒之间波动。
  • 不存在缺失数据的限制:全部八个模型均有 12 个样本中的 12 个,valid_point_count 为 96,覆盖率为 100.0%,不过该时间窗口仅涵盖四个小时。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • gemma4:31b 是性能最强的模型,平均吞吐量为 131.01 词元/秒,峰值达 171.75 词元/秒;nemotron-3-ultra 性能最弱,平均为 26.09 词元/秒,最低为 0.64 词元/秒。
  • deepseek-v4-pro 表现出最剧烈的运行波动,从 07:20 的 118.32 词元/秒骤降至 08:00 的 10.99 词元/秒,随后在 08:20 恢复至 112.86 词元/秒;nemotron-3-ultra 同样不稳定,在 0.64 至 68.29 词元/秒之间波动,变异系数为 90.5%。
  • 不存在数据缺失的限制:全部八个模型均报告了 12 个样本中的 12 个,共 96 个有效数据点,在四小时时间窗口内覆盖率达到 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • gemma4:31b 是表现最强的模型,平均吞吐量为 134.51 词元/秒,p95 为 167.04 词元/秒;nemotron-3-ultra 最弱,平均为 26.77 词元/秒,从未超过 58.45 词元/秒。
  • nemotron-3-ultra 表现出对运行影响最大的波动性:变异系数为 80.6%,趋势为 -37.6%,波动范围从 0.64 到 58.45 词元/秒,最终收于 12.96 词元/秒;glm-5.2 是唯一明显提升的模型,上升 34.4% 至 107.88 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均报告了 12 个样本中的 12 个,总体覆盖率为 100.0%,共 96 个有效数据点,因此四小时的时间窗口是完整的。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • gemma4:31b 是性能最强的模型,平均吞吐量为 127.58 词元/秒(峰值 169.76 词元/秒),而 nemotron-3-ultra 是性能最弱的模型,平均为 38.83 词元/秒,最低为 3.05 词元/秒。
  • 运营层面最显著的波动是 06:00 UTC 的同步下降:minimax-m3 从 102.64 降至 40.59 词元/秒,glm-5.2 从 91.31 降至 20.99 词元/秒,nemotron-3-ultra 从 50.56 降至 3.05 词元/秒;nemotron-3-ultra 的变异性也最高,CV 为 54.4%。
  • 不存在数据缺失的限制:全部八个模型均有 12 个样本中的 12 个,在四小时的时间窗口内共有 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • gemma4:31b 是平均吞吐量最强的模型,达 125.41 词元/秒,领先于 106.70 词元/秒的 glm-5.3;nemotron-3-ultra 最弱,为 42.71 词元/秒,低于 54.51 词元/秒的 glm-5.2。
  • 波动最显著的是 deepseek-v4-flash,在 03:40 骤降至 15.26 词元/秒,随后在 04:40 恢复至 127.27 词元/秒,整体趋势为 -32.3%;glm-5.3-flash 从 191.77 词元/秒的峰值下跌 -37.3%,而 nemotron-3-ultra 的变异度最高,CV 为 50.0%。
  • 不存在缺失数据的限制:全部八个模型均有 12 个样本中的 12 个,在四小时窗口内共有 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • gemma4:31b 是表现最强的模型,平均吞吐量为 120.43 词元/秒,峰值达 163.48 词元/秒,而 nemotron-3-ultra 表现最弱,平均为 39.47 词元/秒,最低降至 6.36 词元/秒。
  • 运营层面最显著的模式是窗口后期的性能下降:glm-5.2 在 04:00 下降了 26.5%,降至 26.81 词元/秒,deepseek-v4-flash 从 00:40 的 152.97 词元/秒降至 04:00 的 43.87 词元/秒;nemotron-3-ultra 还表现出最高的波动性,变异系数为 54.7%。
  • 不存在数据缺失的限制:全部八个模型均报告了 12 个预期样本中的 12 个,共 96 个有效数据点,在四小时窗口内覆盖率达到 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • 平均吞吐量最强的是 gemma4:31b,达到 121.4 词元/秒(p95 为 175.26 词元/秒),而 nemotron-3-ultra 最弱,仅为 42.8 词元/秒,在任何观测中均未超过 79.54 词元/秒。
  • 波动最显著的是 nemotron-3-ultra,变异系数为 50.2%,在 6.36 至 79.54 词元/秒之间波动;glm-5.3-flash 呈现最陡峭的趋势,上升了 66.1%,并在 01:20 飙升至 191.77 词元/秒,而 deepseek-v4-pro 在 00:00 一度跌至 17.26 词元/秒。
  • 该时间窗口内不存在数据缺失的限制:全部八个模型均交付了 12 个预期样本中的 12 个,在四小时期间内共有 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • gemma4:31b 是平均吞吐量最强的模型,达到 136.71 词元/秒(峰值 181.94 词元/秒),而 nemotron-3-ultra 最弱,平均为 36.20 词元/秒,约为 gemma4:31b 速率的四分之一。
  • 八个模型中有七个呈下降趋势,其中 glm-5.2 下降 29.1%,minimax-m3 下降 25.9%;glm-5.3-flash 是例外,在 01:20 飙升至 191.77 词元/秒后上升了 63.1%,而 nemotron-3-ultra 的波动性最高,变异系数为 60.3%。
  • 不存在缺失数据的限制:所有八个模型均有 12 个样本中的 12 个,共 96 个有效数据点,在四小时的时间窗口内覆盖率达到 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • 平均吞吐量最高的是 gemma4:31b,达 131.79 词元/秒;最低的是 nemotron-3-ultra,为 33.95 词元/秒,约为领先者速率的四分之一。
  • 变化最显著的是 glm-5.3-flash,从 21:40 的 190.66 词元/秒降至 01:00 的 61.95 词元/秒(趋势 -30.4%),而 glm-5.3 呈上升趋势,涨幅 24.6%,平均达 103.86 词元/秒;nemotron-3-ultra 波动最大,变异系数为 76.5%,最低降至 4.06 词元/秒。
  • 不存在数据缺失的限制:全部 8 个模型均报告了 12 个预期样本中的 12 个,共 96 个有效数据点,在四小时时间窗口内覆盖率达 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • gemma4:31b 的平均吞吐量最高,达到 132.5 词元/秒(峰值 181.94 词元/秒),而 nemotron-3-ultra 表现最弱,平均仅为 35.23 词元/秒,且从未超过 93.69 词元/秒。
  • glm-5.3 呈现出最剧烈的运行状态变化,从 22:20 的 18.13 词元/秒跃升至 22:40 的 176.53 词元/秒,并在 00:00 之前一直保持在 142 词元/秒以上(趋势 +113.3%);相比之下,glm-5.3-flash 从 21:40 的 190.66 词元/秒骤降至 22:00 的 43.76 词元/秒。
  • 不存在数据缺失的限制:全部 8 个模型均记录了 12 个预期样本中的 12 个,在四小时的时间窗口内共计 96 个有效数据点,覆盖率达到 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • gemma4:31b 以 130.75 词元/秒的平均吞吐量位居最高,而 nemotron-3-ultra 表现最弱,仅为 40.07 词元/秒,不到领先者的三分之一,且在窗口收尾时仅有 4.06 词元/秒。
  • 运营层面最显著的波动来自 glm-5.3-flash(CV 57.9%),其吞吐量从 21:40 的 190.66 词元/秒骤降至 22:00 的 43.76 词元/秒;glm-3.3 同样在 22:20 降至 18.13 词元/秒,随后回升至 176.53 词元/秒。
  • 不存在缺失数据的限制:全部八个模型均有 12 个样本中的 12 个、96 个有效数据点,覆盖率为 100.0%,因此四小时窗口是完整的。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • gemma4:31b 是平均吞吐量最强的模型,达到 129.26 词元/秒,领先于 deepseek-v4-flash 的 124.50 词元/秒;nemotron-3-ultra 最弱,为 35.09 词元/秒,其中包括 0.98 词元/秒的低点。
  • glm-5.3-flash 波动性最为极端(变异系数 51.7%),范围从 43.76 到 190.66 词元/秒,后期一次运行接近 184-191 词元/秒,随后骤降至 43.76 词元/秒;nemotron-3-ultra 同样不稳定(变异系数 102.0%),在 0.98 到 95.88 词元/秒之间大幅波动。
  • 不存在数据缺失的限制:全部 8 个模型均报告 12 个样本中的 12 个,总计 96 个有效数据点,在四小时时间窗口内覆盖率达到 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4-flash 是平均吞吐量最强的模型,达到 128.84 词元/秒,略微领先于 gemma4:31b 的 126.83 词元/秒;nemotron-3-ultra 最弱,为 26.72 词元/秒。
  • 运营层面最显著的波动来自 nemotron-3-ultra,其变异系数为 120.5%,读数范围从 0.98 到 95.88 词元/秒;glm-5.3-flash 同样不稳定,为 52.2%,在 21:00 从 35.53 词元/秒的低点飙升至 183.8 词元/秒。
  • 不存在缺失数据的限制:全部八个模型均有 12 个样本中的 12 个,数据集报告了 96 个有效数据点,在四小时窗口内覆盖率达到 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4-flash 是最强的模型,平均吞吐量为 134.54 词元/秒,略领先于 gemma4:31b 的 130.09 词元/秒;nemotron-3-ultra 最弱,平均为 19.78 词元/秒,最低为 0.98 词元/秒。
  • 运营层面最显著的波动来自 nemotron-3-ultra,在 0.98 至 95.88 词元/秒之间波动(CV 130.5%);glm-5.3-flash 和 deepseek-v4-pro 的波动也很大(CV 分别为 46.2% 和 45.7%),而 deepseek-v4-flash 最为稳定,CV 为 13.0%。
  • 不存在数据缺失的限制:全部八个模型均报告 12 个样本中的 12 个,共 96 个有效数据点,在四小时窗口内覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • 平均吞吐量最强的是 deepseek-v4-flash,达到 130.97 词元/秒(在 17:20 达到峰值 166.55 词元/秒),而最弱的是 nemotron-3-ultra,为 10.26 词元/秒,从未超过 30.88 词元/秒,且最低降至 0.98 词元/秒。
  • 波动最显著的是 nemotron-3-ultra(变异系数 80.1%)和 glm-5.3,后者从 16:40 的 173.24 词元/秒峰值下降 31.8%,至 18:40 降至 60.67 词元/秒;deepseek-v4-pro 也在 16:40 降至 15.65 词元/秒。
  • 不存在数据缺失的限制:全部 8 个模型均交付了 12 个预期样本中的 12 个,在四小时的时间窗口内产生 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4-flash 的平均吞吐量最高,达到 126.11 词元/秒,峰值为 166.55 词元/秒,而 nemotron-3-ultra 是表现最弱的模型,平均仅为 14.39 词元/秒,且从未超过 48.43 词元/秒。
  • deepseek-v4-pro 表现出最剧烈的运行波动性,变异系数为 47.5%,趋势为 -42.2%,从 14:40 的 113.05 词元/秒骤降至 16:40 的 15.65 词元/秒;nemotron-3-ultra 的稳定性更差,变异系数高达 86.1%。
  • 不存在数据缺失的限制:全部八个模型均报告了 12 个样本中的 12 个,数据集记录了 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • gemma4:31b 的平均吞吐量最高,达 137.57 词元/秒(峰值 179.5 词元/秒),而 nemotron-3-ultra 表现最弱,平均 21.15 词元/秒,最终收于 6.22 词元/秒。
  • glm-5.3 呈现最强劲的正向趋势,从 59.44 词元/秒的低点上涨 65.9%,在 UTC 15:40 至 16:40 期间持续保持在 165.88–173.24 词元/秒区间;nemotron-3-ultra 波动最大(变异系数 81.2%),下跌 58.1% 至 6.22 词元/秒,deepseek-v4-pro 在 16:40 一度跌至 15.65 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均记录了 12 个预期样本中的 12 个,在四小时窗口内共产生 96 个有效数据点,覆盖率达 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • gemma4:31b 的平均吞吐量最高,达 130.78 词元/秒,峰值达 179.5 词元/秒,而 nemotron-3-ultra 表现最弱,平均仅 21.36 词元/秒,且从未超过 55.92 词元/秒。
  • glm-5.3 的波动性对运行影响最大,变异系数为 45.4%,在 56.14 至 184.53 词元/秒之间波动;nemotron-3-ultra 的稳定性更差,变异系数达 79.7%,在整个时间窗口内于 6.1 至 55.92 词元/秒之间振荡。
  • 不存在数据缺失的限制:全部八个模型均报告了 12 个预期样本中的 12 个,共 96 个有效数据点,覆盖率为 100.0%,因此从 UTC 12:20 到 16:00 的每个二十分钟间隔均有数据。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • gemma4:31b 是最强模型,平均吞吐量为 127.18 词元/秒,领先于 deepseek-v4-flash 的 117.65 词元/秒;nemotron-3-ultra 最弱,平均为 19.45 词元/秒,最低降至 3.48 词元/秒。
  • glm-5.3 表现出最剧烈的运行波动:它在 12:40 达到 184.53 词元/秒的峰值,随后在 13:00 降至 56.14 词元/秒并持续波动,最终以 80.39 词元/秒收尾,趋势为 -40.9%;nemotron-3-ultra 最不稳定,变异系数为 88.9%。
  • 不存在数据缺失的限制:全部八个模型均有 12 个样本中的 12 个,数据集报告了 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4-flash 是最强模型,平均吞吐量为 128.77 词元/秒,峰值达 210.67 词元/秒,而 nemotron-3-ultra 最弱,平均仅 17.01 词元/秒,从未超过 55.92 词元/秒。
  • 运营层面最显著的变化是 glm-5.3 下降了 20.4%,从 12:40 的 184.53 词元/秒峰值跌至 14:00 的 59.44 词元/秒;nemotron-3-ultra 也表现出极端波动性,变异系数高达 93.4%。
  • 不存在数据缺失的限制:全部八个模型均交付了 12 个预期样本中的 12 个,数据集报告了 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4-flash 是最强的模型,平均吞吐量为 135.83 词元/秒(峰值 210.67 词元/秒),而 nemotron-3-ultra 最弱,平均为 19.39 词元/秒,峰值仅为 73.62 词元/秒。
  • 运营层面最显著的波动来自 nemotron-3-ultra,其变异系数为 107.0%,在 3.48 至 73.62 词元/秒之间摆动,趋势为 -69.4%,最终收于 6.83 词元/秒;glm-5.3 在最后一个区间也从 184.53 摆动至 56.14 词元/秒。
  • 不存在缺失数据的限制:全部八个模型均报告了 12 个预期样本中的 12 个,在 96 个有效数据点上实现了 100.0% 的覆盖率。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • 平均吞吐量最强的是 deepseek-v4-flash,达 142.26 词元/秒(峰值 210.67 词元/秒),而 nemotron-3-ultra 最弱,为 27.04 词元/秒,约为领先者平均值的三分之一……不,约为领先者平均值的五分之一。
  • 波动最显著的是 nemotron-3-ultra:变异系数为 83.0%,趋势为 -68.3%,且在 73.62 词元/秒至 3.48 词元/秒之间大幅波动;glm-5.3 走势相反,上升 31.7%,收于 134.24 词元/秒。
  • 该时间窗口内不存在数据缺失的限制:全部八个模型均提供了 12 个预期样本中的 12 个,共 96 个有效数据点,覆盖率为 100.0%,但四小时的时间跨度限制了对更长期结论的推断。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4-flash 是最强的模型,平均吞吐量为 146.24 词元/秒(峰值 210.67 词元/秒),而 nemotron-3-ultra 最弱,平均为 26.85 词元/秒,峰值仅为 73.62 词元/秒。
  • 八个模型中有六个在观测期内出现下滑;glm-5.2 下降 22.5%,收于 33.34 词元/秒,deepseek-v4-pro 在 10:40 降至 29.39 词元/秒。nemotron-3-ultra 波动最大,波动范围为 3.89 至 73.62 词元/秒,变异系数为 84.8%。
  • 不存在缺失数据的限制:全部 96 个预期数据点均有效,每个模型都有 12 个样本中的 12 个,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4-flash 是最强的模型,平均吞吐量为 139.41 词元/秒(峰值 196.85 词元/秒),而 nemotron-3-ultra 最弱,平均为 31.51 词元/秒,峰值仅为 73.62 词元/秒。
  • nemotron-3-ultra 表现出对运营影响最显著的波动性,变异系数为 74.9%,波动范围在 3.89 至 73.62 词元/秒之间;glm-5.3 的波动性次之,CV 为 38.0%,范围为 55.08 至 187.24 词元/秒。
  • 不存在数据缺失的限制:全部 96 个预期数据点均有效(覆盖率 100.0%),且在四小时的时间窗口内,每个模型都有 12 个样本中的 12 个。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • 平均吞吐量最高的是 gemma4:31b,达 130.93 词元/秒;最低的是 nemotron-3-ultra,为 26.87 词元/秒,后者还在 06:00 UTC 记录了该时间窗口内最低的单次读数 2.23 词元/秒。
  • 运营层面最显著的波动来自 glm-5.3-flash,其变异系数为 43.5%,在 172.45 至 20.84 词元/秒之间摆动;deepseek-v4-flash 是唯一呈现明显上升趋势的模型,涨幅为 +11.2%,并于 07:20 UTC 达到 196.85 词元/秒的峰值。
  • 不存在数据缺失的限制:全部八个模型均有 12/12 个样本,数据集包含 96 个有效数据点,整个四小时时间窗口的覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • gemma4:31b 以 130.04 词元/秒的平均输出吞吐量领先,略微超过 deepseek-v4-flash 的 126.59 词元/秒,而 nemotron-3-ultra 是表现最弱的模型,仅为 23.80 词元/秒。
  • glm-5.3-flash 恶化最为严重,从 04:40 的 185.04 词元/秒峰值下降 50.2%,至 08:00 的 54.27 词元/秒;nemotron-3-ultra 波动最大,变异系数为 78.4%,在 2.23 至 60.25 词元/秒之间波动。
  • 不存在数据缺失的限制:全部八个模型均记录了 12 个预期样本中的 12 个,产生 96 个有效数据点,在四小时时间窗口内覆盖率达到 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4-flash 是平均吞吐量最强的模型,达到 131.33 词元/秒,略微领先于 gemma4:31b 的 130.9 词元/秒;nemotron-3-ultra 最弱,平均仅为 31.36 词元/秒,最大值也只有 73.68 词元/秒。
  • 运营层面最显著的波动来自 nemotron-3-ultra,其变异系数为 71.4%,包括在 06:00 降至 2.23 词元/秒、在 03:40 降至 3.01 词元/秒;glm-5.3-flash 同样不稳定,波动范围从 20.84 到 185.04 词元/秒,变异系数为 53.4%。
  • 不存在数据缺失的限制:全部 96 个预期数据点均有效,覆盖率为 100.0%,且每个模型都有 12 个样本中的 12 个,因此该四小时时间窗口是完整的。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • 平均吞吐量最强的是 gemma4:31b,达 141.18 词元/秒(峰值 190.48 词元/秒);最弱的是 nemotron-3-ultra,为 35.60 词元/秒,从未超过 73.68 词元/秒。
  • glm-5.3 呈现最强劲的上升趋势,达 +39.5%,但波动性较高(标准差 47.99 词元/秒,变异系数 40.8%);nemotron-3-ultra 波动性最大(变异系数 64.7%),在 06:00 骤降至 2.23 词元/秒,而 deepseek-v4-flash 在同一观测时点降至 34.47 词元/秒。
  • 不存在数据缺失的限制:全部 8 个模型均报告了 12 个样本中的 12 个,共 96 个有效数据点,在四小时时间窗口内覆盖率达到 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • gemma4:31b 以 146.77 词元/秒的平均吞吐量表现最强,略胜 deepseek-v4-flash 的 139.32 词元/秒,而 nemotron-3-ultra 最弱,仅为 36.32 词元/秒,远低于 glm-5.2 的 74.4 词元/秒。
  • glm-5.3-flash 的波动性对运营影响最大,在 22.93 至 196.26 词元/秒之间波动,变异系数为 44.0%,趋势为 -23.5%;nemotron-3-ultra 同样不稳定,变异系数达 75.4%,最低降至 1.65 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均记录了 12 个预期样本中的 12 个,在四小时窗口内共有 96 个有效数据点,覆盖率为 100.0%,因此各项平均值均基于完整数据。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • 平均吞吐量最强的是 gemma4:31b,达 151.78 词元/秒(p95 为 186.59 词元/秒);最弱的是 nemotron-3-ultra,为 37.0 词元/秒,最低值为 1.65 词元/秒。
  • glm-5.3-flash 表现出对运营影响最大的波动性,从 01:20 的 196.26 词元/秒降至 04:00 的 22.93 词元/秒,变异系数为 46.1%,趋势为 -22.5%;glm-5.3 同样在 172.31 至 62.75 词元/秒之间大幅波动。
  • 不存在数据缺失的限制:全部八个模型均记录了 12 个预期样本中的 12 个,在四小时窗口内共产生 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • gemma4:31b 以 133.75 词元/秒的平均吞吐量表现最强(峰值达 183.41 词元/秒),而 nemotron-3-ultra 最弱,为 42.27 词元/秒,在整个时间窗口内从未超过 95.76 词元/秒。
  • nemotron-3-ultra 表现出对运行影响最显著的波动性,变异系数为 73.8%,从 01:40 的 1.65 词元/秒到 23:40 的 95.76 词元/秒大幅摆动;glm-5.3 也在 62.75 至 172.31 词元/秒之间剧烈震荡。
  • 不存在数据缺失的限制:全部八个模型均记录了 12 个预期样本中的 12 个,在四小时期间内共有 96 个有效数据点和 100.0% 的覆盖率,因此该摘要反映了完整的观测结果。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • 平均吞吐量最高的是 deepseek-v4-flash,达 139.49 词元/秒(峰值 195.83 词元/秒);最低的是 nemotron-3-ultra,仅 37.11 词元/秒,远低于次低的 glm-5.2(81.56 词元/秒)。
  • nemotron-3-ultra 表现出对运行影响最为显著的波动性:变异系数为 86.4%,在 01:40 时低至 1.65 词元/秒,在 23:40 时高达 95.76 词元/秒,趋势为 -37.9%,且多次跌破 20 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均记录了 12 个样本中的 12 个,valid_point_count 为 96,在四小时窗口内覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强的模型,平均吞吐量为 141.90 词元/秒,而 nemotron-3-ultra 最弱,平均为 50.87 词元/秒,约为领先者速率的三分之一。
  • 运营层面最显著的波动来自 nemotron-3-ultra,其在 3.85 至 95.76 词元/秒之间波动,变异系数为 63.5%;glm-5.3 也呈现出 -31.3% 的急剧下降趋势,从 186.30 词元/秒的峰值降至 23:40 时的 65.00 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均有 12 个样本中的 12 个,共 96 个有效数据点,覆盖率为 100.0%,但四小时的时间窗口限制了对更长期结论的推断。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4-flash 以 140.33 词元/秒的平均吞吐量领先,略微超过 glm-5.3 的 140.21 词元/秒;nemotron-3-ultra 表现最弱,仅为 48.46 词元/秒,从未超过 95.76 词元/秒。
  • glm-5.3 在 21:40 至 23:00 期间保持在 168–186 词元/秒,随后在 23:20 和 23:40 分别降至 75.45 和 65.0 词元/秒,之后回升至 136.34 词元/秒;nemotron-3-ultra 波动最大,变异系数为 69.6%,在 3.85 至 95.76 词元/秒之间波动。
  • 不存在数据缺失的限制:全部八个模型均记录了 12 个样本中的 12 个,在四小时窗口内共产生 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强的模型,平均吞吐量为 153.72 词元/秒(峰值 186.30 词元/秒);nemotron-3-ultra 最弱,平均为 38.10 词元/秒,在 23:00 UTC 时降至 3.85 词元/秒。
  • 运营层面最显著的波动来自 nemotron-3-ultra,在 3.85 至 94.35 词元/秒之间波动(变异系数 80.2%),以及 glm-5.3-flash,范围为 62.32 至 193.35 词元/秒(变异系数 43.5%);与此同时,glm-5.3 呈上升趋势,上升了 20.8%,从 130.10 词元/秒的低点升至 186.30 词元/秒的峰值。
  • 不存在数据缺失的限制:全部八个模型均报告 12 个样本中的 12 个,共 96 个有效数据点,在四小时的时间窗口内覆盖率达到 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强的模型,平均吞吐量为 146.23 词元/秒,在 22:00 UTC 达到 186.3 词元/秒的峰值,而 nemotron-3-ultra 是最弱的模型,平均为 35.57 词元/秒,从未超过 94.35 词元/秒。
  • 运营层面最显著的波动来自 nemotron-3-ultra,其变异系数为 86.1%,在 6.13 至 94.35 词元/秒之间波动,并在该时间窗口内呈 155.9% 的上升趋势;gemma4:31b 也从 173.46 词元/秒的峰值降至 22:00 时的 55.4 词元/秒,降幅为 23.4%。
  • 不存在数据缺失的限制:全部八个模型均有 12 个样本中的 12 个,valid_point_count 为 96,覆盖率为 100.0%,因此该四小时窗口的数据是完整的。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • 平均吞吐量最强的是 gemma4:31b,达 146.45 词元/秒(峰值 173.46 词元/秒);最弱的是 nemotron-3-ultra,为 19.53 词元/秒,最大值仅为 44.67 词元/秒。
  • deepseek-v4-flash 呈现最强劲的上升趋势,达 +38.1%,范围从 64.58 到 187.41 词元/秒,而 glm-5.2 下降了 30.0%,降至 55.5 词元/秒;nemotron-3-ultra 波动最大,变异系数为 73.1%。
  • 不存在数据缺失的限制:全部八个模型均报告 12 个样本中的 12 个,覆盖率为 100.0%,且 96 个有效数据点与预期总数相符,因此四小时时间窗口是完整无缺的。