← 返回性能仪表板

每小时性能洞察

滚动四小时性能数据摘要

已保留 1187 条摘要
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强模型,平均输出吞吐量为 129.58 词元/秒,领先于 124.19 词元/秒的 gemma4:31b;nemotron-3-ultra 最弱,平均为 37.83 词元/秒,从未超过 75.69 词元/秒。
  • deepseek-v4.1-flash 表现出对运营影响最大的波动性,变异系数为 60.6%,波动范围从 19.01 到 185.99 词元/秒;glm-5.3 在整个时间窗口内也下降了 22.0%,最终为 63.23 词元/秒,而其峰值为 178.26 词元/秒。
  • 不存在数据缺失的限制:全部 8 个模型均交付了 12 个预期样本中的 12 个,共计 96 个有效数据点,覆盖率为 100.0%,但四小时的时间窗口限制了对更长期情况的评估。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强的模型,平均吞吐量为 123.05 词元/秒(峰值 178.26 词元/秒),而 nemotron-3-ultra 最弱,平均为 29.47 词元/秒,从未超过 50.9 词元/秒。
  • deepseek-v4.1-flash 表现出对运营影响最大的波动性,在 19.01 至 194.62 词元/秒之间摆动,变异系数为 53.6%;glm-5.2 同样不稳定,达 59.2%,在 21:00 UTC 时降至 12.85 词元/秒。
  • 不存在数据缺失的限制:全部 8 个模型均交付了 12 个预期样本中的 12 个,在四小时的时间窗口内产生 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强模型,平均吞吐量为 130.48 词元/秒,略微领先于 deepseek-v4.1-flash 的 128.91 词元/秒;nemotron-3-ultra 最弱,平均为 24.05 词元/秒,从未超过 41.31 词元/秒。
  • deepseek-v4.1-flash 表现出对运营影响最显著的波动性,从 18:40 的 194.62 词元/秒骤降至 19:40 的 19.01 词元/秒,变异系数为 47.7%,趋势为 -47.3%;glm-5.2 同样不稳定,CV 为 73.3%,最终收于 12.85 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均有 12 个样本中的 12 个,共 96 个有效数据点,在四小时窗口内覆盖率达到 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • glm-5.3 的平均吞吐量最高,达到 131.79 词元/秒,并在 UTC 20:00 达到 178.26 词元/秒的峰值,而 nemotron-3-ultra 表现最弱,平均仅为 24.09 词元/秒,且从未超过 41.31 词元/秒。
  • deepseek-v4.1-flash 表现出对运行影响最为显著的波动性,在 12.98 至 198.28 词元/秒之间大幅摆动,变异系数为 61.1%,其中包括从 19:00 的 160.86 词元/秒跌至 19:20 的 38.51 词元/秒,随后回升至 185.99 词元/秒。
  • 不存在数据缺失的限制:全部 8 个模型均记录了 12 个预期样本中的 12 个,产生 96 个有效数据点,在四小时的时间窗口内覆盖率达到 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4.1-flash 是平均吞吐量最强的模型,达到 136.12 词元/秒,而 nemotron-3-ultra 最弱,仅为 21.19 词元/秒,两者之间大约有 6.4 倍的差距。
  • 运营层面最显著的波动来自 deepseek-v4.1-flash,其吞吐量从 15:40 的 209.88 词元/秒骤降至 16:40 的 12.98 词元/秒,变异系数为 46.9%;deepseek-v4-pro 也从 15.9 词元/秒的低点攀升至 115.41 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均记录了 12 个预期样本中的 12 个,在四小时的时间窗口内共有 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4.1-flash 是平均吞吐量最强的模型,达到 145.0 词元/秒,峰值为 232.5 词元/秒;nemotron-3-ultra 最弱,平均仅 17.82 词元/秒,从未超过 30.41 词元/秒。
  • 运营层面最显著的波动出现在 deepseek-v4.1-flash,其吞吐量从 14:40 的 232.5 词元/秒降至 16:40 的 12.98 词元/秒,随后在 17:40 恢复至 198.28 词元/秒,变异系数为 49.2%;glm-5.2 同样在 101.73 和 15.97 词元/秒之间大幅波动。
  • 不存在数据缺失的限制:全部八个模型均记录了 12 个预期样本中的 12 个,在四小时的时间窗口内共有 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4.1-flash 是最强模型,平均吞吐量为 137.49 词元/秒,而 nemotron-3-ultra 是最弱模型,平均为 20.03 词元/秒,约为领先者速度的七分之一。
  • 运营层面最显著的变化是 deepseek-v4.1-flash 的崩溃:在 13:40 UTC 达到 243.68 词元/秒的峰值后,于 16:40 跌至 12.98 词元/秒,趋势为 -39.7%,变异系数为 60.4%,表明表现最佳的模型存在严重的不稳定性。
  • 不存在数据缺失的限制:全部八个模型均有 12 个样本中的 12 个,valid_point_count 为 96,在四小时窗口内覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4.1-flash 是最强模型,平均吞吐量为 150.03 词元/秒;nemotron-3-ultra 最弱,平均为 19.73 词元/秒,低了约 7.6 倍。
  • deepseek-v4.1-flash 的波动性最具运营意义,范围从 20.22 到 243.68 词元/秒,变异系数为 51.5%,趋势为 +63.2%,而 minimax-m3 下降了 42.4%,最新读数为 42.08 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均报告 12 个样本中的 12 个、96 个有效数据点,在四小时窗口内覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4.1-flash 是最强的模型,平均吞吐量为 135.07 词元/秒,而 nemotron-3-ultra 最弱,平均为 24.51 词元/秒。
  • 运营层面最显著的波动性来自 deepseek-v4.1-flash,其吞吐量在 20.22 至 243.68 词元/秒之间波动(变异系数 57.9%),而 gemma4:31b 呈现最陡峭的下降,从 184.32 词元/秒的峰值下降 40.5%,在时间窗口后期降至约 68-97 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均报告 12 个样本中的 12 个、96 个有效数据点以及 100.0% 的覆盖率;唯一的限制是时间窗口较短,仅为四小时,每个模型有十二次观测。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • 平均吞吐量最强的是 gemma4:31b,达到 135.0 词元/秒,在 11:40 达到峰值 184.32 词元/秒,而 nemotron-3-ultra 最弱,平均为 28.03 词元/秒,且从未超过 57.64 词元/秒。
  • 运营层面最显著的波动来自 deepseek-v4.1-flash,其吞吐量在 13:40 为 243.68 词元/秒,到 14:00 降至 20.22 词元/秒,变异系数为 56.2%;deepseek-v4-pro 同样在 11.76 至 114.54 词元/秒之间大幅波动。
  • 不存在数据缺失的限制:全部八个模型均交付了 12 个预期样本中的 12 个,在四小时窗口内产生 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • gemma4:31b 的平均吞吐量最高,达到 135.78 词元/秒,而 nemotron-3-ultra 最弱,仅为 27.62 词元/秒;deepseek-v4.1-flash 和 glm-5.3 紧随其后,分别为 132.95 和 129.78 词元/秒。
  • deepseek-v4.1-flash 的波动最为剧烈,在 10:00 达到峰值 210.67 词元/秒,随后在 12:40 降至 37.08 词元/秒,变异系数为 44.3%,趋势为 -41.1%;glm-5.3 也在 182.87 和 65.78 词元/秒之间波动。
  • 不存在缺失数据的限制:全部八个模型均有 12 个样本中的 12 个,共 96 个有效数据点,覆盖率为 100.0%,不过该时间窗口仅覆盖四个小时。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4.1-flash 的平均吞吐量最高,达 140.28 词元/秒,峰值为 210.67 词元/秒,而 nemotron-3-ultra 最弱,平均仅 25.28 词元/秒,且从未超过 45.36 词元/秒。
  • glm-5.3 的波动最为剧烈,范围从 50.69 到 182.87 词元/秒,变异系数为 47.2%,其中包括从 10:20 的 181.17 词元/秒跌至 10:40 的 72.23 词元/秒;deepseek-v4.1-flash 也在 12:00 从 142.01 降至 37.34 词元/秒。
  • 不存在缺失数据的限制:全部 8 个模型均记录了 12 个预期样本中的 12 个,共计 96 个有效数据点,在四小时窗口内覆盖率达到 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • glm-5.3-flash 是最强的模型,平均吞吐量为 146.88 词元/秒,峰值达 221.2 词元/秒;nemotron-3-ultra 最弱,平均为 25.75 词元/秒,从未超过 79.12 词元/秒。
  • glm-5.3 的波动性最具运维意义,在 49.75 至 182.87 词元/秒之间波动,变异系数为 46.8%,而 deepseek-v4-pro 在 UTC 10:00 降至 5.64 词元/秒,随后在 10:40 恢复至 114.54 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均记录了 12 个预期样本中的 12 个,在四小时的时间窗口内产生 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • glm-5.3-flash 是平均吞吐量最强的模型,达到 147.85 词元/秒,领先于 deepseek-v4.1-flash(134.79 词元/秒)和 gemma4:31b(133.44 词元/秒);nemotron-3-ultra 最弱,平均仅为 24.36 词元/秒,最大值也仅有 79.12 词元/秒。
  • 运营层面最显著的波动是 deepseek-v4-pro 在 09:00 至 09:40 期间保持 85.61 至 114.36 词元/秒后,于 10:00 骤降至 5.64 词元/秒;deepseek-v4.1-flash 同样在 08:20 跌至 24.35 词元/秒,随后在 10:00 前恢复至 210.67 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均有 12 个样本中的 12 个,整体覆盖率为 100.0%,共 96 个有效数据点。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • gemma4:31b 是平均吞吐量最强的模型,达到 142.88 词元/秒,略微领先于 glm-5.3-flash 的 137.72 词元/秒;nemotron-3-ultra 最弱,平均仅为 24.25 词元/秒,最大值也只有 79.12 词元/秒。
  • deepseek-v4.1-flash 表现出最急剧的恶化,呈 41.8% 的下降趋势,从 06:00 的 196.28 词元/秒跌至 08:20 的 24.35 词元/秒,而 glm-5.3-flash 则改善了 57.7%,从 05:20 的 5.74 词元/秒提升至 09:00 的 221.2 词元/秒;nemotron-3-ultra 波动最大,CV 为 81.5%。
  • 不存在缺失数据的限制:全部 96 个预期数据点均有效,覆盖率为 100.0%,且每个模型在四小时窗口内都拥有 12 个样本中的全部 12 个。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • gemma4:31b 是平均吞吐量最强的模型,达到 152.3 词元/秒(p95 为 175.61 词元/秒),而 nemotron-3-ultra 最弱,平均仅为 28.44 词元/秒,峰值也仅有 79.12 词元/秒。
  • 运营层面最显著的变化来自 glm-5.3-flash,其从 04:20 的 5.15 词元/秒攀升至 06:20 的 233.42 词元/秒,趋势为 294.8%,变异系数为 77.4%;deepseek-v4.1-flash 也在 08:00 降至 24.65 词元/秒,为其窗口最低值。
  • 不存在数据缺失的限制:全部八个模型均报告了 12 个预期样本中的 12 个,共 96 个有效数据点,覆盖率为 100.0%,因此该四小时窗口是完整的。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4.1-flash 是最强的模型,平均速度为 154.31 词元/秒,略微领先于 gemma4:31b 的 151.3 词元/秒;nemotron-3-ultra 最弱,平均速度为 34.64 词元/秒,最终仅为 3.86 词元/秒。
  • glm-5.3-flash 表现出对运行影响最为显著的波动性:它在前七个时间间隔内运行速度接近 5-12 词元/秒,随后在 06:20 跃升至 233.42 词元/秒,变异系数为 120.2%。glm-5.3 还在 03:40 的 184.0 词元/秒下降至 05:40 的 64.84 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均有 12 个样本中的 12 个,valid_point_count 为 96,在四小时的时间窗口内覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • gemma4:31b 是表现最强的模型,平均吞吐量为 154.77 词元/秒,以微弱优势领先于 154.75 词元/秒的 deepseek-v4.1-flash;nemotron-3-ultra 表现最弱,平均为 36.89 词元/秒。
  • glm-5.3-flash 的波动性对运营影响最大:在 03:00 达到 182.04 词元/秒的峰值后,它在连续七次观测(03:20 至 05:20)中跌破 12 词元/秒,变异系数为 127.9%,随后恢复至 130.12 词元/秒。
  • 不存在缺失数据的限制:全部 8 个模型均交付了 12 个预期样本中的 12 个,在四小时的时间窗口内共产生 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4.1-flash 是最强的模型,平均吞吐量为 165.19 词元/秒(峰值 254.14 词元/秒),而 nemotron-3-ultra 最弱,平均为 42.42 词元/秒,峰值仅为 76.96 词元/秒。
  • 运营层面最显著的波动出现在 glm-5.3-flash,其在 UTC 02:20 之后的大多数观测中从 191.44 词元/秒的最大值跌至约 5-11 词元/秒,变异系数为 106.5%,趋势为 -94.4%。
  • 不存在数据缺失的限制:全部八个模型均报告了 12 个预期样本中的 12 个、96 个有效数据点,以及四小时窗口内 100.0% 的覆盖率。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4.1-flash 是最强模型,平均吞吐量为 164.14 词元/秒,峰值达 254.14 词元/秒;minimax-m3 最弱,平均为 49.33 词元/秒,最低为 10.31 词元/秒。
  • glm-5.3-flash 波动最为剧烈,变异系数达 78.8%,并在 UTC 时间 01:00、02:20、03:20 和 03:40 多次骤降至约 7-12 词元/秒;deepseek-v4.1-flash 也从 02:20 的 254.14 词元/秒骤降至 03:40 的 21.39 词元/秒,随后回升至 201.4 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均记录了 12 个预期样本中的 12 个,在四小时时间窗口内共有 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4.1-flash 是最强的模型,平均吞吐量为 175.68 词元/秒,峰值达 233.3 词元/秒,而 nemotron-3-ultra 最弱,平均为 40.98 词元/秒,从未超过 77.48 词元/秒。
  • 运营层面最重大的事件是 01:00 UTC 出现的同步吞吐量下降,当时 glm-5.3-flash 降至 6.91 词元/秒,minimax-m3 降至 10.31 词元/秒,gemma4:31b 降至 36.03 词元/秒;minimax-m3 还表现出最高的波动性,变异系数为 47.0%。
  • 不存在数据缺失的限制:全部八个模型均有 12 个预期样本中的 12 个,valid_point_count 为 96,覆盖率为 100.0%,因此四小时的时间窗口得到了完整呈现。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4.1-flash 是最强的模型,平均吞吐量为 173.88 词元/秒,峰值达 233.3 词元/秒;nemotron-3-ultra 最弱,平均为 43.08 词元/秒,从未超过 77.48 词元/秒。
  • 运营层面最显著的波动是 glm-5.3-flash 在 01:00 的骤降,从 00:20 的 175.51 词元/秒跌至 6.91 词元/秒;deepseek-v4.1-flash 也在 23:40 一度降至 33.76 词元/秒,随后恢复至 229.94 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均有 12 个样本中的 12 个,数据集报告 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • gemma4:31b 在平均吞吐量方面是最强的模型,达到 143.0 词元/秒,仅在峰值上落后于 deepseek-v4.1-flash 的 164.21 词元/秒(最高 233.3 词元/秒);glm-5.2 最弱,平均 43.18 词元/秒,仅略微低于 nemotron-3-ultra 的 42.0 词元/秒。
  • minimax-m3 表现出最具运营意义的波动性,在 11.52 至 105.05 词元/秒之间摆动,变异系数为 54.8%,趋势为 47.4%;deepseek-v4.1-flash 也在 23:40 降至 33.76 词元/秒。
  • 不存在缺失数据的限制:全部 8 个模型均报告了 12 个样本中的 12 个,在四小时窗口内共有 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4.1-flash 是平均吞吐量最强的模型,达到 163.79 词元/秒,而 nemotron-3-ultra 最弱,平均为 42.45 词元/秒。
  • glm-5.3 表现出对运行影响最显著的波动性,变异系数为 39.8%,波动范围在 31.52 至 182.87 词元/秒之间,并伴随 18.9% 的下降趋势;相比之下,deepseek-v4.1-flash 在该时间窗口内提升了 26.3%。
  • 不存在缺失数据的限制:全部八个模型均有 12 个样本中的 12 个,valid_point_count 为 96,覆盖率为 100.0%,因此完整表示了整个四小时窗口。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • gemma4:31b 是最强的模型,平均吞吐量为 140.28 词元/秒(峰值达 176.61 词元/秒),而 nemotron-3-ultra 是最弱的模型,平均为 37.99 词元/秒,在整个时间窗口内从未超过 66.59 词元/秒。
  • deepseek-v4.1-flash 表现出对运营影响最显著的波动性,从 18:40 的低点 9.07 词元/秒摆动到 21:40 的高点 215.65 词元/秒,变异系数为 43.6%,上升趋势为 65.6%;glm-5.3 也在 31.52 至 182.87 词元/秒之间震荡。
  • 不存在数据缺失的限制:全部八个模型均拥有 12 个预期样本中的 12 个,valid_point_count 为 96,且在整个四小时期间覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • 平均吞吐量最强的是 gemma4:31b,12 个样本平均达 142.86 词元/秒(范围 96.61–171.19 词元/秒);最弱的是 nemotron-3-ultra,12 个样本平均为 27.06 词元/秒(范围 6.09–62.14 词元/秒)。
  • deepseek-v4.1-flash 波动幅度最大,跨度从 9.07 到 231.01 词元/秒,变异系数为 54.4%,而 glm-5.3 整体上升 63.4%,最新读数达到 174.8 词元/秒;deepseek-v4-pro 也在 20:40 一度跌至 37.21 词元/秒,随后回升至 115.68 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均有 12 个样本中的 12 个,共 96 个有效数据点,覆盖率为 100.0%,但四小时的时间窗口限制了对更长期结论的推断。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • gemma4:31b 是最强模型,平均吞吐量为 141.79 词元/秒,峰值达 163.56 词元/秒;nemotron-3-ultra 最弱,平均为 23.86 词元/秒,波动范围在 6.09 至 62.14 词元/秒之间。
  • deepseek-v4.1-flash 表现出对运营影响最大的波动性,变异系数为 53.2%,从 17:20 的 231.01 词元/秒骤降至 18:40 的 9.07 词元/秒,趋势为 -33.2%;glm-5.3 也在 42.51 至 182.87 词元/秒之间震荡。
  • 不存在数据缺失的限制:全部八个模型均报告了 12 个样本中的 12 个,在四小时窗口内共提供 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • 平均吞吐量最强的是 gemma4:31b,达 134.03 词元/秒(12 个样本,范围 69.48–163.32 词元/秒);最弱的是 nemotron-3-ultra,为 20.93 词元/秒(12 个样本,范围 6.09–63.19 词元/秒)。
  • 运营层面最显著的波动来自 deepseek-v4.1-flash:变异系数为 56.0%,从 17:20 的 231.01 词元/秒骤降至 18:40 的 9.07 词元/秒,趋势为 -33.2%。glm-5.3 同样在约 42.51 与 181.44 词元/秒之间剧烈震荡。
  • 不存在数据缺失的限制:全部八个模型均拥有 12 个预期样本中的 12 个,共 96 个有效数据点,在截至 19:03 UTC 的四小时时间窗口内覆盖率达到 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4.1-flash 是平均吞吐量最强的模型,达到 154.56 词元/秒,峰值高达 234.24 词元/秒,而 nemotron-3-ultra 最弱,平均仅为 21.87 词元/秒,从未超过 63.19 词元/秒。
  • 运营层面最重大的事件是 deepseek-v4.1-flash 在 17:20 从 231.01 词元/秒骤降至 18:00 的 19.92 词元/秒,为其区间最低值;nemotron-3-ultra 同样表现出极端波动性,变异系数达 76.0%。
  • 不存在数据缺失的限制:全部八个模型均有 12 个样本中的 12 个,覆盖率为 100.0%,总计 96 个有效数据点,因此四小时的时间窗口得到了完整呈现。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4.1-flash 是性能最强的模型,平均吞吐量为 150.61 词元/秒(峰值 234.24 词元/秒),而 nemotron-3-ultra 是性能最弱的模型,平均为 24.31 词元/秒(最低 6.69 词元/秒)。
  • minimax-m3 呈现出最具运营意义的下降趋势,跌幅为 -23.6%,最新读数为 19.02 词元/秒,而其平均值为 47.93 词元/秒;nemotron-3-ultra 波动最大,变异系数为 65.6%,波动区间在 6.69 至 63.19 词元/秒之间。
  • 不存在数据缺失的限制:全部八个模型均报告 12 个样本中的 12 个样本、96 个有效数据点,并且在四小时的时间窗口内覆盖率达到 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4.1-flash 的平均吞吐量最高,达 127.52 词元/秒,而 nemotron-3-ultra 最弱,仅为 23.56 词元/秒,不到领先者速度的五分之一。
  • deepseek-v4.1-flash 的波动性最具运营意义,其范围从 28.67 到 234.24 词元/秒,变异系数为 49.5%,趋势为 +52.4%;minimax-m3 下降了 28.0%,最新读数为 46.38 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均报告了 12 个样本中的 12 个,96 个有效点的整体覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4.1-flash 是最强模型,平均吞吐量为 138.11 词元/秒,而 nemotron-3-ultra 最弱,为 22.29 词元/秒,差距约为六倍;glm-5.3-flash 以 132.95 词元/秒紧随其后。
  • 运营层面最显著的波动来自 deepseek-v4.1-flash,其变异系数为 47.5%,吞吐量从 12:20 的 172.79 词元/秒骤降至 13:00 的 28.67 词元/秒,随后在 14:40 恢复至 234.24 词元/秒;glm-5.3 呈现最强的上升趋势,为 42.4%。
  • 不存在缺失数据的限制:全部 8 个模型均有 12 个样本中的 12 个,valid_point_count 为 96,在四小时时间窗口内覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • glm-5.3-flash 是最强模型,平均吞吐量为 137.19 词元/秒,领先于 gemma4:31b 的 126.37 词元/秒;nemotron-3-ultra 最弱,为 19.43 词元/秒,从未超过 29.87 词元/秒。
  • deepseek-v4.1-flash 表现出对运行影响最为显著的波动性,范围从 28.67 到 231.61 词元/秒,变异系数为 52.4%,趋势为 -38.2%,其中包括在 12:40 降至 42.19 词元/秒、在 13:00 降至 28.67 词元/秒的情况。
  • 不存在数据缺失的限制:预期 96 个数据点中全部 96 个均有效,每个模型都有 12 个样本中的 12 个,且在四小时窗口内覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4.1-flash 是最强的模型,平均吞吐量为 169.41 词元/秒,而 nemotron-3-ultra 最弱,平均为 18.33 词元/秒,两者相差约九倍。
  • 运行层面最显著的波动来自 deepseek-v4.1-flash,其吞吐量在 48.95 至 231.61 词元/秒之间波动,变异系数为 35.3%,并在 10:00 和 11:00 出现急剧下降;glm-5.3 也在 09:20 飙升至 175.87 词元/秒,随后呈 16.6% 的下行趋势。
  • 不存在数据缺失的限制:全部 8 个模型均交付了 12 个预期样本中的 12 个,在四小时的时间窗口内共提供 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4.1-flash 是最强的模型,平均吞吐量为 166.47 词元/秒(峰值 236.23 词元/秒),而 nemotron-3-ultra 最弱,平均为 22.14 词元/秒(最低 4.21 词元/秒)。
  • deepseek-v4.1-flash 的波动性在运营层面最为显著,在 236.23 与 41.15 词元/秒之间波动,变异系数为 43.5%;nemotron-3-ultra 下降了 60.1%,降至 9.98 词元/秒,而 gemma4:31b(平均 139.41 词元/秒)在 11:00 UTC 时呈下降趋势,降幅为 19.1%,降至 76.21 词元/秒。
  • 无缺失数据限制:全部八个模型均有 12 个样本中的 12 个样本、96 个有效数据点,在四小时时间窗口内覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4.1-flash 是最强的模型,平均吞吐量为 169.61 词元/秒,峰值为 236.23 词元/秒,而 nemotron-3-ultra 是最弱的模型,平均吞吐量为 30.80 词元/秒,最低值为 10.96 词元/秒。
  • 最显著的变动是 nemotron-3-ultra 在该时间窗口内下降了 53.6%,最终降至 10.96 词元/秒;deepseek-v4.1-flash 也表现出剧烈波动,从 07:40 的 226.58 词元/秒降至 08:00 的 41.15 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均报告了 12 个样本中的 12 个样本、96 个有效数据点,并且在四小时窗口内覆盖率达到 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4.1-flash 是最强模型,平均吞吐量为 178.85 词元/秒(峰值 236.23 词元/秒),而 nemotron-3-ultra 最弱,平均为 35.14 词元/秒(最低 17.72 词元/秒)。
  • 运营层面最显著的变化是 glm-5.3 下降了 35.8%,从 05:20 的 182.34 词元/秒降至 09:00 的 77.19 词元/秒;deepseek-v4.1-flash 也表现出剧烈波动,在 08:00 一度跌至 41.15 词元/秒,随后在 08:40 回升至 230.00 词元/秒。
  • 不存在数据缺失的限制:全部 8 个模型均交付了 12 个预期样本中的 12 个,在四小时的时间窗口内共产生 96 个有效数据点,覆盖率达到 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4.1-flash 是性能最强的模型,平均吞吐量为 166.32 词元/秒,而 nemotron-3-ultra 是性能最弱的模型,平均为 38.12 词元/秒。
  • 最显著的操作变化是 deepseek-v4.1-flash 从 07:40 的 226.58 词元/秒骤降至 08:00 的 41.15 词元/秒(其窗口最低值);glm-5.3 整体也下降了 45.1%,从 182.34 词元/秒的峰值降至 08:00 的 80.11 词元/秒,而 glm-5.2 和 minimax-m3 的波动性最高,变异系数分别为 45.5% 和 45.4%。
  • 不存在数据缺失的限制:全部 8 个模型均提供了 12 个样本中的 12 个,在四小时窗口内共有 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4.1-flash 是最强的模型,平均吞吐量为 175.2 词元/秒(峰值达 224.51 词元/秒),而 nemotron-3-ultra 最弱,平均为 42.54 词元/秒,从未超过 95.57 词元/秒。
  • 运营层面最显著的变化是 minimax-m3 下降了 35.3%,从 93.83 词元/秒的高点跌至 07:00 时的 12.26 词元/秒;nemotron-3-ultra 的波动性也最高,变异系数达 49.4%。
  • 不存在数据缺失的限制:全部八个模型均记录了 12 个预期样本中的 12 个,在四小时窗口内共有 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • 平均吞吐量最强:deepseek-v4.1-flash 达 185.85 词元/秒(峰值 224.51 词元/秒);最弱:nemotron-3-ultra 为 42.41 词元/秒(最低 22.74 词元/秒)。
  • glm-5.3 波动最为剧烈,在整个时间窗口内于 66.12 至 184.22 词元/秒之间摆动(标准差 50.13 词元/秒,CV 37.7%),而 06:00 的观测值在大多数模型中均出现下降,包括 minimax-m3 降至 11.85 词元/秒,deepseek-v4-pro 降至 50.43 词元/秒。
  • 无缺失数据限制:全部八个模型均有 12 个样本中的 12 个,共 96 个有效数据点,在四小时时间窗口内覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4.1-flash 是最强的模型,平均吞吐量为 192.36 词元/秒,峰值达 224.51 词元/秒,而 nemotron-3-ultra 最弱,平均为 39.25 词元/秒,最低降至 11.77 词元/秒。
  • glm-5.3 波动最为剧烈,在 65.85 至 184.22 词元/秒之间摆动,变异系数为 41.8%;deepseek-v4.1-flash 最为稳定,为 12.9%,但从 224.51 词元/秒的峰值下降至 05:00 UTC 时的 142.01 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均报告 12 个样本中的 12 个、96 个有效数据点以及 100.0% 的覆盖率,因此这四小时的时间窗口得到了完整呈现。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4.1-flash 是最强的模型,平均吞吐量为 189.64 词元/秒(范围 113.73–224.51 词元/秒),而 nemotron-3-ultra 最弱,平均为 36.32 词元/秒(范围 11.77–95.57 词元/秒)。
  • glm-5.3 表现出对运行影响最显著的波动性,在 51.14 至 184.22 词元/秒之间摆动,变异系数为 48.1%,趋势为 47.5%;nemotron-3-ultra 同样不稳定,变异系数达 58.5%,尽管从其 11.77 词元/秒的低点起趋势为 130.1%。
  • 不存在数据缺失的限制:全部八个模型均报告了 12 个预期样本中的 12 个、96 个有效数据点,并且在四小时窗口内覆盖率达到 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4.1-flash 是最强的模型,平均吞吐量为 192.26 词元/秒(范围 113.73 至 240.37 词元/秒),而 nemotron-3-ultra 是最弱的模型,平均吞吐量为 34.2 词元/秒(范围 11.77 至 60.13 词元/秒)。
  • glm-5.3 表现出对运营影响最显著的波动性,趋势为 +80.0%,变异系数为 47.3%,在 51.14 词元/秒的低点和 182.11 词元/秒的高点之间摆动,包括在时间窗口后期跳升至 177.34 和 182.11 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均有 12 个样本中的 12 个,覆盖率为 100.0%,且数据集包含 96 个有效数据点,因此四小时的时间窗口是完整的。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4.1-flash 是性能最强的模型,平均吞吐量为 198.31 词元/秒(峰值 240.37 词元/秒),而 nemotron-3-ultra 是性能最弱的模型,平均为 31.85 词元/秒,速度大约慢六倍。
  • 运营层面最重大的变动是 nemotron-3-ultra 的 47.2% 降幅,其从 23:20 的 60.13 词元/秒峰值降至 01:20 的 11.77 词元/秒,最终收于 20.41 词元/秒;glm-5.3 同样表现出高波动性,变异系数为 47.0%。
  • 不存在数据缺失的限制:全部 8 个模型均交付了 12 个预期样本中的 12 个,在四小时的时间窗口内共产生 96 个有效数据点,覆盖率达到 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4.1-flash 在平均吞吐量方面领先,达到 178.96 词元/秒,峰值为 240.37 词元/秒,而 nemotron-3-ultra 最弱,平均为 37.83 词元/秒,最低为 19.33 词元/秒。
  • glm-5.3 波动最为剧烈,在 22:20 UTC 飙升至 180.91 词元/秒,随后回落至接近其 79.86 词元/秒的平均水平,趋势为 -23.6%;minimax-m3 整体变异性最大,变异系数为 40.2%。
  • 不存在数据缺失的限制:全部 8 个模型均交付了 12 个预期样本中的 12 个,在四小时的时间窗口内提供了 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4.1-flash 是最强的模型,平均吞吐量为 183.05 词元/秒,在 23:40 达到 240.37 词元/秒的峰值,而 nemotron-3-ultra 是最弱的模型,平均为 37.17 词元/秒,从未超过 60.13 词元/秒。
  • glm-5.3 波动最为剧烈,范围从 62.13 到 187.96 词元/秒,变异系数为 47.1%,并且是唯一呈下降趋势的模型(-18.1%);deepseek-v4.1-flash 在该时间窗口内上升了 51.3%,从 22:20 到 23:40 期间保持在 218 词元/秒以上。
  • 不存在数据缺失的限制:全部 8 个模型均交付了 12 个预期样本中的 12 个,共产生 96 个有效数据点,在四小时的时间窗口内覆盖率达到 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4.1-flash 是最强的模型,平均吞吐量为 163.62 词元/秒,峰值达 237.72 词元/秒,收尾时为 228.95 词元/秒;nemotron-3-ultra 最弱,平均仅 30.32 词元/秒,从未超过 58.94 词元/秒。
  • glm-5.3 波动最为剧烈,在 62.13 至 187.96 词元/秒之间摆动,变异系数为 46.5%,趋势为 -28.8%;而 deepseek-v4-pro 在 21:20 降至 12.81 词元/秒,随后回升至 106.53 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均交付了 12 个预期样本中的 12 个,产生 96 个有效数据点,在四小时窗口内覆盖率达到 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4.1-flash 是最强的模型,平均吞吐量为 141.17 词元/秒(峰值 237.72 词元/秒),而 nemotron-3-ultra 最弱,平均为 27.6 词元/秒(峰值 58.94 词元/秒)。
  • glm-5.2 波动最大,变异系数为 76.4%,从 19:40 的 28.82 词元/秒到 19:00 的 203.28 词元/秒之间摆动;deepseek-v4-pro 也在 21:20 骤降至 12.81 词元/秒,随后回升至 106.53 词元/秒。
  • 不存在数据缺失的限制:全部 8 个模型均记录了 12 个预期样本中的 12 个,在四小时的时间窗口内共有 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4.1-flash 是最强模型,平均吞吐量为 146.9 词元/秒,峰值达 237.72 词元/秒;nemotron-3-ultra 最弱,平均为 24.72 词元/秒,从未超过 40.01 词元/秒。
  • glm-5.2 表现出对运行影响最显著的波动性,变异系数为 79.2%,在 19:00 出现单次 203.28 词元/秒的峰值,而平均值为 61.38 词元/秒,趋势为 -21.8%;deepseek-v4-pro 最为稳定,CV 为 13.7%。
  • 不存在数据缺失限制:全部八个模型均有 12 个样本中的 12 个,valid_point_count 为 96,在四小时窗口内覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • 平均吞吐量最强的是 deepseek-v4.1-flash,达 155.96 词元/秒;最弱的是 nemotron-3-ultra,为 18.87 词元/秒,整个时间窗口内的范围为 3.72 至 40.01 词元/秒。
  • glm-5.2 波动最为剧烈(CV 90.7%),从 18:20 的 34.37 词元/秒飙升至 19:00 的 203.28 词元/秒;deepseek-v4.1-flash 也曾在 18:00 骤降至 41.63 词元/秒,随后回升至 144.78 词元/秒。
  • 不存在数据缺失的限制:全部 8 个模型均报告了 12 个样本中的 12 个,在四小时窗口内拥有 96 个有效数据点和 100.0% 的覆盖率。