← 返回性能仪表板

每小时性能洞察

滚动四小时性能数据摘要

已保留 1189 条摘要
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • glm-5.3 是最强的模型,平均吞吐量为 103.63 词元/秒(范围 65.39–139.09 词元/秒),而 nemotron-3-ultra 最弱,平均仅 22.80 词元/秒,峰值也仅为 43.98 词元/秒。
  • glm-5.2 表现出对运营影响最大的波动性,变异系数为 81.3%,吞吐量从 17:00 的 11.59 词元/秒波动到 16:40 的 203.80 词元/秒;minimax-m3 的波动范围也很宽,从 17.72 到 100.11 词元/秒。
  • deepseek-v4-flash 未报告任何样本(预期 12 个中的 0 个),使整体覆盖率降至 87.5%(预期 96 个数据点中的 84 个有效),因此该时间窗口内其吞吐量未知。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • glm-5.3 是最强的模型,平均吞吐量为 100.63 词元/秒(范围 65.39–134.52 词元/秒),而 nemotron-3-ultra 最弱,平均为 23.71 词元/秒,峰值仅为 43.98 词元/秒。
  • glm-5.2 表现出对运营影响最大的波动性,在 11.59 至 203.80 词元/秒之间摆动,变异系数为 85.0%,趋势为 +91.0%,最终在 UTC 17:00 时为 11.59 词元/秒;minimax-m3 在该时间窗口内也下降了 16.6%。
  • deepseek-v4-flash 未报告任何样本(预期 12 个中的 0 个),因此其吞吐量未知;整体覆盖率为 87.5%,即预期的 96 个数据点中有 84 个,这限制了可比性。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • glm-5.3 是最强的模型,平均吞吐量为 108.94 词元/秒(范围从 65.39 到 143.34 词元/秒),而 nemotron-3-ultra 最弱,平均仅为 23.49 词元/秒,峰值也仅有 43.98 词元/秒。
  • 波动最显著的是 glm-5.2,其变异系数为 85.6%,波动范围从 2.36 到 199.19 词元/秒;minimax-m3 呈现最陡峭的下降趋势,从 150.39 词元/秒的峰值下降 46.1%,在 UTC 16:00 降至 17.72 词元/秒。
  • deepseek-v4-flash 在全部 12 个预期时间间隔内均未报告任何样本,仅留下 96 个预期数据点中的 84 个(87.5% 的覆盖率),因此其吞吐量在此时间窗口内未予评估。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • glm-5.3 是平均吞吐量最强的模型,达 103.08 词元/秒,而 nemotron-3-ultra 最弱,为 23.17 词元/秒;次低的平均值分别是 glm-5.2 的 51.46 词元/秒和 glm-5.3-flash 的 63.81 词元/秒。
  • glm-5.2 波动最为剧烈,范围从 2.36 到 199.19 词元/秒,变异系数为 101.2%,且在观测时段内下降了 25.9%;minimax-m3 下降了 26.2%,从 11:20 的 145.59 词元/秒跌至 15:00 的 28.12 词元/秒。
  • deepseek-v4-flash 没有任何数据(12 个样本中为 0,覆盖率 0.0%),整体覆盖率为 87.5%,共 84 个有效数据点,因此模型对比完全将其排除在外。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • 平均吞吐量最强的是 minimax-m3,达 108.61 词元/秒,略胜 107.45 词元/秒的 glm-5.3;最弱的是 nemotron-3-ultra,仅 21.63 词元/秒,远低于次低的 glm-5.2 的 55.63 词元/秒。
  • glm-5.2 波动最为剧烈,变异系数达 93.7%,在 12:20 飙升至 199.19 词元/秒,随后在 13:00 骤降至 2.36 词元/秒;glm-5.3-flash 整体下降 39.6%,从 230.44 词元/秒的峰值跌至 14:00 的 61.78 词元/秒。
  • deepseek-v4-flash 在 12 个采样中报告为 0(覆盖率为 0%),剩余 84 个有效数据点,整体覆盖率为 87.5%,因此全队列对比完全排除该模型。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • glm-5.3 是平均吞吐量最强的模型,达 116.52 词元/秒(p95 为 154.09 词元/秒),而 nemotron-3-ultra 最弱,平均仅 22.93 词元/秒,从未超过 54.52 词元/秒。
  • 运营层面最显著的波动是 13:00 UTC 的崩溃,同时影响两个模型:minimax-m3 从 12:40 的 150.39 词元/秒跌至 7.6 词元/秒,glm-5.2 从 43.89 词元/秒降至 2.36 词元/秒。glm-5.3-flash 也从 10:40 的 230.44 词元/秒峰值回落至 11:20 的 56.15 词元/秒,变异系数为 54.8%。
  • deepseek-v4-flash 在全部 12 个预期时间段内报告的样本数为零(覆盖率为 0%),使整体有效数据点降至 96 个中的 84 个(覆盖率 87.5%),因此其吞吐量在此时间窗口内完全未被测量。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • glm-5.3 是平均吞吐量最强的模型,达到 102.88 词元/秒,略微领先于 gemma4:31b(101.79 词元/秒)和 minimax-m3(101.76 词元/秒);nemotron-3-ultra 最弱,平均仅为 23.01 词元/秒,峰值也仅有 54.52 词元/秒。
  • 运营层面最显著的波动来自 glm-5.3-flash,其在 10:40 飙升至 230.44 词元/秒,随后在 11:20 回落至 56.15 词元/秒,变异系数为 54.7%;minimax-m3 也出现了从 20.8 词元/秒的低点到 145.59 词元/秒的大幅波动。
  • deepseek-v4-flash 在全部 12 个预期时间区间内报告的样本数为零,因此其吞吐量未知,整体覆盖率降至 87.5%(96 个预期数据点中仅有 84 个)。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • glm-5.3 是平均吞吐量最强的模型,达 115.55 词元/秒,而 nemotron-3-ultra 最弱,仅 19.02 词元/秒,两者相差约六倍。
  • minimax-m3 呈现出最具运营意义的趋势,从 07:20 的 60.95 词元/秒上升至 11:00 的 127.65 词元/秒,涨幅达 97.2%;glm-5.2 波动最大,变异系数为 91.0%,在 10.15 至 220.6 词元/秒之间震荡。
  • deepseek-v4-flash 在全部 12 个预期观测点中均未报告任何样本,因此其吞吐量未知;整体覆盖率为 87.5%,共 84 个有效数据点,这限制了对整个集群性能的结论。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • gemma4:31b 是性能最强的模型,平均吞吐量为 113.06 词元/秒(p95 为 150.0 词元/秒),而 nemotron-3-ultra 是性能最弱的模型,平均仅为 17.92 词元/秒,在任何时间区间内都从未超过 51.03 词元/秒。
  • glm-5.2 表现出对运营影响最大的波动性,变异系数为 94.8%,吞吐量在 10.15 至 220.6 词元/秒之间摆动;其趋势在整个时间窗口内下降了 58.1%,且 glm-5.3 在 08:20 降至 6.76 词元/秒。
  • deepseek-v4-flash 没有任何采样数据(预期 12 个中为 0 个,覆盖率为 0%),因此其吞吐量未知;整体覆盖率为 87.5%,共有 84 个有效数据点,这限制了全集群比较的完整性。
4 小时窗口 · 77 个数据点 · 覆盖率 80.2%
  • gemma4:31b 是最强的模型,平均吞吐量为 116.51 词元/秒,而 nemotron-3-ultra 最弱,平均为 17.12 词元/秒,在任何观测中均未超过 34.13 词元/秒。
  • glm-5.2 表现出对运营影响最大的波动性,在 10.15 至 220.60 词元/秒之间摆动,变异系数为 88.8%,其中包括在 07:40 降至 10.15 词元/秒;minimax-m3 整体也下降了 50.0%,最终为 20.80 词元/秒。
  • deepseek-v4-flash 的样本数为零(覆盖率为 0.0%),因此其吞吐量未知;其他所有模型均有 12 个样本中的 11 个(覆盖率 91.7%),整体覆盖率为 80.2%,共 77 个有效数据点,限制了完整性。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • gemma4:31b 是平均吞吐量最强的模型,达到 115.03 词元/秒,略微领先于 114.81 词元/秒的 glm-5.3;nemotron-3-ultra 最弱,仅为 19.44 词元/秒,最大值也只有 45.24 词元/秒。
  • glm-5.2 的波动性最为极端,在 10.15 至 220.6 词元/秒之间波动,变异系数为 82.8%,其中包括在 07:20 至 07:40 之间从 220.6 骤降至 10.15 词元/秒;minimax-m3 整体也下降了 46.9%,最终为 26.94 词元/秒。
  • deepseek-v4-flash 在整个时间窗口内没有任何采样(预期 12 个中为 0 个,覆盖率为 0%),因此其吞吐量未知;整体数据集覆盖率为 87.5%,共 84 个有效数据点,这限制了针对整个机群的结论。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • glm-5.3 是最强的模型,平均吞吐量为 123.38 词元/秒(峰值 176.0 词元/秒),而 nemotron-3-ultra 最弱,平均仅 18.09 词元/秒,从未超过 45.24 词元/秒。
  • glm-5.2 波动最大,变异系数为 74.5%;它在 UTC 06:40 飙升至 211.72 词元/秒,随后在 07:00 骤降至 13.27 词元/秒。deepseek-v4-pro 也在 06:00 跌至 4.56 词元/秒。
  • deepseek-v4-flash 没有任何数据(12 个样本中为 0,覆盖率 0.0%),使整体覆盖率降至 87.5%(96 个有效数据点中的 84 个),因此全集群平均值完全排除了该模型。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • glm-5.3 是最强的模型,平均吞吐量为 133.2 词元/秒(峰值 176.0 词元/秒,出现在 03:20),而 nemotron-3-ultra 最弱,平均仅为 25.71 词元/秒,从未超过 69.7 词元/秒。
  • 波动最显著的是 glm-5.2,变异系数为 62.4%,在 03:00 飙升至 180.18 词元/秒,随后在 03:20 跌至 34.91 词元/秒;minimax-m3 呈现最大的上升趋势,达 111.3%,从 02:40 的 47.01 词元/秒攀升至 05:20 的 158.55 词元/秒。
  • deepseek-v4-flash 在预期的 12 个样本中报告了 0 个(覆盖率为 0%),使整体覆盖率降至 87.5%(84 个有效数据点),因此本周期无法评估其吞吐量。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • glm-5.3 是最强的模型,平均吞吐量为 130.85 词元/秒(p95 为 174.05 词元/秒),而 nemotron-3-ultra 最弱,平均仅为 28.88 词元/秒,峰值也仅有 70.85 词元/秒。
  • glm-5.2 表现出对运营影响最大的波动性,在 27.78 至 197.48 词元/秒之间波动,变异系数为 69.8%,趋势为 -30.9%;nemotron-3-ultra 同样不稳定(变异系数 75.7%,趋势 -45.9%)。
  • deepseek-v4-flash 在整个时间窗口内没有任何数据(12 个采样点中为 0,覆盖率 0%),使整体覆盖率降至 87.5%(96 个预期数据点中仅有 84 个),因此无法评估其吞吐量。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • glm-5.3 是最强的模型,平均吞吐量为 128.69 词元/秒(最新为 172.46 词元/秒),而 nemotron-3-ultra 最弱,平均为 23.79 词元/秒,峰值仅为 70.85 词元/秒。
  • glm-5.3 呈现最明显的上升趋势,在 03:20 之后上升 39.8%,达到持续 166-176 词元/秒;而 minimax-m3 从 00:20 的 177.39 词元/秒峰值下降 39.8%,至 04:00 时为 48.1 词元/秒;glm-5.2 波动最大,变异系数为 70.8%,在 27.78 和 197.48 词元/秒之间摆动。
  • deepseek-v4-flash 在预期的 12 个样本中报告为零(0% 覆盖率),使整体数据集覆盖率降至 87.5%(84 个有效数据点),因此无法在此时间窗口内评估其吞吐量。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • gemma4:31b 是平均吞吐量最强的模型,达到 122.08 词元/秒,略微领先于 120.05 词元/秒的 glm-5.3,而 nemotron-3-ultra 最弱,平均仅为 30.35 词元/秒,峰值也仅有 70.85 词元/秒。
  • 运营层面最显著的变化是 minimax-m3 在整个时间窗口内下降了 34.6%,从 00:20 的 177.39 词元/秒降至 03:00 的 57.07 词元/秒;glm-5.2 也在 26.85 至 197.48 词元/秒之间波动,变异系数为 76.7%。
  • deepseek-v4-flash 在预期的 12 个样本中报告了零个,导致整体覆盖率为 87.5%(84 个有效数据点),因此无法评估其在该时段的吞吐量。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • gemma4:31b 在全部 12 个样本中实现了最强的平均吞吐量 118.7 词元/秒,略微领先于 minimax-m3 的 118.24 词元/秒,而 nemotron-3-ultra 最弱,平均仅为 24.97 词元/秒,峰值也仅有 70.85 词元/秒。
  • 运营层面最显著的波动来自 glm-5.2,其变异系数达到 76.1%,在 26.85 至 197.48 词元/秒之间波动,并以最大值收尾;minimax-m3 也从 00:20 的 177.39 词元/秒骤降至 01:00 的 41.22 词元/秒。
  • deepseek-v4-flash 在预期的 12 个样本中报告了 0 个,使整体覆盖率降至 87.5%(84 个有效数据点),因此其吞吐量完全未得到评估,全时段比较将其排除在外。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • minimax-m3 是最强的模型,平均吞吐量为 120.66 词元/秒,略微领先于 gemma4:31b 的 118.87 词元/秒,而 nemotron-3-ultra 最弱,仅为 18.98 词元/秒,大约比领先者慢六倍。
  • glm-5.2 的波动性最为极端,变异系数为 83.5%,波动范围从 26.85 到 208.08 词元/秒,其中包括在 00:40 降至 31.88 词元/秒,随后在 01:00 飙升至 167.48 词元/秒。
  • deepseek-v4-flash 在整个时间窗口内没有任何采样数据(预期 12 个中的 0 个),使整体覆盖率降至 87.5%(84 个有效数据点),因此无法评估其吞吐量。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • 平均吞吐量最高的是 minimax-m3,达 134.75 词元/秒(峰值 171.93 词元/秒,最新值 137.34 词元/秒);最低的是 nemotron-3-ultra,为 22.64 词元/秒,其最大值 63.19 词元/秒低于大多数模型的平均值。
  • glm-5.2 是波动最大的模型,变异系数为 80.7%,数值范围从 26.85 到 208.08 词元/秒,趋势为 -41.6% 并以其最小值收尾;minimax-m3 最为稳定,变异系数为 15.9%。
  • deepseek-v4-flash 在预期的 12 个样本中报告为零(覆盖率为 0%),因此其吞吐量未知;整体覆盖率为 87.5%,共 84 个有效数据点,这限制了全机队范围的比较。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • minimax-m3 是平均吞吐量最强的模型,达到 132.15 词元/秒,而 nemotron-3-ultra 最弱,仅为 17.89 词元/秒,低了约 7.4 倍。
  • glm-5.2 的波动性最高,变异系数为 65.2%,从 29.2 词元/秒的低点波动至 22:00 UTC 时 208.08 词元/秒的峰值;nemotron-3-ultra 在该时间窗口内也下降了 30.0%,降至 14.49 词元/秒。
  • deepseek-v4-flash 在预期的 12 个样本中报告了 0 个(覆盖率 0.0%),因此总体覆盖率仅为 84 个有效数据点,即 87.5%,限制了对整个机群的结论。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • 平均吞吐量最高的是 minimax-m3,达 129.9 词元/秒(12 个样本中的 12 个);最低的是 nemotron-3-ultra,为 17.23 词元/秒,峰值仅为 31.2 词元/秒。
  • glm-5.2 波动最为剧烈,变异系数达 69.2%,19:00 时低至 10.37 词元/秒,22:00 时飙升至 208.08 词元/秒,而其平均值为 69.8 词元/秒;minimax-m3 也在 22:00 从 159.58 词元/秒的高点跌至 88.57 词元/秒。
  • deepseek-v4-flash 在预期的 12 个样本中报告了 0 个(覆盖率 0.0%),整体覆盖率为 87.5%,共 84 个有效数据点,因此各模型之间的比较基于不完整的数据。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • minimax-m3 是最强模型,平均吞吐量为 133.24 词元/秒;nemotron-3-ultra 最弱,平均为 19.59 词元/秒,峰值仅为 32.41 词元/秒。
  • glm-5.2 呈现最大的上升趋势,达 98.3%,从 17:20 的 21.72 词元/秒攀升至 20:00 的最高值 87.45 词元/秒,而 gemma4:31b 和 glm-5.3-flash 波动性极高,变异系数分别为 42.8% 和 47.7%。
  • deepseek-v4-flash 在全部 12 个预期区间内报告的样本数为零,导致其吞吐量无法测量,并使整体数据集覆盖率降至 87.5%(84 个有效数据点)。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • 平均吞吐量最高的是 minimax-m3,达 129.66 词元/秒(峰值 166.0 词元/秒,变异系数 15.5%),而 nemotron-3-ultra 最弱,平均仅 18.81 词元/秒,从未超过 44.36 词元/秒。
  • glm-5.2 呈现最强的上升趋势,达 +37.3%,从 19:00 的 10.37 词元/秒低点攀升至 20:00 的 87.45 词元/秒;nemotron-3-ultra 波动最大(变异系数 62.3%)且下降了 28.4%,glm-5.3-flash 在 19:20 飙升至 199.21 词元/秒,随后回落至 54.79 词元/秒。
  • deepseek-v4-flash 在预期的 12 个样本中报告了 0 个(覆盖率 0%),其吞吐量未知;整体覆盖率为 87.5%,共有 84 个有效数据点。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • minimax-m3 是最强的模型,平均吞吐量为 128.25 词元/秒(范围 86.3 至 166.0 词元/秒),而 nemotron-3-ultra 最弱,平均为 22.47 词元/秒,峰值仅为 45.82 词元/秒。
  • glm-5.2 呈现最陡峭的下降趋势,趋势为 -49.1%,最终降至 10.37 词元/秒,为其四小时内的最低值;gemma4:31b 波动性极高,变异系数为 40.9%,在 27.01 至 162.98 词元/秒之间摆动。
  • deepseek-v4-flash 没有任何样本(预期 12 个中为 0 个,覆盖率 0.0%),因此其吞吐量未知;整体覆盖率为 87.5%,预期 96 个数据点中有 84 个,这限制了全集群范围的结论。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • minimax-m3 是平均吞吐量最强的模型,达到 123.22 词元/秒(在 18:00 达到峰值 166.0 词元/秒),而 nemotron-3-ultra 最弱,平均仅为 24.92 词元/秒,在整个时间窗口内从未超过 45.82 词元/秒。
  • glm-5.2 表现出对运营影响最为显著的波动性和下滑:43.3% 的下降趋势,61.6% 的变异系数,从 14:40 的 152.68 词元/秒骤降至 15:00 的 15.95 词元/秒,最终读数为 34.84 词元/秒,远低于其 63.39 词元/秒的平均值。
  • deepseek-v4-flash 在整个期间没有任何数据(12 个采样点中为 0,覆盖率为 0%),使整体数据集覆盖率降至 87.5%(96 个预期数据点中仅有 84 个),因此无法评估其吞吐量。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • minimax-m3 是最强的模型,平均吞吐量为 121.14 词元/秒(范围 74.21–154.28 词元/秒),而 nemotron-3-ultra 最弱,平均仅 23.44 词元/秒,峰值仅为 45.82 词元/秒。
  • glm-5.2 表现出对运行影响最大的波动性,变异系数为 56.7%,在 14:00 骤降至 12.75 词元/秒、在 15:00 降至 15.95 词元/秒,且趋势为 -18.2%;gemma4:31b 在其最后一次采样中也降至 27.01 词元/秒。
  • deepseek-v4-flash 在预期的 12 个采样中报告了 0 个(覆盖率 0%),其吞吐量未知;总体覆盖率为 96 个数据点中的 84 个(87.5%),因此结论基于不完整的数据。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • 平均吞吐量最高的是 minimax-m3,达 114.13 词元/秒(峰值 154.28 词元/秒),而 nemotron-3-ultra 最弱,平均仅 21.69 词元/秒,且从未超过 45.82 词元/秒。
  • glm-5.2 波动最为剧烈,变异系数达 59.0%,在观测窗口内于 12.75 至 155.93 词元/秒之间大幅波动;deepseek-v4-pro 呈现最强的上升趋势,达 39.6%。
  • deepseek-v4-flash 未返回任何数据(12 个采样中为 0),使整体覆盖率为 87.5%(96 个预期数据点中仅 84 个),因此任何跨模型比较均完全排除该模型。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • glm-5.3 是最强的模型,平均吞吐量为 108.94 词元/秒,领先于 minimax-m3(104.65 词元/秒)和 gemma4:31b(102.36 词元/秒);nemotron-3-ultra 最弱,平均为 17.25 词元/秒,从未超过 29.39 词元/秒。
  • glm-5.2 波动最大,变异系数为 71.0%,在 12.75 至 155.93 词元/秒之间波动,包括在 13:40 从 155.93 词元/秒降至 14:00 的 12.75 词元/秒;glm-5.3-flash 在该时段内下降了 30.3%,降至 54.46 词元/秒。
  • deepseek-v4-flash 在全部 12 个预期时间间隔内报告的样本数为零,导致其吞吐量未知,并使整体覆盖率降至 87.5%(96 个预期数据点中的 84 个)。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • 平均吞吐量最强的是 minimax-m3,达 109.1 词元/秒(峰值 144.37 词元/秒);最弱的是 nemotron-3-ultra,平均 14.48 词元/秒,从未超过 27.89 词元/秒。
  • glm-5.2 波动最为剧烈(变异系数 72.1%),范围在 12.75 至 155.93 词元/秒之间;其整体呈 69.4% 的上升趋势,于 13:40 达到 155.93 词元/秒,随后在 14:00 跌至 12.75 词元/秒。glm-5.3-flash 同样从 174.2 词元/秒的峰值大幅回落至 60.05 词元/秒。
  • deepseek-v4-flash 在 12 个采样中报告为 0(覆盖率 0%),因此被排除在比较之外;整体覆盖率为 87.5%,共 84 个有效数据点,这限制了模型之间的对比结论。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • 平均吞吐量最强的是 gemma4:31b,达 102.47 词元/秒;最弱的是 nemotron-3-ultra,为 18.9 词元/秒,约为领先者速率的五分之一。
  • glm-5.2 波动最大,变异系数达 101.5%,在 16.88 至 196.55 词元/秒之间波动;minimax-m3 涨幅最大,从 08:20 的 47.62 词元/秒上升 85.3%,于 10:40 达到 144.37 词元/秒的峰值。
  • deepseek-v4-flash 在预期的 12 个样本中返回了 0 个(覆盖率 0%),其吞吐量未知,并使整体数据集覆盖率降至 87.5%(84 个有效数据点),因此比较中完全排除了该模型。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • gemma4:31b 是最强的模型,平均吞吐量为 104.39 词元/秒(峰值 151.14 词元/秒),而 nemotron-3-ultra 是最弱的模型,平均仅为 18.59 词元/秒,在任何观测中均未超过 55.68 词元/秒。
  • 运营层面最显著的变化是 minimax-m3 的上升趋势达 127.7%,从 07:40 的低点 15.55 词元/秒攀升至 10:40 的 144.37 词元/秒和 11:00 的 135.43 词元/秒。glm-5.2 的波动性也很高,其变异系数为 98.7%,波动区间介于 16.88 至 196.55 词元/秒之间。
  • deepseek-v4-flash 在整个时间窗口内没有任何数据,12 个预期样本中为 0 个,覆盖率为 0.0%,使整体数据集覆盖率降至 87.5%(84 个有效数据点),因此无法评估其吞吐量。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • gemma4:31b 是平均吞吐量最强的模型,达到 110.47 词元/秒,而 nemotron-3-ultra 最弱,为 17.36 词元/秒,最小值为 4.91 词元/秒,最大值为 55.68 词元/秒。
  • glm-5.2 表现出最剧烈的波动性,变异系数为 99.5%,在 16.88 和 196.55 词元/秒之间大幅摆动,包括在 08:40 飙升至 196.55 词元/秒,随后在 09:00 骤降至 16.88 词元/秒。
  • deepseek-v4-flash 在该期间内样本数为零,导致整体覆盖率为 87.5%(96 个预期数据点中有 84 个),因此无法从该数据集评估其吞吐量。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • gemma4:31b 是最强的模型,平均吞吐量为 114.2 词元/秒,而 nemotron-3-ultra 最弱,平均为 12.37 词元/秒,在整个时间窗口内从未超过 26.66 词元/秒。
  • glm-5.2 波动最为剧烈,范围从 16.88 到 196.55 词元/秒,变异系数为 100.1%;glm-5.3 趋势最为陡峭,上升了 43.2%,峰值达到 166.83 词元/秒。
  • deepseek-v4-flash 没有任何采样数据(预期 12 个中为 0 个,覆盖率为 0%),因此其吞吐量未知;整体覆盖率为 87.5%,共有 84 个有效数据点,这限制了对整个集群的结论。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • gemma4:31b 是最强的模型,平均吞吐量为 119.48 词元/秒(峰值 157.29 词元/秒),而 nemotron-3-ultra 是最弱的模型,平均仅为 18.48 词元/秒,峰值也仅为 69.25 词元/秒。
  • 波动最显著的是 nemotron-3-ultra,其变异系数高达 96.9%,从 04:20 的 69.25 词元/秒骤降至 06:00 的 3.55 词元/秒。minimax-m3 也下降了 55.1%,从 04:20 的 140.98 词元/秒降至 08:00 的 53.88 词元/秒,而 glm-5.2 在 06:40 飙升至 188.19 词元/秒。
  • deepseek-v4-flash 在预期的 12 个样本中采样数为零,因此其吞吐量未知;整体覆盖率为 87.5%(96 个预期数据点中的 84 个),限制了模型间的比较。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • 平均吞吐量最高的是 glm-5.3-flash,达 110.94 词元/秒,略微领先于 gemma4:31b 的 108.54 词元/秒;最低的是 nemotron-3-ultra,为 21.52 词元/秒。
  • 运行波动最剧烈的是 nemotron-3-ultra,从 69.25 词元/秒的峰值下跌 65.5%,在 07:00 降至 13.81 词元/秒,变异系数为 82.8%;minimax-m3 也下跌了 35.0%,最终为 12.24 词元/秒。
  • deepseek-v4-flash 在 12 个采样中报告了 0 个(覆盖率 0.0%),因此其吞吐量未知;整体覆盖率为 87.5%,共 84 个有效数据点,这限制了针对整个集群的结论。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • glm-5.3-flash 是平均吞吐量最强的模型,达到 111.9 词元/秒,略胜于 107.05 词元/秒的 gemma4:31b,而 nemotron-3-ultra 最弱,平均仅为 26.68 词元/秒。
  • 波动最显著的是 glm-5.3,其在 186.54 和 7.86 词元/秒之间波动,变异系数为 54.2%,趋势为 -37.6%,并在窗口结束时处于最低值;minimax-m3 呈上升趋势,涨幅 61.3%,平均达到 84.97 词元/秒。
  • deepseek-v4-flash 在预期的 12 个样本中报告了零个样本,导致整体覆盖率为 87.5%(共 84 个有效数据点),因此无法评估其在该期间的吞吐量。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • gemma4:31b 的平均吞吐量最高,达到 119.03 词元/秒(峰值 172.67 词元/秒),而 nemotron-3-ultra 最弱,平均仅为 29.94 词元/秒,从未超过 69.25 词元/秒。
  • minimax-m3 的波动幅度最大,从 03:00 的 39.84 词元/秒低点攀升至 04:20 的 140.98 词元/秒峰值,整体上升 68.5%;glm-5.3-flash 是波动性最强的模型,变异系数达 46.0%,波动范围跨越 59.63 至 202.24 词元/秒。
  • deepseek-v4-flash 在预期 12 个样本的情况下报告了零个样本,导致整体覆盖率仅为 87.5%(84 个有效数据点),因此全机队范围的对比完全排除了该模型。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • gemma4:31b 的平均吞吐量最高,达 128.05 词元/秒(峰值 178.0 词元/秒),而 nemotron-3-ultra 最弱,平均仅 23.98 词元/秒,从未超过 40.17 词元/秒。
  • glm-5.2 波动最为剧烈,变异系数达 68.5%,从 01:40 的 11.36 词元/秒到 00:20 的 196.21 词元/秒之间大幅摆动;gemma4:31b 也从 02:00 的 172.67 词元/秒下降至 03:40 的 69.61 词元/秒。
  • deepseek-v4-flash 在全部 12 个预期观测值中报告的样本数为零,使整体覆盖率降至 87.5%(96 个有效数据点中的 84 个),因此其吞吐量在本周期内无法测得。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • gemma4:31b 是表现最强的模型,平均吞吐量为 144.54 词元/秒,而 nemotron-3-ultra 是表现最弱的模型,平均吞吐量为 27.73 词元/秒。
  • 运营层面最显著的变化是 minimax-m3 的持续下滑,从 23:20 的 170.28 词元/秒下降到 03:00 的 39.84 词元/秒,降幅达 49.7%;glm-5.2 也表现出剧烈波动,吞吐量在 11.36 到 196.21 词元/秒之间,变异系数为 79.8%。
  • deepseek-v4-flash 在预期的 12 个采样中返回了零个结果,因此其吞吐量未知;整体覆盖率为 87.5%(84 个有效数据点),这限制了对该时段整个集群性能的结论。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • 平均吞吐量最强的是 gemma4:31b,在 12 个样本中达到 143.06 词元/秒;最弱的是 nemotron-3-ultra,为 29.81 词元/秒,约为领先者的五分之一。
  • 运营层面最显著的变化是 minimax-m3 的持续下滑,从 22:40 时 173.55 词元/秒的峰值下降 37.9%,至 02:00 时为 48.08 词元/秒;glm-5.2 同样波动剧烈,范围在 11.36 至 196.21 词元/秒之间,变异系数为 74.3%。
  • deepseek-v4-flash 在预期 12 个样本的情况下报告为零个样本,导致整体覆盖率为 87.5%(84 个有效数据点),因此其吞吐量未被测量,且全集群平均值可能不完整。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • gemma4:31b 是表现最强的模型,平均吞吐量为 136.43 词元/秒,而 nemotron-3-ultra 是表现最弱的模型,平均为 26.97 词元/秒,峰值仅为 63.1 词元/秒。
  • glm-5.2 的波动性对运营影响最大,变异系数为 63.4%,从 21:20 的 168.57 词元/秒降至 23:20 的 22.36 词元/秒,随后在 00:20 飙升至 196.21 词元/秒,之后又回落至 34.43 词元/秒。
  • deepseek-v4-flash 在预期的 12 个样本中报告了 0 个,导致其完全未被测量;整体覆盖率为 87.5%,共 84 个有效数据点,因此全机群平均值不包含该模型。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • 平均吞吐量最高的是 minimax-m3,达 129.67 词元/秒(在 22:40 达到峰值 173.55 词元/秒),而 nemotron-3-ultra 最弱,平均仅 26.84 词元/秒,从未超过 63.1 词元/秒。
  • glm-5.2 波动最大,范围在 22.36 至 168.57 词元/秒之间,变异系数为 66.3%,其中包括一次在 21:20 飙升至 168.57 词元/秒的异常峰值;glm-5.3-flash 从 23:00 的 67.47 词元/秒跃升至 23:20 的 187.53 词元/秒。
  • deepseek-v4-flash 在预期的 12 个样本中报告为零(覆盖率为 0%),使整体覆盖率降至 87.5%,有效数据点为 84 个,因此无法评估其在该时间窗口内的吞吐量。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • minimax-m3 是平均吞吐量最强的模型,达 129.96 词元/秒(范围 89.3–173.55 词元/秒),而 nemotron-3-ultra 最弱,平均仅 23.53 词元/秒,峰值也只有 43.05 词元/秒。
  • glm-5.2 表现出对运营影响最大的波动性:吞吐量在 20:00 骤降至 8.73 词元/秒,在 21:00 之前一直低于 33 词元/秒,随后在 21:20 飙升至 168.57 词元/秒,其变异系数为 63.0%,而 minimax-m3 仅为 15.2%。
  • deepseek-v4-flash 在预期 12 个样本的情况下报告了零个样本,导致整体覆盖率为 87.5%(84 个有效数据点),因此其吞吐量未被测量,且全时段平均值不包含该模型。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • 平均吞吐量最强的是 minimax-m3,达 121.11 词元/秒(12 个样本中的 12 个,覆盖率 100%);最弱的是 nemotron-3-ultra,为 17.04 词元/秒,峰值仅为 37.9 词元/秒。
  • glm-5.2 表现出对运营影响最大的波动性:变异系数为 76.8%,波动范围从 8.73 到 168.57 词元/秒,以及 57.7% 的上升趋势,其中包括在 20:00 至 20:40 之间低于 30 词元/秒的读数之后,于 21:20 出现的 168.57 词元/秒的峰值。
  • deepseek-v4-flash 在预期 12 个样本的情况下报告了零个样本,导致其吞吐量无法测量;整体数据集覆盖率为 84 个有效数据点,即 87.5%,因此模型对比完全排除了该模型。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • minimax-m3 是最强的模型,平均吞吐量为 121.63 词元/秒,而 nemotron-3-ultra 最弱,平均为 18.29 词元/秒。
  • glm-5.3-flash 表现出对运营影响最大的波动性,范围从 10.61 到 176.59 词元/秒,变异系数为 58.6%,趋势为 -39.4%;glm-5.3 在整个时间窗口内也在 41.44 到 159.54 词元/秒之间波动。
  • deepseek-v4-flash 未报告任何样本(预期 12 个中的 0 个,覆盖率为 0%),因此其吞吐量未知;总体覆盖率为 87.5%,预期 96 个数据点中有 84 个有效。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • minimax-m3 是最强的模型,平均吞吐量为 118.96 词元/秒(12 个样本中的 12 个,覆盖率 100%),而 nemotron-3-ultra 最弱,平均为 19.41 词元/秒,峰值仅为 37.9 词元/秒。
  • 运营层面最显著的变化来自 glm-5.3-flash,其在观测窗口内下降了 40.0%,最新读数为 10.61 词元/秒,波动性较高(变异系数 52.3%),最大值为 176.59 词元/秒。
  • deepseek-v4-flash 在预期的 12 个样本中报告了 0 个(覆盖率 0.0%),因此其吞吐量未知;整体数据集覆盖率为 87.5%,共有 84 个有效数据点,这限制了全机群层面的结论。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • gemma4:31b 是最强的模型,平均吞吐量为 122.8 词元/秒,领先于 minimax-m3 的 117.98 词元/秒;nemotron-3-ultra 最弱,平均为 17.36 词元/秒,从未超过 33.57 词元/秒。
  • glm-5.3-flash 波动幅度最大,在 51.81 至 176.59 词元/秒之间摆动(变异系数 44.1%),而 glm-5.2 在该时间窗口内下降了 19.2%,在 17:40 降至 8.66 词元/秒,收于 11.08 词元/秒。
  • deepseek-v4-flash 未报告任何样本(12 个中的 0 个,覆盖率 0.0%),因此其吞吐量未知;整体数据集覆盖率为 87.5%,共 84 个有效数据点。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • 平均吞吐量最强的是 gemma4:31b,达 113.43 词元/秒,领先于 glm-5.3(111.99 词元/秒)和 minimax-m3(109.78 词元/秒);最弱的是 nemotron-3-ultra,为 17.8 词元/秒,远低于其他所有报告的模型。
  • glm-5.3-flash 的波动最为剧烈,从 14:40 的 3.01 词元/秒低点升至 18:00 的 176.59 词元/秒高点,趋势为 122.0%,变异系数为 55.6%;glm-5.2 的范围也从 8.66 到 162.78 词元/秒。
  • deepseek-v4-flash 在 12 个样本中报告了 0 个(0.0% 覆盖率),其吞吐量未知;整体覆盖率为 87.5%,共 84 个有效数据点,这限制了对该模型的结论。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • 平均吞吐量最高的是 gemma4:31b,在12个样本中达到108.26 词元/秒,峰值为159.92 词元/秒;最低的是 nemotron-3-ultra,为19.05 词元/秒,从未超过27.42 词元/秒。
  • glm-5.3-flash 呈现最陡峭的趋势,从窗口初期的大约50 词元/秒上升147.3%,到UTC 16:40–17:00时达到151.0–160.09 词元/秒;而 glm-5.2 波动最大,变异系数为61.3%,在11.12和162.78 词元/秒之间摆动。
  • deepseek-v4-flash 在12个预期样本中返回了0个,因此其吞吐量未知;整体覆盖率为87.5%(96个预期数据点中的84个),限制了该时段内对整个机群范围的结论。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • 平均吞吐量最高的是 minimax-m3,达 104.41 词元/秒;最低的是 nemotron-3-ultra,为 18.53 词元/秒,gemma4:31b 以 97.57 词元/秒位居第二。
  • glm-5.2 的波动性最大,变异系数为 71.6%,吞吐量在 11.12 至 162.78 词元/秒之间波动;glm-5.3 在整个时间窗口内交替出现接近 144 词元/秒的峰值和接近 27 词元/秒的低谷。
  • deepseek-v4-flash 未报告任何样本(预期 12 个中为 0 个,覆盖率 0%),因此其吞吐量未知;总体覆盖率为预期 96 个数据点中的 84 个,即 87.5%。