← 返回性能仪表板

每小时性能洞察

滚动四小时性能数据摘要

已保留 1190 条摘要
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • 平均吞吐量最高的是 minimax-m3,达 104.41 词元/秒;最低的是 nemotron-3-ultra,为 18.53 词元/秒,gemma4:31b 以 97.57 词元/秒位居第二。
  • glm-5.2 的波动性最大,变异系数为 71.6%,吞吐量在 11.12 至 162.78 词元/秒之间波动;glm-5.3 在整个时间窗口内交替出现接近 144 词元/秒的峰值和接近 27 词元/秒的低谷。
  • deepseek-v4-flash 未报告任何样本(预期 12 个中为 0 个,覆盖率 0%),因此其吞吐量未知;总体覆盖率为预期 96 个数据点中的 84 个,即 87.5%。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • 平均吞吐量最高的是 minimax-m3,达 108.03 词元/秒;最低的是 nemotron-3-ultra,为 21.77 词元/秒,gemma4:31b 以 95.78 词元/秒位居第二。
  • glm-5.2 波动最为剧烈,在该时间窗口内上升 68.3%,在 14:00 降至 11.12 词元/秒后,于 14:40 达到 162.78 词元/秒的峰值,其波动率也最高,CV 为 67.1%;minimax-m3 下降 20.5%,至 15:00 时为 35.94 词元/秒。
  • deepseek-v4-flash 在预期的 12 个样本中报告了 0 个(覆盖率 0%),使整体覆盖率降至 87.5%,有效数据点为 84 个,因此无法对该模型进行吞吐量评估。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • minimax-m3 是平均吞吐量最强的模型,达到 114.76 词元/秒(12 个样本,峰值 168.84 词元/秒),而 nemotron-3-ultra 最弱,平均为 32.23 词元/秒,从未超过 77.25 词元/秒。
  • 运营层面最显著的变化是 nemotron-3-ultra 下降了 50.2%,从 10:40 的 77.25 词元/秒峰值跌至 12:20 的 15.75 词元/秒,收于 26.07 词元/秒;gemma4:31b 也在 12.58 至 173.81 词元/秒之间大幅波动。
  • deepseek-v4-flash 在整个时间窗口内没有任何样本(预期 12 个中为 0 个,覆盖率 0.0%),总体覆盖率为 87.5%,即预期 96 个数据点中有 84 个,因此无法评估其吞吐量。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • gemma4:31b 是平均吞吐量最强的模型,达到 114.14 词元/秒(p95 为 165.5 词元/秒),而 nemotron-3-ultra 最弱,平均仅为 32.23 词元/秒,峰值也仅有 77.25 词元/秒。
  • 运营层面最显著的波动是窗口后期的崩溃:gemma4:31b 从 12:20 的 173.81 词元/秒跌至 13:00 的 12.58 词元/秒,而 glm-5.2 的相对波动性最高,变异系数达 78.4%,波动范围在 11.63 至 139.45 词元/秒之间;deepseek-v4-pro 是唯一明显上升的模型,趋势上涨 56.0%。
  • deepseek-v4-flash 在全部 12 个预期时间间隔内均报告零样本(覆盖率为 0%),其吞吐量未知;整体数据集覆盖率为 87.5%,共 84 个有效数据点,因此模型层面的比较完全排除了该模型。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • gemma4:31b 以 128.66 词元/秒的平均吞吐量表现最强(峰值 174.57 词元/秒),而 nemotron-3-ultra 最弱,平均仅 35.2 词元/秒,从未超过 77.25 词元/秒。
  • minimax-m3 展现出最显著的恢复能力,从 09:00 的 15.35 词元/秒低谷攀升至 11:40 的 168.84 词元/秒峰值,趋势涨幅达 96.3%;glm-5.2 波动最大,变异系数为 69.1%,并在 11:00 跌至 11.63 词元/秒。
  • deepseek-v4-flash 在预期的 12 个样本中报告为零(覆盖率 0%),使整体覆盖率降至 87.5%,有效数据点为 84 个,因此本期无法评估其吞吐量。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • gemma4:31b 是平均吞吐量最强的模型,达到 142.06 词元/秒(范围从 72.03 到 180.87 词元/秒),而 nemotron-3-ultra 最弱,平均仅为 31.72 词元/秒,峰值也仅有 77.25 词元/秒。
  • 运营层面最显著的波动来自 glm-5.2,其变异系数为 81.9%,从 09:20 的 139.45 词元/秒骤降至 11:00 的 11.63 词元/秒;minimax-m3 展现出最强劲的回升,尽管在 08:00 一度跌至 10.61 词元/秒,整体仍从 58.69 上升 101.5% 至 104.63 词元/秒。
  • deepseek-v4-flash 在预期的 12 个样本中报告了 0 个(覆盖率 0.0%),导致其吞吐量在本期间未被测量;整体数据集覆盖率为 87.5%,共 84 个有效数据点,因此模型对比将其完全排除在外。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • gemma4:31b 是表现最强的模型,平均吞吐量为 143.68 词元/秒,峰值达 180.87 词元/秒;nemotron-3-ultra 表现最弱,平均为 28.07 词元/秒,从未超过 49.47 词元/秒。
  • glm-5.2 的波动性对运营影响最大,变异系数为 75.9%:它在 09:20 UTC 飙升至 139.45 词元/秒,随后在 10:00 UTC 降至 20.05 词元/秒,而 deepseek-v4-pro 则从 08:40 的 105.18 词元/秒降至 10:00 的 14.14 词元/秒。
  • deepseek-v4-flash 在预期的 12 个样本中返回了零个(0% 覆盖率),使整体覆盖率降至 87.5%(96 个数据点中的 84 个),因此无法在该时间窗口内评估其吞吐量。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • gemma4:31b 是表现最强的模型,平均吞吐量为 149.81 词元/秒,峰值达 180.87 词元/秒,而 nemotron-3-ultra 表现最弱,平均为 32.29 词元/秒,最低为 13.47 词元/秒。
  • minimax-m3 的波动性最高,变异系数为 57.0%,在 124.9 和 10.61 词元/秒之间波动,而 glm-5.3-flash 在该时间窗口内下降了 44.5%,在 08:40 降至 11.9 词元/秒。
  • deepseek-v4-flash 没有任何采样(预期 12 个中为 0 个,覆盖率为 0%),因此其吞吐量未知;整体覆盖率为 87.5%,共 84 个有效数据点,这限制了对整个集群性能的结论。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • gemma4:31b 是表现最强的模型,平均吞吐量为 147.07 词元/秒(范围从 101.4 到 180.87 词元/秒),而 nemotron-3-ultra 是表现最弱的模型,平均为 35.14 词元/秒,峰值仅为 64.47 词元/秒。
  • 运营层面最显著的变化是 minimax-m3 的持续下滑,从 04:40 的 162.06 词元/秒降至 08:00 的 10.61 词元/秒,呈 60.3% 的下降趋势,变异系数为 57.6%,是数据集中波动性最高的。
  • deepseek-v4-flash 在预期的 12 个样本中报告为零个样本,导致其吞吐量在整个时间窗口内无法测量;数据集整体覆盖率为 87.5%,有效数据点为 84 个,因此全集群范围的比较完全排除了该模型。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • gemma4:31b 是表现最强的模型,平均吞吐量为 137.04 词元/秒,而 nemotron-3-ultra 表现最弱,平均为 43.35 词元/秒,略低于 glm-5.2 的 44.13 词元/秒。
  • minimax-m3 呈现出最剧烈的运行波动,从 04:40 的 162.06 词元/秒峰值降至 06:00 的 35.98 词元/秒,最终收于 45.51 词元/秒,趋势为 -38.4%;glm-5.3-flash 也在 196.79 和 53.1 词元/秒之间波动。
  • deepseek-v4-flash 没有任何采样(预期 12 个中为 0 个,覆盖率 0.0%),因此无法评估其吞吐量;整个时间窗口的总体覆盖率为 87.5%,共有 84 个有效数据点。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • gemma4:31b 是平均吞吐量最强的模型,达到 139.01 词元/秒,而 nemotron-3-ultra 最弱,为 45.51 词元/秒。
  • minimax-m3 表现出对运营影响最大的波动性,从 03:00 的低点 16.66 词元/秒攀升 94.7% 至 04:40 的峰值 162.06 词元/秒,变异系数为 54.5%,随后在 06:00 回落至 35.98 词元/秒。
  • deepseek-v4-flash 未返回任何样本(预期 12 个中的 0 个),导致其吞吐量无法测量,并使整体覆盖率降至 87.5%(84 个有效数据点),因此在此时间窗口内无法进行涉及该模型的比较。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • gemma4:31b 是平均吞吐量最强的模型,达到 135.94 词元/秒(峰值 159.32 词元/秒),而 nemotron-3-ultra 最弱,平均仅 48.30 词元/秒,从未超过 93.06 词元/秒。
  • 运营层面最显著的变化来自 minimax-m3,其在窗口初期从约 97-102 词元/秒跌至 03:00 的最低点 16.66 词元/秒,随后在 04:40 恢复至 162.06 词元/秒的峰值,这一波动体现在其 53.1% 的变异系数和 +132.3% 的趋势中。
  • deepseek-v4-flash 在预期的 12 个采样中报告为零(0% 覆盖率),因此其吞吐量未知;整体数据集覆盖率为 87.5%,共 84 个有效数据点,这限制了跨窗口的比较。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • gemma4:31b 是表现最强的模型,平均吞吐量为 132.87 词元/秒,而 nemotron-3-ultra 最弱,为 48.8 词元/秒;glm-5.2 也较低,为 68.51 词元/秒。
  • minimax-m3 表现出对运营影响最大的波动性:吞吐量从 00:20 的 125.3 词元/秒降至 03:00 的 16.66 词元/秒,随后在 04:00 恢复至 124.1 词元/秒,趋势为 -33.8%,变异系数为 47.9%。
  • deepseek-v4-flash 在预期的 12 个样本中报告了 0 个(覆盖率为 0%),其吞吐量因此未被测量;总体覆盖率为 96 个有效数据点中的 84 个(87.5%),因此结论不包含该模型。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • gemma4:31b 是平均吞吐量最强的模型,达到 136.8 词元/秒,而 nemotron-3-ultra 最弱,为 55.47 词元/秒;其他模型的平均值介于 71.07 至 114.0 词元/秒之间。
  • 运营层面最显著的变化是 minimax-m3 的持续下滑,从 23:20 的 219.82 词元/秒降至 03:00 的 16.66 词元/秒,趋势为 -58.3%,且波动性最高(变异系数 60.1%),最终成为运行中最慢的模型。
  • deepseek-v4-flash 在整个时间窗口内没有任何采样(预期 12 次中为 0 次,覆盖率 0.0%),因此其吞吐量未知;整体覆盖率为 87.5%,共 84 个有效数据点,这限制了任何涉及该模型的比较。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • gemma4:31b 是最强的模型,平均吞吐量为 140.9 词元/秒,而 nemotron-3-ultra 最弱,平均为 53.59 词元/秒。
  • minimax-m3 表现出对运营影响最大的波动性,变异系数为 40.8%,在 219.82 和 49.99 词元/秒之间波动,并以 35.7% 的下降趋势收于其最低值 49.99 词元/秒。
  • deepseek-v4-flash 在该期间没有数据(12 个样本中为 0,覆盖率 0.0%),使整体覆盖率为 87.5%,有效数据点为 84 个,因此无法评估其吞吐量。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • minimax-m3 是平均吞吐量最强的模型,达到 143.91 词元/秒(峰值 219.82 词元/秒),而 nemotron-3-ultra 最弱,平均为 51.45 词元/秒,低于 glm-5.2 的 60.55 词元/秒。
  • 运营层面最显著的变动是 deepseek-v4-pro 在 01:00 降至 12.74 词元/秒的最低值,整个时间窗口内趋势为 -21.6%;glm-5.3-flash 还表现出最高的波动性(变异系数 47.4%),在 46.65 至 187.02 词元/秒之间摆动。
  • deepseek-v4-flash 未返回任何样本(覆盖率为 0%),导致 96 个预期数据点中仅 84 个有效(整体覆盖率为 87.5%),因此该模型在本周期内的吞吐量无法测量。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • minimax-m3 是平均吞吐量最强的模型,达 153.29 词元/秒,峰值为 219.82 词元/秒,而 nemotron-3-ultra 最弱,平均仅 46.49 词元/秒,最低降至 7.8 词元/秒。
  • 运营层面最显著的波动是 glm-5.3-flash 在 22:00 UTC 飙升至 187.02 词元/秒,而其平均值为 78.08 词元/秒;minimax-m3 在该时间窗口内在 65.34 至 219.82 词元/秒之间波动。
  • deepseek-v4-flash 在预期的 12 个样本中报告为零,因此其吞吐量未知;整体覆盖率为 87.5%,共 84 个有效数据点,这限制了跨整个时间窗口的比较。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • minimax-m3 是平均吞吐量最强的模型,达 154.07 词元/秒(峰值 197.54 词元/秒),而 nemotron-3-ultra 最弱,平均仅 40.32 词元/秒,峰值仅为 72.82 词元/秒。
  • glm-5.3-flash 波动最为剧烈:其吞吐量从 19:40 的 192.96 词元/秒跌至 20:00 的 63.27 词元/秒,此后大部分时间维持在 60-77 词元/秒附近,趋势为 -21.2%,变异系数为 55.0%。
  • deepseek-v4-flash 在预期的 12 个样本中报告了 0 个(覆盖率 0.0%),使整体覆盖率降至 87.5%(96 个有效数据点中的 84 个),因此无法评估其在该时间窗口内的吞吐量。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • minimax-m3 是最强的模型,平均吞吐量为 153.01 词元/秒,而 nemotron-3-ultra 最弱,平均为 40.45 词元/秒,glm-5.2 紧随其后,为 50.50 词元/秒。
  • 波动最显著的是 glm-5.3-flash,其变异系数为 49.9%,在 60.84 至 192.96 词元/秒之间波动;glm-5.3 也在 UTC 19:00 骤降至 15.76 词元/秒,随后在 22:00 恢复至 151.61 词元/秒。
  • deepseek-v4-flash 在预期的 12 个样本中报告了 0 个(覆盖率为 0%),使整体覆盖率降至 87.5%,仅有 84 个有效数据点,因此其吞吐量在此时间窗口内完全未被测量。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • minimax-m3 是最强的模型,平均吞吐量为 149.17 词元/秒(范围 128.46–188.76 词元/秒),而 nemotron-3-ultra 是最弱的模型,平均为 35.8 词元/秒,最终仅为 7.8 词元/秒。
  • 波动最显著的是 gemma4:31b,其在 40.02 至 175.55 词元/秒之间波动(变异系数 40.0%),以及 glm-5.3,该模型在 19:00 降至 15.76 词元/秒,随后在 21:00 前恢复至 124.12 词元/秒。
  • deepseek-v4-flash 没有任何样本(预期 12 个中为 0 个,覆盖率 0.0%),因此无法评估其吞吐量;整体数据集覆盖率为 87.5%(84 个有效数据点)。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • minimax-m3 是最强的模型,平均吞吐量为 149.7 词元/秒(范围 110.56 至 188.76 词元/秒),而 nemotron-3-ultra 最弱,平均为 34.38 词元/秒(范围 10.96 至 63.31 词元/秒)。
  • 运营层面最显著的波动来自 glm-5.3-flash,该模型在前六个时间区间保持在约 60 至 73 词元/秒,随后在 19:40 飙升至 192.96 词元/秒,又在 20:00 回落至 63.27 词元/秒;其变异系数为 50.2%。glm-5.3 还曾在 19:00 降至 15.76 词元/秒。
  • deepseek-v4-flash 在预期的 12 个采样点中报告为零个样本,因此其吞吐量未知;总体覆盖率为 96 个预期数据点中的 84 个,即 87.5%,这限制了对整个集群性能的结论。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • gemma4:31b 的平均吞吐量最高,达 115.24 词元/秒,领先于 minimax-m3(111.35 词元/秒)和 glm-5.3(105.84 词元/秒);nemotron-3-ultra 表现最弱,平均仅 23.01 词元/秒,从未超过 52.24 词元/秒。
  • minimax-m3 趋势最为陡峭,从 14:20 的 79.55 词元/秒上升 117%,于 17:20 达到 188.76 词元/秒的峰值;gemma4:31b 波动最大,在 40.02 至 180.26 词元/秒之间摆动,变异系数为 44.6%。
  • deepseek-v4-flash 在预期的 12 个样本中报告为零(覆盖率为 0%),仅剩 84 个有效数据点,总体覆盖率为 87.5%,因此无法评估其在该时段的吞吐量。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • gemma4:31b 是最强的模型,平均吞吐量为 124.04 词元/秒,而 nemotron-3-ultra 最弱,为 28.39 词元/秒,大约是领先者速度的四分之一。
  • 运营层面最显著的波动是 gemma4:31b 从 14:20 的 159.64 词元/秒骤降至 15:00 的 58.4 词元/秒,降幅约 63%,随后在 16:40 恢复至 180.26 词元/秒;nemotron-3-ultra 也表现出最高的相对波动性,变异系数为 57.7%。
  • deepseek-v4-flash 在预期的 12 个样本中报告了 0 个(覆盖率 0%),使整体覆盖率停留在 87.5%,共 84 个有效数据点,因此无法评估其在该时间窗口内的吞吐量。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • 平均吞吐量最高的是 gemma4:31b,达 118.55 词元/秒(峰值 159.64 词元/秒);最低的是 nemotron-3-ultra,为 30.84 词元/秒,窗口结束时为 9.85 词元/秒。
  • 运营层面最重大的事件是 gemma4:31b 从 14:20 的 159.64 词元/秒降至 15:00 的 58.4 词元/秒,导致其趋势为 -40.5%;glm-5.3 也在 184.48 和 61.44 词元/秒之间波动,变异系数为 41.0%。
  • deepseek-v4-flash 在预期的 12 个样本中报告了 0 个(覆盖率为 0%),使整体覆盖率降至 87.5%(96 个有效点中的 84 个),因此无法评估其在该窗口内的吞吐量。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • glm-5.3 是最强的模型,平均吞吐量为 134.86 词元/秒,略微领先于 gemma4:31b 的 129.99 词元/秒,而 nemotron-3-ultra 最弱,平均仅为 30.87 词元/秒,峰值也仅有 59.11 词元/秒。
  • 运营层面最重要的事件是 gemma4:31b 在后期的崩溃:它从 12:20 到 14:20 一直保持在 143-160 词元/秒,随后在最后两次观测中跌至 59.94 和 58.4 词元/秒,相比其 14:20 的水平下降了约 63%。
  • deepseek-v4-flash 在预期的 12 个样本中报告为零(0% 覆盖率),使整体有效数据点降至 96 个中的 84 个(87.5% 覆盖率),因此无法在该时间窗口内评估其吞吐量。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • glm-5.3 是平均吞吐量最强的模型,达到 135.62 词元/秒,略微领先于 gemma4:31b 的 135.35 词元/秒;nemotron-3-ultra 最弱,平均仅为 33.66 词元/秒,最低时为 4.41 词元/秒。
  • glm-5.3 表现出对运营影响最为显著的波动性,在 59.94 至 184.48 词元/秒之间摆动,变异系数为 36.3%,其中包括在 12:00 和 13:00 出现的急剧下降;minimax-m3 也在 40 分钟内从 58.87 飙升至 167.43 词元/秒。
  • deepseek-v4-flash 在预期的 12 个样本中报告为零个,使整体覆盖率降至 87.5%(84 个有效数据点),因此其吞吐量在本周期内无法测得。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • gemma4:31b 是最强模型,平均吞吐量为 127.72 词元/秒(p95 为 165.36 词元/秒),而 nemotron-3-ultra 最弱,平均为 28.03 词元/秒,从未超过 55.27 词元/秒。
  • glm-5.3 表现出对运行影响最大的波动性,变异系数为 44.1%,在 59.94 至 184.48 词元/秒之间摆动;其 +50.4% 的趋势包括从 11:40 的 176.83 词元/秒降至 12:00 的 73.39 词元/秒,随后在 12:20 恢复至 184.48 词元/秒。
  • deepseek-v4-flash 无数据(12 个样本中为 0,覆盖率为 0.0%),使整体覆盖率降至 87.5%,仅有 84 个有效数据点,因此无法在此时间窗口内评估其吞吐量。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • gemma4:31b 是最强的模型,平均吞吐量为 118.33 词元/秒,而 nemotron-3-ultra 最弱,为 30.93 词元/秒;glm-5.3 紧随其后,为 117.44 词元/秒。
  • glm-5.3 表现出对运行影响最显著的波动性,在 59.94 至 176.83 词元/秒之间摆动,变异系数为 41.4%,趋势为 +26.6%,其中包括最后一个时间区间从 176.83 降至 73.39 词元/秒;nemotron-3-ultra 的波动范围也在 4.41 至 75.22 词元/秒之间。
  • deepseek-v4-flash 在预期 12 个样本的情况下报告了零个样本,因此其吞吐量未知;整体覆盖率为 87.5%,有效数据点为 84 个,任何模型对比均将其排除在外。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • gemma4:31b 是平均吞吐量最强的模型,达到 117.8 词元/秒(12 个样本中的 12 个,覆盖率 100%),而 nemotron-3-ultra 最弱,为 30.16 词元/秒,最小值为 4.41 词元/秒,最大值为 75.22 词元/秒。
  • glm-5.3 表现出对运营影响最大的波动性,在 59.94 至 171.09 词元/秒之间波动,变异系数为 41.9%,趋势为 -23.4%;nemotron-3-ultra 更不稳定,变异系数达 68.1%。
  • deepseek-v4-flash 没有任何样本(预期 12 个中的 0 个,覆盖率 0%),因此其吞吐量未知;整体覆盖率为 87.5%,共 84 个有效数据点,这限制了对整个集群得出结论的能力。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • gemma4:31b 是性能最强的模型,平均吞吐量为 127.04 词元/秒,而 nemotron-3-ultra 是性能最弱的模型,平均为 34.86 词元/秒,样本范围从 5.56 到 83.91 词元/秒。
  • glm-5.3 表现出对运营影响最大的波动性,在整个时间窗口内在约 65-80 词元/秒和 166-171 词元/秒之间交替变化,变异系数为 42.8%;nemotron-3-ultra 同样不稳定,在 07:40 降至 5.56 词元/秒。
  • deepseek-v4-flash 未报告任何样本(预期 12 个中的 0 个,覆盖率 0.0%),使整体覆盖率降至 87.5%(预期 96 个数据点中的 84 个),因此无法评估其在该期间的吞吐量。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • 平均吞吐量最强的是 gemma4:31b,达 135.85 词元/秒(峰值 178.41 词元/秒),最弱的是 nemotron-3-ultra,为 41.14 词元/秒,该模型也录得最低单次读数 5.56 词元/秒。
  • 运营层面最显著的波动来自 glm-5.3,其每 20 分钟在约 170 词元/秒和约 75 词元/秒之间交替,标准差为 51.05 词元/秒,变异系数为 45.7%;nemotron-3-ultra 也在窗口期内从 83.91 词元/秒骤降至 5.56 词元/秒。
  • deepseek-v4-flash 的样本数为零(预期 12 个中为 0 个,覆盖率 0%),因此其吞吐量未知;整体覆盖率为 87.5%,共 84 个有效数据点,这限制了全集群层面的结论。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • gemma4:31b 是平均吞吐量最强的模型,达到 139.1 词元/秒(峰值 178.41 词元/秒),而 nemotron-3-ultra 最弱,平均仅为 42.86 词元/秒,从未超过 83.91 词元/秒。
  • glm-5.3-flash 的波动性对运营影响最大,变异系数为 52.2%,吞吐量从 04:40 的 186.31 词元/秒骤降至 06:20 的 13.76 词元/秒;glm-5.3 也在约 28 至 176 词元/秒之间剧烈震荡。
  • deepseek-v4-flash 在预期的 12 个采样中缺失全部样本(0% 覆盖率),使整体有效数据点降至 96 个中的 84 个(87.5% 覆盖率),因此无法评估其在该时间窗口内的吞吐量。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • gemma4:31b 是平均吞吐量最强的模型,达到 138.39 词元/秒(峰值 176.04 词元/秒),而 nemotron-3-ultra 最弱,平均仅为 59.01 词元/秒,最低为 24.6 词元/秒。
  • glm-5.3 表现出对运营影响最大的波动性,变异系数为 45.4%,吞吐量从 05:00 的 176.62 词元/秒骤降至 06:00 的 28.76 词元/秒;glm-5.3-flash 也曾飙升至 186.31 词元/秒,随后回落至 61.32 词元/秒。
  • deepseek-v4-flash 在全部 12 个预期时间区间内报告的采样数为零,使整体覆盖率降至 87.5%(96 个有效数据点中的 84 个),因此其吞吐量在此时间窗口内无法测得。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • 平均吞吐量最强的是 gemma4:31b,达 134.3 词元/秒(峰值 161.46 词元/秒),而 glm-5.2 最弱,平均仅 58.35 词元/秒,最低降至 29.48 词元/秒。
  • glm-5.3-flash 波动最为剧烈,趋势增益为 57.3%,变异系数为 45.8%,在 04:40 从约 75 词元/秒飙升至 186.31 词元/秒,随后在 05:00 骤降至 71.57 词元/秒;glm-5.3 则在 180.64 与 63.42 词元/秒之间波动。
  • deepseek-v4-flash 在预期 12 个样本的情况下报告为零个样本,导致整体覆盖率为 87.5%(84 个有效数据点),因此其吞吐量未被测量,机群层面的平均值可能不完整。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • gemma4:31b 是性能最强的模型,平均吞吐量为 132.51 词元/秒,峰值达 160.05 词元/秒,而 nemotron-3-ultra 性能最弱,平均为 60.83 词元/秒,最低为 33.46 词元/秒。
  • glm-5.3 的波动性对运行影响最大,变异系数为 47.2%,波动范围在 63.42 至 180.64 词元/秒之间,其中包括在 UTC 时间 02:40 至 03:00 之间从 180.64 降至 74.29 词元/秒的情况。
  • deepseek-v4-flash 未报告任何样本(预期 12 个中的 0 个),其吞吐量未知;整体覆盖率为 87.5%,共 84 个有效数据点,因此结论中不包含该模型。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • gemma4:31b 的平均吞吐量最高,达 123.08 词元/秒(峰值 165.03 词元/秒),而 glm-5.2 表现最弱,平均为 61.36 词元/秒,在 00:00 UTC 时一度低至 26.91 词元/秒。
  • glm-5.3 的波动性最具运维意义,呈 101.9% 的上升趋势,变异系数为 48.1%,在整个时间窗口内于 60.89 至 180.64 词元/秒之间波动。
  • deepseek-v4-flash 报告的采样数为零(覆盖率 0%),因此其吞吐量未知;整体覆盖率为 87.5%,即 96 个预期数据点中有 84 个,这限制了跨整个时间窗口的比较。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • gemma4:31b 的平均吞吐量最高,达 121.02 词元/秒(峰值 166.22 词元/秒),而 nemotron-3-ultra 表现最弱,平均仅 55.70 词元/秒,且从未超过 75.15 词元/秒。
  • glm-5.3-flash 呈现出对运营影响最大的波动性,在 22:40 飙升至 201.76 词元/秒,23:00 达到 200.73 词元/秒,随后在 02:00 回落至 76.60 词元/秒,趋势为 -36.9%,变异系数为 55.3%;glm-5.3 同样在 60.89 至 178.38 词元/秒之间大幅波动。
  • deepseek-v4-flash 在预期的 12 个采样中返回了零个(0% 覆盖率),使有效数据点总数为 84 个(87.5% 覆盖率),因此无法评估其在该时间窗口内的吞吐量。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • gemma4:31b 是性能最强的模型,平均吞吐量为 115.25 词元/秒,领先于 deepseek-v4-pro 的 105.64 词元/秒;glm-5.2 性能最弱,为 55.65 词元/秒,略低于 nemotron-3-ultra 的 59.02 词元/秒。
  • glm-5.3-flash 波动性最大,变异系数为 58.5%,从 22:40 的 201.76 词元/秒骤降至 23:40 的 53.22 词元/秒;glm-5.3 在该时间段内也下降了 42.3%,从 21:20 的 165.72 词元/秒降至 01:00 的 79.05 词元/秒。
  • deepseek-v4-flash 没有任何采样(预期 12 个中为 0 个,覆盖率为 0%),因此无法评估其吞吐量;整体覆盖率为 87.5%,预期 96 个采样中有 84 个。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • gemma4:31b 是平均吞吐量最强的模型,达到 122.75 词元/秒(峰值 181.21 词元/秒),而 glm-5.2 最弱,平均仅 45.66 词元/秒,从未超过 106.35 词元/秒。
  • 运行层面最显著的变化是 glm-5.3 下降了 37.6%,从 20:40 时 187.11 词元/秒的峰值跌至最后两小时约 60-73 词元/秒;glm-5.3-flash 也在数小时内从 50.96 词元/秒波动至 201.76 词元/秒,随后又回落。
  • deepseek-v4-flash 在预期的 12 个样本中报告为零(0% 覆盖率),其吞吐量因此未知;总体而言,数据集包含 84 个有效数据点,而预期为 96 个,即 87.5% 的覆盖率。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • glm-5.3 的平均吞吐量最高,达到 129.17 词元/秒,峰值为 187.11 词元/秒,而 glm-5.2 最弱,平均为 40.30 词元/秒,且从未超过 75.38 词元/秒。
  • 运营层面最显著的变化来自 glm-5.3-flash,其吞吐量从 22:20 的 75.79 词元/秒跃升至 22:40 的 201.76 词元/秒,并在 23:00 保持 200.73 词元/秒,趋势为 63.9%,变异系数为 55.8%;nemotron-3-ultra 也在 6.65 至 100.71 词元/秒之间波动。
  • deepseek-v4-flash 在预期的 12 个样本中报告了 0 个(覆盖率为 0%),使整体覆盖率停留在 87.5%,共 84 个有效数据点,因此本时段无法对该模型进行吞吐量评估。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • glm-5.3 是平均吞吐量最强的模型,达到 134.15 词元/秒,略微领先于 gemma4:31b 的 133.03 词元/秒,而 nemotron-3-ultra 最弱,为 39.55 词元/秒,且在窗口结束时仅为 6.65 词元/秒。
  • glm-5.2 表现出对运营影响最大的波动性,变异系数为 73.4%,在 18:00 出现一次 169.82 词元/秒的峰值,而平均值为 53.0 词元/秒,趋势为 -43.9%;glm-5.3 也在 64.1 至 187.11 词元/秒之间波动。
  • deepseek-v4-flash 在预期的 12 个样本中报告了 0 个(覆盖率 0.0%),因此整体覆盖率为 87.5%,有效数据点为 84 个,无法对该模型进行吞吐量比较。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • gemma4:31b 的平均吞吐量最高,达 135.82 词元/秒,而 nemotron-3-ultra 最弱,为 41.17 词元/秒;glm-5.3 位居第二,为 125.49 词元/秒。
  • glm-5.2 表现出对运营影响最大的波动性,变异系数为 83.1%,在整个时间窗口内于 28.58 至 232.61 词元/秒之间波动;glm-5.3-flash 也较其早期峰值 188.36 词元/秒下降了 49.6%。
  • deepseek-v4-flash 在预期 12 个样本的情况下报告了零个样本,因此其吞吐量未知;整体覆盖率为 87.5%,共 84 个有效数据点,这限制了面向整个机群的结论。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • gemma4:31b 是平均吞吐量最强的模型,达到 147.61 词元/秒(p95 为 170.36 词元/秒),而 nemotron-3-ultra 最弱,平均仅为 38.16 词元/秒,峰值也仅有 74.59 词元/秒。
  • glm-5.2 的波动性对运营影响最大,在 28.58 至 232.61 词元/秒之间波动,变异系数为 74.1%,趋势为 -39.2%;glm-5.3-flash 同样下跌 -31.3%,到 19:00 UTC 时降至 54.69 词元/秒。
  • deepseek-v4-flash 在预期的 12 个样本中报告了 0 个(覆盖率 0%),其吞吐量未知;整体数据集覆盖率为 87.5%,即预期的 96 个数据点中有 84 个,因此全集群范围的比较尚不完整。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • gemma4:31b 是平均吞吐量最强的模型,达到 148.72 词元/秒(p95 为 166.18 词元/秒),而 nemotron-3-ultra 最弱,平均仅为 34.45 词元/秒,从未超过 74.59 词元/秒。
  • glm-5.2 波动性最大,变异系数为 70.5%,在四个小时内于 28.58 至 232.61 词元/秒之间波动;glm-5.3-flash 呈现最陡峭的趋势,达 +131.3%,从 14:20 的 48.62 词元/秒上升至 16:40 的 188.36 词元/秒。
  • deepseek-v4-flash 在 12 个预期样本中报告为零(覆盖率 0.0%),因此无法评估其吞吐量;整体覆盖率为 87.5%,共 84 个有效数据点,限制了全机群范围的比较。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • gemma4:31b 是最强的模型,平均吞吐量为 145.45 词元/秒,而 nemotron-3-ultra 是最弱的模型,平均为 30.88 词元/秒,从未超过 62.0 词元/秒。
  • glm-5.3-flash 表现出最剧烈的变化,从 16:00 的 59.8 词元/秒攀升至 16:40 的 188.36 词元/秒(趋势为 97.9%);glm-5.2 波动最大,范围在 31.39 至 232.61 词元/秒之间,变异系数为 63.9%。
  • deepseek-v4-flash 在 12 个样本中报告了 0 个(覆盖率为 0%),因此其吞吐量未知;整体覆盖率为 87.5%,共有 84 个有效数据点。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • 平均吞吐量最高的是 gemma4:31b,达 129.74 词元/秒(峰值 164.92 词元/秒),而 nemotron-3-ultra 最弱,平均仅 28.24 词元/秒,波动范围为 6.84 至 58.48 词元/秒。
  • glm-5.2 波动最大,变异系数为 60.1%,从 14:20 的 31.39 词元/秒摆动至 15:20 的 194.35 词元/秒;glm-5.3 在该时间窗口内下降了 25.0%,最终为 59.85 词元/秒。
  • deepseek-v4-flash 在预期的 12 个样本中报告了 0 个,导致其吞吐量未知,并将整体覆盖率降至 87.5%(96 个有效数据点中的 84 个),因此任何模型对比均完全将其排除在外。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • glm-5.3 是最强的模型,平均吞吐量为 128.43 词元/秒(p95 为 178.85 词元/秒),而 nemotron-3-ultra 最弱,平均仅为 25.75 词元/秒,在任何观测中均未超过 58.48 词元/秒。
  • glm-5.2 的波动性最具运营意义,变异系数为 61.4%,从 12:00 的 5.89 词元/秒波动至 15:00 的 181.99 词元/秒;gemma4:31b 也在 13:00 一度跌至 58.26 词元/秒,随后在 14:20 恢复至 157.22 词元/秒。
  • deepseek-v4-flash 没有任何样本(预期 12 个中的 0 个),因此其吞吐量未知;总体覆盖率为 87.5%(96 个有效数据点中的 84 个),限制了对整个集群性能的结论。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • glm-5.3 是平均吞吐量最强的模型,达到 123.58 词元/秒(峰值 181.11 词元/秒),而 nemotron-3-ultra 最弱,平均仅为 32.30 词元/秒,从未超过 59.43 词元/秒。
  • 波动最显著的是 glm-5.3-flash,其吞吐量从 10:20 的 172.07 词元/秒降至 14:00 的 67.85 词元/秒,降幅达 25.8%,变异系数为 48.9%;nemotron-3-ultra 则在 5.24 至 59.43 词元/秒之间波动。
  • deepseek-v4-flash 在预期的 12 个样本中报告了 0 个(覆盖率为 0%),整体覆盖率为 87.5%,共 84 个有效数据点,因此本期无法评估其吞吐量。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • 平均吞吐量最强的是 gemma4:31b,达 114.49 词元/秒(峰值 163.4 词元/秒);最弱的是 nemotron-3-ultra,为 34.40 词元/秒,最低降至 5.24 词元/秒。
  • 最显著的趋势是 glm-5.3 上升了 59.3%,从 10:20 的 65.63 词元/秒升至 12:40 的 181.11 词元/秒峰值;glm-5.3-flash 波动最为剧烈,变异系数为 51.8%,吞吐量从 172.07 词元/秒一路下探至 27.66 词元/秒。
  • deepseek-v4-flash 未返回任何样本(覆盖率为 0%),使整体覆盖率停留在 87.5%,即 96 个预期数据点中仅有 84 个,因此该模型在本时间窗口内的吞吐量无法测得。
4 小时窗口 · 84 个数据点 · 覆盖率 87.5%
  • gemma4:31b 是表现最强的模型,平均吞吐量为 123.88 词元/秒(峰值达 173.39 词元/秒),而 nemotron-3-ultra 是表现最弱的模型,平均吞吐量为 42.92 词元/秒,波动范围在 5.24 至 89.59 词元/秒之间。
  • 波动最显著的是 glm-5.2 和 nemotron-3-ultra:glm-5.2 从 08:20 的 108.13 词元/秒降至 12:00 的 5.89 词元/秒(趋势为 -23.3%),而 nemotron-3-ultra 的变异系数为 55.8%,趋势为 -37.2%,最终收于 19.72 词元/秒。
  • deepseek-v4-flash 在预期的 12 个样本中报告为零个样本,导致整体覆盖率为 87.5%(84 个有效数据点),因此无法评估其在该时间窗口内的吞吐量。