← 返回性能仪表板

每小时性能洞察

滚动四小时性能数据摘要

已保留 1195 条摘要
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • glm-5.3-flash 是最强的模型,平均吞吐量为 108.11 词元/秒(峰值 165.75 词元/秒),而 nemotron-3-ultra 最弱,平均仅 1.53 词元/秒,在整个时间窗口内从未超过 2.56 词元/秒。
  • deepseek-v4-pro 表现出最具运营意义的波动性,变异系数为 55.0%,在 11.68 至 92.28 词元/秒之间摆动,并呈现 32.3% 的下行趋势,最终收于 14.95 词元/秒;相比之下,deepseek-v4-flash 上升了 67.3%,达到 83.64 词元/秒的峰值。
  • 不存在数据缺失的限制:全部 8 个模型均拥有 12 个预期样本中的 12 个、96 个有效数据点,并且在四小时窗口内覆盖率达到 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • glm-5.3-flash 是最强的模型,平均吞吐量为 111.35 词元/秒(峰值 165.75 词元/秒),而 nemotron-3-ultra 最弱,平均为 1.6 词元/秒,从未超过 2.56 词元/秒。
  • deepseek-v4-flash 降幅最陡,下降 36.3%,平均为 37.42 词元/秒,在 UTC 14:40 时低至 4.94 词元/秒;deepseek-v4-pro 波动最大,变异系数为 52.0%,在 11.68 和 92.28 词元/秒之间摆动。
  • 不存在数据缺失的限制:全部八个模型均有 12 个样本中的 12 个,共 96 个有效数据点,覆盖率为 100.0%,因此结果反映了完整的四小时时间窗口。
4 小时窗口 · 88 个数据点 · 覆盖率 91.7%
  • glm-5.3-flash 是最强的模型,平均吞吐量为 100.49 词元/秒,而 nemotron-3-ultra 是最弱的,仅为 2.34 词元/秒,在整个时间窗口内大约慢 43 倍。
  • 波动最显著的是 deepseek-v4-pro,其在 7.72 至 92.28 词元/秒之间波动,变异系数为 53.1%,包括多次跌破 15 词元/秒;deepseek-v4-flash 也在 14:40 下跌 59.1%,降至 4.94 词元/秒。
  • 八个模型中的每一个都记录了 12 个预期样本中的 11 个,留下 88 个有效数据点和 91.7% 的覆盖率,因此每个模型缺失一次 20 分钟的观测,短暂的骤降可能被低估。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • 平均吞吐量最高的是 minimax-m3,达 90.15 词元/秒,领先于 glm-5.3(86.94 词元/秒)和 gemma4:31b(82.93 词元/秒);最低的是 nemotron-3-ultra,仅 3.09 词元/秒,远低于 glm-5.2(54.02 词元/秒)和 deepseek-v4-flash(54.55 词元/秒)。
  • deepseek-v4-pro 的波动性最大(CV 53.7%),范围从 7.72 到 96.9 词元/秒,并在 UTC 10:00 和 12:00 出现急剧下跌;gemma4:31b 的下降幅度最陡,趋势为 -25.9%,从 09:40 的 140.75 词元/秒降至 13:00 的 32.76 词元/秒。
  • 不存在数据缺失的限制:每个模型都有 12 个预期样本中的 12 个,总计 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • gemma4:31b 是表现最强的模型,平均吞吐量为 90.84 词元/秒,而 nemotron-3-ultra 表现最弱,平均为 3.58 词元/秒,低了约 25 倍。
  • deepseek-v4-flash 趋势最为陡峭,从 08:20 的 36.52 词元/秒上升 125.8% 至 12:00 的 69.41 词元/秒,而 glm-5.3 下降了 29.3%;deepseek-v4-pro 波动最大,变异系数为 56.4%,在 7.72 至 96.9 词元/秒之间震荡。
  • 不存在缺失数据的限制:全部 8 个模型均提供了 12 个预期样本中的 12 个,数据集记录了 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • gemma4:31b 的平均吞吐量最高,达 100.48 词元/秒(峰值 149.3 词元/秒),而 nemotron-3-ultra 最弱,平均仅 3.51 词元/秒,从未超过 5.66 词元/秒。
  • deepseek-v4-pro 表现出对运行影响最显著的波动性,范围从 9.59 到 96.9 词元/秒,变异系数为 57.2%,趋势为 +41.7%,其中包括在 09:00 和 10:00 分别降至 9.59 和 9.92 词元/秒的情况。
  • 不存在数据缺失的限制:全部八个模型均报告了 12 个预期样本中的 12 个,在截至 UTC 11:03 的四小时窗口内共有 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • glm-5.3 是平均吞吐量最强的模型,达 99.93 词元/秒,略胜 95.48 词元/秒的 gemma4:31b;nemotron-3-ultra 最弱,仅 3.28 词元/秒,大约比领先者慢 30 倍。
  • deepseek-v4-pro 的波动在运营层面最为显著,在 3.58 至 92.24 词元/秒之间摆动,变异系数为 83.5%,其中包括在 10:00 降至 9.92 词元/秒;deepseek-v4-flash 在该时段内也下降了 43.4%。
  • 不存在数据缺失的限制:全部 8 个模型均交付了 12 个预期样本中的 12 个,数据集记录了 96 个有效数据点,覆盖率为 100.0%,因此这四小时的时段数据完整无缺。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • 平均吞吐量最强的是 gemma4:31b,达 106.01 词元/秒(p95 为 146.1 词元/秒),而 nemotron-3-ultra 最弱,仅 3.81 词元/秒,在任何观测中均未超过 7.08 词元/秒。
  • 运营层面最显著的波动来自 deepseek-v4-pro,其吞吐量在 3.58 至 104.27 词元/秒之间波动,变异系数为 86.3%;deepseek-v4-flash 整体也下降了 42.2%,从早期的 126.98 词元/秒降至最终的 27.03 词元/秒。
  • 不存在缺失数据的限制:全部八个模型均记录了 12 个预期样本中的 12 个,共计 96 个有效数据点,在四小时窗口内覆盖率达到 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • gemma4:31b 的平均吞吐量最高,达 117.61 词元/秒(峰值 161.83 词元/秒),而 nemotron-3-ultra 表现最弱,平均仅 3.89 词元/秒,在全部 12 次观测中从未超过 7.08 词元/秒。
  • deepseek-v4-pro 的波动性最为剧烈,变异系数达 84.9%,在 3.58 至 104.27 词元/秒之间大幅波动,其中包括 06:00 至 07:00 期间连续四次读数低于 13 词元/秒;deepseek-v4-flash 也在 06:40 骤降至 12.47 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均记录了 12 次预期采样中的 12 次,共有 96 个有效数据点,覆盖率为 100.0%,因此这四小时的时间窗口得到了完整呈现。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • gemma4:31b 以 124.01 词元/秒的平均吞吐量表现最强,峰值达 168.45 词元/秒,而 nemotron-3-ultra 最弱,平均仅为 6.48 词元/秒,且在任何观测中均未超过 33.18 词元/秒。
  • deepseek-v4-pro 表现出对运营影响最显著的波动性,在 05:40 的 104.27 词元/秒与接近 10 词元/秒的读数之间摇摆,最终以 3.58 词元/秒收尾,变异系数为 82.3%;gemma4:31b 在整个时间窗口内也呈 25.0% 的下降趋势。
  • 不存在缺失数据的限制:全部八个模型均记录了 12 个预期样本中的 12 个,共计 96 个有效数据点,在四小时窗口内覆盖率达到 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • gemma4:31b 是最强模型,平均吞吐量为 139.44 词元/秒,而 nemotron-3-ultra 最弱,平均为 7.59 词元/秒,比领先者低约 18 倍。
  • 运营层面最显著的波动来自 deepseek-v4-pro,它反复从接近 104.27 词元/秒的峰值骤降至 9.98、10.96 和 9.36 词元/秒;nemotron-3-ultra 也表现出极端的不稳定性,变异系数达 104.6%。
  • 本时间窗口内不存在数据缺失的限制:全部八个模型均拥有 12 个预期样本中的 12 个、96 个有效数据点,覆盖率为 100.0%,因此从 UTC 02:20 到 06:00 的每二十分钟一次的观测数据全部齐备。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • gemma4:31b 的平均吞吐量最强,达到 131.22 词元/秒,峰值达 169.78 词元/秒,而 nemotron-3-ultra 最弱,平均仅为 7.87 词元/秒,在整个时间窗口内从未超过 33.18 词元/秒。
  • deepseek-v4-pro 表现出最具运营意义的性能下降,从 01:20 的 91.17 词元/秒跌至 04:00 的 10.96 词元/秒和 05:00 的 9.98 词元/秒;glm-5.3-flash 波动最大,范围在 50.22 至 177.96 词元/秒之间,变异系数为 47.7%。
  • 不存在数据缺失的限制:全部 8 个模型均记录了 12 个预期样本中的 12 个,在四小时期间内产生 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • gemma4:31b 是性能最强的模型,平均吞吐量为 114.58 词元/秒,峰值达 169.78 词元/秒;nemotron-3-ultra 性能最弱,平均为 9.55 词元/秒,从未超过 33.18 词元/秒。
  • deepseek-v4-flash 降幅最为明显,从 00:20 的 112.34 词元/秒降至 04:00 的 42.37 词元/秒(趋势为 -34.7%),而 glm-5.3-flash 波动性最大,变异系数为 46.4%,在 50.22 至 177.96 词元/秒之间波动。
  • 不存在数据缺失的限制:全部八个模型均有 12 个样本中的 12 个,valid_point_count 为 96,覆盖率为 100.0%,因此四小时的时间窗口是完整的。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • gemma4:31b 是最强模型,平均吞吐量为 112.0 词元/秒,遥遥领先于 glm-5.3-flash(89.17 词元/秒)和 glm-5.3(89.15 词元/秒);nemotron-3-ultra 最弱,平均 11.01 词元/秒,约为领先者的十分之一。
  • 运营层面最显著的变化是 nemotron-3-ultra 下降了 56.9%,从 21.93 词元/秒的峰值跌至 03:00 时的 7.11 词元/秒,而 glm-5.3 的波动性最高(变异系数 53.0%,范围为 15.63 至 162.33 词元/秒)。
  • 不存在数据缺失的限制:全部八个模型均有 12 个样本中的 12 个,且在 96 个有效数据点上整体覆盖率为 100.0%,因此四小时的时间窗口得到了完整呈现。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • gemma4:31b 是最强的模型,平均吞吐量为 107.15 词元/秒,而 nemotron-3-ultra 最弱,仅为 11.39 词元/秒,约为领先者的十分之一。
  • glm-5.3 表现出最具运营意义的波动性,变异系数为 57.4%,波动范围在 15.48 至 159.95 词元/秒之间;deepseek-v4-flash 的涨幅最为显著,呈上升趋势,增长 44.9%,平均达到 94.82 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均交付了 12 个预期样本中的 12 个,数据集在四小时窗口内记录了 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • 平均吞吐量最强的是 gemma4:31b,达 120.5 词元/秒(峰值 178.16 词元/秒);最弱的是 nemotron-3-ultra,为 11.53 词元/秒,约为 gemma4:31b 平均值的十分之一。
  • glm-5.3 表现出对运行影响最显著的波动性,变异系数为 57.2%,在窗口期内于 15.48 至 159.95 词元/秒之间摆动;gemma4:31b 和 deepseek-v4-pro 在该时段内均下降了 25.0%。
  • 不存在数据缺失的限制:全部八个模型均有 12 个样本中的 12 个,共计 96 个有效数据点,覆盖率为 100.0%,因此四小时窗口期得到完整呈现。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • gemma4:31b 是平均吞吐量最强的模型,达到 120.89 词元/秒,峰值为 178.16 词元/秒;nemotron-3-ultra 最弱,平均仅 9.24 词元/秒,在整个时间窗口内从未超过 21.93 词元/秒。
  • glm-5.3 表现出对运营影响最显著的波动性,在 15.48 至 159.95 词元/秒之间摆动,变异系数为 55.7%,并在 22:40 和 23:20 出现骤降;nemotron-3-ultra 也从 1.01 攀升至 20.23 词元/秒,趋势增幅达 241.7%。
  • 该数据集不存在缺失数据的限制:全部八个模型均记录了 12 个预期样本中的 12 个,产生 96 个有效数据点,覆盖率为 100.0%,但四小时的时间窗口限制了对更长期情况的评估。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • gemma4:31b 是表现最强的模型,平均吞吐量为 127.01 词元/秒(峰值达 178.16 词元/秒),而 nemotron-3-ultra 是表现最弱的模型,平均为 4.94 词元/秒,大约比领先者慢 26 倍。
  • 运营层面最显著的波动来自 nemotron-3-ultra,其变异系数为 70.4%,波动范围从 1.01 到 13.87 词元/秒;glm-5.3 也在 22:40 出现急剧的单区间下降,降至 15.48 词元/秒,随后恢复到 102.15 词元/秒。
  • 此时间窗口内不存在数据缺失的限制:全部八个模型均拥有 12 个预期样本中的 12 个,共有 96 个有效数据点,覆盖率为 100.0%,但四小时的时间跨度限制了对更长期结论的推断。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • 平均吞吐量最强的是 gemma4:31b,达 110.43 词元/秒(峰值 178.16 词元/秒);最弱的是 nemotron-3-ultra,仅 3.32 词元/秒,在整个时间窗口内从未超过 7.66 词元/秒。
  • 运营层面最显著的波动来自 gemma4:31b,其在 32.83 至 178.16 词元/秒之间波动(变异系数 41.5%);deepseek-v4-pro 在 20:00 降至 19.98 词元/秒,随后在 21:40 恢复至 99.99 词元/秒;glm-5.2 整体也下降了 19.3%,在 21:00 降至 45.08 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均记录了 12 个预期样本中的 12 个,共计 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • glm-5.3-flash 是最强的模型,平均吞吐量为 94.67 词元/秒(峰值 172.12 词元/秒),而 nemotron-3-ultra 是最弱的模型,平均为 2.2 词元/秒,峰值仅为 3.7 词元/秒。
  • 波动最显著的是 gemma4:31b,其从 18:40 的 32.83 词元/秒低点波动至 19:40 的 163.16 词元/秒高点(标准差 39.47 词元/秒,趋势 +79.4%);deepseek-v4-pro 也在 20:00 从 89.39 骤降至 19.98 词元/秒。
  • 不存在数据缺失的限制:所有 8 个模型均有 12 个样本中的 12 个,valid_point_count 为 96,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • glm-5.3-flash 是最强模型,平均吞吐量为 96.04 词元/秒,领先于 92.79 词元/秒的 gemma4:31b;nemotron-3-ultra 最弱,平均仅 2.34 词元/秒,峰值也仅为 3.7 词元/秒。
  • deepseek-v4-pro 的波动性对运营影响最大,范围在 3.88 至 88.64 词元/秒之间;它在 17:40 至 19:40 期间维持在约 76-88 词元/秒,随后在 20:00 降至 19.98 词元/秒,而 glm-5.3 在 17:00 飙升至 229.16 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均记录了 12 个样本中的 12 个,valid_point_count 为 96,在四小时窗口内覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • glm-5.3 是平均吞吐量最强的模型,达 93.92 词元/秒(峰值 229.16 词元/秒),而 nemotron-3-ultra 最弱,平均仅 1.9 词元/秒,从未超过 3.63 词元/秒。
  • 运营层面最显著的波动来自 deepseek-v4-pro,其吞吐量在低至 3.88 词元/秒与高达 88.64 词元/秒之间波动(变异系数 56.0%),期间窗口中段曾出现 6.34 和 10.76 词元/秒的读数,随后回升至 82.85 词元/秒。
  • 不存在数据缺失的限制:全部 8 个模型均交付了预期的 12 个样本中的 12 个,在四小时窗口内共有 96 个有效数据点,覆盖率达 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强的模型,平均吞吐量为 99.19 词元/秒,领先于 81.6 词元/秒的 gemma4:31b,而 nemotron-3-ultra 最弱,仅为 1.28 词元/秒,远低于 35.57 词元/秒的 deepseek-v4-flash。
  • 波动最显著的是 deepseek-v4-pro,其在 7.81 至 78.25 词元/秒之间波动,变异系数为 52.0%;gemma4:31b 呈现最陡峭的下滑趋势,从 12:40 UTC 时 135.8 词元/秒的峰值下降了 37.3%。
  • 不存在数据缺失的限制:全部八个模型均有 12 个样本中的 12 个,valid_point_count 为 96,在四小时的时间窗口内覆盖率为 100.0%。
4 小时窗口 · 88 个数据点 · 覆盖率 91.7%
  • 平均吞吐量最高的是 gemma4:31b,达 94.99 词元/秒(峰值 135.8 词元/秒);最低的是 nemotron-3-ultra,仅 1.75 词元/秒,在整个时间窗口内从未超过 2.88 词元/秒。
  • minimax-m3 的波动幅度最大,介于 33.81 至 166.13 词元/秒之间,变异系数为 50.1%;deepseek-v4-pro 的波动性相近,为 54.8%,在 12:00 UTC 时降至 8.07 词元/秒。
  • 每个模型均记录了预期 12 个采样中的 11 个,共得到 88 个有效数据点,总体覆盖率为 91.7%,因此每个模型缺失一次 20 分钟的观测,所报告的平均值在数据完整时可能会有所变化。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • gemma4:31b 是表现最强的模型,平均吞吐量为 106.52 词元/秒,而 nemotron-3-ultra 是表现最弱的模型,平均吞吐量为 2.09 词元/秒,大约低 50 倍。
  • 运营层面最显著的波动出现在 deepseek-v4-flash,其吞吐量在观测窗口内下降了 55.2%,从 10:40 时 132.37 词元/秒的峰值降至 14:00 时的 36.57 词元/秒,变异系数为 73.1%;deepseek-v4-pro 也在 8.07 至 103.07 词元/秒之间大幅波动。
  • 不存在数据缺失的限制:全部 8 个模型均交付了 12 个预期样本中的 12 个,在四小时的观测窗口内共产生 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • gemma4:31b 是最强模型,平均吞吐量为 103.82 词元/秒,领先于 glm-5.3 的 95.11 词元/秒;nemotron-3-ultra 最弱,平均为 2.33 词元/秒,从未超过 3.42 词元/秒。
  • deepseek-v4-flash 的波动性在运营层面最为显著,变异系数为 79.4%,趋势为 -62.9%,从 10:40 的 132.37 词元/秒峰值降至 13:00 的 19.38 词元/秒;deepseek-v4-pro 也下降了 -27.7%,至 17.82 词元/秒。
  • 不存在缺失数据的限制:全部八个模型均报告了 12 个样本中的 12 个,共计 96 个有效数据点,在四小时窗口内覆盖率达到 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • 平均输出吞吐量最强的是 gemma4:31b,在 12 个样本中达到 104.64 词元/秒;最弱的是 nemotron-3-ultra,为 2.55 词元/秒,大约低 41 倍。
  • 运营层面最显著的波动来自 deepseek-v4-pro,其变异系数为 70.6%,波动范围介于 6.45 至 103.07 词元/秒之间;除 minimax-v4-pro 外,minimax-m3 呈现最陡峭的趋势,达 +105.1%,最终为 166.13 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均记录了 12 个预期样本中的 12 个,共获得 96 个有效数据点,在四小时窗口内覆盖率达到 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • gemma4:31b 是平均吞吐量最强的模型,达 105.36 词元/秒(p95 为 151.62 词元/秒),而 nemotron-3-ultra 最弱,仅 2.41 词元/秒,从未超过 3.42 词元/秒。
  • glm-5.3-flash 趋势最为陡峭,在整个时间窗口内增长 +100.6%,从 08:40 的 7.69 词元/秒低点升至 10:40 的 157.03 词元/秒峰值;minimax-m3 波动性最大(变异系数 58.9%,在 12.51 至 141.85 词元/秒之间摆动),deepseek-v4-pro 同样在 6.45 至 103.07 词元/秒之间摆动。
  • 不存在数据缺失的限制:全部八个模型各报告 12 个样本中的 12 个,共计 96 个有效数据点,四小时时间窗口的覆盖率为 100.0%。
4 小时窗口 · 88 个数据点 · 覆盖率 91.7%
  • gemma4:31b 是最强的模型,平均吞吐量为 97.88 词元/秒,glm-5.3 紧随其后,为 96.93 词元/秒;nemotron-3-ultra 最弱,平均仅为 2.36 词元/秒,从未超过 3.23 词元/秒。
  • deepseek-v4-pro 表现出对运营影响最大的波动性,范围从 6.45 到 93.39 词元/秒,变异系数为 66.8%,趋势为 -36.0%;minimax-m3 同样不稳定,变异系数为 66.6%,范围从 18.96 到 141.85 词元/秒。
  • 每个模型都缺失了十二个预期样本中的一个(收集到 11 个,覆盖率为 91.7%),总共留下 88 个有效数据点,因此缺失的观测值可能会影响所报告的平均值和趋势。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强模型,平均吞吐量为 105.52 词元/秒,峰值达 167.38 词元/秒;nemotron-3-ultra 最弱,平均为 3.14 词元/秒,从未超过 5.87 词元/秒。
  • minimax-m3 波动最为剧烈,变异系数为 70.9%:它在 07:00 为 29.72 词元/秒,随后跃升至 07:20 的 136.61 词元/秒和 07:40 的 141.85 词元/秒,之后在 08:20 跌至 18.96 词元/秒。deepseek-v4-pro 同样以 6.45 词元/秒的最低值结束了该时间窗口。
  • 不存在数据缺失的限制:全部八个模型均有 12 个样本中的 12 个,共 96 个有效数据点,在四小时时间窗口内覆盖率为 100%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强的模型,平均吞吐量为 108.62 词元/秒,领先于 95.61 词元/秒的 glm-5.3-flash;nemotron-3-ultra 最弱,平均为 3.95 词元/秒,大约比 glm-5.3 慢 27 倍。
  • 波动性是主要的运行信号:gemma4:31b 在 181.21 和 25.1 词元/秒之间波动(变异系数 51.8%),大多数模型在时间窗口后期出现下降,其中 deepseek-v4-pro 在 07:00 降至 11.74 词元/秒(趋势 -37.4%),glm-5.2 降至 17.82 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均提供了 12 个预期样本中的 12 个,在四小时的时间窗口内共产生 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • 平均吞吐量最强的是 glm-5.3,达 125.36 词元/秒,领先于 99.18 词元/秒的 glm-5.3-flash;最弱的是 nemotron-3-ultra,仅 4.5 词元/秒,远低于次低的 minimax-m3 的 46.35 词元/秒。
  • 运营层面最显著的波动来自 minimax-m3,其在 05:00 飙升至 158.25 词元/秒,而平均值为 46.35 词元/秒,变异系数为 73.9%;gemma4:31b 也在 37.97 至 181.21 词元/秒之间大幅波动。
  • 不存在数据缺失的限制:全部八个模型均报告了 12 个预期样本中的 12 个,共计 96 个有效数据点,在四小时时间窗口内覆盖率达到 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强的模型,平均吞吐量为 124.37 词元/秒,峰值为 177.82 词元/秒;nemotron-3-ultra 最弱,平均为 3.78 词元/秒,从未超过 5.59 词元/秒。
  • minimax-m3 表现出对运行影响最显著的波动性,变异系数为 71.9%,趋势为 -34.5%,从 01:20 的 106.72 词元/秒降至 04:40 的 25.28 词元/秒,随后在 05:00 飙升至 158.25 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均拥有 12 个预期样本中的 12 个,且数据集报告了 96 个有效数据点,覆盖率为 100.0%,因此这些发现反映了四小时时间窗口内的完整观测结果。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强模型,平均吞吐量为 112.58 词元/秒,略胜 108.94 词元/秒的 gemma4:31b;nemotron-3-ultra 最弱,平均为 3.38 词元/秒,大约比领先者慢 33 倍。
  • minimax-m3 波动最为剧烈:它在 01:40 达到 156.65 词元/秒的峰值,随后在 03:00 跌至 29.21 词元/秒,在该时间窗口内趋势为 -63.2%,变异系数为 65.3%,是数据集中最高的。
  • 不存在数据缺失的限制:全部 8 个模型均提供了 12 个预期样本中的 12 个,共计 96 个有效数据点,在四小时窗口内覆盖率达到 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强模型,平均吞吐量为 117.65 词元/秒,略胜 112.85 词元/秒的 gemma4:31b,而 nemotron-3-ultra 最弱,平均仅 4.01 词元/秒,慢了约 29 倍。
  • glm-5.3 呈现最显著的上升趋势,攀升 61.5%,在 03:00 UTC 达到窗口期最高的 177.82 词元/秒;minimax-m3 波动最大,变异系数为 62.3%,从 01:40 的 156.65 词元/秒摆动至 02:20 的 44.76 词元/秒。
  • 不存在缺失数据的限制:全部 8 个模型均交付了 12 个预期样本中的 12 个,产生 96 个有效数据点,在四小时窗口期内覆盖率达到 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4-flash 是最强模型,平均速度为 126.76 词元/秒(峰值 166.44 词元/秒),而 nemotron-3-ultra 最弱,平均速度为 4.5 词元/秒,从未超过 12.84 词元/秒。
  • 运营层面最显著的变化是 minimax-m3 的 86.5% 上升趋势,从 00:00 的 15.78 词元/秒低点攀升至 01:40 的 156.65 词元/秒;nemotron-3-ultra 还显示出最高的波动性,变异系数为 72.6%。
  • 不存在数据缺失的限制:全部八个模型均交付了 12 个预期样本中的 12 个,在四小时窗口内共有 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4-flash 是最强的模型,平均吞吐量为 139.74 词元/秒(范围为 91.11 至 166.44 词元/秒),而 nemotron-3-ultra 最弱,平均仅为 5.27 词元/秒,峰值仅为 12.84 词元/秒。
  • 最显著的趋势是 glm-5.3-flash 在该时段内提升了 34.0%,从 00:00 到 00:40 维持在 162.09 至 164.66 词元/秒,随后在 01:00 降至 78.42 词元/秒;glm-5.3 的波动性最高,变异系数为 44.9%,在 52.93 至 174.58 词元/秒之间波动。
  • 不存在数据缺失的限制:全部 8 个模型均拥有 12 个预期样本中的 12 个,在四小时期间内共有 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4-flash 是最强的模型,平均吞吐量为 145.78 词元/秒,gemma4:31b 位居第二,为 125.69 词元/秒;nemotron-3-ultra 最弱,平均为 5.3 词元/秒,峰值仅为 12.84 词元/秒。
  • 波动最显著的是 glm-5.3,其吞吐量在 52.93 至 174.58 词元/秒之间波动(变异系数为 39.7%);最后 00:00 的读数显示 minimax-m3 骤降至 15.78 词元/秒,glm-5.2 降至 35.09 词元/秒。
  • 不存在数据缺失的限制:全部 96 个预期数据点均有效,且每个模型都拥有 12 个样本中的 12 个,覆盖率达到 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4-flash 是最强的模型,平均吞吐量为 149.99 词元/秒(峰值达 183.45 词元/秒),而 nemotron-3-ultra 最弱,平均仅 4.3 词元/秒,从未超过 9.75 词元/秒。
  • glm-5.3 表现出对运营影响最显著的波动性,在 52.93 至 174.03 词元/秒之间摆动,变异系数为 42.9%,高低读数大约每 20 分钟交替一次;nemotron-3-ultra 在该时段内也上升了 164.2%,但基数非常低。
  • 不存在数据缺失的限制:全部八个模型均交付了 12 个预期样本中的 12 个,在四小时期间内共有 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • 平均吞吐量最强的是 deepseek-v4-flash,达 147.91 词元/秒(峰值 183.45 词元/秒),而 nemotron-3-ultra 最弱,仅为 3.08 词元/秒,慢了约 48 倍。
  • glm-5.3 表现出最具运营意义的波动性,变异系数为 40.9%,在 61.1 至 174.03 词元/秒之间震荡,包括在 UTC 21:00 前后从 75.62 跃升至 127.92 词元/秒;nemotron-3-ultra 也从 1.53 爬升至 8.09 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均报告了 12 个预期样本中的 12 个,在四小时的时间窗口内共有 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4-flash 是最强的模型,平均吞吐量为 135.46 词元/秒,略微领先于 gemma4:31b 的 131.52 词元/秒;nemotron-3-ultra 最弱,平均仅为 1.69 词元/秒,峰值也仅有 2.0 词元/秒。
  • gemma4:31b 波动性最大,变异系数为 32.6%,从 17:20 的 183.23 词元/秒骤降至 18:00 的 65.56 词元/秒,且在整个时间窗口内呈 -19.6% 的趋势;deepseek-v4-flash 提升了 14.2%,达到 151.66 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均拥有 12 个预期样本中的 12 个,在四小时期间内共有 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • gemma4:31b 是最强的模型,平均吞吐量为 139.6 词元/秒,deepseek-v4-flash 以 132.08 词元/秒位居第二;nemotron-3-ultra 最弱,平均为 1.56 词元/秒,比 gemma4:31b 慢约 90 倍。
  • glm-5.3 的波动性最高(CV 为 41.4%),在时间窗口内于 29.02 至 150.55 词元/秒之间大幅波动;gemma4:31b 从 17:20 的 183.23 词元/秒降至 18:00 的 65.56 词元/秒,这一急剧下降导致其趋势为 -17.1%。
  • 无缺失数据的限制:全部八个模型均有 12 个样本中的 12 个,共 96 个有效数据点,在四小时窗口内覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • 平均吞吐量最强的是 gemma4:31b,达到 148.56 词元/秒,峰值高达 183.23 词元/秒;最弱的是 nemotron-3-ultra,仅为 1.70 词元/秒,在整个时间窗口内从未超过 2.80 词元/秒。
  • glm-5.3-flash 呈现最陡峭的下滑趋势,降幅达 -29.1%,从 14:40 的 173.76 词元/秒降至 16:40 的 64.25 词元/秒;而 glm-5.3 波动性最大,在 29.02 至 150.55 词元/秒之间震荡,变异系数为 40.2%。
  • 不存在数据缺失的限制:全部八个模型均交付了 12 个预期样本中的 12 个,产生 96 个有效数据点,在四小时期间内覆盖率达到 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • gemma4:31b 的平均吞吐量最高,达到 132.06 词元/秒(范围从 67.59 到 179.48 词元/秒),而 nemotron-3-ultra 最弱,平均仅为 1.88 词元/秒,在整个时间窗口内从未超过 2.8 词元/秒。
  • glm-5.3 表现出对运行影响最为显著的波动性:变异系数为 46.1%,从 13:20 的 185.55 词元/秒骤降至 15:40 的 29.02 词元/秒,趋势为 -44.3%,不过它在 16:00 回升至 150.55 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均记录了 12 个预期样本中的 12 个,共产生 96 个有效数据点,覆盖率为 100.0%,因此唯一的约束是截至 2026-09-13T16:03:01+00:00 结束的四小时时间窗口。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4-flash 是最强的模型,平均吞吐量为 120.74 词元/秒,略微领先于 gemma4:31b 的 119.05 词元/秒,而 nemotron-3-ultra 最弱,平均仅为 2.32 词元/秒,慢了大约 50 倍。
  • 最显著的波动是 deepseek-v4-flash 在 14:40 骤降至 14.51 词元/秒,随后在 15:00 恢复到 138.93 词元/秒;glm-5.3-flash 呈现最强的上升趋势,上升 49.8%,峰值达到 173.76 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均有 12 个样本中的 12 个,在四小时的时间窗口内共有 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • glm-5.3 的平均吞吐量最高,达 143.76 词元/秒(峰值 185.55 词元/秒),而 nemotron-3-ultra 最弱,平均仅 2.89 词元/秒,峰值仅为 4.97 词元/秒。
  • nemotron-3-ultra 呈现出最具运营意义的趋势,在整个时间窗口内下降 51.3%,至 UTC 14:00 时仅为 1.4 词元/秒;deepseek-v4-pro 波动最大(变异系数 37.0%),在 126.49 和 26.36 词元/秒之间大幅波动。
  • 不存在数据缺失的限制:全部八个模型均有 12 个样本中的 12 个、96 个有效数据点,在四小时窗口内覆盖率达 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • 平均吞吐量最强的是 deepseek-v4-flash,达 143.39 词元/秒(峰值 223.43 词元/秒);最弱的是 nemotron-3-ultra,仅 3.67 词元/秒,低了约 39 倍。
  • 运维层面最显著的波动来自 gemma4:31b,在 51.55 至 155.75 词元/秒之间摆动(变异系数 35.0%),而 glm-5.2 呈现最清晰的趋势,从 09:20 的 45.21 词元/秒上升 27.3%,至 11:20 达到 87.31 词元/秒的峰值。
  • 不存在数据缺失的限制:全部八个模型均报告 12 个预期样本中的 12 个、96 个有效数据点,并在四小时时间窗口内实现 100.0% 的覆盖率。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4-flash 是最强的模型,平均吞吐量为 144.6 词元/秒(峰值 223.43 词元/秒),而 nemotron-3-ultra 最弱,平均为 3.82 词元/秒,峰值仅为 6.04 词元/秒。
  • glm-5.3-flash 降幅最为明显,从 10:00 的 172.69 词元/秒峰值下降至 11:00 的 64.23 词元/秒,降幅达 42.1%;gemma4:31b 波动性最大,变异系数为 37.5%,在 42.58 和 162.02 词元/秒之间波动。
  • 不存在数据缺失的限制:全部八个模型均拥有 12 个预期样本中的 12 个,在四小时的时间窗口内共有 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强的模型,平均吞吐量为 140.99 词元/秒,领先于 deepseek-v4-flash 的 136.53 词元/秒和 gemma4:31b 的 113.93 词元/秒;nemotron-3-ultra 最弱,平均为 4.51 词元/秒,从未超过 6.99 词元/秒。
  • 最显著的变化是 glm-5.3 的 28.6% 上升趋势,收于 183.25 词元/秒,以及 deepseek-v4-flash 在 09:40 飙升至 223.43 词元/秒;波动性最高的是 glm-5.3(33.9% CV)和 gemma4:31b(33.3% CV),二者在 42.58 至 162.02 词元/秒之间波动。
  • 不存在数据缺失的限制:全部 8 个模型均记录了 12 个预期样本中的 12 个,在四小时窗口内共计 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • 平均吞吐量最强的是 deepseek-v4-flash,达 141.82 词元/秒(峰值 223.43 词元/秒),而 nemotron-3-ultra 最弱,仅 4.46 词元/秒,在整个时间窗口内从未超过 6.99 词元/秒。
  • glm-5.3-flash 呈现最大的上升趋势,达 54.9%,从窗口初期的大约 102 词元/秒攀升至最新读数 172.69 词元/秒;glm-5.3 是波动性最大的模型,变异系数为 38.9%,波动区间介于 64.2 至 186.83 词元/秒之间。
  • 不存在缺失数据的限制:全部八个模型均有 12 个样本中的 12 个,在四小时期间内产生 96 个有效数据点,覆盖率为 100.0%。