← 返回性能仪表板

每小时性能洞察

滚动四小时性能数据摘要

已保留 1197 条摘要
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强模型,平均吞吐量为 118.24 词元/秒,领先于 gemma4:31b 的 114.13 词元/秒;nemotron-3-ultra 最弱,平均为 4.99 词元/秒,从未超过 10.46 词元/秒。
  • 运营层面最重大的事件是 deepseek-v4-pro 在 06:00 从 05:40 的 97.77 词元/秒跌至 9.58 词元/秒;gemma4:31b 也表现出剧烈波动,范围在 27.97 至 173.46 词元/秒之间,变异系数为 39.9%。
  • 无缺失数据限制:全部八个模型均记录了 12 个样本中的 12 个,覆盖率为 100.0%,全部 96 个有效数据点均存在,因此四小时时间窗口得到完整呈现。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强的模型,平均吞吐量为 117.41 词元/秒,而 nemotron-3-ultra 最弱,仅为 4.36 词元/秒,慢了大约 27 倍。
  • deepseek-v4-flash 波动最大,在 25.5 至 163.52 词元/秒之间波动,变异系数为 54.5%,呈 54.6% 的上升趋势;glm-5.3 更为稳定,上升 24.8%,达到 144.19 词元/秒的峰值。
  • 不存在数据缺失的限制:全部八个模型均拥有 12 个预期样本中的 12 个,valid_point_count 为 96,在四小时窗口内覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强的模型,平均吞吐量为 110.21 词元/秒,峰值达 132.99 词元/秒;nemotron-3-ultra 最弱,平均为 3.56 词元/秒,从未超过 5.27 词元/秒。
  • deepseek-v4-flash 表现出对运营影响最大的波动性,变异系数为 52.5%,在 25.5 至 142.91 词元/秒之间波动,并呈 51.0% 的上升趋势;gemma4:31b 的波动性也较高,CV 为 43.0%。
  • 无缺失数据限制:全部八个模型均拥有 12 个预期样本中的 12 个,共 96 个有效数据点,在四小时时间窗口内覆盖率达到 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • glm-5.3 是平均吞吐量最强的模型,达到 113.65 词元/秒,领先于 gemma4:31b 的 105.62 词元/秒和 deepseek-v4-pro 的 96.95 词元/秒;nemotron-3-ultra 最弱,为 9.83 词元/秒。
  • 最显著的变化是 nemotron-3-ultra 的崩溃:它在 23:40 达到峰值 53.03 词元/秒,随后从 00:00 起运行在 2.07 至 5.27 词元/秒之间,趋势为 -81.0%。deepseek-v4-flash 波动最大,在 25.5 至 158.01 词元/秒之间摆动,变异系数为 58.2%。
  • 不存在缺失数据的限制:全部 8 个模型均有 12 个样本中的 12 个,valid_point_count 为 96,在四小时窗口内覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强的模型,平均吞吐量为 124.29 词元/秒,最新读数为 122.07 词元/秒;nemotron-3-ultra 最弱,平均为 11.70 词元/秒,最终仅为 2.07 词元/秒。
  • 运营层面最显著的波动来自 nemotron-3-ultra,其 122.4% 的变异系数和 -80.2% 的趋势反映了从 53.03 词元/秒的峰值跌至 2.07 词元/秒;deepseek-v4-flash 也在 158.01 和 25.5 词元/秒之间大幅波动,趋势为 -57.5%。
  • 不存在数据缺失的限制:全部 8 个模型均记录了 12 个样本中的 12 个,在四小时窗口内共获得 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • glm-5.3 以 128.0 词元/秒的平均吞吐量表现最强,而 nemotron-3-ultra 最弱,仅为 11.79 词元/秒,约为领先者的十分之一;deepseek-v4-flash(116.64 词元/秒)和 gemma4:31b(105.96 词元/秒)紧随 glm-5.3 之后。
  • 波动最显著的是 nemotron-3-ultra,其在 23:40 飙升至 53.03 词元/秒,随后在 00:00 骤降至 3.61 词元/秒,变异系数为 121.0%;deepseek-v4-flash 也从 21:20 的 162.15 词元/秒降至 00:40 的 36.91 词元/秒。
  • 不存在数据缺失的限制:全部 8 个模型均报告了预期 12 个样本中的 12 个,在四小时的时间窗口内共有 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强的模型,平均吞吐量为 130.09 词元/秒(p95 为 146.30 词元/秒);nemotron-3-ultra 最弱,平均为 11.48 词元/秒,最大值仅为 53.03 词元/秒。
  • nemotron-3-ultra 表现出最具运营意义的波动性:前两个小时保持在 2.21 至 5.24 词元/秒之间,在 23:40 飙升至 53.03 词元/秒,随后在 00:00 降至 3.61 词元/秒,变异系数为 125.7%。
  • 不存在数据缺失的限制:每个模型都有 12 个样本中的 12 个,数据集报告了 96 个有效数据点,覆盖率为 100.0%,不过其仅覆盖这一个四小时的时间窗口。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • 平均吞吐量最强的是 deepseek-v4-flash,达 125.22 词元/秒(峰值 162.15 词元/秒);最弱的是 nemotron-3-ultra,仅 5.35 词元/秒(峰值 11.99 词元/秒),比领先者低约 23 倍。
  • 运营层面最显著的波动是 minimax-m3 的最后一段飙升:22:40 时为 44.5 词元/秒,到 23:00 跃升至 151.13 词元/秒,接近其 57.74 词元/秒平均值的三倍;gemma4:31b 同样出现大幅波动,从 172.84 词元/秒的峰值跌至 23:00 的 51.6 词元/秒。
  • 本时间窗口内不存在数据缺失的限制:全部八个模型均报告 12 个样本中的 12 个,共 96 个有效数据点,从 19:20 到 23:00 UTC 的覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4-flash 的平均吞吐量最高,达 125.68 词元/秒(p95 为 159.75 词元/秒),而 nemotron-3-ultra 最弱,平均仅 3.68 词元/秒,峰值也仅为 5.24 词元/秒。
  • glm-5.3-flash 降幅最陡,从 18:20 的 59.65 词元/秒降至 22:00 的 22.87 词元/秒,趋势为 -47.0%;gemma4:31b 波动性最大,cv 为 37.1%,在 60.04 至 172.84 词元/秒之间摆动。
  • 无缺失数据限制:全部八个模型均报告 12 个样本中的 12 个,共 96 个有效数据点,在四小时时间窗口内覆盖率达 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4-flash 是最强模型,平均吞吐量为 116.07 词元/秒,略微领先于 115.03 词元/秒的 glm-5.3;nemotron-3-ultra 最弱,平均仅为 3.34 词元/秒,峰值也仅有 4.74 词元/秒。
  • minimax-m3 波动最为显著,在 167.86 和 38.41 词元/秒之间摆动,变异系数为 59.3%,趋势为 -49.7%,从 18:00 的 167.86 词元/秒峰值降至 19:00 之后的大约 50 词元/秒。
  • 不存在缺失数据的限制:全部八个模型均有 12 个预期样本中的 12 个,数据集在四小时窗口内共有 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • 平均吞吐量最强的是 deepseek-v4-flash,达 124.41 词元/秒(p95 为 145.01 词元/秒),而 nemotron-3-ultra 最弱,仅为 2.95 词元/秒,大约比领先者低 42 倍。
  • 运营层面最显著的波动来自 minimax-m3,其变异系数为 65.1%,标准差为 47.41 词元/秒,波动区间介于 29.44 至 167.86 词元/秒之间,并呈现 19.8% 的下降趋势;glm-5.3 也在 17:40 飙升至 222.06 词元/秒。
  • 此时间窗口内不存在数据缺失的限制:全部八个模型均报告了 12 个预期样本中的 12 个、96 个有效数据点,以及 100.0% 的覆盖率,因此这些数据反映了完整的四小时观测结果。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4-flash 是平均吞吐量最强的模型,达到 117.29 词元/秒(12 个样本中的 12 个,峰值 145.22 词元/秒),而 nemotron-3-ultra 最弱,平均仅 2.40 词元/秒,从未超过 4.74 词元/秒。
  • minimax-m3 表现出最具运营意义的波动性,变异系数为 65.9%,在 29.44 至 167.86 词元/秒之间波动,其中包括在 17:40 至 18:00 UTC 之间从 55.05 跃升至 167.86 词元/秒。
  • 该时间窗口内不存在数据缺失的限制:全部 8 个模型均报告了 12 个预期样本中的 12 个,在截至 19:03 UTC 的四小时期间内共有 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • 平均吞吐量最强的是 deepseek-v4-flash,达 103.26 词元/秒,领先于 96.31 词元/秒的 glm-5.3 和 91.47 词元/秒的 deepseek-v4-pro;最弱的是 nemotron-3-ultra,仅 1.98 词元/秒,最大值也只有 2.85 词元/秒。
  • 波动最显著的是 minimax-m3,平均为 69.02 词元/秒,但在 29.44 至 167.86 词元/秒之间大幅波动,变异系数为 70.1%,包括在 16:00、17:20 和 18:00 多次出现超过 140 词元/秒的峰值;glm-5.3 也在 17:40 飙升至 222.06 词元/秒。
  • 该时间窗口内不存在数据缺失的限制:全部 8 个模型均提供了 12 个预期样本中的 12 个,在四小时期间内共产生 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4-flash 是最强的模型,平均吞吐量为 102.34 词元/秒,而 nemotron-3-ultra 最弱,仅为 2.20 词元/秒,低了约 46 倍。
  • minimax-m3 的波动性在运营层面最为显著,变异系数为 67.9%,在 13:40 的 162.45 词元/秒与 17:00 的 29.44 词元/秒之间大幅波动,趋势为 -24.1%;glm-5.2 也在 15:40 一度跌至 14.01 词元/秒。
  • 不存在缺失数据的限制:全部 8 个模型均拥有 12 个预期样本中的 12 个、96 个有效数据点中的 96 个,并且在四小时时间窗口内覆盖率达到 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4-flash 是最强的模型,平均吞吐量为 98.14 词元/秒(峰值 131.51 词元/秒),而 nemotron-3-ultra 最弱,平均仅为 2.93 词元/秒,峰值只有 6.11 词元/秒。
  • minimax-m3 表现出对运行影响最显著的波动性,变异系数为 66.5%,在 36.86 至 162.45 词元/秒之间摆动,且趋势为 -39.2%;在连续五次采样低于 48 词元/秒之后,其最新读数跃升至 144.42 词元/秒。
  • 不存在数据缺失的限制:全部 8 个模型均交付了 12 个预期采样中的 12 个,在四小时的时间窗口内共有 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4-flash 是最强的模型,平均吞吐量为 106.45 词元/秒,峰值达 125.11 词元/秒,而 nemotron-3-ultra 最弱,平均为 4.02 词元/秒,且从未超过 6.85 词元/秒。
  • minimax-m3 表现出最具运营意义的波动性,变异系数为 66.1%,在连续的 20 分钟观测中于 27.73 至 170.83 词元/秒之间摆动;deepseek-v4-pro 也在 12:40 跌至 16.53 词元/秒,随后回升至 111.08 词元/秒。
  • 不存在缺失数据的限制:全部 8 个模型均记录了 12 个预期样本中的 12 个,产生 96 个有效数据点,在四小时的时间窗口内覆盖率达到 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • gemma4:31b 是最强的模型,平均吞吐量为 108.65 词元/秒,deepseek-v4-flash 紧随其后,为 105.68 词元/秒;nemotron-3-ultra 最弱,平均为 3.94 词元/秒,峰值仅为 6.85 词元/秒。
  • minimax-m3 表现出对运营影响最显著的波动性,在 27.73 至 170.83 词元/秒之间摆动,变异系数为 66.1%,而 glm-5.3 在该时间窗口内下降了 22.6%,在达到 225.04 词元/秒的峰值后,最终收于 61.71 词元/秒。
  • 不存在缺失数据的限制:全部 96 个预期数据点均有效,覆盖率为 100.0%,且每个模型都拥有 12 个样本中的 12 个。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • 平均吞吐量最高的是 gemma4:31b,达 108.6 词元/秒(峰值 151.18 词元/秒),而 nemotron-3-ultra 最弱,平均仅 3.66 词元/秒,峰值也仅为 6.85 词元/秒。
  • minimax-m3 表现出最具运营意义的波动性,变异系数为 66.9%,在 27.73 至 170.83 词元/秒之间震荡,且自 10:20 起读数呈低值与高值交替出现;glm-5.3 也在 12:00 时下降 16.6%,至 51.32 词元/秒。
  • 不存在缺失数据的局限:全部 8 个模型均交付了 12 个预期样本中的 12 个,在四小时窗口内共有 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4-flash 的平均吞吐量最高,达 98.96 词元/秒(峰值 135.22 词元/秒),以微弱优势领先于 gemma4:31b 的 98.64 词元/秒,而 nemotron-3-ultra 表现最弱,平均仅 3.86 词元/秒,最大值仅为 6.85 词元/秒。
  • minimax-m3 的波动性对运行影响最大,变异系数为 63.8%,在 08:00 降至 31.47 词元/秒,在 10:40 飙升至 170.83 词元/秒,随后在 11:00 回落至 43.78 词元/秒;glm-5.3 也在 10:00 飙升至 225.04 词元/秒。
  • 不存在缺失数据的限制:全部 96 个预期数据点均有效,覆盖率为 100.0%,且每个模型都拥有 12 个样本中的全部 12 个。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • 平均吞吐量最强的是 deepseek-v4-flash,达 105.59 词元/秒(峰值 161.4 词元/秒),而 nemotron-3-ultra 最弱,平均仅 3.76 词元/秒,峰值也仅为 6.1 词元/秒。
  • 运营层面最显著的波动来自 glm-5.3,其变异系数为 55.2%,并在 UTC 10:00 飙升至 225.04 词元/秒,较整个时间窗口高出 37.5%;minimax-m3 也出现了从 27.25 词元/秒的低点到 112.1 词元/秒的大幅摆动。
  • 不存在数据缺失的限制:全部 8 个模型均交付了 12 个预期样本中的 12 个,在四小时期间内共有 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • gemma4:31b 是平均吞吐量最强的模型,达到 108.04 词元/秒,领先于 deepseek-v4-flash 的 101.03 词元/秒和 deepseek-v4-pro 的 97.79 词元/秒;nemotron-3-ultra 最弱,仅为 4.66 词元/秒,大约比 gemma4:31b 慢 23 倍。
  • glm-5.3 表现出对运营影响最大的波动性,其变异系数为 72.2%,波动范围介于 25.19 至 245.62 词元/秒之间,包括在 UTC 06:00 飙升至 245.62 词元/秒,随后在 06:40 骤降至 45.52 词元/秒。
  • 该时间窗口内不存在数据缺失的限制:全部 8 个模型均报告了预期 12 个样本中的 12 个,数据集包含 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • gemma4:31b 是性能最强的模型,平均吞吐量为 116.47 词元/秒,略微领先于 deepseek-v4-flash 的 116.28 词元/秒,而 nemotron-3-ultra 性能最弱,平均仅为 6.84 词元/秒,从未超过 17.16 词元/秒。
  • glm-5.3 的波动性对运营影响最大,变异系数为 61.7%,从 05:20 的 25.19 词元/秒大幅波动至 06:00 的 245.62 词元/秒;nemotron-3-ultra 的下降幅度最为陡峭,呈 53.3% 的下降趋势,在 08:00 降至 2.46 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均报告了 12 个预期样本中的 12 个,在四小时的时间窗口内共有 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4-flash 以 121.88 词元/秒的平均吞吐量位居最高,略微领先于 121.53 词元/秒的 gemma4:31b,而 nemotron-3-ultra 表现最弱,仅为 9.59 词元/秒,峰值也仅有 18.68 词元/秒。
  • glm-5.3 波动最为剧烈,在 25.19 至 245.62 词元/秒之间摆动,变异系数达 61.1%,而 nemotron-3-ultra 在该时段内下降了 54.9%,最终为 4.81 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均交付了 12 个预期样本中的 12 个,在四小时期间内共有 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • 平均吞吐量最强的是 gemma4:31b,达 123.66 词元/秒(p95 为 155.6 词元/秒,最大值 157.83 词元/秒);最弱的是 nemotron-3-ultra,仅 11.46 词元/秒,峰值仅为 18.68 词元/秒,最终降至 3.71 词元/秒。
  • glm-5.3 表现出最具运营意义的波动性,变异系数为 65.4%,在 02:20 低至 12.24 词元/秒,并在 06:00 飙升至 245.62 词元/秒;deepseek-v4-flash 也在 05:40 从 137.22 降至 38.87 词元/秒。
  • 不存在数据缺失的限制:全部 8 个模型均交付了 12 个预期样本中的 12 个,在四小时窗口内共有 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • gemma4:31b 的平均吞吐量最高,达到 126.69 词元/秒(峰值 168.96 词元/秒),而 nemotron-3-ultra 最弱,平均仅为 16.83 词元/秒,在首次观测之后从未超过 66.98 词元/秒。
  • glm-5.3 表现出对运营影响最大的波动性,在 12.24 至 141.22 词元/秒之间摆动,变异系数为 46.9%,而 nemotron-3-ultra 的稳定性更差,变异系数高达 94.0%,在 40 分钟内从 66.98 词元/秒骤降至个位数。
  • 不存在数据缺失的限制:全部八个模型均记录了 12 个预期样本中的 12 个,在四小时的时间窗口内共有 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4-flash 是最强模型,平均吞吐量为 122.73 词元/秒,峰值达 147.10 词元/秒,而 nemotron-3-ultra 最弱,平均为 24.67 词元/秒,最低为 5.19 词元/秒。
  • 运营层面最显著的波动是 nemotron-3-ultra 从 01:20 的 66.98 词元/秒骤降至 03:20 的 5.19 词元/秒,趋势为 -62.0%,变异系数为 84.0%;minimax-m3 也在 04:00 飙升至 106.49 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均有 12 个样本中的 12 个,valid_point_count 为 96,覆盖率为 100.0%,因此四小时窗口是完整的。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • gemma4:31b 是最强的模型,平均吞吐量为 128.29 词元/秒,略微领先于 deepseek-v4-flash 的 126.76 词元/秒;minimax-m3 最弱,平均为 37.4 词元/秒,nemotron-3-ultra 略高,为 33.88 词元/秒。
  • nemotron-3-ultra 表现出对运行影响最显著的波动性,变异系数为 78.3%,趋势为 -56.8%,并且从 23:40 的 89.35 词元/秒下降到 03:00 的 9.21 词元/秒;glm-5.3 也在 142.71 和 12.24 词元/秒之间大幅波动。
  • 不存在缺失数据的限制:所有 8 个模型均有 12 个样本中的 12 个,在四小时的时间窗口内共有 96 个有效数据点和 100.0% 的覆盖率。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • gemma4:31b 是平均吞吐量最强的模型,达到 137.6 词元/秒(峰值 182.96 词元/秒),而 nemotron-3-ultra 最弱,平均仅 38.51 词元/秒,低于 minimax-m3 的 42.19 词元/秒。
  • 运营层面最显著的波动来自 nemotron-3-ultra,其变异系数为 62.6%,波动范围为 6.08 至 89.35 词元/秒,最新一次读数仅为 6.08 词元/秒;glm-5.3 同样在 27.6 至 147.59 词元/秒之间大幅波动(变异系数 42.0%)。
  • 不存在数据缺失的限制:全部 8 个模型均获得了 12 个预期样本中的 12 个,数据集报告了 96 个有效数据点,在四小时时间窗口内覆盖率达到 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4-flash 是最强的模型,平均吞吐量为 141.01 词元/秒(范围为 95.34–171.16 词元/秒),而 nemotron-3-ultra 最弱,平均为 36.63 词元/秒,在 UTC 22:00 一度降至 4.5 词元/秒。
  • glm-5.3 的波动性最具运营意义,变异系数为 50.3%,在 18.56 至 147.59 词元/秒之间波动,包括在 UTC 22:40 达到峰值 147.59 词元/秒后,于 UTC 23:00 降至 27.6 词元/秒;nemotron-3-ultra 同样不稳定,变异系数为 60.0%。
  • 不存在数据缺失的限制:全部八个模型均有 12 个样本中的 12 个、96 个有效数据点和 100.0% 的覆盖率,但四小时的时间窗口限制了对更长期结论的推断。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4-flash 是最强的模型,平均吞吐量为 142.93 词元/秒(峰值 171.16 词元/秒),而 nemotron-3-ultra 最弱,平均为 30.15 词元/秒,在 22:00 UTC 时降至 4.5 词元/秒。
  • glm-5.3 表现出对运营影响最大的波动性,变异系数为 60.6%,波动范围从 12.79 到 147.59 词元/秒;nemotron-3-ultra 同样不稳定,CV 为 70.4%,其中包括 4.5 词元/秒的低点。
  • 不存在数据缺失的限制:所有八个模型都有 12 个样本中的 12 个,共 96 个有效数据点,覆盖率为 100.0%,因此这四小时的时间窗口数据完整。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • 平均吞吐量最强的是 gemma4:31b,达 118.48 词元/秒,deepseek-v4-flash 紧随其后,为 127.08 词元/秒;最弱的是 nemotron-3-ultra,为 19.72 词元/秒,约为领先者的六分之一。
  • glm-5.3 的波动性对运营影响最大,变异系数为 59.8%,波动范围介于 12.79 至 177.07 词元/秒之间,其中包括在 23:00 的最后一次观测中降至 27.6 词元/秒。
  • 该时间窗口内不存在数据缺失问题:全部八个模型均报告了 12 个样本中的 12 个,在四小时期间内共计 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • 平均吞吐量最强的是 deepseek-v4-flash,达 126.53 词元/秒(峰值 165.47 词元/秒);最弱的是 nemotron-3-ultra,为 16.29 词元/秒,且从未超过 36.36 词元/秒。
  • glm-5.3 表现出对运营影响最显著的波动性:变异系数为 59.9%,从 19:20 的 177.07 词元/秒骤降至 21:00 的 12.79 词元/秒,最终收于 18.56 词元/秒,趋势为 -46.7%。
  • 不存在数据缺失的限制:全部八个模型均有 12 个样本中的 12 个,共 96 个有效数据点,覆盖率为 100.0%;唯一的约束是四小时的观测窗口本身。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4-flash 是最强的模型,平均吞吐量为 123.83 词元/秒,而 nemotron-3-ultra 最弱,平均为 18.20 词元/秒,两者之间相差约 6.8 倍。
  • glm-5.3 表现出最具运营意义的波动性,变异系数为 54.1%,在 19:20 达到 177.07 词元/秒的峰值,随后在 21:00 骤降至 12.79 词元/秒;nemotron-3-ultra 同样不稳定,CV 为 93.1%,范围在 2.67 至 70.41 词元/秒之间。
  • 不存在数据缺失的限制:所有八个模型均有 12 个样本中的 12 个,valid_point_count 为 96,覆盖率为 100.0%,但四小时的时间窗口限制了对更长期结论的推断。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4-flash 是最强的模型,平均吞吐量为 118.88 词元/秒,而 nemotron-3-ultra 最弱,平均为 14.46 词元/秒,大约慢八倍。
  • glm-5.3 表现出对运营影响最大的波动性,变异系数为 57.9%,波动范围从 17.67 到 177.07 词元/秒;deepseek-v4-flash 也从 18:20 的 165.47 词元/秒下降到 20:00 的 62.14 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均有 12 个样本中的 12 个,valid_point_count 为 96,覆盖率为 100.0%,因此四小时的时间窗口是完整的。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4-flash 是平均吞吐量最强的模型,达 123.9 词元/秒,峰值达 165.47 词元/秒;nemotron-3-ultra 最弱,平均为 12.63 词元/秒,最低为 0.52 词元/秒。
  • 最显著的趋势是 minimax-m3 下降了 43.1%,从 15:40 的 149.51 词元/秒降至 19:00 的 36.76 词元/秒。glm-5.3 的波动性最高(CV 56.9%),在 17.67 至 172.09 词元/秒之间波动,而 glm-5.3-flash 最为稳定(CV 9.1%)。
  • 不存在数据缺失的限制:全部 96 个预期数据点均有效,覆盖率为 100.0%,且每个模型都有 12 个样本中的 12 个。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4-flash 是平均吞吐量最强的模型,达到 112.27 词元/秒,而 nemotron-3-ultra 最弱,仅为 8.58 词元/秒,大约低了十三倍。
  • 运营层面最显著的波动来自 nemotron-3-ultra,该模型在大部分时间窗口内处于接近 1-5 词元/秒的水平,随后在 17:40 飙升至 70.41 词元/秒,变异系数达 219.5%;glm-5.3 也出现了从 178.7 词元/秒的峰值跌落至 17.67 词元/秒的大幅波动。
  • 不存在数据缺失的限制:全部八个模型均拥有 12 个预期样本中的 12 个,valid_point_count 为 96,在四小时的时间窗口内覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强的模型,平均吞吐量为 117.25 词元/秒,领先于 deepseek-v4-flash 的 113.07 词元/秒;nemotron-3-ultra 最弱,平均为 1.98 词元/秒,从未超过 4.74 词元/秒。
  • glm-5.3 波动最为剧烈,从 13:40 UTC 的 200.95 词元/秒峰值跌至 16:20 UTC 的 17.67 词元/秒,趋势为 -40.8%;minimax-m3 的波动范围也在 34.42 至 149.51 词元/秒之间。
  • 无缺失数据限制:全部 8 个模型均拥有 12 个样本中的 12 个、96 个有效数据点,在四小时时间窗口内覆盖率达到 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强的模型,平均吞吐量为 126.65 词元/秒,峰值达 200.95 词元/秒,而 nemotron-3-ultra 最弱,平均为 2.03 词元/秒,从未超过 3.2 词元/秒。
  • 运营层面最显著的波动来自 gemma4:31b,其变异系数为 57.0%,在 5.83 至 134.49 词元/秒之间波动;minimax-m3 呈现最陡峭的趋势,达 64.0%,在 UTC 15:40 飙升至 149.51 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均报告了 12 个预期样本中的 12 个,在四小时窗口内共有 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 88 个数据点 · 覆盖率 91.7%
  • deepseek-v4-flash 是最强的模型,平均吞吐量为 110.39 词元/秒,峰值为 167.04 词元/秒,而 nemotron-3-ultra 最弱,平均仅为 2.90 词元/秒,从未超过 6.76 词元/秒。
  • glm-5.3 表现出对运营影响最显著的波动性,在整个时间窗口内上升 107.2%,从 59.59 词元/秒升至 13:40 UTC 时 200.95 词元/秒的峰值,随后在 14:20 回落至 74.74 词元/秒;deepseek-v4-pro 也在 13:40 降至 40.0 词元/秒。
  • 每个模型都缺失了其 12 个预期样本中的一个,每个模型收集到 11 个样本,在 96 个预期样本中获得 88 个有效数据点,覆盖率为 91.7%,因此所有模型的最后一个时间区间均未被观测到。
4 小时窗口 · 88 个数据点 · 覆盖率 91.7%
  • deepseek-v4-flash 的平均吞吐量最高,达 108.06 词元/秒(峰值 167.04 词元/秒),而 nemotron-3-ultra 最弱,平均仅 4.13 词元/秒,峰值也仅为 6.76 词元/秒。
  • 运营层面最显著的波动是 deepseek-v4-flash 从 11:20 的 167.04 词元/秒骤降至 12:00 的 21.16 词元/秒,变异系数为 47.4%;glm-5.3 呈现最陡峭的上升趋势,达 +74.3%,最终收于 200.95 词元/秒。
  • 每个模型均记录了 12 个预期样本中的 11 个(覆盖率 91.7%),在整个时间窗口内共缺失 8 个数据点(预期 96 个中有效 88 个),因此短暂的骤降或骤升可能未被观测到。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • 平均吞吐量最强的是 deepseek-v4-flash,达 118.05 词元/秒(p95 为 179.64 词元/秒,峰值为 195.05 词元/秒),而 nemotron-3-ultra 最弱,平均仅 4.65 词元/秒,从未超过 6.76 词元/秒。
  • 波动最显著的是 deepseek-v4-flash(变异系数 46.5%),其在 10:20 骤降至 16.24 词元/秒,12:00 降至 21.16 词元/秒,随后部分回升至 70.48 词元/秒;gemma4:31b 也在 12:40 大幅下跌至 5.83 词元/秒。
  • 不存在数据缺失的限制:全部 8 个模型均记录了 12 个预期样本中的 12 个,在四小时窗口内共有 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4-flash 是平均吞吐量最强的模型,达 121.78 词元/秒(p95 为 179.64 词元/秒),而 nemotron-3-ultra 最弱,平均仅 5.83 词元/秒,从未超过 9.84 词元/秒。
  • 跌幅最剧烈的是 glm-5.3(趋势 -33.5%)和 glm-5.3-flash(-31.4%);deepseek-v4-flash 波动性最高(变异系数 43.5%),在 195.05 与 16.24 词元/秒之间大幅波动,其最新读数为 21.16 词元/秒。
  • 无缺失数据限制:全部 8 个模型在 12 个样本中均有 12 个,共 96 个有效数据点,在四小时窗口内覆盖率达 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4-flash 是最强的模型,平均吞吐量为 116.87 词元/秒,峰值达 195.05 词元/秒;nemotron-3-ultra 最弱,平均仅 5.76 词元/秒,从未超过 9.84 词元/秒。
  • glm-5.3 表现出对运行影响最显著的波动和下滑,在 181.84 与 14.15 词元/秒之间震荡(变异系数 53.6%),最终收于其 14.15 词元/秒的最低值,趋势为 -42.7%;deepseek-v4-flash 也曾在 10:20 骤降至 16.24 词元/秒,随后回升至 143.87 词元/秒。
  • 不存在数据缺失的限制:全部 8 个模型均交付了预期 12 个样本中的 12 个,在四小时窗口内共有 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强的模型,平均吞吐量为 119.95 词元/秒(峰值 212.99 词元/秒,出现在 06:40),而 nemotron-3-ultra 最弱,平均仅为 5.03 词元/秒,在整个时间窗口内从未超过 9.84 词元/秒。
  • 运营层面最显著的变动是 glm-5.3 的下滑:在 07:40 之前持续保持 131.92 至 212.99 词元/秒,随后在 08:00 至 08:40 之间降至约 62 至 68 词元/秒,趋势为 -40.9%。deepseek-v4-flash 则走势相反,从 06:40 的 58.72 词元/秒攀升至 09:40 的 195.05 词元/秒,趋势为 55.6%。
  • 不存在数据缺失的限制:全部 8 个模型均交付了 12 个预期样本中的 12 个,共 96 个有效数据点,覆盖率为 100.0%,因此从 06:20 到 10:00 UTC 的每个二十分钟间隔均有数据呈现。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强的模型,平均吞吐量为 127.29 词元/秒(峰值达 212.99 词元/秒),而 nemotron-3-ultra 最弱,平均仅为 4.72 词元/秒,在整个时间窗口内从未超过 9.84 词元/秒。
  • 运营层面最显著的波动来自 glm-5.3,其在 06:40 从 212.99 词元/秒跌至 08:00 的 61.93 词元/秒,变异系数为 41.8%;nemotron-3-ultra 也呈 85.9% 的上升趋势,但基数非常低。
  • 不存在数据缺失的限制:全部八个模型均记录了 12 个预期样本中的 12 个,在四小时窗口内共有 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强的模型,平均吞吐量为 140.38 词元/秒,峰值达 212.99 词元/秒;nemotron-3-ultra 最弱,平均仅 4.4 词元/秒,从未超过 7.54 词元/秒。
  • deepseek-v4-flash 降幅最陡,从 04:40 的 150.7 词元/秒峰值降至 08:00 的 94.17 词元/秒,趋势为 -35.0%;glm-5.3 同样波动较大,在 61.93 至 212.99 词元/秒之间摆动(变异系数 37.1%)。
  • 无缺失数据限制:全部 8 个模型均拥有 12 个预期样本中的 12 个,在四小时时间窗口内共有 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强模型,平均吞吐量为 125.21 词元/秒,峰值达 212.99 词元/秒;nemotron-3-ultra 最弱,平均仅 3.91 词元/秒,从未超过 6.96 词元/秒。
  • glm-5.3 的波动性最具运营意义,在 69.63 至 212.99 词元/秒之间波动,变异系数为 42.2%,同时整体呈 22.1% 的上升趋势;deepseek-v4-flash 整体下降 21.9%,从 150.7 降至 74.28 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均交付了 12 个预期样本中的 12 个,产生 96 个有效数据点,在四小时窗口内覆盖率达到 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4-flash 是最强的模型,平均吞吐量为 122.46 词元/秒,峰值达 150.70 词元/秒,而 nemotron-3-ultra 最弱,平均仅 3.85 词元/秒,从未超过 6.96 词元/秒。
  • glm-5.3 表现出对运行影响最显著的波动性,变异系数为 46.0%,在 66.81 至 189.77 词元/秒之间起伏;glm-5.3-flash 也在 04:00 降至 13.93 词元/秒,随后在 06:00 恢复至 126.30 词元/秒。
  • 不存在数据缺失的限制:全部 8 个模型各报告 12 个样本中的 12 个,共计 96 个有效数据点,在四小时时间窗口内覆盖率达到 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4-flash 是最强的模型,平均吞吐量为 111.82 词元/秒,略微领先于 gemma4:31b 的 110.42 词元/秒和 deepseek-v4-pro 的 108.16 词元/秒;nemotron-3-ultra 最弱,平均为 3.71 词元/秒,从未超过 6.96 词元/秒。
  • glm-5.3 波动性最高(变异系数 45.7%),范围从 64.79 到 189.77 词元/秒,glm-5.3-flash 在 04:00 降至 13.93 词元/秒,随后在 04:20 回升至 129.99 词元/秒;deepseek-v4-flash 呈上升趋势,增长 36.4%,达到 150.70 词元/秒的峰值。
  • 没有缺失样本:全部八个模型均报告了 12 个预期观测中的 12 个,共 96 个有效数据点,覆盖率为 100.0%,因此唯一的局限是较短的四小时时间窗口。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4-flash 是最强的模型,平均吞吐量为 114.27 词元/秒,领先于 deepseek-v4-pro(107.36 词元/秒)和 gemma4:31b(105.74 词元/秒);nemotron-3-ultra 最弱,平均为 2.67 词元/秒,从未超过 3.94 词元/秒。
  • 运营层面最显著的变化是 minimax-m3 在整个时间窗口内下降了 38.6%,从 00:40 的 120.57 词元/秒峰值降至 04:00 的 37.39 词元/秒;deepseek-v4-flash 也在 43.15 至 192.88 词元/秒之间大幅波动。
  • 不存在数据缺失的限制:全部八个模型均报告了 12 个预期样本中的 12 个,在四小时的时间窗口内共计 96 个有效数据点,覆盖率为 100.0%。