← 返回性能仪表板

每小时性能洞察

滚动四小时性能数据摘要

已保留 1193 条摘要
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • 平均吞吐量最强的是 gemma4:31b,达 146.45 词元/秒(峰值 173.46 词元/秒);最弱的是 nemotron-3-ultra,为 19.53 词元/秒,最大值仅为 44.67 词元/秒。
  • deepseek-v4-flash 呈现最强劲的上升趋势,达 +38.1%,范围从 64.58 到 187.41 词元/秒,而 glm-5.2 下降了 30.0%,降至 55.5 词元/秒;nemotron-3-ultra 波动最大,变异系数为 73.1%。
  • 不存在数据缺失的限制:全部八个模型均报告 12 个样本中的 12 个,覆盖率为 100.0%,且 96 个有效数据点与预期总数相符,因此四小时时间窗口是完整无缺的。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • gemma4:31b 是最强的模型,平均吞吐量为 143.42 词元/秒,领先于 deepseek-v4-flash 的 133.39 词元/秒;nemotron-3-ultra 最弱,平均仅为 19.52 词元/秒,最大值仅为 44.67 词元/秒。
  • glm-5.3 呈现最大的趋势,上升 52.9% 至 179.38 词元/秒的最大值,而 glm-5.3-flash 波动最大(变异系数 40.7%),在 39.43 和 193.35 词元/秒之间摆动;deepseek-v4-pro 下降了 31.0%,最低跌至 22.90 词元/秒。
  • 无缺失数据:所有 96 个预期数据点均存在,覆盖率为 100.0%,但每个模型 12 个样本的四小时窗口限制了对更长期结论的推断。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • gemma4:31b 是表现最强的模型,平均吞吐量为 131.73 词元/秒,领先于 deepseek-v4-flash 的 116.37 词元/秒;nemotron-3-ultra 表现最弱,平均为 20.07 词元/秒,在任何时间区间内均未超过 55.82 词元/秒。
  • glm-5.3 的波动性对运营影响最大,范围从 16.0 到 179.38 词元/秒,变异系数为 54.3%,上升趋势为 80.7%;而 nemotron-3-ultra 的稳定性更差,变异系数高达 89.7%,在 2.77 到 55.82 词元/秒之间波动。
  • 不存在数据缺失的限制:全部八个模型均交付了 12 个预期样本中的 12 个,产生 96 个有效数据点,在四小时时间窗口内覆盖率达到 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • gemma4:31b 是最强的模型,平均吞吐量为 124.47 词元/秒,领先于 deepseek-v4-flash 的 119.17 词元/秒;nemotron-3-ultra 最弱,平均仅为 17.91 词元/秒,最大值也仅为 55.82 词元/秒。
  • 运营层面最显著的波动来自 nemotron-3-ultra,其变异系数为 92.2%,在 2.57 至 55.82 词元/秒之间大幅波动,其中包括 17:00 时的 2.77 词元/秒和 18:00 时的 6.59 词元/秒读数;glm-5.3 同样表现出不稳定性,变异系数为 47.2%,并在 15:20 时降至 16.0 词元/秒的低点。
  • 不存在缺失数据的限制:全部 8 个模型均拥有 12 个预期样本中的 12 个,valid_point_count 为 96,在四小时窗口内覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • gemma4:31b 的平均吞吐量最高,达 118.22 词元/秒(峰值 174.17 词元/秒),而 nemotron-3-ultra 最弱,平均仅 22.58 词元/秒,从未超过 61.83 词元/秒,最终降至 2.77 词元/秒。
  • 波动最显著的是 glm-5.3,其吞吐量在观测窗口内下降了 53.7%,从 13:40 的 194.37 词元/秒峰值跌至 15:20 的 16.0 词元/秒低点,变异系数为 51.3%;nemotron-3-ultra 同样不稳定,达 86.7%。
  • 不存在数据缺失的限制:全部八个模型均提供了 12 个预期样本中的 12 个,在四小时的观测窗口内共有 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • 平均吞吐量最高的是 deepseek-v4-flash,达到 116.0 词元/秒(范围 77.9 至 148.26 词元/秒),而 nemotron-3-ultra 最弱,平均仅为 23.4 词元/秒,峰值仅 61.83 词元/秒,结束时为 5.46 词元/秒。
  • 运营层面最显著的波动来自 nemotron-3-ultra,其变异系数达到 89.1%,波动区间为 2.57 至 61.83 词元/秒;以及 glm-5.3,其在观测窗口内下降了 24.1%,包括在 UTC 15:20 降至 16.0 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均记录了 12 个预期样本中的 12 个,数据集报告了 96 个有效数据点,覆盖率为 100.0%,因此四小时窗口内的每个二十分钟间隔均有数据呈现。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • 平均吞吐量最强的是 gemma4:31b,达 118.16 词元/秒(峰值 179.47 词元/秒),deepseek-v4-flash 紧随其后,为 114.69 词元/秒;最弱的是 nemotron-3-ultra,仅 22.59 词元/秒,峰值仅为 61.83 词元/秒,最终为 2.57 词元/秒。
  • 运营层面最显著的波动性来自 nemotron-3-ultra,在 2.57 至 61.83 词元/秒之间波动,cv 为 88.0%;glm-5.3 呈现最陡峭的趋势,从 64.21 词元/秒上升 63.9% 至 194.37 词元/秒的峰值,而 gemma4:31b 的波动性也较高,cv 为 41.1%。
  • 不存在数据缺失的限制:全部八个模型均报告了 12 个样本中的 12 个,共计 96 个有效数据点,在四小时时间窗口内覆盖率达到 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • gemma4:31b 的平均吞吐量最高,达 119.17 词元/秒,而 nemotron-3-ultra 最弱,为 29.12 词元/秒;deepseek-v4-flash 位居其后,为 112.96 词元/秒。
  • glm-5.3-flash 恶化最严重,从 10:20 的 189.98 词元/秒下降至 14:00 的 74.57 词元/秒,降幅达 39.9%,变异系数为 50.9%;glm-5.3 上升了 25.8%,nemotron-3-ultra 则在 3.43 至 61.83 词元/秒之间波动(变异系数 77.8%)。
  • 不存在缺失数据的限制:全部 8 个模型均返回了 12 个预期样本中的 12 个,在四小时的时间窗口内共计 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • 平均吞吐量最强的是 gemma4:31b,达 118.2 词元/秒(p95 为 168.37 词元/秒),而 nemotron-3-ultra 最弱,仅为 24.86 词元/秒,从未超过 56.28 词元/秒,且最低降至 3.43 词元/秒。
  • glm-5.3-flash 波动幅度最大,范围在 34.79 至 189.98 词元/秒之间,变异系数为 52.5%,趋势为 -36.0%,收于其 34.79 词元/秒的最低值;nemotron-3-ultra 的稳定性更差,CV 达 83.0%,在 UTC 11:00–12:20 期间反复出现接近 4 词元/秒的崩溃。
  • 不存在数据缺失问题:全部八个模型均报告了 12 个预期样本中的 12 个,产生 96 个有效数据点,在四小时窗口内覆盖率达到 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • 平均吞吐量最强的是 gemma4:31b,达 117.59 词元/秒(峰值 186.58 词元/秒),而 nemotron-3-ultra 最弱,为 27.7 词元/秒,在 12:00 时降至 4.13 词元/秒。
  • glm-5.3-flash 波动最为剧烈,在 54.06 至 189.98 词元/秒之间摆动,变异系数为 45.5%,趋势为 +48.6%;glm-5.2 在该时段内下降了 21.6%。
  • 不存在数据缺失的限制:全部 8 个模型均提供了 12 个预期样本中的 12 个,在四小时窗口内共产生 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • 平均吞吐量最强的是 gemma4:31b,达 115.98 词元/秒,领先于 deepseek-v4-flash 的 115.05 词元/秒;最弱的是 nemotron-3-ultra,为 28.10 词元/秒,约为领先者平均值的三分之一。
  • 变动最显著的是 glm-5.3-flash 的上升趋势,达 +34.1%,在 54.06 至 189.98 词元/秒之间波动后收于 182.00 词元/秒;gemma4:31b 波动性极高(变异系数 42.9%,波动区间 24.95 至 186.58 词元/秒),而 nemotron-3-ultra 在 11:00 降至 4.28 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均记录了 12 个预期样本中的 12 个,在四小时窗口内共获得 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • 平均吞吐量最强的是 deepseek-v4-flash,达 115.78 词元/秒,略胜 gemma4:31b 的 107.57 词元/秒和 deepseek-v4-pro 的 104.25 词元/秒;最弱的是 nemotron-3-ultra,仅 29.50 词元/秒,远低于 glm-5.3-flash 的 78.27 词元/秒。
  • 运营层面最显著的波动来自 gemma4:31b,其吞吐量在 21.39 至 186.58 词元/秒之间波动,变异系数为 52.7%,其中包括在 08:00 降至 24.95 词元/秒的情况;nemotron-3-ultra 同样不稳定,在 07:00 一度跌至 2.37 词元/秒,变异系数为 69.6%。
  • 不存在数据缺失的限制:全部八个模型均交付了 12 个预期样本中的 12 个,数据集报告了 96 个有效数据点,在四小时时间窗口内覆盖率达到 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4-flash 是平均吞吐量最强的模型,达到 112.88 词元/秒,略微领先于 gemma4:31b 的 112.72 词元/秒,而 nemotron-3-ultra 最弱,为 34.1 词元/秒。
  • nemotron-3-ultra 表现出对实际运行影响最大的波动性,在 2.37 至 107.9 词元/秒之间摆动,变异系数为 92.5%,趋势为 -34.7%;glm-5.3 同样在 62.02 至 160.22 词元/秒之间震荡。
  • 不存在数据缺失的限制:全部八个模型均报告了 12 个预期样本中的 12 个,在四小时的时间窗口内产生 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • gemma4:31b 是平均吞吐量最强的模型,达 119.16 词元/秒(峰值 192.08 词元/秒),而 nemotron-3-ultra 最弱,平均为 38.22 词元/秒,最低仅 2.37 词元/秒。
  • nemotron-3-ultra 表现出最具运营意义的波动性,变异系数为 91.5%,在 2.37 至 107.9 词元/秒之间大幅波动;glm-5.3-flash 出现最陡峭的下滑,趋势为 -38.3%,最终收于 92.89 词元/秒。
  • 不存在缺失数据的限制:全部八个模型均有 12 个样本中的 12 个,在四小时窗口内共计 96 个有效数据点,覆盖率达 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • gemma4:31b 是性能最强的模型,平均吞吐量为 134.06 词元/秒,而 nemotron-3-ultra 最弱,为 44.36 词元/秒;deepseek-v4-flash 在其余模型中领先,为 107.93 词元/秒。
  • nemotron-3-ultra 表现出对运营影响最大的波动性,变异系数为 84.9%,波动范围在 2.37 至 107.9 词元/秒之间,其中包括在 07:00 UTC 降至 2.37 词元/秒;glm-5.3-flash 同样不稳定,变异系数为 53.6%。
  • 不存在数据缺失的限制:全部八个模型均报告 12 个样本中的 12 个,valid_point_count 为 96,在四小时窗口内覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • 平均吞吐量最高的是 gemma4:31b,达 136.19 词元/秒;最低的是 nemotron-3-ultra,为 48.03 词元/秒,deepseek-v4-pro(95.25 词元/秒)和 minimax-m3(97.82 词元/秒)也低于 100 词元/秒。
  • glm-5.3-flash 波动最大,范围从 16.85 到 200.22 词元/秒(变异系数 53.7%),而 glm-3 整体下降 44.8%,并在 04:20 达到 6.19 词元/秒的低点;nemotron-3-ultra 在 2.58 到 107.9 词元/秒之间波动。
  • 不存在数据缺失的限制:全部八个模型均记录了 12 个样本中的 12 个,在四小时窗口内共计 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • gemma4:31b 的平均吞吐量最高,达 140.0 词元/秒(峰值 195.2 词元/秒),而 nemotron-3-ultra 最弱,平均仅 44.95 词元/秒,从未超过 97.05 词元/秒。
  • 运营层面最显著的波动来自 glm-5.3-flash,其在 02:40 的 200.22 词元/秒与 03:20 的 16.85 词元/秒之间大幅摆动(变异系数 51.9%),glm-5.3 在 04:20 降至 6.19 词元/秒;nemotron-3-ultra 同样不稳定,在 03:00 低至 2.58 词元/秒,变异系数为 76.4%。
  • 不存在数据缺失的限制:全部 8 个模型均记录了 12 个预期样本中的 12 个,在四小时窗口内共有 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • gemma4:31b 是平均吞吐量最强的模型,达到 148.74 词元/秒,而 nemotron-3-ultra 最弱,为 40.63 词元/秒,两者之间大约有 3.7 倍的差距。
  • 运行层面最显著的波动来自 nemotron-3-ultra,其吞吐量在 2.58 至 95.27 词元/秒之间波动,变异系数为 84.4%;glm-5.3-flash 也在 02:40 飙升至 200.22 词元/秒,随后在 03:20 骤降至 16.85 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均记录了 12 个预期样本中的 12 个,在四小时的时间窗口内共有 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • gemma4:31b 是表现最强的模型,平均吞吐量为 142.54 词元/秒,领先于 deepseek-v4-flash 的 125.79 词元/秒,而 nemotron-3-ultra 表现最弱,平均为 40.05 词元/秒,最低值为 2.58 词元/秒。
  • nemotron-3-ultra 的波动性对运营影响最大,变异系数为 74.9%,波动范围在 2.58 至 87.38 词元/秒之间;glm-5.3-flash 也在 02:40 飙升至 200.22 词元/秒,随后在 03:00 降至 80.18 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均有 12 个样本中的 12 个,valid_point_count 为 96,覆盖率为 100.0%,因此每 20 分钟的观测数据均完整存在。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • gemma4:31b 是最强模型,平均吞吐量为 153.69 词元/秒,峰值达 183.91 词元/秒;nemotron-3-ultra 最弱,平均为 32.36 词元/秒,最终仅为 4.09 词元/秒。
  • glm-5.3 波动最大,范围从 56.69 到 175.08 词元/秒,变异系数为 41.3%,而 glm-5.2 在该时间窗口内下降了 32.8%,从 95.03 降至 49.16 词元/秒。
  • 不存在缺失数据的限制:全部八个模型均有 12 个样本中的 12 个,数据集报告了 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • gemma4:31b 是最强的模型,平均吞吐量为 148.67 词元/秒(p95 为 180.66 词元/秒),而 nemotron-3-ultra 最弱,平均为 32.25 词元/秒,最低降至 5.34 词元/秒。
  • glm-5.3 波动最大,变异系数为 34.7%,在 56.69 和 175.08 词元/秒之间波动;deepseek-v4-flash 在最后一次观测中骤降至 62.52 词元/秒,为其四小时内的最低值,而其平均值为 118.71 词元/秒。
  • 不存在数据缺失的限制:全部八个模型在 12 个预期样本中均有 12 个,共 96 个有效数据点,在四小时时间窗口内覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • gemma4:31b 是平均吞吐量最强的模型,达到 138.02 词元/秒,而 nemotron-3-ultra 最弱,为 31.48 词元/秒;deepseek-v4-flash 位居第二,为 122.13 词元/秒。
  • nemotron-3-ultra 表现出对运营影响最大的波动性,在 5.34 至 67.24 词元/秒之间摆动,变异系数为 74.6%,包括在 UTC 时间 21:00、22:00、22:40 和 23:00 多次跌破 10 词元/秒;glm-5.2 在该时段内也攀升了 46.8%,从 60.26 升至 99.46 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均交付了 12 个预期样本中的 12 个,在四小时期间内提供了 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • gemma4:31b 的平均吞吐量最高,达到 132.37 词元/秒(p95 为 174.76 词元/秒),而 nemotron-3-ultra 最弱,平均仅为 26.67 词元/秒,从未超过 67.24 词元/秒。
  • 运营层面最显著的波动来自 nemotron-3-ultra,其变异系数为 84.7%,并在接近 67 词元/秒的峰值之间反复骤降至约 5–9 词元/秒(最近一次为 5.34 词元/秒);glm-5.3 也呈上升趋势,增长 44.8%,峰值达到 155.85 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均报告 12 个样本中的 12 个,共计 96 个有效数据点,在四小时时间窗口内覆盖率达到 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • gemma4:31b 是最强的模型,平均吞吐量为 123.92 词元/秒,峰值达 175.31 词元/秒;nemotron-3-ultra 最弱,平均为 30.38 词元/秒,最低为 5.41 词元/秒。
  • 波动性是主要的运行信号:nemotron-3-ultra 的变异系数为 76.1%,glm-5.3-flash 在 20:40 骤降至 11.36 词元/秒,随后在 21:40 恢复至 82.07 词元/秒;deepseek-v4-flash 呈现最陡峭的上升趋势,达 30.3%。
  • 不存在数据缺失的限制:全部八个模型均交付了 12 个预期样本中的 12 个,在四小时的时间窗口内共有 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • gemma4:31b 是最强模型,平均吞吐量为 123.39 词元/秒,p95 为 170.5 词元/秒,最大值为 174.3 词元/秒;nemotron-3-ultra 最弱,平均为 27.76 词元/秒,从未超过 77.12 词元/秒。
  • glm-5.3 降幅最陡,从 17:20 的 145.17 词元/秒降至 21:00 的 61.91 词元/秒,趋势为 -38.8%;deepseek-v4-pro 提升了 36.3%,达到 110.81 词元/秒;nemotron-3-ultra 波动最大,变异系数为 69.2%,波动范围在 6.03 至 77.12 词元/秒之间。
  • 不存在数据缺失的限制:全部 8 个模型均交付了 12 个预期样本中的 12 个,在四小时时间窗口内产生 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • gemma4:31b 是最强模型,平均吞吐量为 109.44 词元/秒,略微领先于 108.73 词元/秒的 glm-5.3;nemotron-3-ultra 最弱,平均为 24.88 词元/秒,从未超过 77.12 词元/秒。
  • 波动性是主要特征:nemotron-3-ultra 在 3.77 至 77.12 词元/秒之间波动,变异系数为 80.7%,glm-5.3-flash 在 17:00 飙升至 190.98 词元/秒,随后在接近 81 词元/秒处收尾;gemma4:31b 呈现唯一的正向趋势,为 +13.7%。
  • 不存在数据缺失的限制:全部八个模型均报告了 12 个样本中的 12 个,在四小时的时间窗口内共有 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强的模型,平均吞吐量为 124.9 词元/秒,而 nemotron-3-ultra 最弱,平均为 22.94 词元/秒,最低为 3.77 词元/秒。
  • glm-5.3-flash 的波动性在运营层面最为显著,变异系数为 55.9%,在 190.98 和 44.64 词元/秒之间波动;其吞吐量在该时间窗口内下降了 33.6%,最终为 69.46 词元/秒。
  • 不存在数据缺失的限制:所有八个模型均有 12 个样本中的 12 个,valid_point_count 为 96,覆盖率为 100.0%,因此四小时的时间窗口得到完整呈现。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强的模型,平均吞吐量为 114.58 词元/秒(p95 为 148.98 词元/秒),而 nemotron-3-ultra 最弱,平均为 21.05 词元/秒,峰值仅为 62.34 词元/秒。
  • glm-5.3-flash 的波动幅度最大,范围从 44.64 到 190.98 词元/秒,变异系数为 56.0%,而 nemotron-3-ultra 既不稳定(变异系数 77.3%),又在整个时间窗口内下降了 32.0%,最终为 15.81 词元/秒。
  • 不存在数据缺失的限制:所有八个模型均交付了 12 个预期样本中的 12 个,整体覆盖率为 100.0%,共 96 个有效数据点,因此四小时的时间窗口得到了完整呈现。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强模型,平均吞吐量为 117.39 词元/秒,领先于 deepseek-v4-flash 的 108.88 词元/秒和 gemma4:31b 的 103.81 词元/秒;nemotron-3-ultra 最弱,平均为 26.66 词元/秒,从未超过 62.34 词元/秒。
  • glm-5.3-flash 的波动性最为剧烈,变异系数为 57.5%,在 47.18 至 190.98 词元/秒之间波动,而 gemma4:31b、minimax-m3 和 nemotron-3-ultra 在整个时间窗口内分别下降了 37.5%、40.0% 和 53.7%。
  • 不存在数据缺失的限制:全部八个模型均报告了预期的 12 个样本中的 12 个,共有 96 个有效数据点,覆盖率为 100.0%,因此四小时窗口内的每二十分钟观测值均完整存在。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强的模型,平均吞吐量为 125.95 词元/秒(p95 为 151.16 词元/秒),而 nemotron-3-ultra 最弱,平均仅 27.83 词元/秒,从未超过 62.34 词元/秒。
  • glm-5.3-flash 的波动最为剧烈,从 13:40 的 47.18 词元/秒飙升至 15:20 的 190.28 词元/秒,随后在 16:00 回落至 63.36 词元/秒,变异系数为 54.7%;minimax-m3 也下降了 34.1%,跌至时段内最低的 30.79 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均有 12 个样本中的 12 个,数据集报告了 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • glm-5.3 的平均吞吐量最高,达 121.01 词元/秒,略高于 gemma4:31b 的 118.11 词元/秒,而 nemotron-3-ultra 表现最弱,仅为 28.67 词元/秒,从未超过 62.34 词元/秒。
  • nemotron-3-ultra 的波动性最大,变异系数为 66.3%,在 2.54 至 62.34 词元/秒之间波动;minimax-m3 呈现出最强的趋势,整体上升 48.0%,并在 13:20 达到 163.02 词元/秒的峰值。
  • 不存在数据缺失的限制:全部八个模型均记录了 12 个预期样本中的 12 个,产生 96 个有效数据点,在四小时的时间窗口内覆盖率达到 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强的模型,平均吞吐量为 124.61 词元/秒(峰值达 173.25 词元/秒),而 nemotron-3-ultra 是最弱的模型,平均为 29.46 词元/秒,从未超过 55.05 词元/秒。
  • 运营层面最显著的波动性来自 nemotron-3-ultra,其在 2.54 至 55.05 词元/秒之间波动,变异系数为 64.7%,其中包括三次低于 5 词元/秒的观测值。glm-5.3-flash 也表现出明显的下降趋势,趋势为 -32.2%,从 152.19 词元/秒的峰值降至 47.18 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均拥有 12 个预期样本中的 12 个,valid_point_count 为 96,整体覆盖率为 100.0%,因此四小时的时间窗口得到了完整呈现。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • gemma4:31b 是表现最强的模型,平均吞吐量为 125.83 词元/秒,峰值达 181.44 词元/秒;nemotron-3-ultra 是表现最弱的模型,平均吞吐量为 24.61 词元/秒,最低值为 2.54 词元/秒。
  • nemotron-3-ultra 的波动性对运行影响最大,在 2.54 至 55.05 词元/秒之间波动,变异系数为 81.7%,而 gemma4:31b 尽管领先,但在该时间窗口内下降了 24.3%。
  • 不存在数据缺失的限制:全部八个模型均交付了 12 个预期样本中的 12 个,共 96 个有效数据点,在四小时窗口内覆盖率达到 100%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • gemma4:31b 是平均吞吐量最强的模型,达到 124.66 词元/秒(峰值 181.44 词元/秒),而 nemotron-3-ultra 最弱,平均仅 25.58 词元/秒,最低值仅为 3.33 词元/秒。
  • 运营层面最显著的波动性来自 nemotron-3-ultra,其变异系数为 75.4%,在整个时间窗口内波动于 3.33 至 55.05 词元/秒之间;相比之下,deepseek-v4-pro 是最稳定的模型,保持在 84.36 至 137.21 词元/秒之间,变异系数为 15.2%。
  • 不存在数据缺失的限制:覆盖率为 100.0%,共有 96 个有效数据点,且每个模型都记录了预期 12 个样本中的全部 12 个,因此这四小时的全貌是完整的。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • gemma4:31b 是平均吞吐量最强的模型,达到 127.51 词元/秒(p95 为 174.95 词元/秒),而 nemotron-3-ultra 最弱,平均仅为 24.55 词元/秒,在任何时间区间内都从未超过 55.05 词元/秒。
  • 运营层面最显著的变化是 minimax-m3 在后期的激增,从 10:40 的 89.26 词元/秒跃升至 11:00 的 168.2 词元/秒,推动趋势达到 +32.3%;nemotron-3-ultra 波动性最大,变异系数为 70.9%,波动范围介于 2.73 至 55.05 词元/秒之间。
  • 不存在数据缺失的限制:每个模型都有 12 个样本中的全部 12 个,valid_point_count 为 96,在整个四小时窗口内覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • gemma4:31b 是最强的模型,平均吞吐量为 127.58 词元/秒,峰值为 181.44 词元/秒,p95 为 172.6 词元/秒;nemotron-3-ultra 最弱,平均为 26.42 词元/秒,从未超过 77.53 词元/秒。
  • glm-5.3-flash 表现出对运营影响最大的波动性,从 06:20 的 186.06 词元/秒降至 10:00 的 53.05 词元/秒,趋势为 -40.5%,变异系数为 48.0%;nemotron-3-ultra 更加不稳定,CV 为 79.6%,在 2.73 至 77.53 词元/秒之间摆动。
  • 不存在数据缺失的限制:全部八个模型均报告 12 个样本中的 12 个,valid_point_count 为 96,在四小时窗口内覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • 平均吞吐量最强的是 gemma4:31b,达到 124.21 词元/秒(峰值 186.77 词元/秒),而 nemotron-3-ultra 最弱,仅为 30.20 词元/秒,从未超过 86.78 词元/秒,平均值不到 gemma4:31b 速率的四分之一。
  • glm-5.3-flash 波动最为剧烈,在 51.98 至 186.06 词元/秒之间摆动,变异系数为 50.4%,趋势为 -29.7%;nemotron-3-ultra 的稳定性更差,变异系数高达 87.7%,在 07:20 降至 2.73 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均提供了 12 个样本中的 12 个,数据集报告了 96 个有效数据点,在四小时的时间窗口内覆盖率达到 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • gemma4:31b 是表现最强的模型,平均吞吐量为 143.9 词元/秒,领先于 deepseek-v4-flash 的 102.15 词元/秒;nemotron-3-ultra 表现最弱,平均为 29.02 词元/秒,最低为 2.26 词元/秒。
  • glm-5.3-flash 是唯一呈正增长趋势的模型,增幅为 +26.3%,最终达到 136.05 词元/秒,但其波动范围在 51.98 至 186.06 词元/秒之间;nemotron-3-ultra 波动性最大,变异系数为 100.4%,而 gemma4:31b 下降了 25.0%,降至 113.24 词元/秒。
  • 不存在缺失数据的限制:全部八个模型均有 12 个样本中的 12 个,valid_point_count 为 96,在四小时时间窗口内覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • 平均吞吐量最强的是 gemma4:31b,达 133.15 词元/秒(峰值 194.06 词元/秒);最弱的是 nemotron-3-ultra,为 36.86 词元/秒,最低值为 2.26 词元/秒。
  • 运行层面最显著的波动来自 nemotron-3-ultra,其在 2.26 至 86.78 词元/秒之间波动(变异系数 78.6%),且从 04:40 到 06:20 期间读数接近于零;glm-5.3 同样不稳定(变异系数 52.0%,波动范围 25.38 至 180.01 词元/秒),而大多数模型在 06:00 附近出现低谷。
  • 不存在数据缺失的限制:全部 8 个模型均有 12 个样本中的 12 个,valid_point_count 为 96,覆盖率为 100.0%,因此该四小时时间窗口的数据是完整的。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • gemma4:31b 是表现最强的模型,平均吞吐量为 142.24 词元/秒,峰值达 194.06 词元/秒;nemotron-3-ultra 表现最弱,平均为 32.19 词元/秒,最低为 2.26 词元/秒。
  • glm-5.3 降幅最为剧烈,从 02:20 的 177.13 词元/秒降至 06:00 的 25.38 词元/秒,下降 39.1%;而 nemotron-3-ultra 波动性极高(CV 为 89.0%),在 86.78 和 2.26 词元/秒之间大幅摆动。
  • 不存在数据缺失的限制:全部 8 个模型均记录了 12 个样本中的 12 个,共获得 96 个有效数据点,在四小时时间窗口内覆盖率达到 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • gemma4:31b 是最强的模型,平均吞吐量为 133.36 词元/秒,峰值达 194.06 词元/秒,而 nemotron-3-ultra 最弱,平均为 29.19 词元/秒,从未超过 66.55 词元/秒。
  • 最显著的趋势是 glm-5.3 下降了 31.9%,从 02:20 前后 177.13 词元/秒的峰值降至最后三次观测中的 52.05–64.66 词元/秒;glm-5.3-flash 在同一时间窗口内下降了 22.9%。nemotron-3-ultra 波动性极高,变异系数达 77.9%,在 2.26 至 66.55 词元/秒之间大幅摆动。
  • 不存在缺失数据的限制:全部 8 个模型均有 12 个样本中的 12 个,共 96 个有效数据点,在四小时窗口内覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强模型,平均吞吐量为 130.42 词元/秒,领先于 gemma4:31b 的 120.81 词元/秒;nemotron-3-ultra 最弱,平均仅 28.63 词元/秒,最大值也只有 66.55 词元/秒。
  • 运营层面最显著的变化是 glm-5.3-flash,其吞吐量从 00:20 的 190.15 词元/秒降至 04:00 的 78.96 词元/秒,趋势为 -49.3%,变异系数为 46.6%;deepseek-v4-pro 提升了 33.1%,达到 109.4 词元/秒。
  • 不存在数据缺失的限制:全部 8 个模型均有 12 个样本中的 12 个,共 96 个有效数据点,在四小时时间窗口内覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强的模型,平均吞吐量为 136.27 词元/秒,略胜 130.13 词元/秒的 gemma4:31b,而 nemotron-3-ultra 最弱,仅为 23.65 词元/秒,远低于倒数第二的 glm-5.2 的 74.15 词元/秒。
  • deepseek-v4-flash 降幅最陡,从窗口初期约 150 词元/秒下滑 -25.9%,在 02:40 降至 75.2 词元/秒的低点;glm-5.3-flash 波动性最大,变异系数为 46.5%,在 57.89 至 190.15 词元/秒之间波动。
  • 不存在数据缺失的限制:全部八个模型均报告了 12 个预期样本中的 12 个、96 个有效数据点以及 100.0% 的覆盖率,因此该四小时窗口是完整的。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4-flash 是最强的模型,平均吞吐量为 132.30 词元/秒,略胜 glm-5.3 的 130.87 词元/秒;nemotron-3-ultra 最弱,平均为 30.43 词元/秒,在 00:00 时低至 2.92 词元/秒。
  • 运营层面最显著的波动来自 nemotron-3-ultra,其变异系数为 91.7%,波动范围介于 2.92 至 104.07 词元/秒之间;glm-5.3-flash 同样震荡剧烈,范围从 70.62 到 190.15 词元/秒(变异系数 42.4%)。
  • 不存在数据缺失的限制:全部八个模型均报告 12 个样本中的 12 个,valid_point_count 为 96,在四小时窗口内覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4-flash 是最强的模型,平均吞吐量为 140.39 词元/秒,而 nemotron-3-ultra 最弱,平均为 39.37 词元/秒,下限为 2.92 词元/秒。
  • 运营层面最显著的波动是 nemotron-3-ultra 的下滑:其吞吐量在该时间窗口内下降了 58.8%,变异系数为 75.3%,在接近 00:00 UTC 时读数低至 2.92 词元/秒,相比之下 deepseek-v4-flash 的波动更为平稳,仅为 19.0%。
  • 不存在数据缺失的限制:全部八个模型均提供了 12 个预期样本中的 12 个,数据集报告了 96 个有效数据点,覆盖率为 100.0%,因此这四小时的时间窗口得到了完整呈现。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4-flash 是最强的模型,平均吞吐量为 132.14 词元/秒(12 个样本,范围 93.09 至 165.04 词元/秒),而 nemotron-3-ultra 是最弱的,平均为 48.94 词元/秒(范围 3.55 至 104.07 词元/秒)。
  • 运营层面最显著的波动是 nemotron-3-ultra 的 61.5% 变异系数,包括在 22:20 降至 3.55 词元/秒、在 19:40 降至 5.47 词元/秒;glm-5.3 在该时间窗口内也从 14.06 波动至 149.7 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均拥有 12 个预期样本中的 12 个,共 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4-flash 是最强的模型,平均吞吐量为 132.59 词元/秒(范围 93.09 至 165.04 词元/秒),而 nemotron-3-ultra 最弱,平均为 45.43 词元/秒,在 19:40 时低至 5.47 词元/秒。
  • 运营层面最显著的波动来自 glm-5.3,其变异系数为 50.7%:它在 21:00 降至 14.06 词元/秒,随后在 21:20 飙升至 147.69 词元/秒,并在 21:40 达到 146.02 词元/秒。glm-5.3-flash 呈现类似的波动,从 50.41 到 188.94 词元/秒。
  • 不存在数据缺失的限制:全部 8 个模型均有 12 个样本中的 12 个,valid_point_count 为 96,在四小时窗口内覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4-flash 是最强的模型,平均吞吐量为 126.59 词元/秒(p95 为 150.99 词元/秒),而 nemotron-3-ultra 最弱,平均为 37.24 词元/秒,最低降至 4.81 词元/秒。
  • 运营层面最显著的变化是 glm-5.3 下降了 47.5%,从 19:00 的 134.65 词元/秒降至 21:00 的 14.06 词元/秒;glm-5.3-flash 也表现出较高的波动性(变异系数 55.0%),在 20:40 飙升至 188.94 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均记录了 12 个预期样本中的 12 个,在四小时的时间窗口内共有 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4-flash 以 120.09 词元/秒的平均吞吐量位居最强,领先于 gemma4:31b 的 100.31 词元/秒,而 nemotron-3-ultra 最弱,为 24.03 词元/秒,在任何时间间隔内均未超过 52.53 词元/秒。
  • glm-5.3-flash 表现出对运行影响最显著的波动性,变异系数为 52.7%,在 18:00 时为 43.26 词元/秒,在 17:00 时达到 183.59 词元/秒,在 18:40 时达到 182.29 词元/秒;glm-5.3 整体也下降了 30.0%,最终为 57.67 词元/秒。
  • 不存在缺失数据的限制:全部八个模型均记录了 12 个预期样本中的 12 个,在该时间窗口内共计 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4-flash 是最强的模型,平均吞吐量为 108.31 词元/秒(峰值达 153.96 词元/秒),而 nemotron-3-ultra 最弱,平均为 26.38 词元/秒,从未超过 69.26 词元/秒。
  • 运营层面最显著的波动来自 nemotron-3-ultra,其变异系数为 80.5%,波动范围在 4.77 至 69.26 词元/秒之间;deepseek-v4-flash 呈现最强的上升趋势,为 45.1%,最终达到 132.22 词元/秒。
  • 此时间窗口内不存在数据缺失的限制:全部八个模型均有 12 个样本中的 12 个,valid_point_count 为 96,覆盖率为 100.0%,因此从 15:20 到 19:00 UTC 的每二十分钟观测值均完整存在。