← 返回性能仪表板

每小时性能洞察

滚动四小时性能数据摘要

已保留 1196 条摘要
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • 平均吞吐量最强的是 deepseek-v4-flash,达 141.82 词元/秒(峰值 223.43 词元/秒),而 nemotron-3-ultra 最弱,仅 4.46 词元/秒,在整个时间窗口内从未超过 6.99 词元/秒。
  • glm-5.3-flash 呈现最大的上升趋势,达 54.9%,从窗口初期的大约 102 词元/秒攀升至最新读数 172.69 词元/秒;glm-5.3 是波动性最大的模型,变异系数为 38.9%,波动区间介于 64.2 至 186.83 词元/秒之间。
  • 不存在缺失数据的限制:全部八个模型均有 12 个样本中的 12 个,在四小时期间内产生 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • gemma4:31b 是平均吞吐量最强的模型,达到 126.69 词元/秒,略微领先于 deepseek-v4-flash 的 131.09 词元/秒……更正:deepseek-v4-flash 以 131.09 词元/秒领先,gemma4:31b 以 126.69 词元/秒位居第二;nemotron-3-ultra 最弱,为 4.5 词元/秒。
  • glm-5.3 波动最为剧烈,变异系数为 43.7%,在 64.2 至 186.83 词元/秒之间波动,其中包括在 07:40 至 08:00 之间从 186.83 降至 73.98 词元/秒;deepseek-v4-pro 涨幅最大,从 35.11 词元/秒的低点上升 36.6%,达到 105.41 词元/秒。
  • 不存在缺失数据的限制:全部八个模型均有 12 个(共 12 个)样本,valid_point_count 为 96,在四小时窗口内覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • 平均吞吐量最强的是 gemma4:31b,达 136.76 词元/秒(p95 为 183.66 词元/秒);最弱的是 nemotron-3-ultra,为 5.13 词元/秒,且从未超过 7.36 词元/秒。
  • glm-5.3 表现出对运行影响最为显著的波动性:变异系数为 46.4%,趋势为 +61.1%,在窗口初期约为 69 词元/秒,随后在 07:40 达到 186.83 词元/秒的峰值,之后在 08:00 回落至 73.98 词元/秒。
  • 不存在数据缺失的限制:全部 8 个模型均交付了 12 个预期样本中的 12 个,在四小时窗口内共有 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • gemma4:31b 是平均吞吐量最强的模型,达到 143.84 词元/秒,峰值为 184.99 词元/秒,而 nemotron-3-ultra 最弱,平均仅 5.08 词元/秒,且从未超过 7.36 词元/秒。
  • glm-5.3 的波动性对运营影响最大,变异系数为 47.3%,在 64.2 至 183.69 词元/秒之间波动,其中包括从 UTC 04:00 到 05:40 持续降至约 68–72 词元/秒的低谷;deepseek-v4-pro 整体也下降了 35.9%,在 06:20 降至 35.11 词元/秒。
  • 不存在数据缺失的限制:所有八个模型均有 12 个样本中的 12 个,valid_point_count 为 96,覆盖率为 100.0%,因此四小时的时间窗口是完整的。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • 平均吞吐量最强的是 gemma4:31b,达 145.82 词元/秒(峰值 184.99 词元/秒);最弱的是 nemotron-3-ultra,为 5.36 词元/秒,从未超过 7.36 词元/秒。
  • glm-5.3 表现出最剧烈的运行波动:在 03:00 至 03:40 期间保持 174.24-183.69 词元/秒后,在连续六个采样点降至约 68-72 词元/秒,随后于 06:00 回升至 174.35 词元/秒,趋势为 -37.4%,变异系数为 45.5%。
  • 不存在数据缺失的限制:全部 8 个模型均交付了 12 个预期采样点中的 12 个,valid_point_count 为 96,覆盖率为 100.0%,因此四小时时间窗口是完整的。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4-flash 是最强模型,平均吞吐量为 147.15 词元/秒,略微领先于 gemma4:31b 的 145.47 词元/秒;nemotron-3-ultra 最弱,平均为 5.75 词元/秒,从未超过 9.72 词元/秒。
  • glm-5.3 表现出对运行影响最大的波动性,变异系数为 47.6%:吞吐量从 01:20 的 65.03 词元/秒攀升至 03:20 的 183.69 词元/秒,随后在 04:00 降至 71.47 词元/秒。deepseek-v4-pro 的趋势变化最大,为 +32.4%。
  • 不存在数据缺失的限制:全部八个模型均拥有 12 个预期样本中的 12 个,数据集报告了 96 个有效数据点,在四小时时间窗口内覆盖率达到 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • gemma4:31b 是最强的模型,平均吞吐量为 144.77 词元/秒,deepseek-v4-flash 紧随其后,为 142.96 词元/秒;nemotron-3-ultra 最弱,平均仅为 5.79 词元/秒,峰值也仅有 9.72 词元/秒。
  • glm-5.3 的波动性对运营影响最大,在 191.82 和 65.03 词元/秒之间波动,变异系数为 44.6%,包括在最后 20 分钟区间内从 179.48 降至 71.47 词元/秒;deepseek-v4-pro 的波动范围也达到 33.26 至 122.53 词元/秒。
  • 不存在数据缺失的限制:全部 8 个模型均拥有 12 个预期样本中的 12 个,在四小时窗口内共有 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • 平均吞吐量最高的是 deepseek-v4-flash,达 147.48 词元/秒(峰值 200.56 词元/秒),略高于 gemma4:31b 的 141.25 词元/秒;最弱的是 nemotron-3-ultra,平均仅 10.70 词元/秒,最大值也只有 37.32 词元/秒。
  • 运营层面最显著的波动性来自 nemotron-3-ultra,波动范围为 2.21 至 37.32 词元/秒,CV 为 86.4%,降幅达 61.4%;deepseek-v4-pro 同样不稳定(8.86 至 109.27 词元/秒,CV 为 57.5%),glm-5.2 则下降了 24.6%,平均为 74.10 词元/秒。
  • 不存在缺失数据的限制:全部 8 个模型均报告了 12 个样本中的 12 个,在四小时窗口内共计 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • gemma4:31b 是最强模型,平均吞吐量为 141.62 词元/秒,峰值达 177.46 词元/秒,而 nemotron-3-ultra 最弱,平均为 9.93 词元/秒,从未超过 37.32 词元/秒。
  • deepseek-v4-pro 的波动性对运营影响最大,从 107.66 词元/秒的峰值降至 8.86 词元/秒的低点,变异系数为 54.1%,趋势为 -41.1%;glm-5.3-flash 上升 54.9%,达到 172.45 词元/秒的峰值。
  • 不存在缺失数据的限制:全部 8 个模型均有 12 个样本中的 12 个,在四小时窗口内共有 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • 平均吞吐量最强的是 deepseek-v4-flash,达 136.76 词元/秒(p95 为 188.96,最大值为 190.88 词元/秒);最弱的是 nemotron-3-ultra,为 9.66 词元/秒,从未超过 37.32 词元/秒。glm-5.3 以 125.42 词元/秒位居第二。
  • 运营层面最显著的变化是 deepseek-v4-pro 的下滑:在 22:20 之前约为 100 词元/秒,随后在 23:20 骤降至 8.86 词元/秒,收于 33.24 词元/秒,趋势为 -53.0%,CV 为 47.4%。deepseek-v4-flash 也在 21:40 一度跌至 15.01 词元/秒。
  • 不存在数据缺失的限制:全部 8 个模型均报告了 12 个预期样本中的 12 个,共计 96 个有效数据点,在四小时窗口内覆盖率达到 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4-flash 是最强的模型,平均吞吐量为 135.68 词元/秒(峰值 190.88 词元/秒),而 nemotron-3-ultra 最弱,平均为 5.65 词元/秒,大约慢 24 倍。
  • 运营层面最显著的变化是 deepseek-v4-pro 在后期的下降:从 19:20 到 22:20 它保持在 100-117 词元/秒,随后在最后两个区间降至 37.19 和 32.3 词元/秒,趋势为 -28.2%。deepseek-v4-flash 也出现剧烈波动,范围从 15.01 到 190.88 词元/秒。
  • 不存在数据缺失的限制:全部八个模型都交付了 12 个预期样本中的 12 个,在四小时的时间窗口内共有 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • 平均吞吐量最强的是 deepseek-v4-flash,达 130.51 词元/秒,而 nemotron-3-ultra 最弱,仅为 3.5 词元/秒,慢了约 37 倍。
  • 最显著的趋势是 glm-5.3 上升 67.7%,达到 149.59 词元/秒的峰值,从 19:40 时 19.92 词元/秒的低点回升;deepseek-v4-flash 也在 15.01 至 187.39 词元/秒之间剧烈波动。
  • 不存在数据缺失的限制:全部八个模型均记录了 12 个预期样本中的 12 个,在四小时的时间窗口内共有 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4-flash 是最强模型,平均吞吐量为 138.76 词元/秒,峰值达 168.96 词元/秒;nemotron-3-ultra 最弱,平均为 3.44 词元/秒,从未超过 5.8 词元/秒。
  • deepseek-v4-pro 增幅最大且持续,上升 43.1% 至最新读数 110.26 词元/秒,此前早期徘徊在 61-85 词元/秒附近;glm-5.3 波动最大,从 17:40 的 149.91 词元/秒骤降至 19:40 的 19.92 词元/秒。
  • 不存在数据缺失限制:全部八个模型均报告 12 个样本中的 12 个,共 96 个有效数据点,覆盖率为 100.0%,不过时间窗口仅跨越四个小时。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4-flash 是最强的模型,平均吞吐量为 135.62 词元/秒(峰值 162.57 词元/秒),而 nemotron-3-ultra 最弱,平均为 3.06 词元/秒,慢了大约 44 倍。
  • 变动最显著的是 glm-5.3 系列:glm-5.3 在该时间窗口内下降了 37.1%,在 19:40 降至 19.92 词元/秒,glm-5.3-flash 从 174.92 词元/秒的峰值下降了 35.5%;glm-5.3 还显示出最高的波动性,变异系数为 37.7%。
  • 不存在缺失数据的限制:全部八个模型均有 12 个样本中的 12 个,在四小时窗口内共有 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4-flash 是最强的模型,平均吞吐量为 131.15 词元/秒,领先于 118.37 词元/秒的 glm-5.3,而 nemotron-3-ultra 最弱,平均为 2.92 词元/秒,大约比领先者慢 45 倍。
  • 运营层面最显著的变化是 glm-5.3 从 16:40 的 153.57 词元/秒峰值下降到 19:00 的 61.74 词元/秒,趋势为 -13.5%;deepseek-v4-flash 则走势相反,上升 20.3%,在 17:00 达到 162.57 词元/秒的峰值。
  • 该时间窗口内不存在数据缺失的限制:全部八个模型都拥有 12 个预期样本中的 12 个,在四小时期间共有 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强的模型,平均吞吐量为 124.41 词元/秒,略微领先于 deepseek-v4-flash 的 124.27 词元/秒;nemotron-3-ultra 最弱,平均为 2.87 词元/秒,大约比 glm-5.3 慢 43 倍。
  • deepseek-v4-flash 的波动性最大,范围从 26.57 到 191.31 词元/秒,变异系数为 35.0%,gemma4:31b 同样不稳定,为 37.9%;glm-5.3 是最稳定的,为 19.3%。
  • 不存在缺失数据的限制:所有八个模型都有 12 个样本中的 12 个,valid_point_count 为 96,在四小时窗口内覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强的模型,平均吞吐量为 122.04 词元/秒,领先于 deepseek-v4-flash 的 115.21 词元/秒;nemotron-3-ultra 最弱,平均为 2.76 词元/秒,远低于其他所有模型。
  • 运行波动最剧烈的是 glm-5.3-flash,从 164.14 词元/秒的峰值下降至最新采样点的 78.28 词元/秒,降幅达 40.9%;deepseek-v4-flash 的波动范围也很大,介于 26.57 至 191.31 词元/秒之间。
  • 不存在数据缺失的限制:全部八个模型均报告了 12 个预期采样中的 12 个,在四小时窗口内共有 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强的模型,平均吞吐量为 123.22 词元/秒,而 nemotron-3-ultra 最弱,平均为 3.46 词元/秒,慢了大约 35 倍。
  • gemma4:31b 降幅最明显,在 16:00 时下行 30.8% 至 23.27 词元/秒;deepseek-v4-flash 从 14:40 的 191.31 词元/秒峰值波动至 15:00 的 26.57 词元/秒,而 minimax-m3 在 15:40 飙升至 105.28 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均记录了 12 个样本中的 12 个,数据集包含 96 个有效数据点,在四小时时间窗口内覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4-flash 是最强模型,平均吞吐量为 124.96 词元/秒,略微领先于 122.75 词元/秒的 glm-5.3;nemotron-3-ultra 最弱,平均为 5.09 词元/秒,大约比领先者慢 25 倍。
  • minimax-m3 表现出最具运营意义的波动性,变异系数为 71.8%,在 UTC 时间 10:40 出现一次 168.33 词元/秒的峰值,并以 35.9% 的下降趋势收于 43.52 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均报告 12 个样本中的 12 个,valid_point_count 为 96,整个四小时时间窗口的覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • 按平均吞吐量衡量,最强的模型是 gemma4:31b,达 122.23 词元/秒,略微领先于 115.73 词元/秒的 glm-5.3;最弱的是 nemotron-3-ultra,仅 5.78 词元/秒,最大值也只有 8.37 词元/秒。
  • 运营层面最显著的波动来自 minimax-m3:变异系数为 69.3%,在 10:40 出现单点飙升至 168.33 词元/秒(对比 51.57 词元/秒的平均值),趋势为 -37.2%;deepseek-v4-flash 也在 10.65 至 157.94 词元/秒之间大幅波动。
  • 不存在缺失数据的限制:全部八个模型均报告 12 个样本中的 12 个、96 个有效数据点,并在四小时时间窗口内实现 100.0% 的覆盖率。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4-flash 是最强的模型,平均吞吐量为 129.86 词元/秒,峰值达 213.47 词元/秒,而 nemotron-3-ultra 最弱,平均仅为 6.69 词元/秒,从未超过 17.52 词元/秒。
  • 运营层面最显著的波动来自 minimax-m3,其在 UTC 10:40 飙升至 168.33 词元/秒,而平均值为 51.91 词元/秒(变异系数 68.7%);deepseek-v4-flash 也在 09:40 一度跌至 10.65 词元/秒,glm-5.3 在 10:00 跌至 25.21 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均记录了 12 个预期样本中的 12 个,共计 96 个有效数据点,在四小时的时间窗口内覆盖率达到 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4-flash 以 137.78 词元/秒的平均吞吐量领先(峰值 213.47 词元/秒),而 nemotron-3-ultra 最弱,平均仅 8.36 词元/秒,大约低 16 倍。
  • minimax-m3 波动最为剧烈:从 07:20 的 189.19 词元/秒跌至 11:00 的 33.49 词元/秒低点,变异系数为 72.8%,趋势为 -40.8%;deepseek-v4-flash 也在 09:40 一度跌至 10.65 词元/秒,随后回升。
  • 无缺失数据限制:全部八个模型均报告 12 个样本中的 12 个、96 个有效数据点,在四小时时间窗口内覆盖率达 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4-flash 是平均吞吐量最强的模型,达到 128.54 词元/秒,峰值为 213.47 词元/秒;nemotron-3-ultra 最弱,平均仅 8.66 词元/秒,从未超过 17.52 词元/秒。
  • 运行层面最显著的波动来自 minimax-m3,其吞吐量从 07:00 的 36.89 词元/秒飙升至 07:20 的 189.19 词元/秒和 07:40 的 181.68 词元/秒,随后从 08:20 起骤降至约 40-46 词元/秒,趋势为 -60.6%,变异系数为 76.2%。
  • 不存在数据缺失的限制:全部八个模型均报告了 12 个预期样本中的 12 个,在四小时窗口内共提供 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4-flash 是最强的模型,平均吞吐量为 144.58 词元/秒(峰值 213.47 词元/秒),而 nemotron-3-ultra 最弱,平均仅为 9.48 词元/秒(峰值仅 17.52 词元/秒)。
  • minimax-m3 表现出最具运营意义的波动性,变异系数为 74.3%:它在 07:00 从 36.89 词元/秒跃升至 07:20 的 189.19 词元/秒,随后在 08:20 回落至 45.42 词元/秒。
  • 不存在缺失数据的限制:全部 8 个模型均拥有 12 个预期样本中的 12 个,在四小时的时间窗口内共有 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4-flash 是最强的模型,平均吞吐量为 144.66 词元/秒(峰值 207.34 词元/秒),而 nemotron-3-ultra 最弱,平均为 9.64 词元/秒(最低 2.0 词元/秒),大约低 15 倍。
  • 波动最显著的是 minimax-m3,它在八次观测中保持在接近 45-53 词元/秒的水平,随后在 07:20 跃升至 189.19 词元/秒,导致变异系数达 72.0%,趋势达 126.8%;glm-5.3 也在 06:40 降至 25.72 词元/秒。
  • 不存在缺失数据的限制:所有八个模型均报告 12 个样本中的 12 个,共 96 个有效数据点,在四小时窗口内覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • 平均吞吐量最高的是 deepseek-v4-flash,达 138.7 词元/秒(峰值 207.34 词元/秒),而 nemotron-3-ultra 最弱,平均仅 9.21 词元/秒,峰值也仅为 17.47 词元/秒。
  • gemma4:31b 的波动性最大,变异系数为 46.3%,在 37.48 至 175.35 词元/秒之间波动;glm-5.3 在 06:40 降至 25.72 词元/秒,随后在 07:00 恢复至 150.44 词元/秒,而 deepseek-v4-pro 整体下降 16.2%,在 06:00 降至 27.04 词元/秒。
  • 该时间窗口内不存在数据缺失的限制:全部八个模型均提供了 12 个样本中的 12 个,共有 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4-flash 是最强的模型,平均吞吐量为 141.96 词元/秒(范围 110.03–207.34 词元/秒),而 nemotron-3-ultra 最弱,平均为 11.85 词元/秒,峰值仅为 21.8 词元/秒。
  • gemma4:31b 波动性最大,变异系数为 42.7%,在 49.27 和 190.24 词元/秒之间波动;nemotron-3-ultra 在该时间窗口内也下降了 34.7%,在 06:00 降至 5.32 词元/秒。
  • 不存在缺失数据的限制:全部八个模型均有 12 个样本中的 12 个,valid_point_count 为 96,覆盖率为 100.0%,因此四小时窗口内的每二十分钟观测值均完整存在。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4-flash 是最强的模型,平均吞吐量为 144.63 词元/秒(峰值 207.34 词元/秒),而 nemotron-3-ultra 是最弱的模型,平均为 13.10 词元/秒,峰值仅为 22.22 词元/秒。
  • gemma4:31b 的波动性最高,变异系数为 38.9%,在 49.27 至 190.24 词元/秒之间波动,其中包括在 03:40 降至 49.27 词元/秒;deepseek-v4-pro 是唯一呈上升趋势的模型,涨幅为 +36.5%。
  • 不存在数据缺失的限制:全部八个模型均记录了 12 个样本中的 12 个,在四小时的时间窗口内共有 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • 平均吞吐量最强的是 deepseek-v4-flash,达 134.85 词元/秒(峰值 185.27 词元/秒),而 nemotron-3-ultra 最弱,仅 12.05 词元/秒,约为领先者平均值的十一分之一。
  • gemma4:31b 表现出最剧烈的运行波动,变异系数为 39.0%,在时间窗口内于 49.27 至 190.24 词元/秒之间起伏;glm-5.3-flash 整体下降 11.1%,最终为 85.38 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均报告了 12 个预期样本中的 12 个、96 个有效数据点以及 100.0% 的覆盖率,因此该四小时窗口是完整的,尽管它仅覆盖了一个较短的单一时间段。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4-flash 是平均吞吐量最强的模型,达到 133.21 词元/秒,而 nemotron-3-ultra 最弱,仅为 8.65 词元/秒,在四小时窗口内大约慢了十五倍。
  • 变动最显著的是 glm-5.3-flash,其趋势上升了 76.6%,从 22:20 的 58.61 词元/秒攀升至 01:00 的峰值 172.7 词元/秒,随后回落至 105.25 词元/秒;nemotron-3-ultra 同样表现出高波动性,变异系数为 55.6%。
  • 不存在数据缺失的限制:全部八个模型均报告了 12 个预期样本中的 12 个,产生 96 个有效数据点和 100.0% 的覆盖率,因此窗口内的每个二十分钟间隔都有数据呈现。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4-flash 的平均吞吐量最高,达 125.81 词元/秒,峰值达 157.39 词元/秒,而 nemotron-3-ultra 最弱,平均仅 6.08 词元/秒,且从未超过 12.34 词元/秒。
  • 波动最剧烈的是 glm-5.3-flash,其吞吐量从 00:40 的 89.98 词元/秒跃升至 01:00 的 172.7 词元/秒,推动其趋势达 +27.0%;deepseek-v4-flash 呈下降趋势,降幅 18.4%,最终收于 78.54 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均报告 12 个样本中的 12 个,在四小时窗口内共有 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4-flash 是平均吞吐量最强的模型,达到 116.89 词元/秒,峰值为 157.39 词元/秒,而 nemotron-3-ultra 最弱,仅为 5.28 词元/秒,平均慢约 22 倍。
  • gemma4:31b 波动最为剧烈,范围从 66.21 到 190.44 词元/秒,变异系数为 36.2%,趋势为 -20.6%;相比之下,deepseek-v4-pro 整体提升了 42.4%,收于 100.34 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均交付了 12 个预期样本中的 12 个,产生 96 个有效数据点,在四小时时间窗口内覆盖率达到 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4-flash 是最强的模型,平均吞吐量为 123.17 词元/秒,领先于 glm-5.3(112.16 词元/秒)和 gemma4:31b(111.22 词元/秒);nemotron-3-ultra 最弱,平均为 3.73 词元/秒,远低于倒数第二低的 minimax-m3 的 50.0 词元/秒。
  • gemma4:31b 波动性最高(变异系数 33.4%),在 66.31 和 190.44 词元/秒之间大幅波动,包括 20:20 达到 190.44 词元/秒的峰值,随后在 20:40 骤降至 75.41 词元/秒;deepseek-v4-flash 同样在 20:40 一度跌至 41.3 词元/秒,随后在 22:20 恢复至 157.39 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均有 12 个样本中的 12 个、96 个有效数据点,在四小时时间窗口内覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强模型,平均吞吐量为 118.58 词元/秒,峰值达 146.12 词元/秒;nemotron-3-ultra 最弱,平均为 3.03 词元/秒,从未超过 4.34 词元/秒。
  • 运营层面最显著的变动是 glm-5.2 呈 46.8% 的上升趋势,从 18:20 的 40.51 词元/秒攀升至 22:00 的 103.1 词元/秒,而 deepseek-v4-pro 则表现出最高的波动性(变异系数 42.2%),在 9.18 至 103.28 词元/秒之间摆动。
  • 不存在数据缺失的限制:全部八个模型均报告了 12 个预期样本中的 12 个,在四小时的时间窗口内共有 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • glm-5.3 是平均吞吐量最强的模型,达到 114.11 词元/秒,领先于 deepseek-v4-flash 的 107.66 词元/秒和 gemma4:31b 的 96.74 词元/秒;nemotron-3-ultra 最弱,仅为 3.01 词元/秒,大约比领先者慢 38 倍。
  • 波动性是主要的运维问题:deepseek-v4-pro 在 9.18 到 103.28 词元/秒之间波动(变异系数为 47.6%),gemma4:31b 的范围为 29.03 到 190.44 词元/秒(44.7%),而 deepseek-v4-flash 在 19:00 一度跌至 21.6 词元/秒,随后恢复。
  • 不存在数据缺失的限制:全部八个模型均报告了 12 个预期样本中的 12 个,在四小时的时间窗口内共有 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强的模型,平均吞吐量为 111.39 词元/秒,而 nemotron-3-ultra 最弱,仅为 2.91 词元/秒;deepseek-v4-flash 紧随其后,为 104.80 词元/秒。
  • deepseek-v4-pro 的波动性最高,变异系数为 55.9%,在 9.18 至 103.28 词元/秒之间波动;gemma4:31b 的变化范围也很大,从 29.03 到 154.43 词元/秒,变异系数为 41.3%。
  • 不存在缺失数据的限制:全部八个模型均报告了 12 个样本中的 12 个,数据集记录了 96 个有效数据点,在四小时的时间窗口内覆盖率达到 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强的模型,平均吞吐量为 111.4 词元/秒(峰值 152.09 词元/秒),而 nemotron-3-ultra 最弱,平均仅为 2.7 词元/秒,从未超过 3.56 词元/秒。
  • deepseek-v4-flash 的波动性对运营影响最大,其范围从 21.6 到 180.81 词元/秒,变异系数为 42.1%,且其最新读数降至 21.6 词元/秒;deepseek-v4-pro 同样不稳定,变异系数为 52.6%。
  • 不存在数据缺失的限制:全部八个模型均报告了 12 个预期样本中的 12 个,在四小时的时间窗口内共有 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • 平均吞吐量最高的是 deepseek-v4-flash,达 113.88 词元/秒;最低的是 nemotron-3-ultra,仅 2.61 词元/秒,低了约 44 倍。
  • deepseek-v4-flash 的波动也最大,范围从 22.77 到 180.81 词元/秒,标准差为 46.3 词元/秒,其中包括在 16:20 降至 26.77 词元/秒;deepseek-v4-pro 在 16:20 降至 9.84 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均记录了 12 个预期样本中的 12 个,在四小时的时间窗口内共有 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强的模型,平均吞吐量为 115.28 词元/秒,deepseek-v4-flash 紧随其后,为 115.18 词元/秒;nemotron-3-ultra 最弱,平均为 2.36 词元/秒,从未超过 3.23 词元/秒。
  • 运营层面最显著的波动来自 deepseek-v4-pro,其吞吐量从 14:40 的 91.94 词元/秒降至 16:20 的 9.84 词元/秒,呈 34.3% 的负向趋势;deepseek-v4-flash 也大幅下滑,在 14:40 为 22.77 词元/秒,16:20 为 26.77 词元/秒。
  • 不存在数据缺失的限制:全部 96 个预期数据点均有效,覆盖率为 100.0%,每个模型都有 12 个样本中的 12 个。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • 平均吞吐量最强的是 deepseek-v4-flash,达 133.9 词元/秒,略微领先于 122.41 词元/秒的 glm-5.3;最弱的是 nemotron-3-ultra,仅 2.42 词元/秒,远低于其他所有模型。
  • 运营层面最显著的波动出现在 UTC 14:40:minimax-m3 飙升至 134.78 词元/秒,而其基线约为 40 词元/秒;deepseek-v4-flash 则从 14:20 的 128.11 词元/秒跌至 22.77 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均报告了 12 个预期样本中的 12 个,在四小时的时间窗口内共提供 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4-flash 是最强模型,平均吞吐量为 128.08 词元/秒,领先于 glm-5.3 的 121.15 词元/秒;nemotron-3-ultra 最弱,平均为 2.66 词元/秒,大约比领先者慢 48 倍。
  • deepseek-v4-pro 表现出对运营影响最显著的波动性,在 10.73 至 102.06 词元/秒之间波动,变异系数为 51.3%,包括在 UTC 时间 12:00、13:00 和 14:00 分别降至 11.76、11.13 和 10.73 词元/秒。
  • 不存在数据缺失的限制:所有八个模型均报告 12 个样本中的 12 个,覆盖率为 100.0%,与四小时窗口预期的 96 个有效数据点相符。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4-flash 是最强的模型,平均吞吐量为 135.47 词元/秒(峰值 203.38 词元/秒),而 nemotron-3-ultra 最弱,平均为 3.38 词元/秒,峰值仅为 6.07 词元/秒。
  • glm-5.3 呈现最显著的上升趋势,上升 49.2%,在 13:40 达到 232.92 词元/秒的峰值,而 minimax-m3 下降 48.0% 至 40.4 词元/秒;deepseek-v4-pro 也表现出剧烈波动,在 14:00 降至 10.73 词元/秒。
  • 无缺失数据限制:全部八个模型均有 12 个样本中的 12 个、96 个有效数据点,在四小时时间窗口内覆盖率达到 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • 平均吞吐量最强的是 deepseek-v4-flash,达 126.38 词元/秒(峰值 203.38 词元/秒);最弱的是 nemotron-3-ultra,仅 3.81 词元/秒,从未超过 9.24 词元/秒。
  • 波动最显著:minimax-m3(变异系数 62.6%)在 173.21 与 34.86 词元/秒之间大幅摆动,且在 11:20 之后从未超过 45.07 词元/秒;deepseek-v4-pro 也在 13:00 降至 11.13 词元/秒,而 gemma4:31b 呈下行趋势,下降 27.9% 至 79.15 词元/秒。
  • 无缺失数据限制:全部 8 个模型均交付了 12 个样本中的 12 个,在四小时窗口内共有 96 个有效数据点,覆盖率达 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4-flash 是最强的模型,平均吞吐量为 122.73 词元/秒,峰值达 203.38 词元/秒,而 nemotron-3-ultra 最弱,平均仅为 3.65 词元/秒,从未超过 9.24 词元/秒。
  • minimax-m3 表现出对运行影响最显著的波动性,变异系数为 60.1%,在 33.72 至 173.21 词元/秒之间大幅摆动;deepseek-v4-pro 也从 11:40 的 99.94 词元/秒骤降至 12:00 的 11.76 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均报告了 12 个样本中的 12 个,数据集在四小时窗口内显示 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • gemma4:31b 是平均吞吐量最强的模型,达到 121.52 词元/秒,略胜 deepseek-v4-flash 的 117.77 词元/秒;nemotron-3-ultra 最弱,仅为 3.02 词元/秒,大约比领先者慢 40 倍。
  • minimax-m3 表现出最具运营意义的波动性,在 30.65 至 133.01 词元/秒之间摆动,变异系数为 60.4%,在 33-36 词元/秒附近的近乎平稳读数与 09:40、10:00 和 10:40 UTC 时超过 100 词元/秒的峰值之间交替出现。
  • 不存在缺失数据的限制:全部八个模型均交付了 12 个预期样本中的 12 个,数据集报告了 96 个有效数据点,在四小时时间窗口内覆盖率达到 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • glm-5.3 是平均吞吐量最强的模型,达到 118.79 词元/秒,略微领先于 deepseek-v4-flash 的 117.11 词元/秒,而 nemotron-3-ultra 最弱,仅为 2.34 词元/秒,在整个时间窗口内的最大值也仅为 9.24 词元/秒。
  • 运营层面最显著的变动是 minimax-m3 在后期的激增:它在 06:20 至 08:40 期间维持在约 30-39 词元/秒,随后在最后三次观测中跃升至 98.85、133.01 和 107.97 词元/秒,趋势增幅达 114.9%。nemotron-3-ultra 同样表现出极端波动性,变异系数为 102.1%,并在 08:20 出现 0.49 词元/秒的低点。
  • 不存在缺失数据的限制:全部八个模型均拥有 12 个预期样本中的 12 个,数据集报告了 96 个有效数据点,覆盖率为 100.0%,因此该四小时时间窗口是完整的。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4-flash 是最强的模型,平均吞吐量为 120.16 词元/秒(峰值达 152.17 词元/秒),略微领先于 118.66 词元/秒的 glm-5.3 和 117.75 词元/秒的 gemma4:31b;nemotron-3-ultra 最弱,平均仅为 2.79 词元/秒,大约慢 43 倍。
  • 运营层面最显著的变化是 nemotron-3-ultra 的持续崩溃:它从 05:20 的 5.26 词元/秒跌至 08:20 的 0.49 词元/秒低点,趋势为 -66.1%,随后在 09:00 恢复到 4.58 词元/秒。glm-5.3 也在 186.03 和 76.49 词元/秒之间波动。
  • 不存在数据缺失的限制:全部八个模型均交付了 12 个预期样本中的 12 个,在四小时的时间窗口内提供了 96 个有效数据点,覆盖率达到 100.0%。
4 小时窗口 · 88 个数据点 · 覆盖率 91.7%
  • glm-5.3 是最强的模型,平均吞吐量为 131.05 词元/秒(峰值 186.03 词元/秒),而 nemotron-3-ultra 是最弱的模型,平均为 4.54 词元/秒,从未超过 10.46 词元/秒。
  • 运营层面最显著的变化是 nemotron-3-ultra 从 04:20 的 6.21 词元/秒稳步下降至 07:40 的 1.17 词元/秒,降幅达 63.3%。同样值得注意的是单个时间间隔内的骤降:deepseek-v4-pro 在 06:00 降至 9.58 词元/秒,gemma4:31b 在 05:00 降至 27.97 词元/秒,随后两者均有所回升。
  • 每个模型都记录了 12 个预期样本中的 11 个(覆盖率 91.7%),共产生 88 个有效数据点,因此每个模型都缺失一个观测值,短窗口平均值可能无法充分代表完整的四个小时。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强的模型,平均吞吐量为 127.99 词元/秒(峰值 169.43 词元/秒),而 nemotron-3-ultra 最弱,平均仅为 4.87 词元/秒,从未超过 10.46 词元/秒。
  • 运营层面最显著的波动来自 gemma4:31b,其在 27.97 至 173.46 词元/秒之间波动(变异系数 42.4%);deepseek-v4-pro 也在 UTC 06:00 一度降至 9.58 词元/秒,随后恢复至 108.17 词元/秒,而 glm-5.3-flash 在 07:00 飙升至 166.43 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均有 12/12 个样本、96 个有效数据点,在四小时时间窗口内覆盖率达到 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强模型,平均吞吐量为 118.24 词元/秒,领先于 gemma4:31b 的 114.13 词元/秒;nemotron-3-ultra 最弱,平均为 4.99 词元/秒,从未超过 10.46 词元/秒。
  • 运营层面最重大的事件是 deepseek-v4-pro 在 06:00 从 05:40 的 97.77 词元/秒跌至 9.58 词元/秒;gemma4:31b 也表现出剧烈波动,范围在 27.97 至 173.46 词元/秒之间,变异系数为 39.9%。
  • 无缺失数据限制:全部八个模型均记录了 12 个样本中的 12 个,覆盖率为 100.0%,全部 96 个有效数据点均存在,因此四小时时间窗口得到完整呈现。