← 返回性能仪表板

每小时性能洞察

滚动四小时性能数据摘要

已保留 1194 条摘要
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4-flash 是最强的模型,平均吞吐量为 108.31 词元/秒(峰值达 153.96 词元/秒),而 nemotron-3-ultra 最弱,平均为 26.38 词元/秒,从未超过 69.26 词元/秒。
  • 运营层面最显著的波动来自 nemotron-3-ultra,其变异系数为 80.5%,波动范围在 4.77 至 69.26 词元/秒之间;deepseek-v4-flash 呈现最强的上升趋势,为 45.1%,最终达到 132.22 词元/秒。
  • 此时间窗口内不存在数据缺失的限制:全部八个模型均有 12 个样本中的 12 个,valid_point_count 为 96,覆盖率为 100.0%,因此从 15:20 到 19:00 UTC 的每二十分钟观测值均完整存在。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • gemma4:31b 是表现最强的模型,平均吞吐量为 101.65 词元/秒;nemotron-3-ultra 最弱,为 24.06 词元/秒,约为 gemma4:31b 速度的四分之一。
  • nemotron-3-ultra 表现出对运行影响最显著的波动性,变异系数为 87.1%,在 4.77 至 69.26 词元/秒之间摆动,趋势为 -41.7%,最终收于 4.81 词元/秒;deepseek-v4-flash 呈上升趋势,达 63.4%,峰值达到 153.96 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均交付了 12 个预期样本中的 12 个,共 96 个有效数据点,在四小时的时间窗口内覆盖率达到 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • glm-5.3-flash 是性能最强的模型,平均吞吐量为 102.26 词元/秒,峰值达 183.59 词元/秒;nemotron-3-ultra 是性能最弱的模型,平均为 22.22 词元/秒,最大值仅为 69.26 词元/秒。
  • glm-5.3 呈现最陡峭的上升趋势,达 +92.2%,从 13:20 的 60.13 词元/秒攀升至 16:40 的 154.61 词元/秒;而 nemotron-3-ultra 波动性最大,变异系数为 91.8%,在 2.23 至 69.26 词元/秒之间摆动。
  • 不存在数据缺失的限制:全部 8 个模型均交付了 12 个预期样本中的 12 个,在四小时的时间窗口内共提供 96 个有效数据点,覆盖率达 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • glm-5.3-flash 是最强模型,平均吞吐量为 102.91 词元/秒,领先于 83.31 词元/秒的 deepseek-v4-flash;nemotron-3-ultra 最弱,平均仅 26.21 词元/秒,最高仅为 69.26 词元/秒。
  • 运营层面最显著的波动来自 nemotron-3-ultra 的 80.2% 变异系数,在 2.23 至 69.26 词元/秒之间波动;gemma4:31b 呈现最陡峭的趋势,上升 95.3% 并在 15:20 达到 152.34 词元/秒的峰值,随后回落至 63.13 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均报告 12 个样本中的 12 个,在四小时窗口内共有 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • glm-5.3-flash 是最强的模型,平均吞吐量为 101.2 词元/秒,领先于 87.52 词元/秒的 deepseek-v4-flash;nemotron-3-ultra 最弱,平均为 27.27 词元/秒,最低值为 2.23 词元/秒。
  • glm-5.3 的波动性对运营影响最大,在 9.35 至 134.99 词元/秒之间波动(变异系数 54.8%),包括 14:20 降至 9.35 词元/秒,随后 14:40 达到 134.99 词元/秒;nemotron-3-ultra 同样不稳定,变异系数为 69.3%。
  • 不存在数据缺失的限制:每个模型都有 12 个样本中的全部 12 个,数据集包含 96 个有效数据点,覆盖率为 100.0%,因此唯一的约束就是四小时的时间窗口本身。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • glm-5.3-flash 是最强模型,平均吞吐量为 101.97 词元/秒,而 nemotron-3-ultra 最弱,平均为 32.99 词元/秒。
  • 运营层面最显著的变化是 nemotron-3-ultra 下降了 49.9%,从 10:20 的 70.05 词元/秒降至 14:00 的 21.32 词元/秒,且波动性较高(变异系数 62.2%);deepseek-v4-pro 也下降了 36.5%,至 32.11 词元/秒,而 glm-5.3-flash 上升了 52.7%,至 107.31 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均有 12 个样本中的 12 个,valid_point_count 为 96,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • glm-5.3-flash 是最强的模型,平均吞吐量为 101.02 词元/秒,峰值为 188.73 词元/秒;nemotron-3-ultra 最弱,平均为 39.53 词元/秒,从未超过 71.72 词元/秒。
  • 波动性是主要的运行信号:glm-5.3-flash 在 15.54 至 188.73 词元/秒之间波动(变异系数 54.5%),glm-5.2 在 12:00 UTC 降至 2.45 词元/秒,八个模型中有七个呈下降趋势,deepseek-v4-pro 是唯一增长的模型,增幅为 +21.2%。
  • 不存在数据缺失的限制:所有八个模型均有 12 个样本中的 12 个,共 96 个有效数据点,在四小时窗口内覆盖率达到 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • 平均吞吐量最强的是 glm-5.3,达 95.12 词元/秒;最弱的是 nemotron-3-ultra,为 52.13 词元/秒,glm-5.3-flash 以 92.65 词元/秒位居第二,minimax-m3 最为稳定,为 78.78 词元/秒(CV 16.4%)。
  • glm-5.3-flash 是波动最大的模型,范围从 15.54 到 188.73 词元/秒(CV 55.9%),且 12:00 UTC 时间窗口出现急剧下降:glm-5.2 为 2.45 词元/秒,glm-5.3-flash 为 15.54 词元/秒,而 deepseek-v4-pro 呈上升趋势,增长 10.6% 至 104.79 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均有 12 个样本中的 12 个,valid_point_count 为 96,覆盖率为 100.0%,因此四小时窗口得到完整呈现。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • glm-5.3-flash 是最强的模型,平均吞吐量为 103.53 词元/秒,峰值达 188.73 词元/秒;nemotron-3-ultra 最弱,平均为 50.97 词元/秒,最低为 13.37 词元/秒。
  • 波动性是主要的运营问题:nemotron-3-ultra 在 13.37 至 105.2 词元/秒之间波动(CV 为 55.1%),deepseek-v4-flash 在 36.93 至 146.11 词元/秒之间波动(CV 为 47.3%),而 glm-5.3-flash 尽管平均值较高,也在 52.87 至 188.73 词元/秒之间波动。
  • 不存在数据缺失的限制:全部 8 个模型均有 12 个样本中的 12 个,valid_point_count 为 96,在 07:20 至 11:00 UTC 的观测期间覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • glm-5.3-flash 是最强的模型,平均吞吐量为 100.78 词元/秒,领先于 gemma4:31b 的 90.95 词元/秒;nemotron-3-ultra 最弱,平均为 44.91 词元/秒,最低仅为 6.15 词元/秒。
  • 波动性是主要的运营问题:nemotron-3-ultra 的变异系数为 73.1%,deepseek-v4-flash 为 51.1%,其中 deepseek-v4-flash 从 09:20 的 146.11 词元/秒波动至 09:40 的 36.93 词元/秒。
  • 此时间窗口内不存在数据缺失的限制:全部 8 个模型均有 12 个样本中的 12 个,共 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • glm-5.3-flash 是平均吞吐量最强的模型,达 88.37 词元/秒,而 nemotron-3-ultra 最弱,为 57.49 词元/秒;gemma4:31b 紧随其后,达 86.15 词元/秒。
  • 波动性是主要的运维隐忧:nemotron-3-ultra 在 6.15 至 111.63 词元/秒之间波动(变异系数 66.9%),glm-5.3-flash 的范围为 16.04 至 174.3 词元/秒。大多数模型在观测时段内呈下降趋势,其中 deepseek-v4-flash 下降 20.1%,minimax-m3 下降 14.3%;仅 glm-5.3-flash 上升,涨幅 11.1%。
  • 不存在数据缺失的限制:全部 8 个模型均交付了 12 个预期样本中的 12 个,在四小时的观测窗口内共有 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • glm-5.3-flash 是最强模型,平均吞吐量为 93.76 词元/秒,略微领先于 93.05 词元/秒的 deepseek-v4-flash;nemotron-3-ultra 最弱,平均为 49.5 词元/秒。
  • 运营层面最显著的变化是 nemotron-3-ultra 下降了 57.6%,从 06:00 的 111.63 词元/秒峰值降至 08:00 的 13.37 词元/秒,其中包括在 06:40–07:00 附近低至 6.15 和 7.15 词元/秒的低谷;glm-5.3-flash 波动最大,范围在 16.04 至 174.3 词元/秒之间,变异系数为 51.8%。
  • 不存在数据缺失的限制:全部 8 个模型均提供了 12 个预期样本中的 12 个,数据集记录了 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4-flash 是最强模型,平均吞吐量达 99.9 词元/秒,略胜 glm-5.3-flash(91.87 词元/秒);nemotron-3-ultra 最弱,平均为 48.64 词元/秒,约为领先者的一半。
  • glm-5.3-flash 波动幅度最大,变异系数为 54.6%,在 16.04 至 174.3 词元/秒之间波动;nemotron-3-ultra 整体上升 72.6%,在 06:00 达到 111.63 词元/秒的峰值,随后在 07:00 之前骤降至 7.15 词元/秒。
  • 无缺失数据限制:全部八个模型均交付了 12 个预期样本中的 12 个,数据集报告了 96 个有效数据点,在四小时窗口内覆盖率达到 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4-flash 是平均吞吐量最强的模型,达到 101.62 词元/秒,而 nemotron-3-ultra 最弱,为 49.68 词元/秒;其余六个模型的平均值介于 74.46 至 89.09 词元/秒之间。
  • 运营层面最显著的变化是 nemotron-3-ultra 从 04:00 的 15.95 词元/秒攀升至 06:00 的 111.63 词元/秒,趋势涨幅达 132.9%。波动性最高的是 nemotron-3-ultra(CV 58.8%)和 glm-5.3-flash(54.0%),其吞吐量在 16.04 至 174.3 词元/秒之间波动。
  • 不存在数据缺失的限制:全部 8 个模型均有 12 个样本中的 12 个、96 个有效数据点,覆盖率为 100.0%,因此该时间窗口内每二十分钟一次的观测数据均完整存在。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • 平均吞吐量最强的是 gemma4:31b,达 101.43 词元/秒;最弱的是 nemotron-3-ultra,为 39.12 词元/秒,低了约 2.6 倍。
  • gemma4:31b 的波动幅度最大,在 30.3 至 184.45 词元/秒之间摆动,变异系数为 46.6%;而 glm-5.3 呈现出最显著的趋势,在整个时间窗口内上升 46.3%,在 04:40 一度跌至 36.23 词元/秒后,收于 139.83 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均报告了 12 个样本中的 12 个,产生 96 个有效数据点,在四小时期间内覆盖率达到 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • gemma4:31b 是最强模型,平均吞吐量为 120.66 词元/秒,而 nemotron-3-ultra 最弱,为 34.11 词元/秒;deepseek-v4-flash 以 99.6 词元/秒紧随其后,glm-5.2 以 69.46 词元/秒接近垫底。
  • 波动性是主要的运行信号:gemma4:31b 从 01:40 的 184.45 词元/秒峰值波动至 02:00 的 72.95 词元/秒,并在 03:00 降至 30.3 词元/秒的低点,glm-5.3-flash 的波动范围为 37.97–167.8 词元/秒,变异系数为 46.7%。
  • 不存在数据缺失的限制:全部 8 个模型均提供了 12 个样本中的 12 个,在四小时的时间窗口内共有 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • gemma4:31b 是最强的模型,平均吞吐量达 129.64 词元/秒,超过集群中位数两倍以上;nemotron-3-ultra 最弱,平均为 40.36 词元/秒,从未超过 84.43 词元/秒。
  • glm-5.3 呈现最急剧的下滑趋势,从 140.41 下降至 70.98 词元/秒,降幅达 43.7%;而 nemotron-3-ultra 和 glm-5.3-flash 波动性最大,变异系数分别为 56.0% 和 50.6%;deepseek-v4-flash 在 25.14 至 137.51 词元/秒之间波动。
  • 不存在数据缺失的限制:全部 8 个模型均交付了 12 个预期样本中的 12 个,产生 96 个有效数据点,在四小时时间窗口内覆盖率达到 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • glm-5.3-flash 是最强模型,平均吞吐量为 104.87 词元/秒,略胜 102.0 词元/秒的 glm-5.3;nemotron-3-ultra 最弱,平均仅 34.45 词元/秒,峰值也仅为 84.43 词元/秒。
  • 运营层面最显著的变化是 glm 系列的同步下滑:在此期间 glm-5.2 下降了 30.0%,glm-5.3 下降了 29.8%,最新读数分别为 25.45 和 51.77 词元/秒;nemotron-3-ultra 波动极大(变异系数 76.1%),在 8.69 到 84.43 词元/秒之间摆动。
  • 无缺失数据限制:全部 8 个模型均报告 12 个样本中的 12 个,在四小时窗口内共有 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • gemma4:31b 的平均吞吐量最高,达到 126.83 词元/秒,其次是 glm-5.3,为 111.09 词元/秒;nemotron-3-ultra 最弱,平均仅为 22.82 词元/秒,峰值也仅有 81.64 词元/秒。
  • 运营层面最显著的波动来自 nemotron-3-ultra,其变异系数为 102.3%,趋势为 409.3%,从 22:00 的 4.88 词元/秒跃升至 23:40 的 81.64 词元/秒;glm-5.3-flash 也在 21.78 至 158.36 词元/秒之间波动(变异系数 51.1%)。
  • 此时间窗口内不存在数据缺失的限制:全部八个模型均记录了 12 个预期样本中的 12 个,共计 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • glm-5.3 是平均吞吐量最强的模型,达到 122.26 词元/秒,而 nemotron-3-ultra 最弱,为 18.59 词元/秒;gemma4:31b 位居第二,为 114.05 词元/秒。
  • 运营层面最显著的变化是 nemotron-3-ultra 的后期激增:它在 23:20 之前一直以 4.88-12.12 词元/秒运行,随后在 23:40 跃升至 81.64 词元/秒,并在 00:00 达到 60.45 词元/秒,这导致其变异系数高达 129.0%。glm-5.3-flash 同样波动较大,范围为 21.78-157.0 词元/秒。
  • 不存在数据缺失的限制:全部 8 个模型均有 12 个样本中的 12 个,在四小时的时间窗口内共有 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强的模型,平均吞吐量为 120.37 词元/秒(峰值 167.3 词元/秒),而 nemotron-3-ultra 最弱,平均仅 10.15 词元/秒,峰值仅为 23.06 词元/秒。
  • 变化最显著的是 glm-5.3-flash,在观测时段内上升了 66.9%,从 21:40 的低点 21.78 词元/秒攀升至 23:00 的 150.01 词元/秒;nemotron-3-ultra 在同一时段内下降了 41.5%。
  • 不存在数据缺失的限制:全部 8 个模型均提供了 12 个预期样本中的 12 个,在四小时的观测窗口内共有 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强的模型,平均吞吐量为 124.9 词元/秒,领先于 gemma4:31b 的 105.55 词元/秒;nemotron-3-ultra 最弱,平均为 9.22 词元/秒,从未超过 23.06 词元/秒。
  • 最剧烈的运行波动是 nemotron-3-ultra 的 43.4% 下降,从 20:00 的 23.06 词元/秒降至 22:00 的 4.88 词元/秒;minimax-m3 也从 20:00 的 168.39 词元/秒峰值跌至 21:40 的 69.66 词元/秒,趋势降幅为 19.3%。
  • 不存在数据缺失的限制:全部八个模型均有 12 个样本中的 12 个,共 96 个有效数据点,覆盖率为 100.0%,因此没有任何结论受到数据空缺的制约。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强模型,平均吞吐量为 126.47 词元/秒,峰值达 167.30 词元/秒;nemotron-3-ultra 最弱,平均为 11.42 词元/秒,从未超过 32.62 词元/秒。
  • 波动性是主要的运行信号:gemma4:31b 在 27.25 至 160.34 词元/秒之间波动,变异系数为 39.5%,nemotron-3-ultra 的变异系数为 74.4%,minimax-m3 的趋势变化幅度最大,为 31.8%,而 glm-5.3 最为稳定,变异系数为 18.6%。
  • 不存在数据缺失的限制:全部八个模型均报告了 12 个预期样本中的 12 个、96 个有效数据点,并在四小时窗口内实现 100.0% 的覆盖率。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • glm-5.3 是平均吞吐量最强的模型,达到 106.39 词元/秒,略微领先于 gemma4:31b 的 105.43 词元/秒,而 nemotron-3-ultra 最弱,平均为 13.59 词元/秒,从未超过 32.62 词元/秒。
  • 运营层面最显著的变化是 minimax-m3 的 57.7% 上升趋势,从 16:20 的 67.96 词元/秒升至 20:00 的 168.39 词元/秒;gemma4:31b 波动性最高(变异系数 42.3%),在 27.25 至 160.34 词元/秒之间摆动。
  • 不存在数据缺失的限制:全部八个模型均报告了 12 个预期样本中的 12 个,共计 96 个有效数据点,在四小时时间窗口内覆盖率达到 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强的模型,平均吞吐量为 98.47 词元/秒,峰值达 144.55 词元/秒,而 nemotron-3-ultra 最弱,平均为 12.14 词元/秒,且从未超过 32.62 词元/秒。
  • 波动性是主要的运行信号:gemma4:31b 在 27.25 至 146.37 词元/秒之间波动(变异系数 47.8%),deepseek-v4-flash 的范围为 26.31 至 133.55 词元/秒(变异系数 52.1%),而 nemotron-3-ultra 的相对波动性最高,变异系数达 75.7%。
  • 此时间窗口内不存在数据缺失的限制:全部八个模型均报告了 12 个预期样本中的 12 个,共有 96 个有效数据点,覆盖率为 100.0%;唯一的限制是数据集仅涵盖四个小时。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强的模型,平均吞吐量为 89.0 词元/秒,领先于 gemma4:31b 的 83.15 词元/秒;nemotron-3-ultra 最弱,平均仅 18.19 词元/秒,峰值也仅为 45.96 词元/秒。
  • nemotron-3-ultra 波动性最高(变异系数 76.3%),在 3.44 至 45.96 词元/秒之间震荡,最终收于 6.34 词元/秒;deepseek-v4-flash 趋势最陡,达 +84.3%,但在 26.31 至 133.55 词元/秒之间大幅波动。
  • 无缺失数据限制:全部 8 个模型均交付了预期 12 个样本中的 12 个,在四小时窗口内共有 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强模型,平均吞吐量为 90.6 词元/秒,峰值达 136.75 词元/秒;nemotron-3-ultra 最弱,平均为 19.49 词元/秒,从未超过 45.96 词元/秒。
  • deepseek-v4-pro 表现出最剧烈的运行波动,从 14:20 的 116.96 词元/秒降至 15:00 的 8.02 词元/秒,并在 16:00 再次降至 6.8 词元/秒;nemotron-3-ultra 的变异系数最高,为 66.2%。
  • 无缺失数据限制:全部 8 个模型均报告 12 个样本中的 12 个,在四小时窗口内共有 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • glm-5.3 是平均吞吐量最强的模型,达 89.64 词元/秒,而 nemotron-3-ultra 最弱,为 24.87 词元/秒;两者之间的差距约为 64.77 词元/秒。
  • 运行层面最显著的变化来自 deepseek-v4-flash,其吞吐量在该时间窗口内下降了 55.5%,从 12:40 的 143.01 词元/秒峰值跌至 16:00 的 32.51 词元/秒。deepseek-v4-pro 同样波动剧烈,一度低至 6.5 和 6.8 词元/秒,变异系数达 60.3%。
  • 不存在数据缺失的限制:全部 8 个模型均交付了 12 个预期样本中的 12 个,在四小时期间内共产生 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强模型,平均吞吐量为 102.04 词元/秒,领先于第二名 glm-5.3-flash 的 78.45 词元/秒;nemotron-3-ultra 最弱,平均为 28.70 词元/秒,峰值仅为 59.33 词元/秒。
  • deepseek-v4-pro 波动最为剧烈,在 6.5 至 116.96 词元/秒之间波动(变异系数为 48.9%),其中在 UTC 13:00 低至 6.5 词元/秒,在 UTC 15:00 为 8.02 词元/秒;nemotron-3-ultra 同样不稳定,变异系数为 61.3%,趋势为 -24.3%。
  • 无缺失数据限制:全部八个模型均有 12 个样本中的 12 个,在四小时窗口内共有 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强的模型,平均吞吐量为 99.81 词元/秒(峰值达 137.96 词元/秒),而 nemotron-3-ultra 最弱,平均仅为 33.69 词元/秒,从未超过 75.87 词元/秒。
  • deepseek-v4-flash 的波动性最高,变异系数为 45.8%,在 35.86 至 143.01 词元/秒之间波动;deepseek-v4-pro 也在 UTC 13:00 骤降至 6.5 词元/秒,随后在 14:00 恢复至 84.71 词元/秒。
  • 不存在数据缺失的限制:全部 8 个模型均提供了 12 个预期样本中的 12 个,在四小时的时间窗口内共产生 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • glm-5.3 的平均吞吐量最高,达 89.79 词元/秒,而 nemotron-3-ultra 最低,仅为 32.04 词元/秒;gemma4:31b 紧随 glm-5.3 之后,为 85.95 词元/秒。
  • 波动最显著的是 deepseek-v4-pro(CV 49.5%),其吞吐量在 6.5 至 121.1 词元/秒之间波动,最终收于仅 6.5 词元/秒;glm-5.3 也从 10:00 的 65.18 词元/秒波动至 11:20 的 137.96 词元/秒,随后又回落至 12:40 的 63.38 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均记录了 12 个预期样本中的 12 个,共计 96 个有效数据点,覆盖率达 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强的模型,平均吞吐量为 100.92 词元/秒,而 nemotron-3-ultra 最弱,为 34.15 词元/秒;gemma4:31b 以 90.43 词元/秒紧随其后,minimax-m3 为 83.99 词元/秒。
  • deepseek-v4-pro 表现出对运营影响最为显著的波动性,范围从 8.33 到 121.1 词元/秒,变异系数为 53.3%,呈 82.9% 的上升趋势;nemotron-3-ultra 更加不稳定,变异系数达 73.6%,最低降至 3.26 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均有 12 个样本中的 12 个,数据集记录了 96 个有效数据点,在四小时窗口内覆盖率达到 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • gemma4:31b 以 99.67 词元/秒的平均吞吐量表现最强,而 nemotron-3-ultra 最弱,为 34.15 词元/秒;glm-5.3-flash(52.05 词元/秒)和 deepseek-v4-flash(63.91 词元/秒)也低于整体平均值。
  • 运营层面最显著的波动来自 nemotron-3-ultra(变异系数 67.5%,范围 3.26 至 76.24 词元/秒)和 deepseek-v4-pro(53.4%,范围 8.33 至 121.1 词元/秒),而 glm-5.3 呈现最陡峭的下降趋势,为 -26.2%。
  • 不存在数据缺失的限制:全部八个模型均记录了 12 个预期样本中的 12 个,在四小时窗口内共有 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 88 个数据点 · 覆盖率 91.7%
  • glm-5.3 是最强的模型,平均吞吐量为 107.56 词元/秒,而 nemotron-3-ultra 最弱,平均为 28.08 词元/秒,最新一次读数仅为 3.26 词元/秒。
  • 波动最显著的是 deepseek-v4-pro,其变异系数为 55.8%,波动范围从 8.33 到 107.36 词元/秒,且呈 26.4% 的下降趋势;glm-5.3-flash 呈现类似的 27.0% 降幅,其中包括在 08:00 降至 4.95 词元/秒的低谷。
  • 每个模型在 12 个预期样本中拥有 11 个(91.7% 的覆盖率),96 个有效数据点中保留 88 个,因此每个模型各缺失一个观测值。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强的模型,平均吞吐量为 111.08 词元/秒(峰值 169.24 词元/秒),而 nemotron-3-ultra 最弱,平均为 32.32 词元/秒,波动范围在 5.07 至 76.24 词元/秒之间。
  • 运营层面最显著的波动是 nemotron-3-ultra 的变异系数达 67.0%,在 5.07 至 76.24 词元/秒之间摆动;deepseek-v4-pro 也从 08:40 的 107.36 词元/秒骤降至 09:00 的 11.0 词元/秒,为其在该时间窗口内的最低读数。
  • 不存在数据缺失的限制:全部八个模型均提供了 12 个预期样本中的 12 个,在四小时期间内共产生 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • glm-5.3 是性能最强的模型,平均吞吐量为 107.02 词元/秒,峰值达 169.24 词元/秒;nemotron-3-ultra 是性能最弱的模型,平均为 38.62 词元/秒,最低仅为 5.07 词元/秒。
  • 运营层面最显著的波动是 nemotron-3-ultra 的 65.4% 变异系数和 -49.0% 的趋势,而 glm-5.3-flash 在 08:00 降至 4.95 词元/秒,与其 135.07 词元/秒的峰值形成对比;deepseek-v4-flash 也在 137.88 和 30.21 词元/秒之间大幅波动。
  • 不存在数据缺失的限制:全部 8 个模型均交付了预期 12 个样本中的 12 个,在四小时的时间窗口内共有 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强的模型,平均吞吐量为 114.24 词元/秒(峰值 175.78 词元/秒),而 nemotron-3-ultra 最弱,平均仅 36.38 词元/秒,峰值仅为 83.24 词元/秒。
  • 最显著的趋势是 deepseek-v4-flash 下降了 39.4%,从 03:20 的 135.67 词元/秒降至 07:00 的 45.17 词元/秒;nemotron-3-ultra 也表现出极端波动性,变异系数达 74.7%,在 4.21 至 83.24 词元/秒之间大幅摆动。
  • 不存在数据缺失的限制:全部八个模型均拥有 12 个预期样本中的 12 个,在四小时的时间窗口内共有 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强的模型,平均吞吐量为 109.99 词元/秒,而 nemotron-3-ultra 最弱,平均为 41.06 词元/秒,最低仅为 4.21 词元/秒。
  • nemotron-3-ultra 波动最大,变异系数为 80.3%,在 4.21 至 102.83 词元/秒之间波动,并呈现 65.2% 的上升趋势;glm-5.3-flash 也不稳定(变异系数 45.2%),且下降了 29.8%。
  • 无缺失数据限制:全部 8 个模型均交付了 12 个预期样本中的 12 个,共 96 个有效数据点,在四小时时间窗口内覆盖率达到 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • glm-5.3 是最强的模型,平均吞吐量为 122.79 词元/秒,峰值达 175.78 词元/秒,而 nemotron-3-ultra 最弱,平均为 42.53 词元/秒,最低为 4.21 词元/秒。
  • nemotron-3-ultra 表现出对运行影响最显著的波动性,变异系数为 79.7%,在 4.21 至 102.83 词元/秒之间波动;gemma4:31b、glm-5.3 以及两个 deepseek 变体均在 03:00 UTC 记录到各自时间窗口内的最低值。
  • 不存在数据缺失的限制:全部八个模型均有 12 个样本中的 12 个,数据集报告了 96 个有效数据点,在四小时时间窗口内覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • glm-5.3 的平均吞吐量最高,达 116.37 词元/秒,略微领先于 gemma4:31b 的 114.0 词元/秒,而 nemotron-3-ultra 表现最弱,仅为 34.68 词元/秒,峰值也只有 102.83 词元/秒。
  • deepseek-v4-pro 呈现最急剧的下滑,趋势为 -36.6%,在 02:20 经历 20.75 词元/秒的骤降后收于 18.79 词元/秒;nemotron-3-ultra 波动最大,变异系数为 83.1%,在 7.54 至 102.83 词元/秒之间波动。
  • 不存在数据缺失的限制:全部八个模型均有 12 个样本中的 12 个、96 个有效数据点,在四小时窗口内覆盖率达到 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • 平均吞吐量最强的是 gemma4:31b,达 120.89 词元/秒;最弱的是 nemotron-3-ultra,为 24.48 词元/秒,约为领先者平均值的三分之一不到,接近其五分之一。
  • 运营层面最显著的波动来自 nemotron-3-ultra,其吞吐量在 1.0 至 80.97 词元/秒之间波动,变异系数为 92.8%;glm-5.3 呈现最强的上升趋势,达 +61.8%,收于 138.11 词元/秒。
  • 本时间窗口内不存在数据缺失的限制:全部八个模型均交付了 12 个预期样本中的 12 个,共计 96 个有效数据点,覆盖率为 100.0%,因此没有任何吞吐量结论受到数据缺口的影响。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • gemma4:31b 的平均吞吐量最高,达 121.31 词元/秒,峰值达 179.27 词元/秒,而 nemotron-3-ultra 最弱,平均仅 15.99 词元/秒,且从未超过 46.52 词元/秒。
  • 运营层面最显著的波动来自 nemotron-3-ultra,其变异系数为 105.1%,在 22:40 的 1.0 词元/秒与 00:20 的 46.52 词元/秒之间大幅摆动;glm-5.3-flash 呈现最陡峭的下降趋势,为 -14.7%。
  • 不存在数据缺失的限制:全部八个模型均记录了 12 个预期样本中的 12 个,在四小时的时间窗口内共有 96 个有效数据点,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • gemma4:31b 是最强模型,平均吞吐量为 113.88 词元/秒,而 nemotron-3-ultra 最弱,平均为 9.11 词元/秒,最低为 1.0 词元/秒,最高仅为 40.16 词元/秒。
  • 运营层面最显著的波动性来自 nemotron-3-ultra,其变异系数为 147.6%,吞吐量从 20:20 的 1.37 词元/秒升至 23:40 的 40.16 词元/秒;deepseek-v4-pro 在其他模型中表现出最大的正向趋势,为 30.4%。
  • 不存在数据缺失的限制:全部八个模型均有 12/12 个预期样本,valid_point_count 为 96,覆盖率为 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • 平均吞吐量最强的是 gemma4:31b,达 113.03 词元/秒(范围 68.57 至 163.35 词元/秒);最弱的是 nemotron-3-ultra,为 2.13 词元/秒,峰值仅为 4.8 词元/秒,比领先者低约 53 倍。
  • glm-5.3-flash 波动性最大,变异系数为 40.0%,在 56.29 至 168.33 词元/秒之间波动,且趋势为 -28.1%,尽管最终达到 142.51 词元/秒;deepseek-v4-pro 也在 22:00 降至 23.77 词元/秒。
  • 无缺失数据:全部八个模型均报告 12 个样本中的 12 个、96 个有效数据点,覆盖率为 100.0%;唯一的局限是四小时的时间窗口,无法确认这些模式是否持续存在。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • 平均吞吐量最强的是 glm-5.3,达 106.36 词元/秒,其次是 glm-5.3-flash,为 102.65 词元/秒;最弱的是 nemotron-3-ultra,仅 2.42 词元/秒,远低于次低的 glm-5.2 的 70.48 词元/秒。
  • 运营层面最显著的波动性来自 glm-5.3-flash,在 56.29 至 168.33 词元/秒之间波动,变异系数为 41.9%,而 deepseek-v4-flash 呈现最陡峭的上升趋势,达 +47%,在达到 123.44 词元/秒的峰值后,最终接近 95.75 词元/秒。
  • 不存在数据缺失的限制:全部八个模型均记录了 12 个预期样本中的 12 个、96 个有效数据点,覆盖率为 100%;唯一的约束是四小时的时间窗口本身。
4 小时窗口 · 88 个数据点 · 覆盖率 91.7%
  • glm-5.3-flash 是最强的模型,平均吞吐量为 103.33 词元/秒,略微领先于 glm-5.3 的 103.06 词元/秒;nemotron-3-ultra 最弱,平均仅为 2.76 词元/秒,最大值也只有 5.29 词元/秒。
  • 运营层面最显著的波动来自 glm-5.3-flash,其吞吐量在 55.56 至 168.33 词元/秒之间波动(变异系数 43.9%),而 nemotron-3-ultra 呈现最陡峭的下降趋势,为 -32.0%,最终降至 1.84 词元/秒。
  • 八个模型中的每一个都有 12 个预期样本中的 11 个(91.7% 的覆盖率,88 个有效数据点),因此每个模型缺失一次二十分钟的观测,这限制了区间级别的比较。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • glm-5.3 是平均吞吐量最强的模型,达 94.85 词元/秒(峰值 149.70 词元/秒),而 nemotron-3-ultra 最弱,平均仅 2.65 词元/秒,从未超过 5.29 词元/秒。
  • 波动性是主要的运行信号:gemma4:31b 从 17:20 的 142.49 词元/秒骤降至 18:40 的 19.97 词元/秒,minimax-m3 从 164.79 词元/秒的峰值跌至 20:00 的 26.38 词元/秒;deepseek-v4-pro 的相对波动幅度最大(变异系数 49.6%)。
  • 不存在数据缺失的限制:全部 8 个模型均交付了 12 个预期样本中的 12 个,共有 96 个有效数据点,覆盖率达 100.0%,因此四小时的时间窗口得到了完整呈现。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • glm-5.3-flash 是平均吞吐量最强的模型,达到 93.51 词元/秒,领先于 89.6 词元/秒的 glm-5.3 和 86.2 词元/秒的 minimax-m3;nemotron-3-ultra 最弱,仅为 2.6 词元/秒,远低于倒数第二的 deepseek-v4-pro 的 50.53 词元/秒。
  • 运营层面最显著的变化是 minimax-m3 的下滑,从 16:40 的 164.79 词元/秒峰值到 19:00 的 72.8 词元/秒,趋势为 -37.6%;deepseek-v4-pro 波动幅度最大,变异系数为 52.7%,在 8.89 至 86.06 词元/秒之间波动。
  • 不存在数据缺失的限制:全部八个模型均报告了预期 12 个样本中的 12 个,共 96 个有效数据点,在四小时窗口内覆盖率达到 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • glm-5.3-flash 是最强的模型,平均吞吐量为 93.51 词元/秒,领先于 minimax-m3(87.80 词元/秒)和 gemma4:31b(87.16 词元/秒);nemotron-3-ultra 最弱,平均为 1.96 词元/秒,从未超过 3.72 词元/秒。
  • deepseek-v4-pro 表现出对运营影响最为显著的波动性,变异系数为 57.9%,在 UTC 14:20 达到 92.28 词元/秒的峰值,并在 UTC 18:00 骤降至 8.89 词元/秒;glm-5.3-flash 在整个时间窗口内也下降了 39.0%。
  • 不存在数据缺失的限制:全部八个模型均记录了 12 个样本中的 12 个,共计 96 个有效数据点,在四小时时间窗口内覆盖率达到 100.0%。
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • glm-5.3-flash 是最强的模型,平均吞吐量为 108.11 词元/秒(峰值 165.75 词元/秒),而 nemotron-3-ultra 最弱,平均仅 1.53 词元/秒,在整个时间窗口内从未超过 2.56 词元/秒。
  • deepseek-v4-pro 表现出最具运营意义的波动性,变异系数为 55.0%,在 11.68 至 92.28 词元/秒之间摆动,并呈现 32.3% 的下行趋势,最终收于 14.95 词元/秒;相比之下,deepseek-v4-flash 上升了 67.3%,达到 83.64 词元/秒的峰值。
  • 不存在数据缺失的限制:全部 8 个模型均拥有 12 个预期样本中的 12 个、96 个有效数据点,并且在四小时窗口内覆盖率达到 100.0%。