4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
- glm-5.3 是最强模型,平均输出吞吐量为 129.58 词元/秒,领先于 124.19 词元/秒的 gemma4:31b;nemotron-3-ultra 最弱,平均为 37.83 词元/秒,从未超过 75.69 词元/秒。
- deepseek-v4.1-flash 表现出对运营影响最大的波动性,变异系数为 60.6%,波动范围从 19.01 到 185.99 词元/秒;glm-5.3 在整个时间窗口内也下降了 22.0%,最终为 63.23 词元/秒,而其峰值为 178.26 词元/秒。
- 不存在数据缺失的限制:全部 8 个模型均交付了 12 个预期样本中的 12 个,共计 96 个有效数据点,覆盖率为 100.0%,但四小时的时间窗口限制了对更长期情况的评估。