gemma4:31b
40.9
输出词元/秒
125 个词元 · 请求 3.2 秒
每 5 分钟测试一次输出词元吞吐量
GLM-5.2 对滚动四小时、五分钟粒度数据集的分析
在四小时的时间窗口内,deepseek-v4-flash 实现了最强的平均吞吐量,达到 103.84 词元/秒,而 nemotron-3-ultra 最弱,为 45.14 词元/秒。最具运营意义的波动出现在 glm-5.2 中,该模型从 216.98 词元/秒的峰值急剧下降至 04:30 时的 13.59 词元/秒,反映出 53.4% 的变异系数。该数据集包含跨六个模型的 288 个有效观测值,相当于每个模型 48 个预期样本的恰好 100.0% 覆盖率,这意味着没有需要报告的缺失数据限制。