4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
- gemma4:31b 是性能最强的模型,平均吞吐量为 123.66 词元/秒,而 nemotron-3-ultra 是性能最弱的模型,平均为 26.74 词元/秒,两者差距约为 4.6 倍。
- glm-5.3 的波动性对运营影响最大,在 05:20 的 183.18 词元/秒与 06:00 的 16.28 词元/秒之间波动,变异系数为 46.6%;deepseek-v4-flash 同样不稳定,为 53.1%。
- 不存在数据缺失的限制:所有 8 个模型均有 12 个样本中的 12 个,valid_point_count 为 96,在四小时时间窗口内覆盖率为 100.0%。