4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
- deepseek-v4.1-flash 是平均吞吐量最强的模型,达 161.69 词元/秒(p95 为 228.39 词元/秒),而 nemotron-3-ultra 最弱,平均仅 24.56 词元/秒,峰值也仅为 52.47 词元/秒。
- 运维层面最显著的变化是 gemma4:31b 从 00:20 的 159.5 词元/秒持续下降至 04:00 的 42.72 词元/秒,呈 35% 的下行趋势,其最后三个采样点分别为 73.48、103.13、56.64 和 42.72 词元/秒。glm-5.2 同样表现出极大的波动性,范围在 13.44 至 195.72 词元/秒之间,变异系数达 70.5%。
- 不存在数据缺失的限制:全部八个模型在四小时窗口内均获得了 12 个预期采样中的 12 个,共 96 个有效数据点,覆盖率为 100.0%。