4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
- deepseek-v4-flash 是最强的模型,平均吞吐量为 114.27 词元/秒,领先于 deepseek-v4-pro(107.36 词元/秒)和 gemma4:31b(105.74 词元/秒);nemotron-3-ultra 最弱,平均为 2.67 词元/秒,从未超过 3.94 词元/秒。
- 运营层面最显著的变化是 minimax-m3 在整个时间窗口内下降了 38.6%,从 00:40 的 120.57 词元/秒峰值降至 04:00 的 37.39 词元/秒;deepseek-v4-flash 也在 43.15 至 192.88 词元/秒之间大幅波动。
- 不存在数据缺失的限制:全部八个模型均报告了 12 个预期样本中的 12 个,在四小时的时间窗口内共计 96 个有效数据点,覆盖率为 100.0%。