Ollama Cloud 性能监控

每 5 分钟测试一次输出词元吞吐量

6/6 个模型监控中
gemma4:31b
40.9
输出词元/秒
125 个词元 · 请求 3.2 秒
minimax-m3
44.2
输出词元/秒
160 个词元 · 请求 3.8 秒
glm-5.2
63.4
输出词元/秒
160 个词元 · 请求 2.7 秒
deepseek-v4-pro
92.2
输出词元/秒
160 个词元 · 请求 1.9 秒
deepseek-v4-flash
106.7
输出词元/秒
160 个词元 · 请求 1.7 秒
nemotron-3-ultra
50.9
输出词元/秒
160 个词元 · 请求 3.3 秒

每小时性能洞察

GLM-5.2 对滚动四小时、五分钟粒度数据集的分析

AI 生成 · 每小时
4 小时窗口 · 288 个数据点 · 覆盖率 100.0%

在四小时的时间窗口内,deepseek-v4-flash 实现了最强的平均吞吐量,达到 103.84 词元/秒,而 nemotron-3-ultra 最弱,为 45.14 词元/秒。最具运营意义的波动出现在 glm-5.2 中,该模型从 216.98 词元/秒的峰值急剧下降至 04:30 时的 13.59 词元/秒,反映出 53.4% 的变异系数。该数据集包含跨六个模型的 288 个有效观测值,相当于每个模型 48 个预期样本的恰好 100.0% 覆盖率,这意味着没有需要报告的缺失数据限制。

查看完整洞察记录 →

过去 24 小时

过去 24 小时的词元吞吐量