Ollama Cloud 性能监控

每 20 分钟测试一次输出词元吞吐量

8/8 个模型监控中
gemma4:31b
145.7
输出词元/秒
123 个词元 · 请求 1.2 秒
minimax-m3
62.5
输出词元/秒
160 个词元 · 请求 2.7 秒
glm-5.2
74.9
输出词元/秒
160 个词元 · 请求 2.3 秒
glm-5.3
60.8
输出词元/秒
160 个词元 · 请求 2.8 秒
glm-5.3-flash
137.7
输出词元/秒
160 个词元 · 请求 1.3 秒
deepseek-v4-pro
107.4
输出词元/秒
160 个词元 · 请求 1.6 秒
deepseek-v4.1-flash
74.7
输出词元/秒
160 个词元 · 请求 2.3 秒
nemotron-3-ultra
16.3
输出词元/秒
160 个词元 · 请求 10.0 秒

每小时性能洞察

滚动四小时、二十分钟粒度数据集分析

AI 生成 · 每小时
4 小时窗口 · 96 个数据点 · 覆盖率 100.0%
  • deepseek-v4.1-flash 是最强的模型,平均速度为 184.46 词元/秒(峰值达 235.93 词元/秒),而 nemotron-3-ultra 最弱,平均速度仅为 25.54 词元/秒,从未超过 52.47 词元/秒。
  • glm-5.2 表现出对运行影响最大的波动性,变异系数为 64.2%,在四小时内速度在 10.78 至 96.62 词元/秒之间摆动;nemotron-3-ultra 同样不稳定,变异系数为 57.9%。
  • 不存在数据缺失的限制:全部八个模型均报告了 12 个预期样本中的 12 个,在整个期间共有 96 个有效数据点,覆盖率为 100.0%。
查看完整洞察记录 →

过去 24 小时

过去 24 小时的词元吞吐量