Monthly AI latency report · September 2026

State of AI API latency

Where AI APIs were quick in September, and from where.

6 locations

Amsterdam, San Francisco, Montreal, Singapore, Tokyo, Mumbai

Daily measurements

2,100 requests in the summary

Partial month

14 to 27 September 2026

Time to first token

Typical and p95, never averages

Published 27 September 2026

3 things we learned in September

  1. 1

    Provider choice mattered more than location

    With the same low-effort request, ChatGPT took 1,025 ms and Grok 2,495 ms, a 1,470 ms gap. Moving between cities changed any one of them by 658 ms at most.

  2. 2

    DeepSeek answered quickest from Asia

    From Singapore, Tokyo and Mumbai it took 569 ms, against 735 ms from our other cities: 23% quicker.

  3. 3

    The network was a small part of the wait

    Reaching the server took 12 to 19 ms, never more than 6% of the time to first token. The rest was the model.

September at a glance

APITypical TTFTp95 TTFTSpread
ChatGPT (Low reasoning effort)1,025 ms2,055 ms1.8×
Claude (Low reasoning effort)1,343 ms2,105 ms1.2×
DeepSeek (Reasoning turned off)698 ms937 ms1.4×
Grok (Low reasoning effort)2,495 ms4,136 ms1.2×
Mistral (Provider default settings)344 ms525 ms1.8×

* Low reasoning effort

** Provider default settings

*** Reasoning turned off

Daily typical TTFT

Daily typical time to first token, 1 September 2026 to 27 September 2026. Each point is the median of an API's test locations that day.
01000200030004000 ms1 Sept27 Sept23901109896699302
Show the numbers
DayChatGPTClaudeDeepSeekGrokMistral
1 September 20261127 ms1223 ms—2675 ms—
2 September 20261016 ms1517 ms—2669 ms—
3 September 20261047 ms1491 ms—2198 ms—
4 September 2026850 ms1463 ms—2998 ms—
5 September 2026939 ms1297 ms714 ms2758 ms—
6 September 2026951 ms1400 ms493 ms2524 ms—
7 September 20261355 ms1509 ms617 ms2558 ms—
8 September 2026986 ms1278 ms538 ms1752 ms388 ms
9 September 2026998 ms2097 ms434 ms2268 ms340 ms
10 September 20261179 ms1996 ms781 ms3061 ms312 ms
11 September 20261319 ms1317 ms611 ms2874 ms362 ms
12 September 20261124 ms1414 ms645 ms1837 ms331 ms
13 September 20261211 ms1421 ms676 ms2938 ms327 ms
14 September 20261403 ms1390 ms802 ms2519 ms350 ms
15 September 20261336 ms1383 ms902 ms2573 ms361 ms
16 September 20261207 ms1308 ms733 ms2633 ms330 ms
17 September 20261000 ms1824 ms594 ms2518 ms370 ms
18 September 20261393 ms1811 ms732 ms2961 ms353 ms
19 September 20261089 ms1300 ms630 ms2828 ms316 ms
20 September 2026997 ms1320 ms619 ms2456 ms361 ms
21 September 2026918 ms1774 ms700 ms2792 ms322 ms
22 September 2026962 ms1715 ms638 ms2616 ms362 ms
23 September 20261192 ms1328 ms667 ms2485 ms345 ms
24 September 20261020 ms1259 ms647 ms2636 ms376 ms
25 September 20261111 ms1310 ms558 ms1445 ms345 ms
26 September 2026729 ms1173 ms655 ms1931 ms349 ms
27 September 2026896 ms1109 ms699 ms2390 ms302 ms

Geography this month

Typical time to first token in milliseconds, by provider and test location
AmsterdamSan FranciscoMontrealSingaporeTokyoMumbai
ChatGPT1,0509708271,1739991,485
Claude1,2951,2941,2451,5001,3901,486
DeepSeek735742709546569687
Grok2,5932,2292,3302,6122,4712,519
Mistral242349295380430338
Typical TTFT in ms. Compared with each API's fastest location:

Deep dive of the month

DeepSeek direct or via OpenRouter?

Asia favored direct. Montreal favored OpenRouter.

Read the full comparison →

How we measure: same one-line prompt · streaming · first visible token · typical and p95, not averages · 6 locations

Methodology →

Follow AI latency over time

A new report every month. All reports →