DASHBOARD

results over the last 7 days — who's slacking?

SPEED LEADERBOARD

mistral/mistral-small-latest 447ms
CHEAP
mistral/mistral-medium-latest 459ms
MID
google/gemini-3.1-flash-lite-preview 569ms
google/gemini-3.1-flash-lite 600ms
CHEAP
mistral/mistral-large-latest 605ms
FLAGSHIP
anthropic/claude-haiku-4-5 700ms
CHEAP
openai/gpt-5.4-mini 740ms
CHEAP
google/gemini-3-flash-preview 1008ms
MID
deepseek/deepseek-v4-flash 1407ms
MID
anthropic/claude-sonnet-4-6 1819ms
MID
anthropic/claude-opus-4-7 1845ms
FLAGSHIP
deepseek/deepseek-v4-pro 1959ms
FLAGSHIP
openai/gpt-5.4 2030ms
MID
openai/gpt-5.5 2379ms
FLAGSHIP
google/gemini-3.1-pro-preview 3547ms
FLAGSHIP

7-DAY UPTIME

anthropic/claude-haiku-4-5 -
CHEAP
anthropic/claude-opus-4-7 -
FLAGSHIP
anthropic/claude-sonnet-4-6 -
MID
deepseek/deepseek-v4-flash -
MID
deepseek/deepseek-v4-pro -
FLAGSHIP
google/gemini-3.1-flash-lite -
CHEAP
google/gemini-3.1-flash-lite-preview -
google/gemini-3.1-pro-preview -
FLAGSHIP
google/gemini-3-flash-preview -
MID
mistral/mistral-large-latest -
FLAGSHIP
mistral/mistral-medium-latest -
MID
mistral/mistral-small-latest -
CHEAP
openai/gpt-5.4 -
MID
openai/gpt-5.4-mini -
CHEAP
openai/gpt-5.5 -
FLAGSHIP

WRONG ANSWERS

% of successful probes where the model did NOT return the expected response · lower is better · daily over 7 days

daily averages in your local timezone · only successful probes