Tony Nguyen · výzkumná poznámka · 3. 8. 2026

Skvělý na papíře. Skvělý pro tvůj úkol?

3. 8. 2026Souvisí: Placená předplatná pro AI agentyRead in English

Žebříček říká, kdo vyhrál jeho měření. Ne tvoje. GPT-5 je ukázka: nahoře v capability benchmarcích, výrazně níž ve slepém porovnávání lidmi — zdokumentoval to i samotný Scale AI (firma, jejíž neutralita je kapitola sama o sobě). Než vsadíš na model, zjisti, kdo ho vlastně měří. Když jsem porovnával předplatná pro coding agenty, nechal jsem tuhle otázku záměrně otevřenou. Tohle není žebříček. Je to mapa — čtyři velké hráči, kteří modely měří a řadí, a co přesně měří. Žádný z nich není „ten správný". Každý měří něco jiného, jinak, a za jiným účelem.

Čtyři giganti, čtyři různé pravdy

  1. Artificial AnalysisOtevřít

    Co měří: kvalita (Intelligence Index) · cena $/1M tokenů · rychlost a latence

    Nezávislá analýza modelů i API providerů — kvalita, cena, rychlost. Na tuhle stránku jsem na ni odkázal jako na zdroj kvality už v první poznámce.

  2. ArenaOtevřít

    Co měří: crowdsourced slepé souboje → Elo/Bradley-Terry hodnocení

    Dřív Chatbot Arena / LMArena z Berkeley (2023), dnes firma za $1,7 mld (1/2026). Coding žebříček k 1. 8. 2026: 1,56 mil. hlasů přes 379 modelů. Nově prodává „AI Evaluations" přímo vendorům.

  3. Vals AIOtevřít

    Co měří: enterprise evaly · souhrnný Vals Index (finance, coding, právo…)

    Startup prodávající hodnocení pro firmy. Jejich Vals Index k 1. 8. 2026 vede Claude Fable 5 se 75,14 %.

  4. Epoch AIOtevřít

    Co měří: databáze modelů · tréninkový compute · FrontierMath (v2, 338 úloh)

    Sám sebe popisuje jako nezávislou neziskovku. Notable AI Models (3 500+ modelů od 1950), odhady compute, matematický benchmark FrontierMath. Financovaný granty i zakázkovými evaly (OpenAI, DeepMind, xAI).

Záměrně tu chybí SWE-bench, Terminal-bench, SEAL, HELM, LiveBench nebo žebříčky OpenRouter. To jsou spíš jednotlivé benchmarky a tržní signály než agregátoři — a hlavně: to je téma samostatné poznámky o benchmarcích pro coding agenty, kterou připravuju.

Pravidlo je jednoduché: leaderboard je vždycky něčí měření. Než uvěříte číslu, zjistěte, kdo ho měří, jak, a co z toho má.

Data ověřená z veřejných stránek jednotlivých hráčů k 3. 8. 2026.