al-Qantara
Observatório

A adoção de IA, em números.

Cada dimensão é um ensaio curto de dados a partir de uma fonte pública — com o gráfico, a história por trás dele e a conta aberta de como o número foi obtido. Escolha uma dimensão para explorar.

Escolha uma dimensão…

Capacidades

Do texto ao trabalho: o que a IA já sabe fazer

0%mais barato

Para igualar o GPT-4 no GPQA Diamond, o preço por token de saída caiu de US$60 para US$2,19 por milhão — mesma prova, quase 30× mais barato, em menos de dois anos.

Em pouco mais de três anos, os modelos saltaram de 'completar frases' para resolver problemas de pós-graduação, fechar issues de código sozinhos e sustentar empresas de dezenas de bilhões. Esta dimensão mede esse salto em três lentes — o que eles sabem, o que conseguem executar, e quanto isso já move de dinheiro — e termina no exame feito para ser imbatível.

Capacidade cognitiva — por ano e por preço

Cada ponto é um modelo de fronteira: quando saiu (eixo horizontal), quanto acertou no GPQA Diamond — questões de pós-graduação 'à prova de Google' (eixo vertical) — e em que faixa de preço joga (a cor). O teto sobe e, ao mesmo tempo, os pontos mais claros mostram a mesma inteligência ficando barata: a DeepSeek-R1 entregou 71% a US$2 o milhão de tokens.

  • 2023-03GPT-435.7%US$60/M
  • 2024-03Claude 3 Opus50.4%US$75/M
  • 2024-05GPT-4o53.6%US$10/M
  • 2024-06Claude 3.5 Sonnet59.4%US$15/M
  • 2024-12o178%US$60/M
  • 2025-02Claude 3.7 Sonnet78.2%US$15/M
  • 2025-03Gemini 2.5 Pro84%US$10/M
  • 2025-08GPT-588.4%US$10/M
  • 2025-11Gemini 3 Pro91.9%US$12/M
  • 2026-02Gemini 3.1 Pro94.1%US$12/M

O que esse gráfico conclui

O eixo vertical é o acerto no GPQA Diamond (100% = gabaritar). Em 2023 o GPT-4 fazia 36% a US$60/M tokens; a DeepSeek-R1 logo fazia 71% — o dobro — a US$2.19. Daí o grande número: superar o GPT-4 ficou 96% mais barato. Capacidade sobe, preço desaba.

Método
GPQA Diamond (198 questões de pós-graduação, 'à prova de Google'), score oficial pass@1 na data de lançamento. Preço = tabela de saída do provedor (US$/M tokens); cor = faixa de preço, linha = recorde acumulado.
Fonte
Epoch AI — GPQA Diamond
Snapshot de
05 de julho de 2026

Capacidade agêntica — resolver, não só responder

Responder bem é uma coisa; executar uma tarefa de ponta a ponta é outra. O SWE-bench Verified mede exatamente isso: 500 issues reais de GitHub que o modelo tem de resolver mexendo no repositório até os testes passarem. Em menos de dois anos, a fronteira saiu de um terço para quase tudo.

  1. 2024-08GPT-4o
    33%
  2. 2024-103.5 Sonnet
    49%
  3. 2025-023.7 Sonnet
    62.3%
  4. 2025-05Opus 4
    72.5%
  5. 2025-08GPT-5
    74.9%
  6. 2025-11Gemini 3
    76.2%
  7. 2025-11Opus 4.5
    80.9%
  8. 2026-04Opus 4.7
    87.6%
  9. 2026-06Fable 5 👑
    95%

Claude Fable 5 nas três suítes agênticas hoje

  • SWE-bench Verifiedcódigo de ponta a ponta
    95
  • Terminal-Bench 2.1tarefas no terminal
    88
  • τ-benchatendimento com ferramentas
    89,2
Método
SWE-bench Verified: 500 issues reais do GitHub resolvidas de ponta a ponta (editar o repo até os testes passarem) — o padrão de capacidade agêntica de código. Escada = recorde por data; barras = líder atual em três suítes. Nota: em 2026 um estudo de Berkeley mostrou que essas suítes podem ser 'gameadas' — leia como tendência.
Fonte
SWE-bench (leaderboard oficial)
Snapshot de
05 de julho de 2026

A economia por trás — quem fatura, e quanto

Capacidade virou receita numa velocidade sem precedente. A OpenAI abriu a década na frente, mas em 2026 a Anthropic cruzou a curva — puxada pelo uso corporativo de código. Os números são run-rate anualizado (o mês vezes doze), reportados pelas empresas e pela imprensa.

US$0 biUS$7,5 biUS$15 biUS$22,5 biUS$30 bi202420252026
OpenAIAnthropic

Valuation na última rodada

US$852 biOpenAI · 2026
US$965 biAnthropic · mai/2026

O fim da régua

Humanity's Last Exam — o exame feito para ser imbatível

Quando os modelos passaram a gabaritar provas como o MMLU, os benchmarks perderam a graça: não dava mais para medir quem estava na frente. A resposta, lançada em janeiro de 2025 pelo Center for AI Safety com a Scale AI, foi montar a prova mais difícil que a humanidade conseguisse escrever.

Como ele é feito

  1. 1Cerca de mil especialistas de mais de 500 instituições enviaram mais de 70 mil questões nas suas áreas — da topologia à virologia.
  2. 2Cada questão só entra se os melhores modelos da época erram: as fáceis são descartadas na hora, num filtro adversarial contra a própria fronteira.
  3. 3As sobreviventes passam por duas rodadas de revisão por pares até sobrarem 3 mil — 2.500 públicas e 500 secretas, para flagrar quem 'decorou' o teste.
  4. 4São de resposta fechada (76% resposta curta exata, 24% múltipla escolha; ~14% exigem imagem), então dá para corrigir automaticamente e comparar de forma justa.

Melhor score ao longo do tempo (%)

  • 2025-01o1
    8%
  • 2025-04o3
    17%
  • 2025-08GPT-5
    25.3%
  • 2025-11Gemini 3 Pro
    37.5%
  • 2026-02Gemini 3.1 Pro
    45%
  • 2026-06Fable 5
    53.3%

Os primeiros modelos acertavam 3% a 8%. Dezoito meses depois, a fronteira passou da metade — num exame desenhado para não ser vencido tão cedo. É esse o ritmo que esta dimensão tenta capturar.

Método
Center for AI Safety (CAIS) + Scale AI. 3.000 questões (2.500 públicas + 500 secretas) em 100+ disciplinas, filtradas contra a fronteira. Lançado em 24/01/2025.
Fonte
Humanity's Last Exam (CAIS + Scale AI)
Snapshot de
05 de julho de 2026

Explore as dimensões