A adoção de IA, em números.
Cada dimensão é um ensaio curto de dados a partir de uma fonte pública — com o gráfico, a história por trás dele e a conta aberta de como o número foi obtido. Escolha uma dimensão para explorar.
Escolha uma dimensão…
Capacidades
Do texto ao trabalho: o que a IA já sabe fazer
Para igualar o GPT-4 no GPQA Diamond, o preço por token de saída caiu de US$60 para US$2,19 por milhão — mesma prova, quase 30× mais barato, em menos de dois anos.
Em pouco mais de três anos, os modelos saltaram de 'completar frases' para resolver problemas de pós-graduação, fechar issues de código sozinhos e sustentar empresas de dezenas de bilhões. Esta dimensão mede esse salto em três lentes — o que eles sabem, o que conseguem executar, e quanto isso já move de dinheiro — e termina no exame feito para ser imbatível.
Capacidade cognitiva — por ano e por preço
Cada ponto é um modelo de fronteira: quando saiu (eixo horizontal), quanto acertou no GPQA Diamond — questões de pós-graduação 'à prova de Google' (eixo vertical) — e em que faixa de preço joga (a cor). O teto sobe e, ao mesmo tempo, os pontos mais claros mostram a mesma inteligência ficando barata: a DeepSeek-R1 entregou 71% a US$2 o milhão de tokens.
- 2023-03GPT-435.7%US$60/M
- 2024-03Claude 3 Opus50.4%US$75/M
- 2024-05GPT-4o53.6%US$10/M
- 2024-06Claude 3.5 Sonnet59.4%US$15/M
- 2024-12o178%US$60/M
- 2025-02Claude 3.7 Sonnet78.2%US$15/M
- 2025-03Gemini 2.5 Pro84%US$10/M
- 2025-08GPT-588.4%US$10/M
- 2025-11Gemini 3 Pro91.9%US$12/M
- 2026-02Gemini 3.1 Pro94.1%US$12/M
O que esse gráfico conclui
O eixo vertical é o acerto no GPQA Diamond (100% = gabaritar). Em 2023 o GPT-4 fazia 36% a US$60/M tokens; a DeepSeek-R1 logo fazia 71% — o dobro — a US$2.19. Daí o grande número: superar o GPT-4 ficou 96% mais barato. Capacidade sobe, preço desaba.
- Método
- GPQA Diamond (198 questões de pós-graduação, 'à prova de Google'), score oficial pass@1 na data de lançamento. Preço = tabela de saída do provedor (US$/M tokens); cor = faixa de preço, linha = recorde acumulado.
- Fonte
- Epoch AI — GPQA Diamond
- Snapshot de
- 05 de julho de 2026
Capacidade agêntica — resolver, não só responder
Responder bem é uma coisa; executar uma tarefa de ponta a ponta é outra. O SWE-bench Verified mede exatamente isso: 500 issues reais de GitHub que o modelo tem de resolver mexendo no repositório até os testes passarem. Em menos de dois anos, a fronteira saiu de um terço para quase tudo.
- 2024-08GPT-4o33%
- 2024-103.5 Sonnet49%
- 2025-023.7 Sonnet62.3%
- 2025-05Opus 472.5%
- 2025-08GPT-574.9%
- 2025-11Gemini 376.2%
- 2025-11Opus 4.580.9%
- 2026-04Opus 4.787.6%
- 2026-06Fable 5 👑95%
Claude Fable 5 nas três suítes agênticas hoje
- SWE-bench Verifiedcódigo de ponta a ponta95
- Terminal-Bench 2.1tarefas no terminal88
- τ-benchatendimento com ferramentas89,2
- Método
- SWE-bench Verified: 500 issues reais do GitHub resolvidas de ponta a ponta (editar o repo até os testes passarem) — o padrão de capacidade agêntica de código. Escada = recorde por data; barras = líder atual em três suítes. Nota: em 2026 um estudo de Berkeley mostrou que essas suítes podem ser 'gameadas' — leia como tendência.
- Fonte
- SWE-bench (leaderboard oficial)
- Snapshot de
- 05 de julho de 2026
A economia por trás — quem fatura, e quanto
Capacidade virou receita numa velocidade sem precedente. A OpenAI abriu a década na frente, mas em 2026 a Anthropic cruzou a curva — puxada pelo uso corporativo de código. Os números são run-rate anualizado (o mês vezes doze), reportados pelas empresas e pela imprensa.
Valuation na última rodada
O fim da régua
Humanity's Last Exam — o exame feito para ser imbatível
Quando os modelos passaram a gabaritar provas como o MMLU, os benchmarks perderam a graça: não dava mais para medir quem estava na frente. A resposta, lançada em janeiro de 2025 pelo Center for AI Safety com a Scale AI, foi montar a prova mais difícil que a humanidade conseguisse escrever.
Como ele é feito
- 1Cerca de mil especialistas de mais de 500 instituições enviaram mais de 70 mil questões nas suas áreas — da topologia à virologia.
- 2Cada questão só entra se os melhores modelos da época erram: as fáceis são descartadas na hora, num filtro adversarial contra a própria fronteira.
- 3As sobreviventes passam por duas rodadas de revisão por pares até sobrarem 3 mil — 2.500 públicas e 500 secretas, para flagrar quem 'decorou' o teste.
- 4São de resposta fechada (76% resposta curta exata, 24% múltipla escolha; ~14% exigem imagem), então dá para corrigir automaticamente e comparar de forma justa.
Melhor score ao longo do tempo (%)
- 2025-01o18%
- 2025-04o317%
- 2025-08GPT-525.3%
- 2025-11Gemini 3 Pro37.5%
- 2026-02Gemini 3.1 Pro45%
- 2026-06Fable 553.3%
Os primeiros modelos acertavam 3% a 8%. Dezoito meses depois, a fronteira passou da metade — num exame desenhado para não ser vencido tão cedo. É esse o ritmo que esta dimensão tenta capturar.
- Método
- Center for AI Safety (CAIS) + Scale AI. 3.000 questões (2.500 públicas + 500 secretas) em 100+ disciplinas, filtradas contra a fronteira. Lançado em 24/01/2025.
- Fonte
- Humanity's Last Exam (CAIS + Scale AI)
- Snapshot de
- 05 de julho de 2026