~/beer-and-code
▪ próximo evento Workshop: Loop Engineering — Pare de Ser o Operador do Agente · 19 Ago · 19h (horário de Brasília) — duração de 2 a 4 horas, ao vivo via Google Meet garantir vaga
~ / noticias / gpt-5-6-sol-ultrafast $
Notícias

GPT-5.6 Sol Ultrafast: 750 tokens/s na Cerebras, 11x mais rápido que o Fable 5

LS Lucas Souza · · 10 min de leitura
GPT-5.6 Sol Ultrafast: 750 tokens/s na Cerebras, 11x mais rápido que o Fable 5

Não é modelo novo. É o mesmo Sol em outro chip

A OpenAI não lançou um modelo novo em 13/08/2026.

Lançou o mesmo GPT-5.6 Sol rodando num chip do tamanho de um prato. Mesma inteligência, mesma janela de contexto, mesma qualidade. Só que os tokens saem a 750 por segundo.

O nome é GPT-5.6 Sol Ultrafast. Não é modelo, não é modo de raciocínio — é um tier de inferência, no Wafer-Scale Engine da Cerebras em vez de GPU. É o tipo de lançamento que separa quem lê o anúncio de quem lê a nota de rodapé: manchete de dois fabricantes com números diferentes, benchmark rodado pelo próprio fornecedor e zero preço publicado. Vamos separar o verificável do marketing e ver onde essa velocidade vira dinheiro.

TL;DR

  • O que é: tier de inferência do GPT-5.6 Sol em hardware Cerebras (CS-3), com até 750 tokens de saída por segundo. Não é modelo novo.
  • Muda o quê: só a velocidade. Inteligência, contexto de ~1M de tokens e qualidade seguem iguais.
  • Acesso: limited preview, por convite, formulário em /openai-ultrafast-signup. Clientes de lançamento: Jane Street, Basis, Rogo e Podium.
  • Custo: não divulgado. Sem tarifa, cota, região, SLA ou compromisso mínimo.
  • Fontes primárias: blog da Cerebras e o anúncio da OpenAI, "Previewing Ultrafast mode: GPT-5.6 Sol at up to 14X the speed" — página que devolveu 403 e foi reconstruída por secundárias convergentes.

Sol, Ultra e Ultrafast: três coisas diferentes com nomes parecidos

Sol é o modelo. $5 por 1M de input e $30 por 1M de output, janela de ~1 milhão de tokens. (Tem revendedor circulando $7/$43 — ignore, é markup.)

Ultra é um modo de raciocínio e orquestração, não um modelo: quatro subagents cooperando em paralelo, coordenados pelo próprio Sol. O GPT-5.6 Sol Ultra no Codex explica a mecânica e por que ele queima mais tokens por tarefa.

Ultrafast é um tier de inferência. Muda o hardware embaixo, não o cérebro em cima.

Resumindo: o ultra muda quanto o modelo pensa; o Ultrafast muda quão rápido ele fala. Um tem preço publicado por token. O outro ainda não disse quanto custa.

E é aí que mora a decisão real. Comprar latência é pagar prêmio sobre um insumo que você já usa — isso não se resolve com benchmark, se resolve com conta de margem e desenho de arquitetura. Essa conversa, com CTO, PM e dono de SaaS olhando a mesma planilha, é o que rola toda semana no Clã Beer and Code — porque, com IA no meio, a stack deixou de ser o problema e a decisão virou de produto.

GPT-5.6 Sol Ultrafast a 750 tok/s: dois números de manchete, dois baselines diferentes

A OpenAI anunciou "até 14X". O baseline é o próprio Sol em modo Standard, que roda a ~53 tokens/s. Faça a conta: 53 × 14 ≈ 750.

A Cerebras anunciou "11x mais rápido que o Fable 5" e "5x mais rápido que o Opus 4.8 em modo Fast". Baseline diferente: concorrente, não ele mesmo.

Os dois são reais e medem coisas diferentes. Mas o 11x tem uma ressalva que quase ninguém reproduziu: o texto literal da Cerebras é "compared with output speeds reported by Artificial Analysis" para os modelos da Anthropic. Não houve teste pareado. Não invalida o dado. Muda o que ele é.

Os benchmarks reforçam a dúvida:

  • GDP-Val: 5,6x end-to-end, "with no quality loss"rodado pela própria Cerebras em 31/07/2026.
  • HLE: 2.500 questões em 11h11 (Sol Ultrafast) contra 78h27 (Fable 5). Só que o Sol foi medido em 10/07 e o Fable entre 13 e 15/07 — dias diferentes, carga desconhecida.

E o HLE tem um problema estrutural que o woadwarrior01, no Hacker News, cravou melhor que qualquer press release: responder 2.500 questões independentes é embarrassingly parallel. Wall-clock ali mede quanta capacidade você alocou, não quão rápido o chip é. O contraponto honesto, do rpdillon: "750t/s tells the story".

Regra prática: cite o 750 tok/s, trate o 11h11 vs 78h27 com pinça. Nenhum avaliador independente mediu o Ultrafast até hoje.

Wafer-Scale Engine: 44 GB de SRAM e o gargalo que muda de lugar

Numa GPU, os pesos vivem na HBM e são puxados para o compute a cada token — banda de memória é o gargalo. No WSE-3 (4 trilhões de transistores, ~125 petaflops), os pesos ficam nos 44 GB de SRAM on-chip. Sem ida e volta. Daí a velocidade.

Só que 44 GB é pouco para contexto longo. philipportner, no HN, fez a matemática que a Cerebras não fez:

"You'd need hundreds of GB alone for the KV cache of each user. For something like LLama 3 405B you need ~67GB at ~130k tokens. A single CS-3 has 44GB on-chip sram."

Traduzindo: o KV cache de um usuário com contexto longo já não cabe. O modelo anuncia 1M de janela; a memória rápida tem 44 GB. O "up to" de "up to 750 tokens/s" está fazendo trabalho pesado. Ninguém publicou a curva de velocidade × contexto — é essa a pergunta que você faz antes de assinar contrato.

O que segura o produto de pé é a arquitetura não ser "tudo na Cerebras". É híbrida: prefill em AWS Trainium, decode no CS-3, via Elastic Fabric Adapter — a inferência desagregada anunciada por AWS e Cerebras em 13/03/2026. A parte que come memória sai do wafer. Alivia, não elimina.

▪ Clã Beer and Code

Não só acompanhe as novidades — domine. Engenharia de IA na prática, ao vivo, toda semana, na maior comunidade do Brasil.

Entrar no Clã

Limited preview: quem entra e por que não tem preço

Acesso é por convite. Clientes de lançamento: Jane Street, Basis, Rogo e Podium — trading e fintech. A Cerebras promete expandir "conforme a capacidade crescer" e mantém um formulário em /openai-ultrafast-signup: não é waitlist com garantia de entrada, é fila de qualificação. E vale ser honesto — este produto não foi desenhado para o dev PHP/Laravel médio. Como resumiu o btown no HN, existem indústrias que pagam múltiplos absurdos sobre a tarifa de API por latência baixa. Você não é uma delas.

O preço vai doer por engenharia, não por ganância. Em GPU, o batching dilui custo fixo entre muitos usuários. Na Cerebras, a banda entre chips é de ~150 GB/s contra ~2 TB/s do NVLink — nas palavras do porridgeraisin, dá para fazer batching, "but that would just service more users at lower token/s each without any amortization of fixed cost". Cada usuário rápido ocupa a máquina. A única âncora pública é o tier Fast: 2x o Standard por até 2,5x de velocidade. Como alerta o explainx, nenhum número por token do Ultrafast circulando hoje é confiável.

Contexto: isso é a ponta comercial de um contrato de mais de US$ 10 bilhões entre OpenAI e Cerebras, de janeiro. ⚠️ A cifra de "US$ 20 bi" que circula é imprensa não confirmada.

Onde velocidade vira dinheiro (e onde não vira)

A conta que importa não é tokens por segundo. É tempo por tarefa concluída. E o caso onde a matemática fecha é agente em loop longo — 40 chamadas sequenciais de 800 tokens de saída cada:

# Conta de guardanapo — só a geração, ignorando prefill e overhead de rede
passos          = 40
tokens_por_passo = 800

standard  = passos * tokens_por_passo / 53    # ~604 s  -> 10 min
ultrafast = passos * tokens_por_passo / 750   # ~43 s

# 10 minutos de espera viram 43 segundos.
# O ganho só existe porque as chamadas são SEQUENCIAIS.

Se fossem paralelas, você resolveria o mesmo com concorrência em GPU e fatura menor. A latência só vira dinheiro quando a próxima decisão depende do token anterior: incidente com o outage acontecendo, pesquisa financeira interativa, IA de voz, suporte multi-step — os casos que a OpenAI nomeou. Jeffrey Wang, pesquisador da OpenAI, resume o efeito: a tarefa "finishes for me before I even have the opportunity to context-switch".

Agora o takeaway que o anúncio não te dá. sixtyj, no HN:

"Compilation time will be a genuine bottleneck for slop coding if this becomes the standard generation rate."

Se o modelo cospe 750 tok/s, o composer install, o build e a suíte de testes viram a nova fila. Velocidade de geração não é velocidade de entrega. Meça quanto do seu ciclo de agente é modelo e quanto é pipeline. Na maioria dos times, o modelo já não é o gargalo há tempos.

Limitações e pontos de atenção

Onde você se queima:

  • Nenhum benchmark é independente. GDP-Val e HLE foram rodados pela Cerebras, em datas diferentes por modelo, sob o disclaimer verbatim da casa: "Performance comparisons are based on third-party benchmarking or internal testing."
  • Contexto longo e 750 tok/s provavelmente não coexistem. 44 GB de SRAM contra 1M de janela, e ninguém publicou a curva velocidade × contexto.
  • Sem preço, sem SLA, sem GA, sem model ID público — e sem economia de batching: a conta unitária tende a ser pior que GPU por design.
  • Velocidade por token ≠ tempo por tarefa. O aetherspawn levantou no HN a hipótese (não medida) de que o Sol gasta 10–100x menos tokens de saída que o Fable na mesma tarefa. Se procede, o "11x" mede a coisa errada duas vezes — mesma lógica de preço por token não ser preço por tarefa.
  • Omissão apontada, não verificada: o ricardobeat cita o Mimo v2.5-Pro Ultraspeed, de junho, com ~1000 tok/s por menos de 1/10 do custo. Nenhuma primária menciona.
  • Lacuna aberta: ninguém disse se o Ultrafast combina com o modo ultra. É a pergunta mais óbvia do lançamento e as duas primárias estão em silêncio.

FAQ

O Ultrafast é mais inteligente que o Sol normal? Não. Mesmo modelo, mesma janela, mesmo output máximo — só muda a velocidade de entrega. Se o seu problema é qualidade de raciocínio, o caminho é o modo ultra, e aí você queima mais tokens, não menos.

Quanto custa? Não foi divulgado. Nem tarifa, nem cota, nem SLA. A única âncora pública é o tier Fast: 2x o preço por até 2,5x de velocidade.

Consigo usar no ChatGPT ou no Codex? Não há anúncio nesse sentido. O preview é de API, por convite, com trading e fintech na frente da fila.

Vale a pena esperar por isso pro meu agente? Só se o loop for longo e sequencial, e se você já mediu que a geração é o gargalo. Se o ciclo gasta mais tempo em build e teste que em inferência, 750 tok/s não te devolve nada.

O que fica

O Ultrafast é honesto e desconfortável ao mesmo tempo. Honesto porque não finge ser modelo novo: é o mesmo Sol entregue mais rápido, com engenharia de hardware real por trás. Desconfortável porque chegou com benchmark de fornecedor, sem preço e por convite — no mesmo dia em que o Google colocou o Gemini 3.7 Flash em GA em 160+ países com preço na mesa. Um shipou produto, o outro shipou preview.

O que muda pra você hoje: nada na fatura, muito na cabeça. Velocidade virou SKU. Escolher modelo agora tem três eixos — qual modelo, quanto ele pensa, quão rápido ele fala — cada um com custo próprio. Comece pelo que já tem tabela: o Sol em negócio real, antes de sonhar com o tier que ninguém sabe precificar.

Lucas Souza
Escrito por
Lucas Souza

{AI Engineer} — apaixonado por Laravel, arquitetura de software e construir produtos com impacto. Compartilho aqui tutoriais, descobertas e reflexões sobre o dia a dia de engenharia.

▪ Clã Beer and Code

Conteúdo é o que não falta. Falta quem desembaralhe: o que importa agora é como implementar do jeito certo. No Clã você tem isso ao vivo, toda semana, com quem já filtrou o ruído.

Entrar no Clã
Conheça o Clã Beer and Code
tocando