GPT-5.6 Sol Ultrafast: 750 tokens/s na Cerebras, 11x mais rápido que o Fable 5
Não é modelo novo. É o mesmo Sol em outro chip
A OpenAI não lançou um modelo novo em 13/08/2026.
Lançou o mesmo GPT-5.6 Sol rodando num chip do tamanho de um prato. Mesma inteligência, mesma janela de contexto, mesma qualidade. Só que os tokens saem a 750 por segundo.
O nome é GPT-5.6 Sol Ultrafast. Não é modelo, não é modo de raciocínio — é um tier de inferência, no Wafer-Scale Engine da Cerebras em vez de GPU. É o tipo de lançamento que separa quem lê o anúncio de quem lê a nota de rodapé: manchete de dois fabricantes com números diferentes, benchmark rodado pelo próprio fornecedor e zero preço publicado. Vamos separar o verificável do marketing e ver onde essa velocidade vira dinheiro.
TL;DR
- O que é: tier de inferência do GPT-5.6 Sol em hardware Cerebras (CS-3), com até 750 tokens de saída por segundo. Não é modelo novo.
- Muda o quê: só a velocidade. Inteligência, contexto de ~1M de tokens e qualidade seguem iguais.
- Acesso: limited preview, por convite, formulário em
/openai-ultrafast-signup. Clientes de lançamento: Jane Street, Basis, Rogo e Podium. - Custo: não divulgado. Sem tarifa, cota, região, SLA ou compromisso mínimo.
- Fontes primárias: blog da Cerebras e o anúncio da OpenAI, "Previewing Ultrafast mode: GPT-5.6 Sol at up to 14X the speed" — página que devolveu 403 e foi reconstruída por secundárias convergentes.
Sol, Ultra e Ultrafast: três coisas diferentes com nomes parecidos
Sol é o modelo. $5 por 1M de input e $30 por 1M de output, janela de ~1 milhão de tokens. (Tem revendedor circulando $7/$43 — ignore, é markup.)
Ultra é um modo de raciocínio e orquestração, não um modelo: quatro subagents cooperando em paralelo, coordenados pelo próprio Sol. O GPT-5.6 Sol Ultra no Codex explica a mecânica e por que ele queima mais tokens por tarefa.
Ultrafast é um tier de inferência. Muda o hardware embaixo, não o cérebro em cima.
Resumindo: o ultra muda quanto o modelo pensa; o Ultrafast muda quão rápido ele fala. Um tem preço publicado por token. O outro ainda não disse quanto custa.
E é aí que mora a decisão real. Comprar latência é pagar prêmio sobre um insumo que você já usa — isso não se resolve com benchmark, se resolve com conta de margem e desenho de arquitetura. Essa conversa, com CTO, PM e dono de SaaS olhando a mesma planilha, é o que rola toda semana no Clã Beer and Code — porque, com IA no meio, a stack deixou de ser o problema e a decisão virou de produto.
GPT-5.6 Sol Ultrafast a 750 tok/s: dois números de manchete, dois baselines diferentes
A OpenAI anunciou "até 14X". O baseline é o próprio Sol em modo Standard, que roda a ~53 tokens/s. Faça a conta: 53 × 14 ≈ 750.
A Cerebras anunciou "11x mais rápido que o Fable 5" e "5x mais rápido que o Opus 4.8 em modo Fast". Baseline diferente: concorrente, não ele mesmo.
Os dois são reais e medem coisas diferentes. Mas o 11x tem uma ressalva que quase ninguém reproduziu: o texto literal da Cerebras é "compared with output speeds reported by Artificial Analysis" para os modelos da Anthropic. Não houve teste pareado. Não invalida o dado. Muda o que ele é.
Os benchmarks reforçam a dúvida:
- GDP-Val: 5,6x end-to-end, "with no quality loss" — rodado pela própria Cerebras em 31/07/2026.
- HLE: 2.500 questões em 11h11 (Sol Ultrafast) contra 78h27 (Fable 5). Só que o Sol foi medido em 10/07 e o Fable entre 13 e 15/07 — dias diferentes, carga desconhecida.
E o HLE tem um problema estrutural que o woadwarrior01, no Hacker News, cravou melhor que qualquer press release: responder 2.500 questões independentes é embarrassingly parallel. Wall-clock ali mede quanta capacidade você alocou, não quão rápido o chip é. O contraponto honesto, do rpdillon: "750t/s tells the story".
Regra prática: cite o 750 tok/s, trate o 11h11 vs 78h27 com pinça. Nenhum avaliador independente mediu o Ultrafast até hoje.
Wafer-Scale Engine: 44 GB de SRAM e o gargalo que muda de lugar
Numa GPU, os pesos vivem na HBM e são puxados para o compute a cada token — banda de memória é o gargalo. No WSE-3 (4 trilhões de transistores, ~125 petaflops), os pesos ficam nos 44 GB de SRAM on-chip. Sem ida e volta. Daí a velocidade.
Só que 44 GB é pouco para contexto longo. philipportner, no HN, fez a matemática que a Cerebras não fez:
"You'd need hundreds of GB alone for the KV cache of each user. For something like LLama 3 405B you need ~67GB at ~130k tokens. A single CS-3 has 44GB on-chip sram."
Traduzindo: o KV cache de um usuário com contexto longo já não cabe. O modelo anuncia 1M de janela; a memória rápida tem 44 GB. O "up to" de "up to 750 tokens/s" está fazendo trabalho pesado. Ninguém publicou a curva de velocidade × contexto — é essa a pergunta que você faz antes de assinar contrato.
O que segura o produto de pé é a arquitetura não ser "tudo na Cerebras". É híbrida: prefill em AWS Trainium, decode no CS-3, via Elastic Fabric Adapter — a inferência desagregada anunciada por AWS e Cerebras em 13/03/2026. A parte que come memória sai do wafer. Alivia, não elimina.
Não só acompanhe as novidades — domine. Engenharia de IA na prática, ao vivo, toda semana, na maior comunidade do Brasil.
Entrar no ClãLimited preview: quem entra e por que não tem preço
Acesso é por convite. Clientes de lançamento: Jane Street, Basis, Rogo e Podium — trading e fintech. A Cerebras promete expandir "conforme a capacidade crescer" e mantém um formulário em /openai-ultrafast-signup: não é waitlist com garantia de entrada, é fila de qualificação. E vale ser honesto — este produto não foi desenhado para o dev PHP/Laravel médio. Como resumiu o btown no HN, existem indústrias que pagam múltiplos absurdos sobre a tarifa de API por latência baixa. Você não é uma delas.
O preço vai doer por engenharia, não por ganância. Em GPU, o batching dilui custo fixo entre muitos usuários. Na Cerebras, a banda entre chips é de ~150 GB/s contra ~2 TB/s do NVLink — nas palavras do porridgeraisin, dá para fazer batching, "but that would just service more users at lower token/s each without any amortization of fixed cost". Cada usuário rápido ocupa a máquina. A única âncora pública é o tier Fast: 2x o Standard por até 2,5x de velocidade. Como alerta o explainx, nenhum número por token do Ultrafast circulando hoje é confiável.
Contexto: isso é a ponta comercial de um contrato de mais de US$ 10 bilhões entre OpenAI e Cerebras, de janeiro. ⚠️ A cifra de "US$ 20 bi" que circula é imprensa não confirmada.
Onde velocidade vira dinheiro (e onde não vira)
A conta que importa não é tokens por segundo. É tempo por tarefa concluída. E o caso onde a matemática fecha é agente em loop longo — 40 chamadas sequenciais de 800 tokens de saída cada:
# Conta de guardanapo — só a geração, ignorando prefill e overhead de rede
passos = 40
tokens_por_passo = 800
standard = passos * tokens_por_passo / 53 # ~604 s -> 10 min
ultrafast = passos * tokens_por_passo / 750 # ~43 s
# 10 minutos de espera viram 43 segundos.
# O ganho só existe porque as chamadas são SEQUENCIAIS.
Se fossem paralelas, você resolveria o mesmo com concorrência em GPU e fatura menor. A latência só vira dinheiro quando a próxima decisão depende do token anterior: incidente com o outage acontecendo, pesquisa financeira interativa, IA de voz, suporte multi-step — os casos que a OpenAI nomeou. Jeffrey Wang, pesquisador da OpenAI, resume o efeito: a tarefa "finishes for me before I even have the opportunity to context-switch".
Agora o takeaway que o anúncio não te dá. sixtyj, no HN:
"Compilation time will be a genuine bottleneck for slop coding if this becomes the standard generation rate."
Se o modelo cospe 750 tok/s, o composer install, o build e a suíte de testes viram a nova fila. Velocidade de geração não é velocidade de entrega. Meça quanto do seu ciclo de agente é modelo e quanto é pipeline. Na maioria dos times, o modelo já não é o gargalo há tempos.
Limitações e pontos de atenção
Onde você se queima:
- Nenhum benchmark é independente. GDP-Val e HLE foram rodados pela Cerebras, em datas diferentes por modelo, sob o disclaimer verbatim da casa: "Performance comparisons are based on third-party benchmarking or internal testing."
- Contexto longo e 750 tok/s provavelmente não coexistem. 44 GB de SRAM contra 1M de janela, e ninguém publicou a curva velocidade × contexto.
- Sem preço, sem SLA, sem GA, sem model ID público — e sem economia de batching: a conta unitária tende a ser pior que GPU por design.
- Velocidade por token ≠ tempo por tarefa. O
aetherspawnlevantou no HN a hipótese (não medida) de que o Sol gasta 10–100x menos tokens de saída que o Fable na mesma tarefa. Se procede, o "11x" mede a coisa errada duas vezes — mesma lógica de preço por token não ser preço por tarefa. - Omissão apontada, não verificada: o
ricardobeatcita o Mimo v2.5-Pro Ultraspeed, de junho, com ~1000 tok/s por menos de 1/10 do custo. Nenhuma primária menciona. - Lacuna aberta: ninguém disse se o Ultrafast combina com o modo
ultra. É a pergunta mais óbvia do lançamento e as duas primárias estão em silêncio.
FAQ
O Ultrafast é mais inteligente que o Sol normal?
Não. Mesmo modelo, mesma janela, mesmo output máximo — só muda a velocidade de entrega. Se o seu problema é qualidade de raciocínio, o caminho é o modo ultra, e aí você queima mais tokens, não menos.
Quanto custa? Não foi divulgado. Nem tarifa, nem cota, nem SLA. A única âncora pública é o tier Fast: 2x o preço por até 2,5x de velocidade.
Consigo usar no ChatGPT ou no Codex? Não há anúncio nesse sentido. O preview é de API, por convite, com trading e fintech na frente da fila.
Vale a pena esperar por isso pro meu agente? Só se o loop for longo e sequencial, e se você já mediu que a geração é o gargalo. Se o ciclo gasta mais tempo em build e teste que em inferência, 750 tok/s não te devolve nada.
O que fica
O Ultrafast é honesto e desconfortável ao mesmo tempo. Honesto porque não finge ser modelo novo: é o mesmo Sol entregue mais rápido, com engenharia de hardware real por trás. Desconfortável porque chegou com benchmark de fornecedor, sem preço e por convite — no mesmo dia em que o Google colocou o Gemini 3.7 Flash em GA em 160+ países com preço na mesa. Um shipou produto, o outro shipou preview.
O que muda pra você hoje: nada na fatura, muito na cabeça. Velocidade virou SKU. Escolher modelo agora tem três eixos — qual modelo, quanto ele pensa, quão rápido ele fala — cada um com custo próprio. Comece pelo que já tem tabela: o Sol em negócio real, antes de sonhar com o tier que ninguém sabe precificar.
{AI Engineer} — apaixonado por Laravel, arquitetura de software e construir produtos com impacto. Compartilho aqui tutoriais, descobertas e reflexões sobre o dia a dia de engenharia.
Conteúdo é o que não falta. Falta quem desembaralhe: o que importa agora é como implementar do jeito certo. No Clã você tem isso ao vivo, toda semana, com quem já filtrou o ruído.
Entrar no Clã