#Hardware
Não é modelo novo. É o mesmo GPT-5.6 Sol rodando num chip do tamanho de um prato: 750 tokens/s, 44 GB de SRAM on-chip e zero preço publicado. A OpenAI anuncia 14x contra o próprio Sol Standard; a Cerebras anuncia 11x contra o Fable 5 (sem teste pareado). Aqui separamos o que é verificável do que é marketing de fornecedor, explicamos por que Sol, Ultra e Ultrafast são três coisas diferentes, e mostramos a conta que decide se latência vira dinheiro no seu agente.
A Alibaba lançou o Qwen 3.8 27B e alguém abriu o diff contra o 3.6: 59 de 59 nós do grafo mapeiam um pra um, e o único campo diferente é metadado. Mesma arquitetura, DeepSWE triplicando de 13,3 para 42,2. Aqui vão os benchmarks reais (e o que a tabela do vendor omite), a conta de VRAM que a imprensa simplificou, o KV cache de 64KB por token, o bug do template Jinja que derruba tool call no dia 1, e a diferença entre o 27B denso e o 3.8 Max de 2,4T. Com o contraponto que ninguém fez.
A Cactus Compute lançou o Needle 2: 45M de parâmetros, binário de 14 MB, sessão em 28 MB de RAM, 500 tokens/s num Raspberry Pi 5 e 70 MFLOPs por token contra 460 do LFM2.5 230M. A engenharia é real: quantização CQ2-bit aplicada desde o pré-treino, gramática byte-level que trava a saída em function calls válidas. Mas o Show HN virou laboratório público de falhas: digitar "HN" dispara lock_door com confidence 0, "warmer" vira mode cool, e a demo de ESP32 que viralizou era do Needle 1.
A imprensa diz que o Muse Glimmer 30B exige uma 5090. O r/LocalLLaMA posta print rodando numa 3090 usada de 2020. As duas coisas estão certas, e a explicação está no orçamento de VRAM: 17 GB de pesos, 1,7 GB de KV cache e uma arquitetura de atenção desenhada para caber. Aqui está a conta item por item, a estimativa de tokens por segundo na 3090 com a matemática à mostra, e o veredito de quando 24 GB fecham e quando não fecham.
A OpenAI lançou seu primeiro hardware: o Codex Micro, um macropad de US$ 230 pra controlar agentes do Codex — e ele esgotou em horas. Specs, o uso real na supervisão de múltiplos agentes e a conta honesta de se vale a pena comprar.