~/beer-and-code
▪ próximo evento AI Engineering Lab 3ª Edição — Da Arquitetura à Produção · 19—20 Set · 19 e 20 de setembro, das 09h às 13h — ao vivo via Google Meet garantir vaga
~ / tag / #modelos-de-ia $ grep

#Modelos de IA

20 posts
01 #openai · #harness
GPT-6 Astra vs Claude Fable 5.1 vs GPT-5.6 Sol: os números, o preço e o 99,9% que depende do harness

A OpenAI lançou o GPT-6 Astra em 03/09/2026 pelo mesmo preço do Claude Fable 5.1. Benchmark por benchmark contra Fable 5.1 e GPT-5.6 Sol, a conta de cache que deixa uma sessão de agente 54% mais cara no Astra, o índice independente onde o Fable ainda lidera, e o ARC-AGI-3 onde o mesmo modelo fez 62,7% ou 99,9% dependendo só do harness. Mais o que muda na sua API com o primeiro modelo "Critical" em cyber.

03 Set · 18 min
02 #claude · #anthropic
Claude Fable 5.1 chegou: o quanto ele é melhor que o Opus 5 (e quando não vale a pena)

A Anthropic lançou o Claude Fable 5.1 em 01/09/2026. Ele bate o Opus 5 em todos os benchmarks publicados, mas quase sempre por 2 a 3 pontos, e custa o dobro por token. Os números oficiais, a conta real de uma sessão agentic com cache quente (onde a razão de custo cai de 2x para 1.3x), a árvore de decisão entre Fable 5.1, Opus 5 e Sonnet 5, e os 3 breaking changes que quebram seu código se você só trocar o model id.

01 Set · 15 min
03 #ia · #llm
Ox Alpha era o GLM-5.3-Flash: a Z.ai confirmou, abriu os pesos em MIT — e o benchmark de 80% continua falso

O Ox Alpha era o GLM-5.3-Flash. Cinco dias antes de qualquer anúncio, o fingerprinting por tokenizador já apontava a Zhipu: 95 de 95 contra o vocabulário do GLM-5. Agora a Z.ai confirmou, publicou os pesos no Hugging Face sob licença MIT e revelou a arquitetura: 320B totais com 18B ativos, 1M de contexto, US$ 0,075 por milhão. O benchmark de 80% continua sendo o que sempre foi: uma amostra de dez tarefas. No conjunto completo, 63%.

25 Ago · 13 min
04 #ia · #llm
Qwen3.8-Flash-Next: 125B com 6B ativos, o MoE que a Alibaba lançou pra preparar o Qwen4

A Alibaba anunciou o Qwen3.8-Flash-Next: 125B totais com apenas 6B ativos por token, mais 51B em embeddings N-gram e uma atenção esparsa redesenhada. O que foi confirmado pela Qwen, o que ainda é estimativa da comunidade, quanta memória ele pede de verdade e por que a arquitetura está sendo publicada antes do Qwen 4. Nenhum benchmark oficial saiu até agora.

25 Ago · 8 min
05 #google · #ai-agents
Gemini 3.7 Flash chegou: 43,6% no FrontierCode e US$ 0,75/M, com o Flash antes do Pro de novo

O Google repetiu a jogada e soltou o Flash antes do Pro. Só que o US$ 0,75/M que tomou a timeline não é preço baixo: a tabela oficial mostra que é o preço do 3.6 Flash com 50% de desconto até 31/12/2026, e a fatura dobra em 1º de janeiro. Aqui estão os dois valores, os benchmarks reais (FrontierCode 43,6%, AutomationBench 30,4%), o que quebra na migração vindo do 3.6, e o dado que o release não conta: a alucinação subiu de 55,6% para 64,5%.

15 Ago · 11 min
06 #openai · #noticias
OpenAI Astra: o modelo secreto que "resolveu" 10 problemas de matemática — fato vs rumor

A OpenAI nomeou o Astra, sua próxima grande família de modelos, ao anunciar 10 problemas matemáticos resolvidos com provas verificáveis por máquina. Rastreador vivo: fato vs rumor, agora com a refutação da conjectura de Connes, problemas de Erdős e o nome GPT-5.7 na disputa.

01 Ago · 9 min
07 #openai · #tokens
Preço do GPT-5.6 Luna caiu 80%: a conta refeita com a tabela de hoje

A OpenAI cortou 80% do preço do GPT-5.6 Luna e 20% do Terra, três semanas depois do lançamento. Refazemos a conta por milhão de tokens com um cenário real de agente em produção, comparamos os três tiers e mostramos o que revisar na sua arquitetura antes de sair migrando de modelo por causa de manchete.

30 Jul · 8 min
08 #openai · #noticias
GPT-4o descontinuado: 23 de outubro é a data. O checklist pra migrar sem quebrar produção

A OpenAI confirma o desligamento do gpt-4o-2024-05-13 em 23 de outubro de 2026, junto com mais onze model IDs. Mas a manchete que circulou erra em dois pontos: o gpt-4o-mini não está na lista, e não houve falta de aviso. O que a fonte primária diz, e o checklist técnico pra migrar sem quebrar produção.

27 Jul · 14 min
09 #claude · #anthropic
Claude Opus 5 chegou: quase um Fable 5 pela metade do preço

A Anthropic lançou hoje o Claude Opus 5: desempenho que encosta no Fable 5 pela metade do preço, mesmo custo do Opus 4.8 ($5/$25 por milhão de tokens). Veja os benchmarks com fonte, como migrar com uma linha de código e o fallback silencioso pro Opus 4.8 que você precisa monitorar antes de apontar produção pro modelo novo.

24 Jul · 8 min
10 #openai · #noticias
GPT-6: Altman vai a Washington e o lançamento parece próximo. O que é fato e o que é boato

A Bloomberg reportou que Sam Altman fará um briefing à administração Trump e ao Congresso sobre a próxima geração de modelos da OpenAI, e a internet leu isso como lançamento iminente do GPT-6. Este é um rastreador: cada linha com data e fonte, separando o que foi confirmado do que é especulação. Mais o que fazer se você tem produto rodando na API da OpenAI.

22 Jul · 7 min
11 #ia · #google
Gemini 3.6 Flash chegou: benchmarks, preço e por que o Google lançou o Flash antes do Pro

O Google lançou o Gemini 3.6 Flash prometendo qualidade de Pro com preço de Flash. Testei o anúncio contra os números: benchmarks oficiais, preço por token, o tier Flash-Lite — e o que é fato e o que é rumor na história do Pro que não chega.

21 Jul · 9 min
12 #openai · #multi-agent
GPT-5.6 no Codex: o modo Ultra rende 3 pontos, e o Terra gasta 2,6x mais tokens pra entregar pior

O GPT-5.6 está no Codex desde 9 de julho, nos três tiers. O modo Ultra coordena quatro subagents que cooperam durante a tarefa e rende 3 pontos no Terminal-Bench (88,8% para 91,9%), a um custo de tokens bem maior. E o teste independente da CodeRabbit derruba o reflexo de escolher o tier barato: o Terra gastou 2,6x mais tokens que o Sol para passar 40,7% das tarefas contra 63,7%. Preço por token não é preço por tarefa.

15 Jul · 10 min
Conheça o Clã Beer and Code
tocando