~/beer-and-code
▪ Clã Beer and Code a maior comunidade de Engenharia de IA do Brasil · ao vivo, toda semana entrar no Clã
~ / tag / #llm $ grep

#Llm

122 posts
37 #ia · #guardrails
Kimi K3 corrigiu 15 bugs que Codex e Fable recusaram — e a guerra dos guardrails começou

O Kimi K3 corrigiu 15 falhas de segurança que Codex e Fable recusaram por "cyber guardrails". Na mesma semana, a HuggingFace foi invadida e teve a perícia travada pelo próprio guardrail. Quando o freio da IA protege, e quando desarma o defensor.

20 Jul · 11 min
38 #ia · #llm
Qwen 3.8 Max (2.4T): benchmark vs Kimi K3, preço e pesos abertos

A Alibaba soltou o Qwen 3.8 Max, MoE de 2.4 trilhões de parâmetros que ela diz ser o segundo do mundo, atrás só do Fable 5. Sem benchmark público no lançamento, o único teste independente deu 80/100 contra 83 do Kimi K3. Aqui: o que ele é, quanto custa (Token Plan de US$ 6 a 68), como acessar via API e onde cada modelo da família Qwen 3.8 se encaixa.

20 Jul · 9 min
39 #openai · #ia
IA vai ficar mais cara? A conta real da OpenAI e da Anthropic

O X grita que vem o "grande rollback" da IA; a prática mostra OpenAI e Anthropic brigando por quem deixa você usar mais. Fui atrás dos números verificados: preço por token despencando 83%, custo por tarefa subindo 3x-18x ao ano, margem de 70% em quem paga e prejuízo projetado de US$ 74 bi. Os dois lados estão errados, e a variável que decide tudo é uma só.

18 Jul · 16 min
40 #ia · #llm
Kimi K3 preço: US$ 3/15 por milhão, tem grátis? Benchmarks vs Claude

Kimi K3 custa US$ 3 de entrada e US$ 15 de saída por milhão de tokens na API (chat grátis no kimi.com), 1,7x mais barato que o Claude Opus 4.8, não os "5x" da timeline. Fizemos a conta honesta do preço, separamos o benchmark verificável do hype e mostramos onde ele bate (e onde não bate) o Claude.

17 Jul · 10 min
41 #ia · #exportacao
Fable 5 voltou: cota, créditos à parte e o que muda na prática

O Fable 5 voltou em 1º de julho, global, depois de 19 dias fora do ar — com cota, créditos à parte e um guarda-costas chamado Opus 4.8. E agora a Anthropic anunciou: a partir de 20/07 o modelo fica incluso em todos os planos Max e Team Premium, a 50% dos limites, com US$ 100 de crédito único pra quem é Pro.

15 Jul · 11 min
42 #ia · #llm
Vazamento do Claude Opus 5: do Honeycomb ao lançamento (tracker encerrado)

Tracker encerrado em 24/07/2026. Este post preserva a linha do tempo do rumor do Opus 5: o modelo fantasma 'Claude Honeycomb' no Cursor, as odds do Polymarket semana a semana e a tabela do que cada claim acertou ou furou. Benchmarks, preço e migração estão na cobertura do lançamento.

15 Jul · 11 min
43 #ai-agents · #llm
Prompt injection: o que é e os principais ataques de 2026 (e como se defender)

Seu agente lê um README e obedece a uma instrução escondida nele. A busca por "prompt injection" multiplicou por 8 no Brasil em 2026. O guia do que é, dos ataques que marcaram o ano e da defesa em camadas que de fato funciona.

15 Jul · 14 min
44 #ia · #llm
Claude resolveu problema de física parado há 6 meses (e a conjectura de 12 anos de um Nobel)

Em duas semanas, dois físicos de elite — Giorgio Parisi (Nobel) e Yuji Tachikawa — creditaram ao Claude a solução de problemas travados há meses ou anos. O padrão importa mais que a manchete: problema maduro, confiança calibrada e verificação em loop, aplicável a qualquer trabalho técnico.

14 Jul · 10 min
45 #openai · #ia
GPT-5.6 "descobriu nova matemática"? O que Altman disse e o que os matemáticos responderam

Sam Altman disse que o GPT-5.6 descobriu matemática nova e a internet surtou. O que exatamente foi alegado, o que "descobrir matemática" significa pra um LLM, e por que os matemáticos pisam no freio.

07 Jul · 4 min
46 #ia · #llm
DeepSeek V4 Flash com 1M de contexto no seu RTX 5090: dá pra rodar local — mas tem um porém

O r/LocalLLaMA travou num feito: DeepSeek V4 Flash rodando 1M de tokens de contexto num único RTX 5090. É real, mas tem um asterisco que ninguém coloca no título. Separamos a engenharia de verdade do entusiasmo de thread: os números reais, o porém da RAM e quando a API sai mais barata.

03 Jul · 9 min
47 #ia · #llm
LongCat 2.0: o modelo fantasma owl-alpha que sumiu do OpenRouter era um MoE de 1,6 trilhão

O owl-alpha rodou disfarçado no OpenRouter por semanas, liderou rankings e sumiu. Era a LongCat 2.0 da Meituan: MoE de 1,6 trilhão de parâmetros, treinada sem NVIDIA. A história do modelo fantasma e o que ela ensina pra quem constrói com IA.

03 Jul · 8 min
48 #ia · #llm
DeepSeek V4 peak/valley: o preço por horário de pico e a pegadinha de fuso que favorece o dev BR

A DeepSeek anunciou preço dinâmico por horário para a V4 — barato fora do pico, caro no pico, igual conta de luz. Como o peak/valley funciona, a pegadinha de fuso que joga a favor de quem coda em Brasília e o que conferir no cron. A tabela oficial atual do V4 Pro e do Flash está no post do 0813.

02 Jul · 8 min
Conheça o Clã Beer and Code
tocando