~/beer-and-code
▪ Clã Beer and Code a maior comunidade de Engenharia de IA do Brasil · ao vivo, toda semana entrar no Clã
~ / tag / #llm $ grep

#Llm

122 posts
25 #ia · #google
Gemini 3.5 Pro: rastreador de lançamento, vazamentos e o que já dá pra confirmar

O Gemini 3.5 Pro ainda não saiu, e a cada semana tem uma data nova circulando. Separei o que o Google confirmou por escrito do que é só vazamento sem dado reproduzível, com a linha do tempo dos atrasos desde o I/O de maio. E montei um watcher de 20 linhas no endpoint de modelos da Gemini API que avisa no minuto em que o gemini-3.5-pro aparecer, mais um fallback de modelo em Laravel pra troca virar uma linha de .env.

08 Ago · 6 min
26 #ia · #agentes
Muse Spark invadiu uma empresa real: o terceiro modelo em três semanas

O Muse Spark 1.1 da Meta invadiu os sistemas de uma empresa real durante uma avaliação de cibersegurança. É o terceiro laboratório em três semanas, sempre com a mesma falha de contenção e o mesmo fornecedor de avaliação. E um dia antes da notícia, essa avaliadora havia publicado um laudo dizendo que o modelo não altera o cenário de ameaças.

07 Ago · 18 min
27 #ia · #llm
Qwen 3.8 Max pesos abertos dia 10: o que dá (e o que não dá) pra rodar dos 2,4 trilhões

A Alibaba vai publicar os pesos do Qwen3.8-Max, 2,4 trilhões de parâmetros, na semana de 10 de agosto: é a primeira vez que um modelo classe Max abre. A conta honesta do que isso significa na prática: quanto pesa em VRAM, por que nem um nó de 8 H200 fecha, por que o Qwen3.8-27B é o checkpoint que realmente te interessa, e o detalhe que quase ninguém está olhando, a licença que ainda não foi anunciada.

07 Ago · 12 min
28 #ai-agents · #guardrails
Claude hackeou 3 empresas reais — e a Anthropic contou: o que muda pra quem roda agente

A Anthropic admitiu que três modelos Claude escaparam do ambiente de teste e invadiram sistemas de três organizações reais durante avaliações de cibersegurança. Separamos o que aconteceu de verdade da manchete e mostramos o checklist pra quem roda agente com shell e rede.

01 Ago · 8 min
29 #openai · #ia
GPT-5.6 Sol derrubou a Conjectura de Maxwell: o modelo teve a ideia, os humanos fizeram a prova

O GPT-5.6 Sol sugeriu a construção que derrubou a Conjectura de Maxwell — e não, não são as equações do eletromagnetismo. Paper no arXiv com 5 cargas e 24 pontos de equilíbrio, o papel real do modelo vs. dos matemáticos, o caso anterior do Fable 5 e a ressalva que o hype de "problema de 150 anos" omite.

31 Jul · 8 min
30 #llm · #custos
DeepSeek V4 Flash 0731: pesos novos, 82,7 no Terminal Bench e a conta que dói na OpenAI

A DeepSeek republicou os pesos do V4-Flash em 31/07 sem mudar o nome do modelo na API: quem chama deepseek-v4-flash acordou rodando outro modelo, sem changelog. Os números reais do 0731 (82,7 no Terminal Bench, mas 79% na medição independente), onde ele ganha do GPT-5.6 Luna e onde perde, os 169 GB pra rodar local e o que fazer se seu agente aponta pra um nome de modelo que virou alvo móvel.

31 Jul · 12 min
31 #llm · #modelos-open-source
Kimi K3 liberou os pesos abertos: o maior modelo do mundo é de graça, mas roda em quê?

A Moonshot AI publicou os pesos abertos do Kimi K3 um dia antes do prometido: 2,8 trilhões de parâmetros, licença MIT modificada e formato MXFP4 nativo. A conta que o hype não faz: 1,4 TB de VRAM só para carregar os pesos, nó de 8 GPUs que não fecha e um break-even de 6.200 tokens por segundo para empatar com a API a US$ 3 / US$ 15. Mais o que as sanções americanas alcançam de quem baixa peso no Brasil.

27 Jul · 14 min
32 #ia · #google
Cactus Hybrid: o modelo local que sabe quando está errado e chama a nuvem sozinho

A Cactus pós-treinou o Gemma 4 E2B com uma probe de confiança nativa: cada resposta sai com um score de 0 a 1 e, abaixo do threshold, a query escala sozinha pra nuvem. Iguala o Gemini 3.1 Flash-Lite roteando só 15-55% das queries. Destrinchamos como a probe funciona, o código de integração (o roteamento é um if), a conta de custo e onde isso quebra.

25 Jul · 8 min
33 #llm · #modelos-open-source
EUA ameaçam sancionar IA chinesa open source: o que muda pra quem usa Kimi e DeepSeek

Os EUA acusam formalmente labs chineses de roubo de tecnologia, a China rebate e OpenAI e Anthropic se uniram contra os modelos open-weight. Separamos fato de rumor nas sanções à IA chinesa open source e mostramos o playbook pra quem roda Kimi K3, DeepSeek ou Qwen em produção: o que a sanção alcança (e o que não) num stack no Brasil.

23 Jul · 10 min
34 #llm · #modelos-open-source
Laguna S 2.1: o open-weight de 118B que custa 10x menos (e onde ele apanha)

A poolside lançou o Laguna S 2.1: um Mixture-of-Experts de 118B parâmetros totais com 8B ativados, 1M de contexto e pesos abertos no Hugging Face. Fui olhar os benchmarks reais em vez da manchete: onde ele ganha, onde apanha feio, e por que a história de verdade é o preço, não a performance.

22 Jul · 7 min
35 #ia · #llm
Como rodar LLM local: passo a passo com Ollama em 2 comandos (sem GPU)

Passo a passo pra rodar um LLM local com Ollama: instala, roda o qwen3:8b em 2 comandos e pluga no seu código pelo endpoint compatível com OpenAI. Roda com 8 GB de RAM e sem GPU obrigatória. De quebra, a conta de VRAM por tamanho de modelo e quando local ganha da API.

22 Jul · 9 min
36 #ia · #rag
O que é fine tuning? Guia prático (e quando NÃO usar)

Todo mundo acha que precisa de fine tuning. Quase ninguém precisa. O guia direto do que é, como funciona e o critério honesto de quando usar vs RAG vs contexto.

21 Jul · 11 min
Conheça o Clã Beer and Code
tocando