~/beer-and-code
▪ próximo evento Workshop: Jev na Prática para Devs · 14 Out · 19h — duração de 2h a 3h, ao vivo via Google Meet garantir vaga ›
~ / tag / #llm $ grep

#Llm

123 posts
13 #ia · #rag
Fine-tuning, RAG ou prompt: qual dos três o seu problema pede

A decisão que mais gente erra pra cima. Critério objetivo pra escolher entre prompt, RAG e fine tuning, quanto custa cada caminho com números reais, os três casos raros em que treinar um modelo ganha, e o teste de cinco minutos que separa problema de conhecimento de problema de recuperação. Com a notícia que muda a conta: a OpenAI está encerrando a plataforma de fine-tuning.

31 Ago · 14 min ›
14 #ia · #llm
O que é um LLM: a explicação para quem vai construir, não para quem vai postar

Fundamento operacional de LLM sem analogia de papagaio: o que o modelo faz a cada token, por que ele é stateless, como a janela de contexto degrada muito antes do limite e por que temperatura 0 não é determinística. Cada conceito fecha com a consequência de arquitetura que ele te obriga a construir, com a doc oficial da Anthropic e da OpenAI, o paper Lost in the Middle e o estudo de context rot da Chroma na mão.

31 Ago · 5 min ›
15 #ia · #arquitetura-de-software
Engenharia de prompt acabou. O que veio depois se chama engenharia de contexto

Metade das tecnicas de prompt sumiu porque o modelo aprendeu sozinho. A outra metade virou parametro de API. O que sobreviveu, o que virou folclore, e por que em sistema real o problema deixou de ser a frase e passou a ser o que entra na janela de contexto.

31 Ago · 13 min ›
16 #ia · #ai-agents
Graph engineering é hype? Li o paper, os benchmarks e a conta

Uma frase de doze palavras no X virou paradigma com paper em cinco semanas. Fui ler o survey procurando o benchmark que justifica o degrau novo: não tem nenhum. O que separa hype de engenharia em graph engineering, com os números rastreados até a fonte, quais são de fabricante e quais são independentes, e a régua de cinco perguntas pra decidir se o seu caso pede grafo ou se você só quer o crachá novo.

27 Ago · 14 min ›
17 #ia · #produto-ia
AWS Bedrock: o que é e como rodar Claude em produção com governança (e a conta em real)

A AWS documenta muito bem como ligar o Bedrock. Ninguém documenta o resto: a diferença entre CloudTrail e model invocation logging, o fato de São Paulo não te dar residência de dados, e o que aparece na fatura em real no fim do mês. Guia prático de Claude em produção no AWS Bedrock: IDs de modelo, inference profiles, as quatro camadas de governança e a conta fechada de um agente interno.

27 Ago · 15 min ›
18 #ia · #llm
Ox Alpha era o GLM-5.3-Flash: a Z.ai confirmou, abriu os pesos em MIT — e o benchmark de 80% continua falso

O Ox Alpha era o GLM-5.3-Flash. Cinco dias antes de qualquer anúncio, o fingerprinting por tokenizador já apontava a Zhipu: 95 de 95 contra o vocabulário do GLM-5. Agora a Z.ai confirmou, publicou os pesos no Hugging Face sob licença MIT e revelou a arquitetura: 320B totais com 18B ativos, 1M de contexto, US$ 0,075 por milhão. O benchmark de 80% continua sendo o que sempre foi: uma amostra de dez tarefas. No conjunto completo, 63%.

25 Ago · 13 min ›
19 #ia · #llm
Qwen3.8-Flash-Next: 125B com 6B ativos, o MoE que a Alibaba lançou pra preparar o Qwen4

A Alibaba anunciou o Qwen3.8-Flash-Next: 125B totais com apenas 6B ativos por token, mais 51B em embeddings N-gram e uma atenção esparsa redesenhada. O que foi confirmado pela Qwen, o que ainda é estimativa da comunidade, quanta memória ele pede de verdade e por que a arquitetura está sendo publicada antes do Qwen 4. Nenhum benchmark oficial saiu até agora.

25 Ago · 8 min ›
20 #ia · #produto-ia
OpenRouter: o que é, como usar e quando vale a pena

Um endpoint compatível com a API da OpenAI para centenas de modelos, com fallback automático entre provedores. O que é o OpenRouter, como chamar em curl, Python e PHP, como controlar roteamento, provedor e teto de custo, e os cenários em que essa camada extra atrapalha mais do que ajuda.

25 Ago · 9 min ›
21 #laravel · #php
Laravel AI SDK vs Prism PHP: qual usar em cada caso

A internet trata o Laravel AI SDK e o Prism PHP como concorrentes e ainda repete que o SDK oficial usa o Prism por baixo dos panos. O composer.json diz outra coisa. Neste post: o que cada pacote faz de fato, o código lado a lado, a tabela do que só existe em um deles, a cadência de release dos dois e um guia de decisão por caso concreto. Sem "depende".

20 Ago · 4 min ›
22 #laravel · #php
O que é o Laravel AI SDK: guia prático do SDK de IA nativo do Laravel

O Laravel AI SDK é o pacote first-party de IA do Laravel: agentes como classes PHP, tool calling, structured output, streaming, embeddings com pgvector e fakes para testar sem gastar token. Guia prático do composer require ao primeiro agente rodando, com o que o SDK resolve, o que ele não resolve e as limitações que ninguém conta.

18 Ago · 5 min ›
23 #llm · #custos
DeepSeek V4 Pro 0813: 87,9 no Terminal Bench passa o Opus 4.8 e a conta vai subir

A DeepSeek publicou o DeepSeek-V4-Pro-0813 na página oficial de preços e o release oficial do V4 Pro finalmente saiu do rótulo de preview. Os números reportados, o que é fato e o que ainda não tem documento público, a comparação com o Flash 0731 e o Opus 4.8, e o aviso na própria página de preços de que a DeepSeek vai aumentar os valores em breve.

12 Ago · 11 min ›
24 #mobile · #tool-use
Needle2: um LLM de 14 MB que roda no ESP32 e faz tool calling com 6,5x menos compute

A Cactus Compute lançou o Needle 2: 45M de parâmetros, binário de 14 MB, sessão em 28 MB de RAM, 500 tokens/s num Raspberry Pi 5 e 70 MFLOPs por token contra 460 do LFM2.5 230M. A engenharia é real: quantização CQ2-bit aplicada desde o pré-treino, gramática byte-level que trava a saída em function calls válidas. Mas o Show HN virou laboratório público de falhas: digitar "HN" dispara lock_door com confidence 0, "warmer" vira mode cool, e a demo de ESP32 que viralizou era do Needle 1.

12 Ago · 10 min ›
Conheça o Clã Beer and Code
tocando