#2 Todo mundo está tentando enjaular a própria IA agora

#newsletter #ia

Construindo um pipeline de RAG do zero

Construí um pipeline de RAG do zero, de ponta a ponta, e queria compartilhar como ele funciona por dentro.

O pipeline tem seis etapas: dividir o documento de origem em chunks, transformar cada chunk em um vetor (embedding), armazenar esses vetores, recuperar os trechos mais próximos de uma pergunta, gerar uma resposta fundamentada e avaliar tudo com um LLM atuando como juiz.

Na minha demo, usei uma página da Wikipédia sobre a Copa do Mundo da FIFA, dividida em 89 chunks (1.000 caracteres cada, com 200 caracteres de sobreposição), gerei todos os embeddings localmente com um modelo compacto de sentence-transformer e armazenei os vetores no ChromaDB, um banco de dados vetorial gratuito e local. A recuperação e a geração rodaram no endpoint gratuito do LLaMA 3.3 da Groq.

A parte de que mais me orgulho é a etapa de avaliação. Em vez de recorrer a uma biblioteca, montei um esquema simples de LLM como juiz que avalia cada resposta em três eixos: fidelidade (a resposta se baseia no contexto recuperado ou é alucinada), relevância da resposta (ela realmente responde à pergunta) e precisão do contexto (os chunks recuperados são úteis ou só ruído). É uma forma limpa e minimalista de saber de verdade se o seu sistema de RAG funciona.

Building a RAG Pipeline from Scratch: Chunking, Embeddings, Vector Storage, and LLM-as-Judge…A hands-on guide to chunking, embedding, and evaluating with LLM-as-JudgeMedium

Uma biblioteca de templates de slides para o seu agente de código

Se você monta apresentações com um agente de código, vale a pena salvar este repositório. É uma biblioteca com 30 templates de slides em HTML, gratuitos e com licença MIT, cada um com identidade visual própria. Tem de tudo: de um visual editorial suave com fonte serifada a uma estética pixel art de 8 bits, passando por um tema completo no estilo do Windows 95. Vale muito dar uma olhada.

A ideia é simples: em vez de pedir ao agente que crie uma apresentação a partir de uma página em branco, aponte-o para essa biblioteca. Um arquivo de instruções que acompanha o repositório explica ao agente como ler o índice de templates, escolher o que combina com o seu briefing, clonar o template certo e adaptar o conteúdo, para que você termine com algo que realmente parece ter sido desenhado, e não genérico.

zarazhangrui/beautiful-html-templatesA library of HTML slide templates designed so any coding agent can pick the right one and produce a beautiful deck on the user's behalf, automatically.GitHub

Prompts multimodais estão silenciosamente virando o novo normal

Tem um vídeo circulando sobre prompts multimodais, e vale resumir o argumento: a engenharia de prompt não está morrendo, está evoluindo para algo muito mais rico do que uma frase bem escrita.

A ideia é que os desenvolvedores estão indo além de instruções só em texto e conduzindo agentes de código com uma mistura de entradas: capturas de tela, mood boards, rascunhos de interface, até mapas mentais desenhados à mão. Em vez de otimizar uma única linha estática de texto, você guia o agente por todo o ciclo de planejamento, prototipação e depuração usando um contexto muito mais rico.

Duas coisas me chamaram a atenção. Primeiro, a expertise humana não é substituída aqui, ela se torna ainda mais importante, já que é o conhecimento do domínio que permite julgar se o resultado do agente presta. Segundo, a própria troca, fazer brainstorming e visualizar ideias lado a lado com o agente, tende a revelar os "desconhecidos desconhecidos" que você nunca teria pensado em digitar num prompt.

My new way of working with AI Agents.
My new way of working with AI Agents. · Elvis Saravia

O Fable 5 voltou. As críticas também.

O modelo mais poderoso da Anthropic teve semanas difíceis. O Fable 5 foi lançado em 9 de junho, retirado do ar três dias depois por preocupações do Departamento de Comércio com controle de exportação, e voltou em 1º de julho, quando esses controles foram suspensos.

A volta veio com uma condição. Para obter a liberação, a Anthropic criou um classificador de segurança mais rígido, voltado a uma técnica de jailbreak relatada por um pesquisador da Amazon. A Anthropic diz que o novo classificador bloqueia essa técnica específica em mais de 99% das tentativas. O preço: ele também está barrando muitos pedidos comuns de programação e depuração, redirecionando-os discretamente para o Opus 4.8, menos capaz.

O grupo independente de benchmarks BridgeMind refez seus testes de programação no modelo relançado e relatou quedas bruscas. As notas de depuração caíram de 86,2 para 25,9, e as de refatoração, de 73,6 para 38,4. Desenvolvedores no Reddit e no X descreveram o mesmo padrão, reclamando que tarefas do dia a dia, incluindo muitas sem nenhuma questão real de segurança, estavam sendo jogadas para o modelo mais fraco.

A Anthropic afirma que o modelo em si não mudou, e os números parecem confirmar isso: na parcela menor de tarefas que não são barradas, o Fable 5 tem desempenho parecido com o de antes da proibição. O problema real é o redirecionamento. É um bom lembrete de que "o modelo ficou pior" e "as proteções ficaram mais rígidas" podem parecer idênticos vistos de fora, e, neste caso, é a segunda opção.

Além das mudanças no classificador, o acesso também tem limite: o Fable 5 está restrito a 50% do uso semanal de cada usuário até 12 de julho. Depois disso, passa para um sistema de pagamento por créditos para todos.


Do básico de GPU a escrever seus próprios kernels de inferência

Se uma carreira em infraestrutura de IA está nos seus planos, este repositório no GitHub é quase uma grade curricular completa. É um currículo em níveis, dos fundamentos de GPU até as otimizações usadas nos laboratórios de IA de ponta, organizado em três níveis de profundidade e várias trilhas: arquitetura de hardware, multiplicação de matrizes e tensor cores, kernels limitados por memória como FlashAttention e PagedAttention, abordagens de compilação como Triton e CUTLASS, sistemas de inferência em produção como vLLM e SGLang, e até uma trilha mais nova sobre agentes de IA que escrevem seus próprios kernels de GPU.

Ele é mantido pela Wafer, uma empresa que desenvolve ferramentas assistidas por IA para analisar e otimizar kernels de GPU. Seja começando do zero ou já à vontade com CUDA, é um ótimo mapa do que estudar a seguir.

wafer-ai/gpu-perf-engineering-resourcesA curated resource list for learning AI performance engineering, from GPU fundamentals to production inference.GitHub

Pare de pedir uma nota ao juiz. Faça perguntas de sim ou não.

Avaliar as respostas de um LLM com uma única nota dada por outro LLM é uma prática comum, mas tem uma fraqueza real: um número só quase não diz nada sobre o que de fato deu errado.

Um novo artigo chamado BINEVAL propõe uma solução. Em vez de pedir a um modelo que dê uma nota de 1 a 5 para uma resposta, ele decompõe cada critério de avaliação em pequenas perguntas de sim ou não e depois agrega as respostas numa nota. Em vez de "avalie a consistência factual deste resumo", você faz uma série de perguntas concretas: se todas as entidades citadas estão corretas, se algum número foi informado errado, se o resumo inventa informações que não estão na fonte.

Em três benchmarks consolidados, a abordagem decomposta igualou ou superou os avaliadores existentes, e foi especialmente boa em pegar erros factuais sutis. Os pesquisadores também usaram esse mesmo feedback por pergunta para melhorar prompts automaticamente, tanto do próprio avaliador quanto do modelo que gera as respostas, fazendo um modelo mais forte apontar as perguntas específicas em que um mais fraco discordava.

Ask, Don't Judge: Binary Questions for Interpretable LLM Evaluation and Self-ImprovementEvaluating LLM outputs remains a major bottleneck in NLP: human evaluation is expensive and slow, lexical metrics correlate poorly with human judgments on open-ended generation, and holistic LLM judges often produce opaque scores that are hard to debug. We propose BINEVAL, a framework that…arXiv.org

A China pode estar preparando sua própria versão da proibição de exportação de IA

Duas semanas depois de os EUA retirarem temporariamente os modelos Fable 5 e Mythos 5 da Anthropic por preocupações com controle de exportação, a China parece estar esboçando uma versão da mesma estratégia.

Segundo relatos, o Ministério do Comércio da China passou o último mês em conversas com Alibaba, ByteDance e a startup Z.ai sobre restringir o acesso estrangeiro aos seus modelos de IA mais avançados, incluindo alguns ainda não lançados. As propostas iriam além de uma simples proibição de exportação. Elas abrangeriam modelos fechados e de pesos abertos, o que significa que sistemas como o Qwen, da Alibaba, o Doubao, da ByteDance, e o GLM-5.2, da Z.ai, poderiam ser afetados. Uma das versões sugeria um sistema em camadas: ferramentas open source básicas com exigências leves de registro, tecnologias mais avançadas sob revisão de segurança e os modelos de ponta mais capazes restritos ao uso doméstico.

Nada foi decidido, e as autoridades envolvidas não se pronunciaram publicamente. Mas isso acontece em meio a um atrito crescente entre os setores de IA dos dois países: a Alibaba teria proibido seus funcionários de usar o Claude Code a partir desta semana, depois que um desenvolvedor encontrou na ferramenta um código feito para detectar se o usuário estava conectado a um laboratório de IA chinês, algo que a Anthropic disse ter como objetivo combater a destilação de modelos.

Se os dois governos acabarem restringindo seus próprios modelos de ponta dessa forma, o fluxo aberto e praticamente sem fronteiras de capacidade de IA que marcou os últimos dois anos pode começar a se fechar, dos dois lados ao mesmo tempo.


O modelo minúsculo que defende a IA rodando em casa

Enquanto os grandes laboratórios discutem controles de exportação, há uma tendência mais discreta que merece atenção: modelos ficando pequenos o bastante para rodar no seu próprio hardware.

O LFM2.5-VL-450M, da Liquid AI, é um bom exemplo. É um modelo de visão e linguagem com apenas 450 milhões de parâmetros, minúsculo perto dos modelos de 7B ou mais que costumam cuidar de tarefas com imagens, e roda inteiramente em um celular ou notebook. Apesar do tamanho, ele faz resposta a perguntas visuais, detecção de objetos com bounding boxes e extração de dados estruturados direto para JSON.

Parte do que torna isso possível é a arquitetura. A Liquid AI deixa de lado o design padrão de Transformer em favor de uma arquitetura não Transformer baseada em sistemas dinâmicos, que se mostra bem mais rápida e leve em memória, especialmente para contextos longos ou uso no próprio dispositivo.

Considerando o quanto desta edição fala sobre quem controla o acesso aos grandes modelos, um modelo realmente capaz que você roda localmente, sem API, sem limite de requisições, sem proteção que pode mudar da noite para o dia, começa a parecer menos uma novidade e mais uma proteção.

LFM2.5-VL-450M : This Tiny AI is Breaking the Internet 🤯 (Runs Locally!)
LFM2.5-VL-450M : This Tiny AI is Breaking the Internet 🤯 (Runs Locally!) · Codedigipt