Blog

  • LLMs: como a IA escolhe quais conteúdos mostrar

    LLMs: como a IA escolhe quais conteúdos mostrar

    No artigo anterior você entendeu como um modelo de linguagem busca e recupera informação antes de responder, o RAG. Mas recuperar a informação certa não adianta nada se o modelo não souber o que fazer com ela. É aqui que entra a peça que realmente escreve a resposta: o LLM.

    Antes de mais nada, o que é um LLM?

    LLM é a sigla para Large Language Model, ou modelo de linguagem de grande escala, em português. É o tipo de sistema por trás do ChatGPT, do Gemini, do Claude, e de praticamente todo assistente de IA que gera texto respondendo você.

    Mas calma antes de pensar em algo muito abstrato. Na essência, um LLM faz uma coisa só, e a faz repetidamente: prevê qual é a próxima palavra mais provável, dado tudo o que veio antes dela. Só isso. A conversa fluida, a resposta que parece raciocinar, o texto que soa natural, tudo isso é resultado de fazer essa previsão, palavra por palavra, bilhões de vezes, com muita precisão estatística.

    Parece simples demais pra explicar algo tão poderoso, eu sei. E é exatamente aí que mora o mal-entendido mais comum sobre o assunto.

    De onde veio esse conceito

    A arquitetura que tornou os LLMs atuais possíveis nasceu em 2017, num artigo de pesquisadores do Google chamado “Attention Is All You Need”. Ele apresentou o Transformer, um jeito novo de processar linguagem que, em vez de ler uma palavra de cada vez em sequência, como os modelos anteriores faziam, consegue olhar para todas as palavras de um texto ao mesmo tempo e decidir quais delas importam mais pra entender cada parte.

    Esse mecanismo de “decidir o que importa mais” se chama atenção, e é literalmente de onde vem o nome do artigo. Ele é o motivo pelo qual um modelo consegue entender que, na frase “o cliente que reclamou ontem voltou a comprar”, o “voltou” se refere ao cliente, não à reclamação, mesmo com várias palavras no meio. Sem isso, não existiria ChatGPT, Gemini, Claude, nem nenhum modelo de linguagem como os que usamos hoje.

    O que isso muda no entendimento de “pensar”

    Aqui vale um esclarecimento direto, porque ele muda a forma como você deveria escrever pra esse tipo de sistema: um LLM não verifica fato, ele estima probabilidade. Se um erro comum aparece descrito com muita frequência e consistência nos dados que o modelo processou, ele pode “prever” aquele erro como se fosse a resposta certa, com a mesma confiança que usaria pra uma informação verdadeira.

    É exatamente esse problema que o RAG, do artigo anterior, existe pra reduzir: em vez de o modelo confiar só na previsão baseada em padrão, ele consulta uma fonte real antes de responder. RAG e LLM não competem entre si, um recupera informação, o outro decide como usar essa informação pra formar frase. São duas camadas do mesmo processo, e cada uma tem uma função diferente.

    Token, não palavra

    Um detalhe técnico que muda como você deveria pensar sobre otimização de texto: o modelo não processa “palavra por palavra” no sentido literal, ele processa em tokens, que são pedaços de palavra. “Reconhecimento” pode virar dois ou três tokens diferentes, dependendo de como o texto foi cortado pelo tokenizador daquele modelo específico.

    Isso explica por que termo técnico muito específico, sigla pouco usada, ou nome próprio raro, às vezes confunde o modelo mais do que deveria: ele nunca viu aquela combinação exata de tokens com frequência suficiente pra prever bem o que vem depois dela. Termo comum e bem estabelecido tende a ser processado com mais precisão do que neologismo ou jargão interno de nicho.

    Por que isso muda o jeito de escrever pra ser entendido

    1. Ambiguidade custa caro. Se uma frase pode ser lida de duas formas diferentes, o modelo vai escolher a interpretação estatisticamente mais provável, não necessariamente a que você quis dizer. Clareza sintática não é luxo de redator obsessivo, é o que garante que a ideia certa seja a mais previsível dali.

    2. Contexto explícito supera contexto implícito. Um humano entende referência indireta, ironia, e informação subentendida pelo tom. Um modelo entende melhor quando a relação entre as ideias está dita, não sugerida. “O CAC caiu porque o orgânico passou a suprir parte da demanda” recupera e processa melhor do que deixar essa conexão implícita.

    3. Termo consistente ao longo do texto. Trocar de sinônimo por variedade estilística, prática comum em texto pensado só pra leitor humano, pode fragmentar como o modelo conecta os tokens relacionados ao mesmo conceito. Isso não significa escrever repetitivo, significa ser consistente com o termo central de cada seção.

    Se fosse só prever a próxima palavra, a resposta seria decorada

    Calma, porque tem uma pergunta óbvia aqui: se o modelo só prevê a próxima palavra mais provável, como ele consegue responder pergunta que nunca viu exatamente daquele jeito antes?

    A resposta está na escala. O modelo não decorou frase, ele aprendeu padrão de linguagem, relação entre conceito, e estrutura de raciocínio, a partir de uma quantidade de texto que nenhum ser humano conseguiria ler numa vida inteira. Isso permite generalizar pra situação nova, combinando padrões conhecidos de um jeito que nunca apareceu exatamente igual antes. Não é criatividade no sentido humano da palavra, mas também não é decoreba simples. É outra coisa, no meio do caminho, e é por isso que o resultado engana tanto.

    E o erro mais comum de quem tenta escrever pra IA é tratar isso como uma fórmula fixa, tipo “sempre comece com definição, sempre feche com lista”. Não existe fórmula única, porque o modelo está avaliando probabilidade em cada contexto específico, não seguindo um roteiro decorado. O que existe são princípios, os que você acabou de ler, não receita pronta.


    O que vem depois de entender LLM

    Se você ainda não leu, vale voltar em RAG pra entender a camada de busca que alimenta o modelo antes dele processar qualquer coisa. As duas juntas, recuperação e geração, são a base técnica de tudo.

    Agora, com as duas camadas entendidas, dá pra falar de estratégia de verdade: o que fazer, na prática, pra aumentar a chance de ser citado. Isso é assunto de GEO e Busca com IA, o próximo artigo dessa série.

    Se você trabalha com um site que depende de tráfego orgânico pra gerar receita, entender essas duas camadas não é curiosidade técnica, é a base de qualquer decisão de conteúdo daqui pra frente. Se quiser conversar sobre como isso se aplica ao seu caso específico, me chama.

    Falar com a Gabriely no LinkedIn

  • RAG: o mecanismo por trás da citação em resposta de IA

    RAG: o mecanismo por trás da citação em resposta de IA

    Você já perguntou alguma coisa pro ChatGPT ou pro Gemini e recebeu uma resposta com fonte citada, quase como se ele tivesse “pesquisado” antes de responder? Pois é exatamente isso que aconteceu. E entender esse mecanismo pode ser a diferença entre o seu conteúdo ser citado numa resposta de IA ou simplesmente não existir para ela.

    Antes de mais nada, o que é RAG?

    Se você chegou até aqui, provavelmente já ouviu falar em LLM, em busca com IA, ou já percebeu que o Google mudou. Muito bem, você está no lugar certo. Mas antes de falar de estratégia, precisamos entender o mecanismo por trás dela, porque é ele que explica tudo o que vem depois.

    RAG é a sigla para Retrieval-Augmented Generation, ou geração aumentada por recuperação, em português. Na prática, é o processo que permite a um modelo de linguagem buscar informação externa no momento em que responde, em vez de confiar só no que aprendeu durante o treinamento.

    Pensa assim: um modelo de linguagem sem RAG é como alguém respondendo uma prova só com o que decorou. Ele pode saber muita coisa, mas o conhecimento dele parou numa data específica, e ele não tem como confirmar se aquilo ainda é verdade. Um modelo com RAG é como alguém que, antes de responder, dá uma consultada rápida em fontes atualizadas e monta a resposta com base no que encontrou. É mais lento, mas é mais confiável, e principalmente, é verificável.

    De onde veio esse conceito

    O termo não é marketing recente disfarçado de novidade. RAG foi apresentado formalmente em 2020, num artigo de pesquisadores do FAIR, o laboratório de inteligência artificial da Meta, liderado por Patrick Lewis. A motivação original era resolver um problema bem específico: modelos de linguagem “alucinam”, ou seja, inventam informação com total confiança, porque eles geram texto prevendo a próxima palavra mais provável, não consultando fato algum.

    RAG nasceu como uma resposta técnica a esse problema, não como estratégia de marketing. Isso importa saber, porque explica por que o mecanismo prioriza precisão e verificabilidade acima de tudo, e é exatamente por isso que conteúdo vago, promocional ou sem fonte tem dificuldade de ser recuperado por ele.

    Como o RAG funciona, sem complicar

    O processo acontece em algumas etapas, e cada uma delas importa pra quem quer ser encontrado por esse mecanismo:

    • Fatiamento do conteúdo. Antes de qualquer busca acontecer, o conteúdo da internet precisa ser dividido em pedaços menores, chamados de chunks. Uma página inteira raramente é usada de uma vez, ela é quebrada em trechos que fazem sentido sozinhos.
    • Indexação vetorial. Cada pedaço vira uma representação matemática do significado dele, não das palavras exatas. É por isso que um modelo consegue conectar “como reduzir o custo de aquisição de cliente” com um texto seu que fala em “diminuir o CAC”, mesmo sem repetir os termos.
    • Recuperação. Quando alguém faz uma pergunta, o sistema busca, entre milhões de pedaços indexados, os que têm mais relação de significado com aquela pergunta específica.
    • Geração da resposta. Só depois de recuperar esses trechos é que o modelo de linguagem escreve a resposta, usando o que encontrou como base, e não apenas o que já sabia de antemão.

    Repara numa coisa importante: em nenhuma dessas etapas o modelo está “escolhendo” o seu site porque gosta dele, ou porque ele é grande, ou porque é conhecido. Ele está escolhendo o pedaço de texto que responde melhor àquela pergunta específica, com mais clareza. É um jogo diferente do SEO tradicional, e por isso a estratégia também precisa ser diferente.

    RAG não é a mesma coisa que busca por palavra-chave

    Vale um parênteses aqui, porque essa confusão é comum. Busca tradicional, a que você já conhece do Google, funciona majoritariamente por correspondência de termo: se a palavra que você digitou aparece na página, ou em variação próxima dela, existe chance de match.

    Busca vetorial, que é a que sustenta o RAG, funciona por proximidade de significado. Duas frases sem nenhuma palavra em comum podem ser consideradas equivalentes pelo sistema, se o significado por trás delas for o mesmo. E o inverso também é verdade: duas frases com palavras idênticas podem ser tratadas como distantes, se o contexto ao redor mudar o sentido.

    Isso tem uma consequência prática direta. Otimizar um texto repetindo a palavra-chave “SEO técnico” quinze vezes, prática que já era ultrapassada no Google tradicional, é ainda menos eficaz aqui. O que pesa é a clareza conceitual do trecho, não a frequência de um termo específico dentro dele.

    Por que isso muda o jeito de estruturar conteúdo

    Agora que você entende o mecanismo, dá pra entender por que ele muda tudo:

    1. Cada parágrafo precisa fazer sentido sozinho. Se o conteúdo depende do parágrafo anterior pra ser entendido, e ele for cortado num chunk separado, a resposta que o modelo constrói fica incompleta ou errada. Clareza por trecho importa mais do que fluidez de texto corrido.

    2. Estrutura marcada favorece a recuperação. Título, subtítulo, lista, pergunta e resposta direta. Tudo isso ajuda o sistema a identificar onde começa e termina uma ideia completa, o que aumenta a chance daquele trecho ser recuperado como resposta.

    3. Dado estruturado vira sinal de confiança. Schema markup não é só para rich snippet no Google tradicional. Ele ajuda sistemas de IA a confirmar do que se trata aquele conteúdo, sem precisar inferir a partir do texto solto.

    4. Ser citado não depende de ranquear em primeiro. Como o mecanismo busca por significado, não por posição em lista de resultado, uma página bem estruturada pode ser recuperada mesmo sem estar na primeira posição do Google tradicional. E o contrário também é verdade: estar em primeiro não garante nada aqui.

    Na prática: o que muda ao escrever um parágrafo

    Traduzindo os quatro pontos acima em decisão de escrita, no dia a dia:

    • Evite parágrafos que começam com “isso” ou “essa estratégia” sem repetir do que está falando. Se aquele trecho for lido sozinho, fora de contexto, “isso” não quer dizer nada.
    • Responda a pergunta no primeiro ou segundo período do parágrafo, não no final dele. Sistemas de recuperação priorizam trechos que entregam a resposta rápido.
    • Use número, dado e definição direta em vez de rodeio. “RAG reduz alucinação porque ancora a resposta em fonte recuperada” recupera melhor do que um parágrafo de contexto antes de chegar nessa frase.

    Se fosse só isso, todo mundo já estaria sendo citado

    Calma, porque aqui mora o ponto que a maioria do conteúdo sobre GEO por aí não conta. Estruturar bem um texto ajuda, mas não é garantia de citação, e desconfie de quem promete isso.

    O sistema de recuperação compete entre milhões de pedaços de conteúdo parecidos. Se a sua explicação sobre um tema é tecnicamente idêntica a outras cem que já existem na internet, não tem estrutura de texto que resolva, porque o problema não é de formato, é de originalidade. É a mesma lógica de sempre, só que mais exposta: conteúdo raso perde pra conteúdo específico, e agora isso é medido pelo próprio mecanismo de busca, não só pelo leitor.

    Tem outro erro comum, que é tratar RAG como se fosse só sobre o Google. Não é. O mesmo mecanismo está por trás de praticamente todo assistente de IA que busca informação externa antes de responder, o que significa que essa não é uma otimização pontual pra uma plataforma, é uma mudança estrutural em como conteúdo é encontrado, ponto.


    O que vem depois de entender RAG

    Entender como a informação é buscada e recuperada é só a primeira camada. A próxima pergunta é o que acontece depois que esse conteúdo chega até o modelo: como ele processa, pondera e decide o que efetivamente vira resposta. Isso é assunto pra falar sobre LLMs, que é o próximo artigo dessa série.

    E só depois de entender as duas camadas é que faz sentido falar de estratégia de verdade, que é o que tratamos em GEO e Busca com IA.

    Se você trabalha com um site que depende de tráfego orgânico pra gerar receita, essa não é uma leitura opcional pra daqui a alguns meses. Isso já está acontecendo agora. Se quiser conversar sobre como isso se aplica ao seu caso específico, me chama.

    Falar com a Gabriely no LinkedIn