
llms.txt está morto em 2026? O que o estudo da SE Ranking encontrou
10,13% dos domínios indexados publicam llms.txt; 0% dos top 1000. SE Ranking, maio/2026, não encontrou lift mensurável. O que realmente move citação.
A atualização honesta
Publicamos O Que É llms.txt e Por Que Todo Site Precisa de Um em 2026 em 2026-04-22. O post argumentava que llms.txt era o padrão de fato de identidade de IA e logo seria universal. Citava um estudo de N pequeno sugerindo que sites com llms.txt eram 1,6x mais propensos a serem citados corretamente pelo Perplexity.
A SE Ranking rodou a maior análise de llms.txt até hoje em maio de 2026 - cerca de 300.000 domínios indexados, controlados por autoridade de site, densidade de markup de schema e recência de conteúdo. Os achados não suportam a versão forte daquela afirmação anterior. Suportam uma versão mais branda. Este post é a atualização.
Os números headline do dataset SE Ranking:
| Métrica | Mai 2026 | Abr 2025 |
|---|---|---|
| Adoção de llms.txt, todos os domínios | 10,13% | 0,4% |
| Adoção de llms.txt, top 1000 domínios | 0% | 0% |
| Lift de taxa de citação atribuível ao llms.txt (controlado) | não estatisticamente significativo | (N pequeno) +60% reportado |
| Comprimento ótimo por regressão de taxa de citação | ≈ 800 caracteres | (recomendado) 800-3000 caracteres |
A adoção cresceu ~25x em 13 meses, o que é genuíno. O sinal é real. A alavancagem em citações não é a que a narrativa do início de 2025 implicava. O topo da web - os publicadores e plataformas de alto tráfego cuja adoção forçaria motores de IA a tratar o arquivo como autoritativo - não se moveu. O meio da web adotou pesadamente, é por isso que a adoção agregada parece um hockey stick por baixo e uma linha plana por cima.
O que as cifras iniciais realmente mediam
A cifra de 1,6x de precisão de citação amplamente citada de abril de 2025 era um estudo inicial de N pequeno no nível de alguns milhares de domínios, sem controle para autoridade de site, densidade de schema ou recência de conteúdo. O estudo maior da SE Ranking replicou a metodologia em escala de ~300K domínios com os controles adicionados. O lift atribuível à presença de llms.txt especificamente - tudo mais constante - encolheu para um efeito não significativo.
A interpretação mais limpa: o lift original de 1,6x foi um confundimento de população-de-publicadores. Os publicadores que adotaram llms.txt cedo em 2025 eram também os publicadores fazendo todas as outras melhores práticas AEO - markup FAQPage, recência de conteúdo, Q&A estruturado, internal linking, tudo. O lift de citação veio do pacote de práticas que adotantes iniciais shipparam juntos, não do arquivo llms.txt em si.
Este é o padrão standard quando um novo sinal recebe uma leitura inicial forte. Os adotantes iniciais se auto-selecionam; o lift parece atribuível ao novo sinal; replicação com N maior com controles dissolve o efeito. Aconteceu com sinais adjacentes a PageRank nos anos 2010, com sinais de structured data nos anos 2010, e agora com llms.txt em 2025-2026. A resposta correta é a mesma em todo caso: atualizar o modelo.
O que os dados de maio de 2026 mostram que eleva citações
O conjunto de controle positivo do estudo SE Ranking manteve a presença de llms.txt constante e variou a densidade de markup de schema no conteúdo em si. Os resultados nos quatro principais motores de IA estudados - ChatGPT search, Claude, Perplexity e Google AI Mode - mostraram quatro sinais limpos.
FAQPage com pares Q/A reais
FAQPage com 4+ pares Question/Answer escopados a perguntas que usuários de fato fazem, com respostas ≥300 caracteres cada: +34% de taxa de citação no Perplexity, +28% no ChatGPT search, controlando por recência de conteúdo e autoridade de domínio.
O mecanismo é mecânico. Motores de IA puxam pares Q/A marcados como FAQPage quase verbatim em snippets de citação quando a pergunta combina com a query do usuário. Uma página com 6 pares Q/A bem marcados que endereçam 6 intents distintos de usuário é, efetivamente, 6 oportunidades de citação competindo por 6 queries diferentes. Uma página com o mesmo conteúdo em forma de parágrafo corrido é 1 oportunidade de citação, e o motor de IA tem que fazer o trabalho de extração ele mesmo, o que faz com menos confiabilidade.
Documentamos esse padrão em FAQPage Schema for Citation Lift e o conselho operacional não mudou - 4-6 pares Q/A por página de conteúdo, cada um ≥300 caracteres, cada um endereçando uma pergunta de usuário distinta, cada um pontuado contra as queries de busca reais que a página alveja.
ClaimReview em parágrafos densos em stats
ClaimReview com claimReviewed e reviewRating envolvendo afirmações estatísticas verificáveis: +41% de taxa de citação no AI Mode no conteúdo marcado, no mesmo estudo.
O mecanismo é sinal. A maioria dos parágrafos densos em stats na web é sem fonte; o AI Mode os penaliza. Um parágrafo envolto em ClaimReview diz ao motor que a afirmação foi revisada e avaliada, o que a eleva acima de afirmações concorrentes sem fonte mesmo quando os números subjacentes são idênticos.
O imposto de implementação é real - cada bloco ClaimReview requer claimReviewed (a proposição sendo revisada), reviewRating (numérico, em escala definida), author (o revisor), datePublished e itemReviewed.url (a fonte revisada). Para uma equipe de conteúdo entregando 4 posts densos em stats por mês, o overhead de markup por post é cerca de 15 minutos. O lift em citações do AI Mode mais que paga esse tempo.
Ligações SameAs
Organization schema com SameAs URLs apontando para Wikidata, LinkedIn, Crunchbase, GitHub, e (quando aplicável) Twitter e YouTube: +22% de precisão de desambiguação de entidade nos quatro motores estudados.
O mecanismo é verificação. Há pelo menos 4 empresas chamadas "Inite" em viagens, fitness e consultoria. Há pelo menos 12 produtos de software "Apex". Quando um motor de IA resolve uma entity-reference em query do usuário → entidade → URL do site, ele cruza os SameAs targets para confirmar que está mapeando para a entidade certa. SameAs para Wikidata é o sinal único mais forte porque Wikidata é o grafo canônico de entidade ao qual os grandes motores deferem.
Três SameAs URLs - Wikidata + LinkedIn + GitHub - entregaram cerca de 80% do lift de desambiguação de entidade nos dados SE Ranking. O 4º e o 5º targets adicionaram pequenos lifts marginais. Passando dos 5-6 targets, o lift platôs.
Speakable com cssSelector
Schema speakable com cssSelector apontando para blocos de resposta direta (.aeo-direct-answer ou pares H1+H2): +18% de precisão de extração de resposta no AI Mode, onde o trecho citado correspondeu ao texto marcado como speakable em vez de outro trecho na mesma página.
O mecanismo é dica. A propriedade speakable diz ao motor "este trecho é uma resposta limpa a uma pergunta e é adequado para extração de voz/resposta". AI Mode é o motor que escuta esse sinal mais agressivamente. ChatGPT e Claude escutam menos; Perplexity, no estudo SE Ranking, não mostrou resposta mensurável especificamente ao speakable (embora sua lógica de citação pareça favorecer trechos curtos, declarativos e front-loaded - que é o que trechos marcados como speakable tendem a ser).
Documentamos o padrão em Direct Answer Blocks for AEO e o analisador inite.ai verifica isso em toda auditoria.
O que llms.txt ainda faz bem
O frame contrarian não deve passar do ponto. llms.txt continua sendo a superfície certa para dois trabalhos específicos que as métricas de taxa de citação do SE Ranking não medem diretamente.
Desambiguação de entidade. Se sua marca tem nome não único, llms.txt é um de vários inputs que um motor de IA usa para decidir qual entidade você é. O estudo SE Ranking não mediu precisão de desambiguação de entidade como função da presença de llms.txt; mediu taxa de citação. Ainda não há estudo de N grande publicado isolando a contribuição do llms.txt à desambiguação de entidade. O mecanismo é plausível - um H1 claro com o nome legal, uma descrição de uma linha e uma âncora SameAs inequívoca no markdown ajudam o motor a fixar a entidade - mas o caso quantitativo está por fazer.
Roteamento programático de instruções. Se você quer que agentes de IA busquem em /docs/llm-overview.md em vez do landing de vendas, llms.txt é onde esse roteamento se declara. Conforme agentic browsing cruza 5-10% de tráfego inbound em 2026, isto importa mais, não menos. O dataset SE Ranking mediu taxas de citação de interfaces de search-flavor (ChatGPT search, Perplexity, AI Mode), não roteamento de tráfego agêntico - então esta dimensão está fora do que foi medido.
Nenhum dos dois mapeia para um lift limpo de taxa de citação nos números de maio de 2026. Ambos são reais. A posição honesta em meados de 2026: entregue llms.txt, entregue bem, mas não venda o trabalho como projeto de citation-lift. O lift vem do substrato FAQPage / ClaimReview / SameAs / speakable ao redor.
Para onde o tempo deve ir
Se uma equipe tem 8 horas de tempo AEO por semana em meados de 2026, os achados SE Ranking apontam para uma alocação limpa. Usamos esta alocação na ferramenta /analyze e em nossa própria equipe de conteúdo:
| Horas/sem | Atividade | Base de lift de citação |
|---|---|---|
| 4 | Markup FAQPage + ClaimReview + speakable em conteúdo novo e existente | +28-41% por motor |
| 2 | Manutenção SameAs + refresh de recência de conteúdo nos top 20 cited pages | +22% disambiguação, evitada penalidade de staleness de 12% |
| 1 | Tier de identidade (llms.txt, ai.txt, robots-ai.txt, .well-known/agent-actions) | substrato; sem lift isolado |
| 1 | Citation tracking + medição (ver Citation Tracking Metrics) | loop de feedback |
Isto é o reverso da alocação de abril de 2025, quando equipes entregavam arquivos llms.txt + ai.txt grandes primeiro e adicionavam markup de schema depois. Os dados de maio de 2026 inverteram a prioridade.
O que mudaria nossa opinião
Duas coisas precisam ser verdade para llms.txt importar mais em 2027 do que em 2026.
Adoção nos top 1000 precisa cruzar 25-40%. Enquanto a web de alto tráfego não publica llms.txt, motores de IA constroem seus pipelines de citação sem ele como input primário. Eles não podem tornar um arquivo autoritativo quando 0 dos 1000 top sites o publicam. O caminho mais rápido adiante é um default de plataforma grande - Shopify, Vercel, WordPress ou Squarespace entregando llms.txt por padrão em todo site cliente. Nenhum desses aconteceu. Se um acontecer, o cálculo muda.
A spec precisa padronizar em um schema pequeno e machine-readable. A spec atual é markdown freeform, o que significa que cada motor de IA acaba parsing-a diferente e tratando-a como dica em vez de contrato. O trabalho de draft IETF sobre AI Identity - informalmente trackado ao lado da spec Web Bot Auth HTTP Message Signatures - aponta para um perfil de identidade compatível com JSON-LD que motores poderiam confiar como contrato. Se um schema pequeno e estrito aterrissa e os principais motores se comprometem a honrá-lo, o arquivo volta a ser de alta alavancagem.
Nenhuma das mudanças é iminente. Revisitamos em outubro de 2026 com o refresh H2 do SE Ranking.
O que mudou no analisador
A repesagem da pontuação de citation-readiness da ferramenta /analyze, motivada diretamente pelos achados SE Ranking:
| Componente da pontuação | Peso antigo | Peso novo |
|---|---|---|
| Superfície de identidade (llms.txt, ai.txt, robots-ai.txt, .well-known/agent-actions) | 35% | 15% |
| Padrões de schema (FAQPage, ClaimReview, SameAs, speakable, Organization) | 30% | 50% |
| Recência de conteúdo + densidade de resposta direta | 25% | 25% |
| Política robots + higiene de crawler allowlist | 10% | 10% |
A pontuação nova reflete melhor onde o lift empírico de fato vive em meados de 2026. Findings no relatório do analisador agora carregam uma estimativa per-finding de lift de citação atrelada ao dataset SE Ranking - assim uma equipe entregando FAQPage com 6 pares Q/A vê um explícito "+34% Perplexity citation rate (SE Ranking 2026 estimate)" anexado a essa finding.
As outras ferramentas do analisador - citation tracking, ai-crawler allowlist, browser-agent readiness - todas sentam no mesmo produto. A repesagem é uma atualização, não um relançamento.
O resumo em uma frase
llms.txt não está morto nem é inútil, mas não é a alavanca de citação que a narrativa do início de 2025 implicava; o estudo SE Ranking de maio de 2026 nos diz onde o lift de fato vive em meados de 2026, que é o substrato Schema.org - FAQPage, ClaimReview, SameAs, speakable - e é aí que equipes com 8 horas de tempo AEO por semana devem gastá-lo.
Atualize o modelo quando os dados com N maior mandarem. Ajuste a alocação. Continue entregando.
01Se 10,13% dos domínios têm llms.txt e não eleva citações, por que publicá-lo?+
Porque a ausência de um aumento mensurável de citação no agregado não é o mesmo que o arquivo não ter propósito. llms.txt continua sendo a superfície certa para dois trabalhos específicos que as métricas de taxa de citação não medem diretamente. (1) Desambiguação de entidade - se sua marca tem nome não único (há pelo menos 4 empresas chamadas 'Inite' em viagens, fitness e consultoria), llms.txt é um dos inputs que um motor de IA usa para decidir qual entidade você é. O estudo SE Ranking não mediu precisão de desambiguação de entidade diretamente; mediu taxa de citação. (2) Roteamento programático de instruções - se você quer que agentes de IA busquem em /docs/llm-overview.md em vez do landing de vendas, llms.txt é onde esse roteamento se declara. Nenhum dos dois mapeia limpamente em uplift de taxa de citação, mas ambos são reais e ambos importam quando seu tráfego de agentic browsing passa de 5% do total. A posição honesta em meados de 2026: entregue llms.txt, entregue bem, mas não venda o trabalho como projeto de citation-lift. O lift vem do substrato FAQPage / ClaimReview / SameAs / speakable ao redor.
02O que a narrativa de abril de 2025 errou sobre llms.txt?+
Três coisas. (1) A cifra de 1,6x de precisão de citação amplamente citada de um estudo inicial com N pequeno não sobreviveu à replicação com N maior. A análise de ~300K domínios da SE Ranking em escala não mostrou lift estatisticamente significativo na taxa de citação atribuível à presença de llms.txt, após controlar pelos confundidores. A descoberta original parece um efeito de população-de-publicadores: os publicadores que adotaram llms.txt cedo também faziam todas as outras melhores práticas AEO, e o lift de citação veio do pacote, não do arquivo. (2) Projetava-se que a adoção seguiria a trajetória do robots.txt rumo à cobertura universal. Na prática, estagnou no mid-tier e não penetrou nos top 1000 da web de alto tráfego. As principais plataformas de conteúdo, os principais varejistas, as principais casas de mídia - nenhuma delas tem llms.txt em maio de 2026, o que significa que os motores de IA não podem confiar nele como sinal primário mesmo se quisessem. (3) O contrato foi superespecificado - templates iniciais sugeriam arquivos markdown de 3-5 KB com árvores de produto detalhadas. A maioria dos motores de IA, quando busca llms.txt, trata-o como dica, não contrato. O llms.txt de 144 linhas vs o de 39 linhas não produz diferença mensurável nem em precisão de desambiguação de entidade nem em taxa de citação. O comprimento ótimo pelos dados SE Ranking está mais próximo de 800 caracteres do que de 3 KB.
03Então o que move a agulha da citação em meados de 2026?+
Markup Schema.org no próprio conteúdo que precisa ser citado, não arquivos identidade-declarativos na raiz. O conjunto de controle positivo do dataset SE Ranking - sites com a mesma presença de llms.txt e densidade de schema variável - mostrou correlação linear limpa entre contagem de marcadores de schema e taxa de citação. Quatro padrões específicos de markup produziram os lifts mais limpos. (1) FAQPage com 4+ pares Question/Answer escopados a perguntas que usuários de fato fazem: +34% Perplexity, +28% ChatGPT search. O mecanismo é mecânico - motores de IA puxam esses Q/A diretamente em seus snippets de citação. (2) ClaimReview com claimReviewed + reviewRating envolvendo afirmações estatísticas verificáveis: +41% de taxa de citação no AI Mode no conteúdo marcado. O mecanismo é sinal - o schema diz ao motor que a afirmação foi revisada, o que a eleva acima de afirmações concorrentes sem fonte. (3) Organization com SameAs URLs apontando para Wikidata, LinkedIn, Crunchbase, GitHub, e (quando aplicável) Twitter e YouTube: +22% de precisão de desambiguação de entidade. O mecanismo é verificação - motores de IA cruzam as entradas SameAs para confirmar que estão falando da entidade certa. (4) Speakable com cssSelector apontando para blocos de resposta direta: +18% de precisão de extração de resposta no AI Mode. O mecanismo é dica - o schema diz ao motor 'este trecho é uma resposta limpa a uma pergunta', o que o eleva acima de trechos concorrentes na mesma página. Empilhe os quatro em uma página e os lifts marginais compõem, modestamente. Nenhum dos quatro precisa de llms.txt para funcionar.
04Como uma equipe em meados de 2026 deve realmente investir seu tempo AEO?+
Prioridade em três tiers. Tier 1 - entregue os quatro padrões de schema acima em toda página de conteúdo que deva ser citada. FAQPage com pares Q/A reais, distintos, úteis ≥300 caracteres cada. ClaimReview em parágrafos densos em stats. Organization SameAs na raiz do site. Speakable nos blocos de resposta direta. É aqui que vivem os lifts de taxa de citação de 18-41%. Tier 2 - acerte a superfície de identidade de entidade. Publique llms.txt (pequeno, ~800 caracteres, conciso), ai.txt com a detalhe SEMrush-grade mostrada no [post original de comparação llms.txt](/pt/blog/llms-txt-vs-ai-txt-vs-robots-txt), .well-known/agent-actions para endpoints de checkout agêntico se você tem, e um robots.txt limpo allowlistando GPTBot/ClaudeBot/PerplexityBot/Google-Extended explicitamente. Este é o substrato que permite os outros sinais aterrissarem. O lift não é mensurável isoladamente, mas a ausência deste tier silenciosamente limita os demais. Tier 3 - o trabalho mais difícil e lento que produz lift composto. O [padrão de bloco de resposta direta](/pt/blog/direct-answer-blocks-aeo) - um parágrafo de 300-700 caracteres por página que responde limpamente à pergunta principal da página. As [métricas de citation tracking](/pt/blog/citation-tracking-aeo-metrics) que permitem medir seu próprio lift semana a semana. A disciplina de recência de conteúdo que faz você ser re-fetched. O padrão de internal linking que consolida autoridade tópica. Isto é 80% do teto de taxa de citação. Gastar tempo de Tier 3 em um llms.txt perfeito é capital mal alocado.
05O que isso significa especificamente para o produto analisador AEO inite.ai?+
O analisador em [/analyze](/pt/analyze) verifica llms.txt, ai.txt, .well-known/agent-actions, robots.txt e o grafo completo de markup Schema.org - o mesmo pipeline de nove passos de sempre. O que está mudando na iteração de produto H2 2026, motivada diretamente pelos achados SE Ranking: a pontuação de citation-readiness retornada pelo analisador está sendo repesada. A ponderação atual era substrate-heavy (llms.txt + ai.txt + robots-ai.txt respondiam por 35% da pontuação). A repesagem de meados de 2026 empurra isso para 15% e eleva a ponderação dos padrões de schema de 30% para 50%. Presença e qualidade de FAQPage / ClaimReview / SameAs / speakable são agora o eixo dominante da pontuação, com recência de conteúdo e densidade de resposta direta em 25%, e superfície de identidade em 15%. O relatório completo do analisador agora vem com uma estimativa per-finding de lift de citação atrelada ao dataset SE Ranking - assim uma equipe que entrega FAQPage com 6 pares Q/A vê um explícito '+34% Perplexity citation rate (SE Ranking 2026 estimate)' nessa finding. O trabalho do produto é dizer às equipes onde o lift de fato vive em meados de 2026, não onde costumava viver em meados de 2025.
06llms.txt vai voltar? O que precisa ser verdade para que importe mais?+
Duas coisas precisam mudar. (1) Adoção nos top 1000 precisa cruzar algum limiar - provavelmente 25-40% - para que motores de IA tratem a ausência de llms.txt como sinal faltante. Enquanto o topo da web não publica, os motores constroem seus pipelines sem ele como input primário, o que significa que publicar permanece de baixa alavancagem. O caminho mais rápido para adoção nos top 1000 é um mandato de plataforma grande - Shopify, Vercel, WordPress ou Squarespace entregando llms.txt por padrão em todo site cliente - o que não aconteceu. (2) A spec precisa padronizar em um schema pequeno e machine-readable em vez de markdown freeform. O draft IETF sobre AI Identity (informalmente trackado ao lado da spec Web Bot Auth HTTP Message Signatures) aponta nessa direção. Um perfil de identidade padronizado - provavelmente compatível com JSON-LD, provavelmente um superset estrito de Schema.org Organization - seria a versão do llms.txt na qual motores de IA poderiam confiar como contrato em vez de dica. Se ambos acontecerem, o arquivo importa mais em 2027. Se nenhum acontecer, llms.txt permanece uma superfície útil mas secundária, exatamente como é hoje.


