Painel público recorrente: dez perguntas fixas do sector, postas aos motores de resposta (ChatGPT, Claude, Gemini, Perplexity, Copilot) e às fontes que eles leem. A ronda 0 mede a camada de recuperação — estar rastreável, citável e estruturado — de 11 domínios que respondem a essas perguntas. As rondas seguintes acrescentam a SERP do Bing e os cinco assistentes, com sessão iniciada.
Auditado por script a 2026-09-05, contra endpoints públicos. O Common Crawl é o corpus aberto que alimenta treino e recuperação; o llms.txt é a página de apresentação para modelos; o robots.txt diz quem pode entrar; o sitemap e o JSON-LD dizem o que há para ler e em que forma. A linha da casa está destacada — este painel mede-nos também.
| domínio | Common Crawl | llms.txt | robots (crawlers IA) | sitemap | JSON-LD |
|---|---|---|---|---|---|
| dre.pt institucional PT | 4000+ | não (soft-404) | aberto | — | — |
| thefuture3d.com listicle citada por assistentes | 4000+ | sim | aberto | 1 | 7 |
| ted.europa.eu institucional UE | 3000+ | não | aberto | 2124 | — |
| ipq.pt institucional PT | 2110 | não | sem robots.txt (404) | 5 | — |
| base.gov.pt institucional PT | 2102+ | não | sem robots.txt (404) | — | — |
| impic.pt institucional PT | 1110 | não | ilegível (403) | — | — |
| builtcolab.pt institucional PT | 783 | não (soft-404) | aberto | — | — |
| oasrs.org institucional PT | 675 | não | sem robots.txt (404) | — | — |
| clutch.co directório de empresas | 645 | sim | aberto | 59 | 2 |
| truecadd.com listicle citada por assistentes | 280 | não | aberto | 348 | 1 |
| xyzbim.eu a casa | 0 | sim | aberto | 77 | 1 |
Mesma janela das quatro colecções recentes (2026-21 a 2026-34). Contagens cortadas nas 1000 capturas aparecem como «1000+»; escala linear até 1000. A casa é a barra vermelha.
O corpus já fala português institucional. O Diário da República (4000+ capturas na janela), o IPQ, a BASE
e o IMPIC estão no Common Crawl em massa — pela idade e pelos links, não pela arrumação: o sitemap do IPQ
declara 5 URL, a maioria das institucionais não tem sitemap nenhum e nenhuma anuncia entidades em JSON-LD
(ronda 0, verificadas a 2026-09-05) [medido].
Quando um motor de resposta responde a uma pergunta normativa portuguesa, a matéria-prima existe no corpus;
o que falta a estas fontes é a forma (estrutura, metadados), não a presença.
A casa tem a forma e não tem a presença — o inverso exacto. É o achado mais útil da ronda: os dois tipos
de falha são independentes e pedem trabalhos diferentes. Para as institucionais, arranjar a forma. Para a
casa, arranjar a presença — ser referenciada a partir de páginas que já estão no crawl (directórios,
listicles, fichas de empresa), porque o Common Crawl não tem formulário de submissão: entra-se por links.
llms.txt é raro e às vezes um acidente. Três dos onze domínios têm um llms.txt verdadeiro. Outros dois
respondem `200 OK` a `/llms.txt` com uma página HTML de erro — um verificador ingénuo contaria «tem llms.txt».
A lição de método: cada sinal booleano deste painel foi confirmado por segunda verificação de conteúdo, não
por código de estado HTTP.
Nenhum domínio bloqueia os crawlers de IA. Os onze robots.txt (quatro deles inexistentes, um ilegível)
permitem GPTBot, ClaudeBot, PerplexityBot, CCBot e companhia. Em 2026, nesta amostra, o bloqueio a modelos
deixou de ser a norma — quem está fora do corpus está-o por não ser alcançado, não por se recusar a ser lido.
O painel. Dez perguntas fixas do sector da construção em Portugal, mantidas estáveis entre rondas:
A ronda 0 mediu a camada de recuperação — as condições objectivas para um domínio ser lido e citado —
em cinco sinais: capturas no Common Crawl (índice CDX, quatro colecções recentes, domínio e subdomínios,
contagem cortada às 1000 capturas por colecção) [medido], `llms.txt` (existência e conteúdo verificados, não só o
código HTTP), `robots.txt` (regras para dez crawlers de IA), `sitemap.xml` (URL declarados) e JSON-LD da
homepage (entidades estruturadas anunciadas).
O que este painel não é. Não mede se os assistentes citam ou recomendam alguém — isso é a ronda 1 e
exige sessão iniciada em cada assistente. Não pontua nem premia: regista sinais verificáveis.
Dois perigos de método registados, para quem replicar. Primeiro: o índice do Common Crawl devolve
`404` espúrios quando um shard está sob carga — a primeira passagem desta ronda dizia que o dre.pt e a
thefuture3d.com estavam ausentes, e estava errada; as contagens publicadas só aceitam um zero depois de
segunda chamada de confirmação. Segundo: o Bing serve resultados orgânicos plausíveis mas de outra query a
clientes sem sessão — para a mesma pergunta, quatro tentativas devolveram resultados sobre uma ponte de
Dublin, um restaurante de BBQ, um jogo de hóquei e páginas do Reddit. A SERP do Bing mede-se com sessão
humana; qualquer ferramenta que diga o contrário está a medir ruído — ou a não dizer como mede.
A ronda 1 acrescenta as duas camadas que exigem sessão humana: a SERP do Bing para as dez perguntas (que
domínios são devolvidos) e os cinco assistentes — ChatGPT, Claude, Gemini, Perplexity e Copilot — com as
mesmas perguntas, registando quem é mencionado e quem é citado com link. Cadência mensal; as perguntas não
mudam, para as rondas serem comparáveis. Se quiser ver um domínio seu auditado na ronda seguinte,
escreva para [email protected] — a auditoria de recuperação é gratuita e leva minutos.