XYZ BIMColectivo · Portugal Pesquisa
xyzbim.eu / pesquisa / visibilidade-ia · painel · ronda 0 · 2026-09-05

Visibilidade IA — quem os motores de resposta conseguem ler na construção

Painel público recorrente: dez perguntas fixas do sector, postas aos motores de resposta (ChatGPT, Claude, Gemini, Perplexity, Copilot) e às fontes que eles leem. A ronda 0 mede a camada de recuperação — estar rastreável, citável e estruturado — de 11 domínios que respondem a essas perguntas. As rondas seguintes acrescentam a SERP do Bing e os cinco assistentes, com sessão iniciada.

domínios auditados · perguntas fixas11 · 10 fontes que os motores de resposta leem
fora do Common Crawl (janela 2026-21 a 2026-34)1 xyzbim.eu
llms.txt verdadeiro3 de 11 dois soft-404 limpos na verificação
a bloquear crawlers de IA0 de 11 robots.txt de todos os domínios
Veredito — A única fonte invisível ao corpus é a casa — e a culpa não é técnica. Das onze fontes que os motores de resposta leem para perguntas da construção em Portugal, dez estão no
Common Crawl, várias com milhares de capturas. A que não está — zero capturas em todas as colecções testadas
até 5 de Setembro de 2026, incluindo uma de 2024 — é a única que publica llms.txt verdadeiro (um de três em
todo o conjunto), robots.txt
aberto a todos os crawlers de IA, sitemap com 77 URL e dados estruturados. A porta está arrumada; o problema
é que ninguém liga a ela de fora. Nenhuma menção de terceiros, nenhuma listicle, nenhum directório — e sem
links de fora não há entrada no crawl.

1 · Os cinco sinais, os onze domínios

Auditado por script a 2026-09-05, contra endpoints públicos. O Common Crawl é o corpus aberto que alimenta treino e recuperação; o llms.txt é a página de apresentação para modelos; o robots.txt diz quem pode entrar; o sitemap e o JSON-LD dizem o que há para ler e em que forma. A linha da casa está destacada — este painel mede-nos também.

domínioCommon Crawlllms.txtrobots (crawlers IA)sitemapJSON-LD
dre.pt
institucional PT
4000+não (soft-404)aberto
thefuture3d.com
listicle citada por assistentes
4000+simaberto17
ted.europa.eu
institucional UE
3000+nãoaberto2124
ipq.pt
institucional PT
2110nãosem robots.txt (404)5
base.gov.pt
institucional PT
2102+nãosem robots.txt (404)
impic.pt
institucional PT
1110nãoilegível (403)
builtcolab.pt
institucional PT
783não (soft-404)aberto
oasrs.org
institucional PT
675nãosem robots.txt (404)
clutch.co
directório de empresas
645simaberto592
truecadd.com
listicle citada por assistentes
280nãoaberto3481
xyzbim.eu
a casa
0simaberto771

Capturas no Common Crawl, por domínio

Mesma janela das quatro colecções recentes (2026-21 a 2026-34). Contagens cortadas nas 1000 capturas aparecem como «1000+»; escala linear até 1000. A casa é a barra vermelha.

thefuture3d.com
4000+
dre.pt
4000+
ted.europa.eu
3000+
ipq.pt
2110
base.gov.pt
2102+
impic.pt
1110
builtcolab.pt
783
oasrs.org
675
clutch.co
645
truecadd.com
280
xyzbim.eu
0

2 · Leituras da ronda 0

O corpus já fala português institucional. O Diário da República (4000+ capturas na janela), o IPQ, a BASE
e o IMPIC estão no Common Crawl em massa — pela idade e pelos links, não pela arrumação: o sitemap do IPQ
declara 5 URL, a maioria das institucionais não tem sitemap nenhum e nenhuma anuncia entidades em JSON-LD
(ronda 0, verificadas a 2026-09-05) [medido].
Quando um motor de resposta responde a uma pergunta normativa portuguesa, a matéria-prima existe no corpus;
o que falta a estas fontes é a forma (estrutura, metadados), não a presença.

A casa tem a forma e não tem a presença — o inverso exacto. É o achado mais útil da ronda: os dois tipos
de falha são independentes e pedem trabalhos diferentes. Para as institucionais, arranjar a forma. Para a
casa, arranjar a presença — ser referenciada a partir de páginas que já estão no crawl (directórios,
listicles, fichas de empresa), porque o Common Crawl não tem formulário de submissão: entra-se por links.

llms.txt é raro e às vezes um acidente. Três dos onze domínios têm um llms.txt verdadeiro. Outros dois
respondem `200 OK` a `/llms.txt` com uma página HTML de erro — um verificador ingénuo contaria «tem llms.txt».
A lição de método: cada sinal booleano deste painel foi confirmado por segunda verificação de conteúdo, não
por código de estado HTTP.

Nenhum domínio bloqueia os crawlers de IA. Os onze robots.txt (quatro deles inexistentes, um ilegível)
permitem GPTBot, ClaudeBot, PerplexityBot, CCBot e companhia. Em 2026, nesta amostra, o bloqueio a modelos
deixou de ser a norma — quem está fora do corpus está-o por não ser alcançado, não por se recusar a ser lido.

3 · Como medimos — e o que este painel não é

O painel. Dez perguntas fixas do sector da construção em Portugal, mantidas estáveis entre rondas:

A ronda 0 mediu a camada de recuperação — as condições objectivas para um domínio ser lido e citado —
em cinco sinais: capturas no Common Crawl (índice CDX, quatro colecções recentes, domínio e subdomínios,
contagem cortada às 1000 capturas por colecção) [medido], `llms.txt` (existência e conteúdo verificados, não só o
código HTTP), `robots.txt` (regras para dez crawlers de IA), `sitemap.xml` (URL declarados) e JSON-LD da
homepage (entidades estruturadas anunciadas).

O que este painel não é. Não mede se os assistentes citam ou recomendam alguém — isso é a ronda 1 e
exige sessão iniciada em cada assistente. Não pontua nem premia: regista sinais verificáveis.

Dois perigos de método registados, para quem replicar. Primeiro: o índice do Common Crawl devolve
`404` espúrios quando um shard está sob carga — a primeira passagem desta ronda dizia que o dre.pt e a
thefuture3d.com estavam ausentes, e estava errada; as contagens publicadas só aceitam um zero depois de
segunda chamada de confirmação. Segundo: o Bing serve resultados orgânicos plausíveis mas de outra query a
clientes sem sessão — para a mesma pergunta, quatro tentativas devolveram resultados sobre uma ponte de
Dublin, um restaurante de BBQ, um jogo de hóquei e páginas do Reddit. A SERP do Bing mede-se com sessão
humana; qualquer ferramenta que diga o contrário está a medir ruído — ou a não dizer como mede.

4 · A ronda 1

A ronda 1 acrescenta as duas camadas que exigem sessão humana: a SERP do Bing para as dez perguntas (que
domínios são devolvidos) e os cinco assistentes — ChatGPT, Claude, Gemini, Perplexity e Copilot — com as
mesmas perguntas, registando quem é mencionado e quem é citado com link. Cadência mensal; as perguntas não
mudam, para as rondas serem comparáveis. Se quiser ver um domínio seu auditado na ronda seguinte,
escreva para [email protected] — a auditoria de recuperação é gratuita e leva minutos.