XYZ BIMKollektiv · Portugal Forschung
xyzbim.eu / pesquisa / visibilidade-ia · Panel · Runde 0 · 2026-09-05

KI-Sichtbarkeit — wen die Answer Engines im Bauwesen lesen können

Wiederkehrendes öffentliches Panel: zehn feste Fragen der Branche, gestellt an die Answer Engines (ChatGPT, Claude, Gemini, Perplexity, Copilot) und an die Quellen, die sie lesen. Die Runde 0 misst die Retrieval-Schicht — crawlbar, zitierfähig und strukturiert sein — von 11 Domains, die diese Fragen beantworten. Die folgenden Runden ergänzen die Bing-SERP und die fünf Assistenten, mit eingeloggter Sitzung.

geprüfte Domains · feste Fragen11 · 10 Quellen, die die Answer Engines lesen
außerhalb des Common Crawl (Fenster 2026-21 bis 2026-34)1 xyzbim.eu
echtes llms.txt3 von 11 zwei saubere Soft-404s bei der Prüfung
KI-Crawler blockieren0 von 11 robots.txt aller Domains
Urteil — Die einzige Quelle, die für das Corpus unsichtbar ist, ist das eigene Haus — und es liegt nicht an der Technik. Von den elf Quellen, die die Answer Engines für Baufragen in Portugal lesen, sind zehn im
Common Crawl, mehrere mit Tausenden von Captures. Die fehlende — null Captures in allen getesteten Kollektionen
bis zum 5. September 2026, inklusive einer von 2024 — ist die einzige, die echtes llms.txt veröffentlicht (eine von drei in der
gesamten Stichprobe), eine robots.txt,
die allen KI-Crawlern offensteht, eine Sitemap mit 77 URLs und strukturierte Daten. Die Tür ist in Ordnung; das Problem
ist, dass niemand sie von außen verlinkt. Keine Erwähnung durch Dritte, keine Listicle, kein Verzeichnis — und ohne
Links von außen gibt es keinen Eingang in den Crawl.

1 · Die fünf Signale, die elf Domains

Per Skript geprüft am 2026-09-05, gegen öffentliche Endpunkte. Common Crawl ist das offene Corpus, das Training und Retrieval speist; llms.txt ist die Visitenkarte für Modelle; robots.txt sagt, wer eintreten darf; sitemap und JSON-LD sagen, was es zu lesen gibt und in welcher Form. Die Zeile des eigenen Hauses ist hervorgehoben — dieses Panel misst auch uns.

DomainCommon Crawlllms.txtrobots (KI-Crawler)sitemapJSON-LD
dre.pt
institutionell PT
4000+nein (Soft-404)offen
thefuture3d.com
Listicle, von Assistenten zitiert
4000+jaoffen17
ted.europa.eu
institutionell EU
3000+neinoffen2124
ipq.pt
institutionell PT
2110neinkeine robots.txt (404)5
base.gov.pt
institutionell PT
2102+neinkeine robots.txt (404)
impic.pt
institutionell PT
1110neinunlesbar (403)
builtcolab.pt
institutionell PT
783nein (Soft-404)offen
oasrs.org
institutionell PT
675neinkeine robots.txt (404)
clutch.co
Firmenverzeichnis
645jaoffen592
truecadd.com
Listicle, von Assistenten zitiert
280neinoffen3481
xyzbim.eu
das eigene Haus
0jaoffen771

Captures im Common Crawl, je Domain

Dasselbe Fenster der vier jüngsten Kollektionen (2026-21 bis 2026-34). Bei 1000 Captures gekappte Zählungen erscheinen als „1000+“; lineare Skala bis 1000. Das eigene Haus ist der rote Balken.

thefuture3d.com
4000+
dre.pt
4000+
ted.europa.eu
3000+
ipq.pt
2110
base.gov.pt
2102+
impic.pt
1110
builtcolab.pt
783
oasrs.org
675
clutch.co
645
truecadd.com
280
xyzbim.eu
0

2 · Lesarten der Runde 0

Das Corpus spricht bereits institutionelles Portugiesisch. O Diário da República (4000+ Captures im Fenster), das IPQ, die BASE
und das IMPIC sind massenhaft im Common Crawl — wegen des Alters und der Links, nicht wegen der Ordnung: Die Sitemap des IPQ
deklariert 5 URLs, die meisten institutionellen Seiten haben gar keine Sitemap, und keine weist Entitäten in JSON-LD aus
(Runde 0, geprüft am 2026-09-05) [gemessen].
Wenn eine Answer Engine eine portugiesische Normfrage beantwortet, existiert der Rohstoff im Corpus;
was diesen Quellen fehlt, ist die Form (Struktur, Metadaten), nicht die Präsenz.

Das Haus hat die Form und nicht die Präsenz — das exakte Gegenteil. Das ist der nützlichste Befund der Runde: Die beiden Arten
von Versagen sind unabhängig und verlangen unterschiedliche Arbeiten. Für die institutionellen Seiten: die Form in Ordnung bringen. Für das
Haus: die Präsenz — verlinkt werden von Seiten, die schon im Crawl stehen (Verzeichnisse,
Listicles, Firmenprofile), denn Common Crawl hat kein Anmeldeformular: Man kommt über Links herein.

llms.txt ist selten und manchmal ein Versehen. Drei der elf Domains haben ein echtes llms.txt. Zwei weitere
antworten `200 OK` auf `/llms.txt` mit einer HTML-Fehlerseite — ein naiver Prüfer würde „hat llms.txt“ zählen.
Die methodische Lektion: Jedes boolesche Signal dieses Panels wurde durch eine zweite Prüfung des Inhalts bestätigt, nicht
durch einen HTTP-Statuscode.

Keine Domain blockiert die KI-Crawler. Die elf robots.txt (vier davon nicht vorhanden, einer unlesbar)
erlauben GPTBot, ClaudeBot, PerplexityBot, CCBot und Konsorten. Im Jahr 2026, in dieser Stichprobe, ist das Blockieren von Modellen
nicht mehr die Norm — wer außerhalb des Corpus steht, steht dort, weil er nicht erreicht wird, nicht weil er sich weigert, gelesen zu werden.

3 · Wie wir messen — und was dieses Panel nicht ist

Das Panel. Zehn feste Fragen des Bausektors in Portugal, zwischen den Runden stabil gehalten:

Die Runde 0 hat die Retrieval-Schicht gemessen — die objektiven Bedingungen dafür, dass eine Domain gelesen und zitiert wird —
an fünf Signalen: Captures im Common Crawl (CDX-Index, vier jüngste Kollektionen, Domain und Subdomains,
Zählung gekappt bei 1000 Captures je Kollektion) [gemessen], `llms.txt` (Existenz und Inhalt geprüft, nicht nur der
HTTP-Code), `robots.txt` (Regeln für zehn KI-Crawler), `sitemap.xml` (deklarierte URLs) und JSON-LD der
Homepage (ausgewiesene strukturierte Entitäten).

Was dieses Panel nicht ist. Es misst nicht, ob die Assistenten jemanden zitieren oder empfehlen — das ist die Runde 1 und
verlangt eine eingeloggte Sitzung in jedem Assistenten. Es vergibt weder Punkte noch Preise: Es registriert überprüfbare Signale.

Zwei methodische Fallstricke, dokumentiert für alle, die replizieren. Erstens: Der Common-Crawl-Index liefert
Schein-`404`s, wenn ein Shard unter Last steht — der erste Durchlauf dieser Runde behauptete, dre.pt und
thefuture3d.com fehlten, und lag falsch; die veröffentlichten Zählungen akzeptieren eine Null erst nach
einem zweiten Bestätigungsaufruf. Zweitens: Bing serviert Kunden ohne Sitzung plausible organische Ergebnisse, aber von einer anderen
Query — auf dieselbe Frage lieferten vier Versuche Ergebnisse über eine Brücke in
Dublin, ein BBQ-Restaurant, ein Hockeyspiel und Reddit-Seiten. Die Bing-SERP wird mit menschlicher
Sitzung gemessen; jedes Tool, das etwas anderes behauptet, misst Rauschen — oder sagt nicht, wie es misst.

4 · Die Runde 1

Die Runde 1 ergänzt die beiden Schichten, die eine menschliche Sitzung verlangen: die Bing-SERP für die zehn Fragen (welche
Domains zurückgegeben werden) und die fünf Assistenten — ChatGPT, Claude, Gemini, Perplexity und Copilot — mit denselben
Fragen; protokolliert wird, wer erwähnt wird und wer mit Link zitiert wird. Monatlicher Takt; die Fragen ändern
sich nicht, damit die Runden vergleichbar bleiben. Wenn Sie eine Ihrer Domains in der nächsten Runde geprüft sehen möchten,
schreiben Sie an [email protected] — das Retrieval-Audit ist kostenlos und dauert Minuten.