Wiederkehrendes öffentliches Panel: zehn feste Fragen der Branche, gestellt an die Answer Engines (ChatGPT, Claude, Gemini, Perplexity, Copilot) und an die Quellen, die sie lesen. Die Runde 0 misst die Retrieval-Schicht — crawlbar, zitierfähig und strukturiert sein — von 11 Domains, die diese Fragen beantworten. Die folgenden Runden ergänzen die Bing-SERP und die fünf Assistenten, mit eingeloggter Sitzung.
Per Skript geprüft am 2026-09-05, gegen öffentliche Endpunkte. Common Crawl ist das offene Corpus, das Training und Retrieval speist; llms.txt ist die Visitenkarte für Modelle; robots.txt sagt, wer eintreten darf; sitemap und JSON-LD sagen, was es zu lesen gibt und in welcher Form. Die Zeile des eigenen Hauses ist hervorgehoben — dieses Panel misst auch uns.
| Domain | Common Crawl | llms.txt | robots (KI-Crawler) | sitemap | JSON-LD |
|---|---|---|---|---|---|
| dre.pt institutionell PT | 4000+ | nein (Soft-404) | offen | — | — |
| thefuture3d.com Listicle, von Assistenten zitiert | 4000+ | ja | offen | 1 | 7 |
| ted.europa.eu institutionell EU | 3000+ | nein | offen | 2124 | — |
| ipq.pt institutionell PT | 2110 | nein | keine robots.txt (404) | 5 | — |
| base.gov.pt institutionell PT | 2102+ | nein | keine robots.txt (404) | — | — |
| impic.pt institutionell PT | 1110 | nein | unlesbar (403) | — | — |
| builtcolab.pt institutionell PT | 783 | nein (Soft-404) | offen | — | — |
| oasrs.org institutionell PT | 675 | nein | keine robots.txt (404) | — | — |
| clutch.co Firmenverzeichnis | 645 | ja | offen | 59 | 2 |
| truecadd.com Listicle, von Assistenten zitiert | 280 | nein | offen | 348 | 1 |
| xyzbim.eu das eigene Haus | 0 | ja | offen | 77 | 1 |
Dasselbe Fenster der vier jüngsten Kollektionen (2026-21 bis 2026-34). Bei 1000 Captures gekappte Zählungen erscheinen als „1000+“; lineare Skala bis 1000. Das eigene Haus ist der rote Balken.
Das Corpus spricht bereits institutionelles Portugiesisch. O Diário da República (4000+ Captures im Fenster), das IPQ, die BASE
und das IMPIC sind massenhaft im Common Crawl — wegen des Alters und der Links, nicht wegen der Ordnung: Die Sitemap des IPQ
deklariert 5 URLs, die meisten institutionellen Seiten haben gar keine Sitemap, und keine weist Entitäten in JSON-LD aus
(Runde 0, geprüft am 2026-09-05) [gemessen].
Wenn eine Answer Engine eine portugiesische Normfrage beantwortet, existiert der Rohstoff im Corpus;
was diesen Quellen fehlt, ist die Form (Struktur, Metadaten), nicht die Präsenz.
Das Haus hat die Form und nicht die Präsenz — das exakte Gegenteil. Das ist der nützlichste Befund der Runde: Die beiden Arten
von Versagen sind unabhängig und verlangen unterschiedliche Arbeiten. Für die institutionellen Seiten: die Form in Ordnung bringen. Für das
Haus: die Präsenz — verlinkt werden von Seiten, die schon im Crawl stehen (Verzeichnisse,
Listicles, Firmenprofile), denn Common Crawl hat kein Anmeldeformular: Man kommt über Links herein.
llms.txt ist selten und manchmal ein Versehen. Drei der elf Domains haben ein echtes llms.txt. Zwei weitere
antworten `200 OK` auf `/llms.txt` mit einer HTML-Fehlerseite — ein naiver Prüfer würde „hat llms.txt“ zählen.
Die methodische Lektion: Jedes boolesche Signal dieses Panels wurde durch eine zweite Prüfung des Inhalts bestätigt, nicht
durch einen HTTP-Statuscode.
Keine Domain blockiert die KI-Crawler. Die elf robots.txt (vier davon nicht vorhanden, einer unlesbar)
erlauben GPTBot, ClaudeBot, PerplexityBot, CCBot und Konsorten. Im Jahr 2026, in dieser Stichprobe, ist das Blockieren von Modellen
nicht mehr die Norm — wer außerhalb des Corpus steht, steht dort, weil er nicht erreicht wird, nicht weil er sich weigert, gelesen zu werden.
Das Panel. Zehn feste Fragen des Bausektors in Portugal, zwischen den Runden stabil gehalten:
Die Runde 0 hat die Retrieval-Schicht gemessen — die objektiven Bedingungen dafür, dass eine Domain gelesen und zitiert wird —
an fünf Signalen: Captures im Common Crawl (CDX-Index, vier jüngste Kollektionen, Domain und Subdomains,
Zählung gekappt bei 1000 Captures je Kollektion) [gemessen], `llms.txt` (Existenz und Inhalt geprüft, nicht nur der
HTTP-Code), `robots.txt` (Regeln für zehn KI-Crawler), `sitemap.xml` (deklarierte URLs) und JSON-LD der
Homepage (ausgewiesene strukturierte Entitäten).
Was dieses Panel nicht ist. Es misst nicht, ob die Assistenten jemanden zitieren oder empfehlen — das ist die Runde 1 und
verlangt eine eingeloggte Sitzung in jedem Assistenten. Es vergibt weder Punkte noch Preise: Es registriert überprüfbare Signale.
Zwei methodische Fallstricke, dokumentiert für alle, die replizieren. Erstens: Der Common-Crawl-Index liefert
Schein-`404`s, wenn ein Shard unter Last steht — der erste Durchlauf dieser Runde behauptete, dre.pt und
thefuture3d.com fehlten, und lag falsch; die veröffentlichten Zählungen akzeptieren eine Null erst nach
einem zweiten Bestätigungsaufruf. Zweitens: Bing serviert Kunden ohne Sitzung plausible organische Ergebnisse, aber von einer anderen
Query — auf dieselbe Frage lieferten vier Versuche Ergebnisse über eine Brücke in
Dublin, ein BBQ-Restaurant, ein Hockeyspiel und Reddit-Seiten. Die Bing-SERP wird mit menschlicher
Sitzung gemessen; jedes Tool, das etwas anderes behauptet, misst Rauschen — oder sagt nicht, wie es misst.
Die Runde 1 ergänzt die beiden Schichten, die eine menschliche Sitzung verlangen: die Bing-SERP für die zehn Fragen (welche
Domains zurückgegeben werden) und die fünf Assistenten — ChatGPT, Claude, Gemini, Perplexity und Copilot — mit denselben
Fragen; protokolliert wird, wer erwähnt wird und wer mit Link zitiert wird. Monatlicher Takt; die Fragen ändern
sich nicht, damit die Runden vergleichbar bleiben. Wenn Sie eine Ihrer Domains in der nächsten Runde geprüft sehen möchten,
schreiben Sie an [email protected] — das Retrieval-Audit ist kostenlos und dauert Minuten.