Kurze Antwort: robots.txt teilt Suchmaschinen und AI-Crawlern mit, welche Pfade in Ihrem Shop sie crawlen dürfen. Shopify bietet eine sinnvolle Standardeinstellung und ermöglicht es Ihnen, diese mit einer robots.txt.liquid-Vorlage anzupassen. Der häufige, kostspielige Fehler besteht darin, versehentlich Produkt- oder Kollektionspfade zu blockieren, was sie deindexiert. Für die AI-Suche sollten Sie die Crawler, von denen Sie zitiert werden möchten, explizit zulassen — GPTBot, ClaudeBot, PerplexityBot und Google-Extended.
Ihre robots.txt teilt Suchmaschinen und AI-Crawlern mit, was sie in Ihrem Shop crawlen dürfen. Bei Shopify ist dies größtenteils automatisch, was gut ist — aber die Standardeinstellungen verursachen zwei wiederkehrende Probleme, und die Google-Warnung "Indexiert, obwohl durch robots.txt blockiert" bringt viele Händler durcheinander, die es dann durch härteres Blockieren noch schlimmer machen. Hier erfahren Sie, wie die Datei bei Shopify funktioniert, wie Sie sie sicher bearbeiten und wie Sie die dadurch verursachten Fehler beheben können.
Wie Shopify robots.txt funktioniert
Shopify generiert die Datei automatisch unter yourstore.com/robots.txt und bietet eine sinnvolle Standardeinstellung. Diese Standardeinstellung blockiert bereits die internen Pfade, die Sie niemals indexiert haben möchten — /cart, /checkout, /orders, /account und die internen Such- und Filter-URLs von Shopify — und verweist Crawler auf Ihre Sitemap. Für viele Shops müssen Sie sie nie anfassen.
Seit 2021 können Sie sie anpassen, indem Sie eine templates/robots.txt.liquid-Datei zu Ihrem Theme hinzufügen. Sie erstellen sie im Theme-Code-Editor: Gehen Sie in Ihrem Admin zu Online Store → Themes → [Ihr Theme] → ⋯ → Code bearbeiten, klicken Sie dann im Ordner Templates auf "Neue Vorlage hinzufügen" und wählen Sie robots.txt aus dem Dropdown-Menü für den Vorlagentyp. Shopify erstellt die Standardregeln als Liquid, und Sie bearbeiten von dort aus. Die Datei ist Liquid, kein reiner Text, sodass Sie eine Vorlage ändern, die die Regeln rendert, anstatt rohe Anweisungen zu schreiben — was es Ihnen ermöglicht, spezifische Regeln hinzuzufügen oder zu entfernen, während Sie die sinnvollen Standardeinstellungen von Shopify intakt halten.
Zwei Vorsichtsmaßnahmen, bevor Sie bearbeiten. Erstens, diese Datei ist in die falsche Richtung mächtig — ein versehentliches Disallow: / würde jedem Crawler sagen, Ihren gesamten Shop zu ignorieren, also ändern Sie sie bewusst und überprüfen Sie die gerenderte Ausgabe anschließend unter yourstore.com/robots.txt. Zweitens, robots.txt steuert das Crawlen, nicht das Indexieren. Das sind unterschiedliche Dinge, und sie zu verwechseln ist die Ursache des häufigsten Shopify-robots-Fehlers.
Crawlen ist nicht Indexieren
Eine Disallow-Regel in robots.txt sagt einem Crawler "rufe diese URL nicht ab." Sie sagt Google nicht "indexiere diese URL nicht." Wenn Google eine blockierte URL über einen Link irgendwo entdeckt, kann es die nackte URL trotzdem zu seinem Index hinzufügen — es kann die Seite nur nicht lesen, um zu sehen, was darauf ist. Das Ergebnis ist ein Eintrag ohne nützlichen Titel oder Beschreibung, was schlimmer ist, als die Seite entweder richtig zu indexieren oder sie ganz draußen zu halten.
Diese einzelne Unterscheidung erklärt die folgende Warnung, und deshalb ist "einfach in robots.txt blockieren" die falsche Lösung für Seiten, die Sie aus der Suche herausgehalten haben möchten.
Behebung von "Indexiert, obwohl durch robots.txt blockiert"
Diese Search Console-Warnung bedeutet, dass Google eine URL gefunden hat, normalerweise über einen Link, sie aber nicht crawlen konnte, weil robots.txt den Pfad blockiert — also hat es die URL ohne Inhalt indexiert. Die Lösung hängt davon ab, was mit dieser URL geschehen soll:
| Wenn Sie möchten, dass... | Dann... | Weil... |
|---|---|---|
| Die URL indexiert bleibt und der Eintrag korrigiert wird | Entfernen oder verengen Sie die Disallow-Regel; fordern Sie die Indexierung in der Search Console an | Google muss die Seite crawlen, um ihren Inhalt zu sehen und den Eintrag zu aktualisieren |
| Die URL vollständig aus den Suchergebnissen entfernt wird | Entsperren Sie die Seite, fügen Sie dann ein noindex-Meta-Tag oder einen X-Robots-Tag-Header hinzu | Ein Crawler kann eine noindex-Anweisung auf einer blockierten Seite nicht lesen |
- Identifizieren Sie die genau blockierte URL im Seitenbericht der Search Console unter diesem Status und überprüfen Sie sie gegen Ihre robots.txt, um die passende Disallow-Regel zu finden.
- Wenn sie indexiert werden sollte — ein echtes Produkt oder eine Kollektion, die von einer zu breiten Regel erfasst wurde — entfernen oder verengen Sie die Disallow-Regel in robots.txt.liquid, damit Google sie crawlen kann, und fordern Sie dann die Indexierung an. Sobald Google die Seite liest, verschwindet die Warnung und der Eintrag erhält einen ordentlichen Titel und eine Beschreibung.
- Wenn sie nicht indexiert werden sollte — eine dünne Filterseite, ein internes Suchergebnis, eine Login-Seite — verlassen Sie sich nicht auf das Blockieren. Allein das Blockieren kann die nackte URL für immer indexiert lassen. Lassen Sie stattdessen Google die Seite crawlen und geben Sie ihr ein noindex-Signal, das es tatsächlich lesen kann: ein noindex-Robots-Meta-Tag im Seitenmarkup oder einen X-Robots-Tag-noindex-Header. Paradoxerweise müssen Sie, um eine Seite aus dem Index zu entfernen, sie oft zuerst entsperren, damit der Crawler die noindex-Anweisung sehen kann. Eine blockierte Seite ist eine Seite, deren noindex-Tag Google niemals lesen wird.
Blockieren von Such- und Tag-Seiten
Zwei Shopify-URL-Muster erzeugen nahezu unendlich viele Seiten mit geringem Wert, die Ihren Index aufblähen können: interne Suchergebnisse (Pfade unter /search) und tag-gefilterte Kollektions-URLs (lange Abfragezeichenfolgen mit ?constraint= oder Tag-Parametern). Die Standardeinstellungen von Shopify behandeln vieles davon, aber bei angepassten Themes und stark getaggten Katalogen können diese durchrutschen und als dünne, doppelte Seiten indexiert werden.
Wenn Sie sie indexiert finden und sie entfernen möchten, wenden Sie die oben beschriebene Logik zum Crawlen versus Indexieren an. Das Blockieren von /search in robots.txt stoppt das erneute Crawlen, entfernt jedoch keine bereits indexierten URLs; für diese ist ein noindex-Signal auf den Such- und Filtervorlagen die dauerhafte Lösung. Auch kanonische Tags helfen hier — das Verweisen von gefilterten Kollektionsvarianten auf die saubere Kollektions-URL ist oft sauberer als das Blockieren, und es wird im Leitfaden zu kanonischen Tags behandelt. Die Entscheidung ist, ob Sie die Seite nicht crawlen oder nicht indexieren lassen möchten; sie erfordern gegensätzliche Werkzeuge.
AI-Crawler bewusst willkommen heißen
Um von AI-Antwortmaschinen zitiert zu werden, muss Ihre robots.txt die Crawler zulassen, die diese Maschinen verwenden — und viele Shops blockieren sie versehentlich, oft durch ein CDN oder eine Sicherheitseinstellung, anstatt durch die Wahl des Shop-Besitzers. Die Agenten, die es wert sind, namentlich bekannt zu sein:
- GPTBot und OAI-SearchBot — OpenAIs Crawler, der zweite speziell für die Suchzitate von ChatGPT.
- ClaudeBot — Anthropics Crawler.
- Google-Extended — Googles Kontrolle für AI-Training und -Verankerung, getrennt von Googlebot.
- PerplexityBot — Perplexitys Crawler.
- CCBot — Common Crawl, das viele nachgelagerte Modelle speist.
Diese sind von Googlebot getrennt und jeder holt auf seine eigenen Bedingungen ab. Die schnellste AEO-Maßnahme ist, zu bestätigen, dass Ihre robots.txt nicht die blockiert, die Sie zitieren möchten, und idealerweise sie namentlich mit einem expliziten User-agent und Allow-Block in robots.txt.liquid zuzulassen. Sie stillschweigend zu blockieren, schließt Ihren Shop von der AI-Sichtbarkeit aus, ohne dass irgendwo ein Fehler Sie warnt. Dies ist zentral für Antwortmaschinenoptimierung und die breitere generative Maschinenoptimierung und AI-Sichtbarkeit Arbeit — und es passt natürlich zu einer guten llms.txt-Datei, die die bejahende Version derselben Idee ist. Wenn Sie abwägen, welche Agenten Sie zulassen möchten, geht der ChatGPT-SEO-Leitfaden tiefer auf die Crawler von OpenAI ein.
Eine schnelle Möglichkeit, Ihre robots.txt zu überprüfen
Öffnen Sie yourstore.com/robots.txt in einem Browser — das ist die gerenderte Ausgabe, die jeder Crawler sieht, und es ist die Datei, die zählt, nicht Ihre Liquid-Vorlage. Suchen Sie nach einem Disallow: / alleinstehend (eine vollständige Site-Blockierung), nach AI-Crawler-Benutzeragenten, die unter einem Disallow stehen, und nach einer Sitemap:-Zeile, die auf Ihre echte sitemap.xml verweist. In der Search Console zeigt Ihnen der Seitenbericht, was tatsächlich passiert — wie viele URLs unter "Indexiert, obwohl durch robots.txt blockiert" stehen und welche. Zwischen der rohen Datei und dem Seitenbericht können Sie sowohl die Richtlinie als auch ihre Konsequenzen sehen.
Die Hygiene von robots.txt steht neben Ihrer Sitemap, Weiterleitungen und Schema-Markup als die Crawlability-Schicht von Shopify SEO; die 2026-Checkliste und der Shopify-SEO-Leitfaden verbinden sie, und die Shopify-SEO-Tools Übersicht deckt ab, was sie automatisiert.
RankEngine prüft Ihre robots-Richtlinie, markiert blockierte-aber-indexierte URLs aus Ihren Search Console-Daten und kann eine robots.txt.liquid mit den richtigen AI-Crawler-Regeln veröffentlichen — dann überprüft es sie gegen die live gerenderte Datei, damit Sie wissen, dass die Änderung tatsächlich übernommen wurde, anstatt darauf zu vertrauen, dass die Vorlage gespeichert wurde.