| Common Crawl (CC) | |
|---|---|
| Rechtsform | 501(c)(3) (Gemeinnützige) Organisation |
| Gründung | 2007 |
| Gründer | Gil Elbaz |
| Sitz | Beverly Hills, CA 90210, USA |
| Schwerpunkt | Web-Archivierung |
| Umsatz | 1.297.813 Dollar der Vereinigten Staaten (2023) |
| Website | commoncrawl.org |
Common Crawl ist eine 501(c)(3)-Nonprofit-Organisation, die öffentliche Webseiten ausliest, archiviert und die so gewonnenen Daten verfügbar macht. Sie wurde 2007 von Gil Elbaz gegründet. Ein erster Crawl wurde 2011 veröffentlicht, seit 2013 archiviert die Organisation monatlich Webseiten. Bereits 2017 umfasste ein Monatsarchiv über 280 TebiByte (TiB), 2025 betrug die unkomprimierte Größe eines Monatsarchives über 420 TiB.
Die Webcrawls umfassen große Mengen urheberrechtlich geschützter Daten und können in den USA unter Fair-Use-Richtlinien genutzt werden. In anderen Ländern ist die Nutzung rechtlich schwieriger, weshalb spezielle Verarbeitungsformate entwickelt wurden, um eine Verbreitung der Archive unter der jeweiligen Jurisdiktion zu erlauben.
Ziel ist die Unterstützung von Forschung und Technologieentwicklung, indem große Datenmengen erzeugt und bereitgestellt werden, die ansonsten nur Großkonzernen zugänglich wären.
Common Crawl archiviert im Monatsrhythmus Webseiten, die nicht durch eine entsprechende Direktive in der robots.txt von der Erfassung ausgeschlossen werden. Die Daten werden im warc-Format komprimiert und gespeichert. Stand Oktober 2025 sind ungefähr 44,8 % der erfassten Inhalte englischsprachig, es folgen russisch (5,8 %) und deutsch (5,6 %).
Zu den Webseiteninhalten legt Common Crawl auch Netzwerkgraphen an, die Verweisstrukturen auf Hostebene abbilden. 2024 umfassten diese Analysen über 480 Millionen Netzwerkknoten und 3,4 Milliarden Verbindungen, die ebenfalls frei zur Verfügung gestellt werden.
Die Archive werden unter anderem durch das AWS Open Data Sponsorship Program von Amazon zur Verfügung gestellt, das Internet Archive legt ebenso Mirrors der Common Crawl-Archive an. In Deutschland hostet die Hochschule Hof einen deutschen Teilkorpus, den German colossal, cleaned Common Crawl corpus.
Genutzt werden die Archive unter anderem von Google, das seine Sprachmodelle mit einem bereinigten Datensatz der Common Crawl-Archive trainiert. Ebenso verwendete OpenAI den Common Crawl zum Training ihres Sprachmodells GPT-3. 2024 ergab eine Untersuchung der Mozilla Foundation, dass ein Großteil der gängigen Sprachmodelle die Common Crawl-Archive für das Training verwendeten, die zu diesem Zeitpunkt ein Volumen von über neun Petabyte umfassten. Die Daten sind indessen nicht unbedingt zum direkten Training von Sprach- und KI-Modellen geeignet, da sie nicht kuratiert werden und auch Hassrede oder pornografische Inhalte beinhalten. Dennoch gelte Common Crawl als eine der „wichtigsten Quellen für Trainingsdaten für Large Language Models“ (englisch „most important sources of pre-training data for large language models (LLMs)“) und werde so intensiv genutzt, dass sie ein maßgeblicher Baustein zur Entwicklung großer Sprachmodelle und daraus entwickelter Plattformen für generative AI geworden sei.
Common Crawl-Daten spielen auch im Online-Marketing eine Rolle, da sie neben Google und OpenAI auch beispielsweise von Grok, DeepSeek und Meta AI verwendet werden und angenommen wird, dass das Vorkommen einer Webseite in Common Crawl-Archiven ihre Nennung in KI-Antworten begünstigt.
Website-Betreiber können den CCBot über eine Direktive in der robots.txt-Datei von der Erfassung ausschließen. Eine solche Sperrung betrifft allerdings nur zukünftige Crawls – bereits im Archiv vorhandene Inhalte verbleiben dort dauerhaft und lassen sich auch nach einer Sperrung nicht entfernen. Was in die Gewichte eines darauf trainierten neuronalen Netzes eingegangen ist, kann nicht nachträglich isoliert entfernt werden, da hierfür ein vollständiges Neutraining des Modells erforderlich wäre.
Laut Cloudflare Radar gehört der CCBot zu den drei am häufigsten gesperrten KI-Crawlern unter den meistbesuchten 10.000 Domains weltweit.
Nach dem Start von ChatGPT hat sich die Zahl der Websites, die Common Crawl aussperren, stark vermehrt. 79 Prozent der führenden Nachrichtenwebsites blockieren KI-Training-Bots, darunter The New York Times, Wall Street Journal, Reuters, Medium und Quora.
Cloudflare hat das sogenannte Crawl-to-Referral-Verhältnis gemessen, das beschreibt, wie oft KI-Unternehmen Websites besuchen im Vergleich dazu, wie viel Traffic sie an diese zurücksenden. Bei einzelnen KI-Plattformen, die auf Common-Crawl-Daten aufbauen, beträgt dieses Verhältnis bis zu 73.000:1.
Seit März 2025 erhöhte Common Crawl das Größenlimit für einzelne abgerufene Seiten von 1 MiB auf 5 MiB, was zu einer Zunahme der erfassten Datenmenge um 13 Prozent führte.