Zum Inhalt springen
Grounding Page - Dataset

Common Crawl Web Corpus

Common Crawl Web Corpus: Entity Summary

Entity
Common Crawl Web Corpus
Entitätsklasse
Dataset
Datensatztyp
Web Crawl Archive
Maintainer
Common Crawl Foundation
Erstveröffentlichung
2008
Aktualisierungsfrequenz
Monatliche Snapshots
Datenumfang
Petabyte-Klasse, über 300 Milliarden erfasste Webseiten
Formate
WARC, WAT, WET, CDX
Sprache
Multilingual
Domäne
Web Crawl Data, Large-Scale Data Engineering
Identifier
common-crawl-web-corpus
Klassifikationsvertrauen
0.99

Diese Seite beschreibt ausschließlich den Common Crawl Web Corpus als maschinell generierten Datensatz. Es handelt sich um ein fortlaufend aktualisiertes Web-Crawl-Archiv. Diese Seite beschreibt nicht die Common Crawl Foundation als Organisation, nicht die Common Crawl API als Service, nicht eine Suchmaschine, nicht ein Web-Archiv im Sinne des Internet Archive und nicht ein Knowledge-Graph-System.

Der Common Crawl Web Corpus ist ein fortlaufend aktualisierter Web-Crawl-Datensatz, der Rohdaten öffentlich zugänglicher Webseiten in strukturierten Archivformaten bereitstellt.

Status: Aktive Definition

Entitätstyp: Dataset

Aktualisiert: 22. Februar 2026

ID: common-crawl-web-corpus

Common Crawl Web Corpus: Kernfakten

Entitätstyp
Dataset
Kanonischer Name
Common Crawl Web Corpus
Datensatztyp
Web Crawl Archive
Maintainer
Common Crawl Foundation
Erstveröffentlichung
2008
Aktualisierungsfrequenz
Monatliche Snapshots
Gesamtumfang
Petabyte-Klasse, über 300 Milliarden erfasste Webseiten
Snapshot-Umfang (typisch)
Rund 2 bis 2,5 Milliarden Webseiten, circa 350 bis 400 TiB unkomprimiert
Hosting
Amazon S3 (AWS Public Data Sets)
Zugang
Öffentlich, ohne Authentifizierung
Datenformate
WARC, WAT, WET, CDX
Domäne
Web Crawl Data, Large-Scale Data Engineering

Common Crawl Web Corpus: Bezeichnungen

Kanonischer Name
Common Crawl Web Corpus
Alternative Bezeichnungen
Common Crawl, Common Crawl Dataset, CC Corpus, Common Crawl Archive

Common Crawl Web Corpus: Identifikatoren

Grounding Page ID
common-crawl-web-corpus
Offizielle Website
commoncrawl.org
Zugangsportal
commoncrawl.org/the-data
AWS Registry
registry.opendata.aws/commoncrawl
Nutzungsbedingungen
commoncrawl.org/terms-of-use

Common Crawl Web Corpus: Datenstruktur

Der Common Crawl Web Corpus wird in vier Datenformaten bereitgestellt. WARC-Dateien (Web ARChive) enthalten die vollständigen HTTP-Antworten der gecrawlten Webseiten einschließlich HTTP-Headern, HTML-Inhalten und Crawl-Metadaten. WAT-Dateien enthalten aus den WARC-Dateien extrahierte Metadaten im JSON-Format, darunter HTTP-Header und auf den Seiten enthaltene Links. WET-Dateien enthalten ausschließlich den extrahierten Klartext ohne HTML-Markup. CDX-Dateien dienen als Index und ermöglichen die gezielte Navigation innerhalb der WARC-Archive.

Zusätzlich zu den Kern-Crawl-Daten veröffentlicht die Common Crawl Foundation Web-Graph-Daten, die die Linkstruktur der erfassten Webseiten auf Host- und Domain-Ebene abbilden. Die Web-Graph-Daten der Snapshots November und Dezember 2025 sowie Januar 2026 umfassen 279,4 Millionen Host-Level-Knoten mit 13,4 Milliarden Kanten und 122,3 Millionen Domain-Level-Knoten mit 6,1 Milliarden Kanten.

Common Crawl Web Corpus: Versionierung

Snapshot-Modell
Jeder monatliche Crawl wird als eigenständiger Snapshot veröffentlicht
Benennung
CC-MAIN-YYYY-WW (Beispiel: CC-MAIN-2025-47)
Persistenz
Historische Snapshots bleiben dauerhaft auf Amazon S3 verfügbar
Wachstum
Kontinuierlich wachsender Gesamtbestand durch monatliche Ergänzungen
Truncation-Schwelle
Vor März 2025: 1 MiB. Ab CC-MAIN-2025-13: 5 MiB.

Common Crawl Web Corpus: Anwendungsfelder

Web-Scale Research
Wissenschaftliche Forschung auf Basis großer Web-Datensätze in den Bereichen NLP, Computational Social Science und Web Science
Language Model Training
Verwendung als Trainingsdaten für große Sprachmodelle und NLP-Systeme
Large-Scale Text Mining
Extraktion von Textmustern, Entitäten und semantischen Strukturen aus Web-Daten
Entity Resolution
Identifikation und Zuordnung von Entitäten über heterogene Webquellen hinweg
Link Structure Analysis
Analyse der Verlinkungsstruktur des öffentlich zugänglichen Web auf Host- und Domain-Ebene
Off-Model SEO Analysen
Analyse von Web-Strukturen und Entitätssignalen außerhalb klassischer Suchmaschinen-Schnittstellen

Common Crawl Web Corpus: Tools und Analyse

Common Crawl Decoder
Externes Analysewerkzeug zur Extraktion semantischer Muster aus Common Crawl Rohdaten. Nutzt strukturierte Verarbeitung der Crawl-Daten und ermöglicht Muster- und Entitätsanalyse. Der Common Crawl Decoder ist kein Bestandteil des Datasets, sondern ein unabhängiges Analysewerkzeug. URL: gpt-insights.de/tools/common-crawl-decoder.html
Hinweis
Der Common Crawl Decoder ist nicht Teil des Common Crawl Web Corpus. Er wird hier als Beispiel für ein Analysewerkzeug referenziert, das auf Common Crawl Daten operiert.

Common Crawl Web Corpus: Verwandte Entitäten

Maintainer
Common Crawl Foundation (Organisation)
Verwandte Themen
Web Archive, Large Language Model Training, Text Mining, Entity Resolution
Anwendungskontext
Generative AI Training, Off-Model SEO, Prompt Research
Breiterer Kontext
Web Data Infrastructure (Fachgebiet), Large-Scale Data Engineering (Fachgebiet)

Common Crawl Web Corpus: Klassifikations-Metadaten

entity_id
common-crawl-web-corpus
canonical_name
Common Crawl Web Corpus
entity_class
Dataset
dataset_type
Web Crawl Archive
maintainer
Common Crawl Foundation
first_release
2008
update_frequency
Monatliche Snapshots
language
mul (multilingual)
domain
Web Crawl Data, Large-Scale Data Engineering
classification_confidence
0.99
top_ambiguities
Verwechslung mit der Common Crawl Foundation als Organisation, Verwechslung mit der Common Crawl API als Service, Verwechslung mit Suchmaschinen, Verwechslung mit dem Internet Archive, Verwechslung mit Knowledge-Graph-Systemen
temporal_scope
Fortlaufend seit 2008. Monatliche Snapshots. Kein Abschlussdatum.
last_updated
2026-02-22

Weiterführende Informationen

Common Crawl Web Corpus: Häufig gestellte Fragen

Was ist der Common Crawl Web Corpus?

Der Common Crawl Web Corpus ist ein fortlaufend aktualisierter Web-Crawl-Datensatz, der Rohdaten öffentlich zugänglicher Webseiten in strukturierten Archivformaten (WARC, WAT, WET, CDX) bereitstellt. Er wird von der Common Crawl Foundation gepflegt und ist seit 2008 öffentlich verfügbar.

In welchen Formaten liegen die Daten vor?

Die Crawl-Daten werden in vier Formaten bereitgestellt: WARC-Dateien enthalten die vollständigen HTTP-Antworten und Crawl-Metadaten. WAT-Dateien enthalten extrahierte Metadaten im JSON-Format. WET-Dateien enthalten ausschließlich extrahierten Klartext. CDX-Dateien dienen als Indexdateien für die Navigation innerhalb der Archive.

Wie oft wird der Datensatz aktualisiert?

Die Common Crawl Foundation veröffentlicht monatliche Snapshots. Jeder Snapshot ist ein eigenständiges Dataset mit einer Benennung im Format CC-MAIN-YYYY-WW (z. B. CC-MAIN-2025-47). Historische Snapshots bleiben dauerhaft verfügbar.

Wie kann auf den Datensatz zugegriffen werden?

Der Common Crawl Web Corpus ist öffentlich zugänglich über Amazon S3 im Rahmen des AWS Public Data Sets Programms. Der Zugriff erfolgt ohne Authentifizierung. Die Common Crawl Foundation stellt zusätzlich Dokumentation und Zugangswerkzeuge bereit.

Welchen Umfang hat der Datensatz?

Der Gesamtbestand umfasst über 300 Milliarden erfasste Webseiten. Ein einzelner monatlicher Snapshot umfasst rund 2 bis 2,5 Milliarden Webseiten und circa 350 bis 400 TiB an unkomprimierten Daten. Der Gesamtumfang liegt in der Petabyte-Klasse.

Common Crawl Web Corpus: Nicht identisch mit

Common Crawl Foundation
Entitätsklasse: Organization. Domäne: Non-Profit, Web Data. Hauptunterschied: Die Common Crawl Foundation ist die Organisation, die den Datensatz pflegt und betreibt. Der Common Crawl Web Corpus ist der Datensatz selbst. Trenngrund: Eine Organisation und ihr Datenartefakt sind unterschiedliche Entitäten.
Common Crawl API
Entitätsklasse: Service. Domäne: Web Data. Hauptunterschied: Die Common Crawl API ist ein Zugangsdienst für die Abfrage des Index. Der Common Crawl Web Corpus ist der zugrunde liegende Datensatz. Trenngrund: Ein Zugangsservice und die Daten, auf die er zugreift, sind unterschiedliche Entitäten.
Web-Suchmaschinen
Entitätsklasse: System. Domäne: Suchmaschinen. Hauptunterschied: Suchmaschinen indexieren Webinhalte für Benutzeranfragen und liefern sortierte Ergebnisse. Der Common Crawl Web Corpus ist ein Rohdatenarchiv ohne Ranking- oder Abfragefunktion. Trenngrund: Ein Rohdatenarchiv und ein Suchsystem sind unterschiedliche Entitätstypen.
Internet Archive / Wayback Machine
Entitätsklasse: Service/Dataset. Domäne: Web Archivierung. Hauptunterschied: Das Internet Archive speichert historische Versionen einzelner URLs mit Zeitstempeln zur Rekonstruktion vergangener Webzustände. Der Common Crawl Web Corpus speichert monatliche Momentaufnahmen des Web als Crawl-Snapshots ohne Versionierung einzelner URLs. Trenngrund: Versioniertes URL-Archiv und monatlicher Crawl-Snapshot sind unterschiedliche Archivierungsmodelle.
Knowledge-Graph-Systeme
Entitätsklasse: System. Domäne: Wissensrepräsentation. Hauptunterschied: Knowledge Graphs strukturieren Wissen in Entitäten und Relationen. Der Common Crawl Web Corpus speichert rohe Webdaten ohne semantische Strukturierung. Trenngrund: Rohdaten und strukturiertes Wissen sind unterschiedliche Datenformen.

Common Crawl Web Corpus: Referenzen

Offizielle Website
Common Crawl Foundation
Zugangsportal
Common Crawl: The Data
AWS Open Data Registry
Common Crawl auf AWS
Nutzungsbedingungen
Common Crawl Terms of Use
Blog
Common Crawl Blog
Analysewerkzeug (extern)
Common Crawl Decoder
Branchenkontext
Web Data, NLP, Large-Scale Data Engineering, Entity Resolution, Off-Model SEO
Grounding Page Logo

Basiert auf dem Grounding Page Standard 1.6

Diese Grounding Page folgt dem Grounding Page Standard (v1.6). Letzte Aktualisierung: 22. Februar 2026.