
Common Crawl
United States"Democratizando o acesso a dados da web"
Sobre
Common Crawl é uma organização sem fins lucrativos 501(c)(3) que mantém um repositório aberto de dados de rastreamento da web. Desde sua fundação em 2008 pelo cientista da computação Gil Elbaz, a organização rastreou sistematicamente a internet e disponibilizou gratuitamente petabytes de HTML bruto, metadados e texto extraído. Os dados são hospedados em buckets S3 públicos da Amazon Web Services; os usuários pagam apenas por seus próprios custos de computação e armazenamento. O corpus do Common Crawl é o maior conjunto de dados da web abertamente acessível, usado por pesquisadores, jornalistas, startups e grandes laboratórios de IA. Na década de 2020, tornou-se a principal fonte de treinamento para grandes modelos de linguagem, incluindo GPT-3, GPT-4 e LLaMA. Uma investigação de novembro de 2025 conduzida pelo The Markup e pela Wired examinou como as empresas de IA usam os dados, gerando debates sobre consentimento e direitos autorais.
Missão
A missão do Common Crawl é democratizar o acesso a dados da web, rastreando a internet e fornecendo o conteúdo resultante gratuitamente para qualquer pessoa. O objetivo é reduzir as barreiras para a análise de dados em escala da web, promover a inovação e preservar um registro histórico aberto da web.
História
Gil Elbaz começou a construir o primeiro rastreador em 2007, impulsionado pela crença de que dados abertos da web eram essenciais para uma internet saudável. O primeiro conjunto de dados de rastreamento público, contendo cerca de 2 bilhões de páginas, foi lançado em 2008. A infraestrutura inicial dependia de servidores doados e subsídios. Em 2012, o Common Crawl fez uma parceria com a Amazon Web Services para hospedar os dados em buckets S3 públicos, tornando o acesso gratuito e escalável. O conjunto de dados News Crawl foi lançado em 2015, fornecendo um feed continuamente atualizado de artigos de notícias. Em 2017, o corpus havia crescido para 3,5 bilhões de páginas, o maior conjunto de dados da web publicamente disponível na época. O boom da IA no início dos anos 2020 aumentou dramaticamente a demanda; o Common Crawl tornou-se o corpus de treinamento de fato para grandes modelos de linguagem. Em resposta às preocupações com direitos autorais e consentimento levantadas por uma investigação de 2025, a organização anunciou planos para desenvolver um sistema de opt-out e um melhor rastreamento de proveniência.
Pessoas notáveis
Gil Elbaz
Founder and Chairman of the Board · 2008–present
Founded Common Crawl; previously co-founded Applied Semantics (AdSense) and Factual.
Rich Skrenta
Diretor Executivo · 2024–present
Former CEO of Blekko; creator of the Elk Cloner virus.
Peter Norvig
Former Board Member · 2010–2020
Director of Research at Google; co-author of Artificial Intelligence: A Modern Approach.
Marcos
2007
Gil Elbaz begins building the first web crawler.
2008
Common Crawl officially founded; first public crawl dataset released (approx. 2 billion pages).
2012
Partnership with Amazon Web Services; data made available via public S3 buckets.
2015
Launch of the News Crawl dataset.
2017
Dataset reaches 3.5 billion pages, becoming the largest publicly available web corpus.
2020
Release of CC-MAIN-2020-50 with over 50 billion URLs crawled.
2022
Common Crawl becomes primary training source for large language models (GPT-3, LLaMA, etc.).
2023
Release of CC-MAIN-2023-23 with 3.1 billion pages and 400+ terabytes of uncompressed data.
2025
The Markup and Wired investigation raises copyright and consent issues; Common Crawl announces plans for opt-out system.
Departamentos
Informações da organização
- Fundado
- +2008
- Sede
- San Francisco, California, United States
- País
- United States
- Executive Director
- Rich Skrenta
- Tipo
- Non-profit
- Tipo
- Non-profit
- Fundado
- +2008
- País
- Estados Unidos
- Fundador
- Gil Elbaz
- Annual Budget
- $1–2 million
- Funcionários
- 5–10
- Data Size
- Petabytes
Finanças
- Receita
- $0.0 billion
- Orçamento
- $1–2 million
- Funcionários
- 5–10
Site oficial
commoncrawl.org/
Junte-se à comunidade
fãs comentando