Last updated
    Common Crawl
    Non-profit

    Common Crawl

    United States flagUnited States

    "Democratizando o acesso a dados da web"

    Founded +2008 San Francisco, California, United States Executive Director: Rich Skrenta

    Sobre

    Common Crawl é uma organização sem fins lucrativos 501(c)(3) que mantém um repositório aberto de dados de rastreamento da web. Desde sua fundação em 2008 pelo cientista da computação Gil Elbaz, a organização rastreou sistematicamente a internet e disponibilizou gratuitamente petabytes de HTML bruto, metadados e texto extraído. Os dados são hospedados em buckets S3 públicos da Amazon Web Services; os usuários pagam apenas por seus próprios custos de computação e armazenamento. O corpus do Common Crawl é o maior conjunto de dados da web abertamente acessível, usado por pesquisadores, jornalistas, startups e grandes laboratórios de IA. Na década de 2020, tornou-se a principal fonte de treinamento para grandes modelos de linguagem, incluindo GPT-3, GPT-4 e LLaMA. Uma investigação de novembro de 2025 conduzida pelo The Markup e pela Wired examinou como as empresas de IA usam os dados, gerando debates sobre consentimento e direitos autorais.

    Missão

    A missão do Common Crawl é democratizar o acesso a dados da web, rastreando a internet e fornecendo o conteúdo resultante gratuitamente para qualquer pessoa. O objetivo é reduzir as barreiras para a análise de dados em escala da web, promover a inovação e preservar um registro histórico aberto da web.

    História

    Gil Elbaz começou a construir o primeiro rastreador em 2007, impulsionado pela crença de que dados abertos da web eram essenciais para uma internet saudável. O primeiro conjunto de dados de rastreamento público, contendo cerca de 2 bilhões de páginas, foi lançado em 2008. A infraestrutura inicial dependia de servidores doados e subsídios. Em 2012, o Common Crawl fez uma parceria com a Amazon Web Services para hospedar os dados em buckets S3 públicos, tornando o acesso gratuito e escalável. O conjunto de dados News Crawl foi lançado em 2015, fornecendo um feed continuamente atualizado de artigos de notícias. Em 2017, o corpus havia crescido para 3,5 bilhões de páginas, o maior conjunto de dados da web publicamente disponível na época. O boom da IA no início dos anos 2020 aumentou dramaticamente a demanda; o Common Crawl tornou-se o corpus de treinamento de fato para grandes modelos de linguagem. Em resposta às preocupações com direitos autorais e consentimento levantadas por uma investigação de 2025, a organização anunciou planos para desenvolver um sistema de opt-out e um melhor rastreamento de proveniência.

    Pessoas notáveis

    Gil Elbaz

    Founder and Chairman of the Board · 2008–present

    Founded Common Crawl; previously co-founded Applied Semantics (AdSense) and Factual.

    Rich Skrenta

    Diretor Executivo · 2024–present

    Former CEO of Blekko; creator of the Elk Cloner virus.

    Peter Norvig

    Former Board Member · 2010–2020

    Director of Research at Google; co-author of Artificial Intelligence: A Modern Approach.

    Marcos

    2007

    Gil Elbaz begins building the first web crawler.

    2008

    Common Crawl officially founded; first public crawl dataset released (approx. 2 billion pages).

    2012

    Partnership with Amazon Web Services; data made available via public S3 buckets.

    2015

    Launch of the News Crawl dataset.

    2017

    Dataset reaches 3.5 billion pages, becoming the largest publicly available web corpus.

    2020

    Release of CC-MAIN-2020-50 with over 50 billion URLs crawled.

    2022

    Common Crawl becomes primary training source for large language models (GPT-3, LLaMA, etc.).

    2023

    Release of CC-MAIN-2023-23 with 3.1 billion pages and 400+ terabytes of uncompressed data.

    2025

    The Markup and Wired investigation raises copyright and consent issues; Common Crawl announces plans for opt-out system.

    Departamentos

    Crawling & Infrastructure EngineeringData Processing & QualityCommunity & OutreachAdministration & Finance

    Informações da organização

    Fundado
    +2008
    Sede
    San Francisco, California, United States
    País
    United States
    Executive Director
    Rich Skrenta
    Tipo
    Non-profit
    Tipo
    Non-profit
    Fundado
    +2008
    País
    Estados Unidos
    Fundador
    Gil Elbaz
    Annual Budget
    $1–2 million
    Funcionários
    5–10
    Data Size
    Petabytes

    Finanças

    Receita
    $0.0 billion
    Orçamento
    $1–2 million
    Funcionários
    5–10

    Site oficial

    commoncrawl.org/

    Junte-se à comunidade

    fãs comentando