LLMs and models

C4

Reference entryTraining and benchmark datasets
Reference entryC4

C4, or Colossal Clean Crawled Corpus, is a cleaned English web-text dataset derived from Common Crawl for language-model training.

Where it sits