Stable Diffusion(简称SD)之所以能够生成风格多样、内容丰富的图像,很大程度上取决于它训练时所使用的海量数据。SD系列模型的核心训练数据来自LAION-5B,这是一个包含约58.5亿个图文对的超大规模数据集。了解这个数据集的来源、构建方式和内容分布,不仅有助于理解SD模型的能力边界,也能帮助我们在训练自己的模型时做出更合理的数据决策。

一、LAION-5B数据集从哪里来
LAION-5B由德国非营利组织LAION(Large-scale Artificial Intelligence Open Network)于2022年发布。它并非人工标注的数据集,而是通过爬取互联网公开网页自动构建的。具体来说,LAION使用了Common Crawl的网络抓取数据,Common Crawl是一个长期抓取互联网网页并免费开放的组织,其数据量极为庞大,涵盖了数百亿个网页地址。
构建流程大致分为三步。第一步,从Common Crawl的网页数据中提取所有的图文对,即网页中出现的图片及其对应的alt文本或周边文字描述。第二步,使用OpenAI的CLIP模型对图文对进行相似度计算,过滤掉图文不匹配的低质量样本,只保留CLIP分数达到一定阈值的图文对。第三步,将过滤后的数据整理成索引,发布URL和相关元数据。
需要特别注意的是,LAION-5B本身并不直接存储图片文件,它发布的只是图片的URL链接、文本描述以及一些元信息(如图片尺寸、CLIP分数、是否含水印的推测标记等)。使用者需要根据URL自行下载图片,这也意味着部分链接随时间推移已经失效。这种设计在规避存储成本的同时,也为后续的版权争议埋下了伏笔。
二、三大子集的构成与规模
LAION-5B并非一个单一的数据集合,它由三个子集组成,分别对应不同的语言和规模。首先是LAION-2B-en,包含约23.2亿个英文图文对,是SD v1.x系列模型训练时主要依赖的子集。其次是LAION-2B-multi,包含约22.6亿个非英文图文对,覆盖全球多种语言。最后是LAION-1B-nolang,包含约12.7亿个无法明确判定语言的图文对,其文本可能为乱码、符号或语言检测工具无法识别的内容。
Stable Diffusion v1版本在训练时,初期主要使用LAION-2B-en的子集LAION-Aesthetics。这是一个在LAION-2B-en基础上进一步筛选的美学子集,通过训练一个美学评分模型对图片打分,只保留分数较高的样本,最终约6亿条数据用于最终训练阶段。这个筛选策略直接影响了SD模型生成图像的整体审美倾向,比如偏向摄影质感和艺术风格的比例较高。
从语言分布来看,中文数据在LAION-5B中的占比并不高。中文图文对主要集中在LAION-2B-multi子集中,估计数量在数千万到一亿级别的规模,与英文数据相比差距明显。这也是为什么早期SD模型对中文提示词的理解能力较弱,社区后续才训练出专门针对中文优化的模型来弥补这一短板。
三、内容主题分布特点
LAION-5B的内容分布反映了互联网本身的内容生态。由于数据来源于公开网页,图片主题呈现明显的长尾分布特征。占比最高的是人物照片,包括名人、普通人的社交媒体图片、新闻图片等,这一类内容在数据集中占据了相当大的比重。这也是SD模型生成人像能力较强的根本原因。
其次是各类艺术作品和设计素材,包括插画、绘画、摄影作品、产品图等。许多艺术家的作品被收录其中,引发了后来广受关注的版权争议,多位艺术家对SD的开发方Stability AI提起了诉讼,指控其未经授权使用受版权保护的作品进行训练。此外,风景、动物、建筑、食物等常见摄影主题也占有稳定比例。
数据集中还存在不少噪声内容,例如表情包、广告横幅、截图、水印图片以及部分不适合公开的内容。LAION团队提供了NSFW标记和水印推测标记,方便使用者二次过滤,但过滤并不完全。研究显示,训练数据中的这些噪声会导致模型偶尔生成带有水印痕迹或质量低下的图像,这也是后续SDXL等版本在数据清洗上投入更多精力的原因。
四、数据集带来的影响与启示
LAION-5B的发布极大推动了开源文生图模型的发展,但它暴露的问题同样值得深思。一方面,超大规模网络数据带来了内容多样性,让SD模型具备了惊人的泛化能力;另一方面,未经授权的内容抓取引发了法律与伦理层面的持续讨论。2023年后,LAION一度下线了部分数据访问,并推出了经过更严格审查的子集Re-LAION-5B,尝试剔除明确的非法内容。
对于想要训练自己模型的开发者而言,LAION-5B的经验提供了几点启示。第一,数据质量比数量更关键,LAION-Aesthetics子集的筛选策略证明了精细化过滤的价值。第二,图文对齐度直接影响模型对提示词的理解能力,CLIP过滤虽然是有效手段,但并非完美,仍需结合人工抽检。第三,如果目标是特定领域(如国风插画、医疗影像),在通用数据集基础上补充垂直领域数据,效果通常优于单纯依赖通用数据。
总的来说,LAION-5B是AI图像生成发展历程中的一个标志性数据集。它以极低的成本实现了前所未有的数据规模,也让SD模型成为可能。理解它的来源与内容分布,能帮助我们更理性地看待模型的生成结果:模型擅长的内容往往源于数据中的高频主题,而模型的偏见与缺陷,同样是数据分布的直接映射。