Krea 是一家构建创意人工智能工具的初创公司,它发布了 Krea 2 (K2),这是一系列开放权重文本到图像基础模型,该公司表示,该模型在人工分析排行榜上名列前 10 名图像生成器,在独立实验室模型中排名第二。该版本在 2026 年 6 月 23 日发布的技术报告中进行了详细介绍,附带两个模型检查点和一个允许社区在其基础上进行微调和构建的许可。

与许多针对单一精美默认输出进行优化的最新图像模型不同,Krea 围绕创意探索的理念设计了 Krea 2,展示了用户可以导航的广泛视觉分布,而不是强迫一种狭隘的审美。 更多相关背景,请参阅我们的人工智能资讯

满足不同需求的两个检查点

Krea 2 版本包括两个不同的检查点。第一个是 K2 Raw,是一个未经蒸馏的基础模型,旨在用于微调和训练后研究,为开发人员提供了一个干净的适应基础。第二种是 K2 Turbo,是一种指导和时间步长提取模型,专为快速、少步生成而设计,即创意工作流程所需的快速迭代。

提供适合研究的基础和速度优化的变体反映了务实的分裂。研究人员和修补者获得原始模型进行实验,而生产用户获得更快的检查点,为了速度而牺牲很少的质量。

针对人工智能生成的训练数据的故意立场

Krea 技术报告中最引人注目的主张之一涉及训练数据。该团队表示,它在预训练组合中没有使用人工智能生成的图像。虽然合成数据和蒸馏已成为获取模型功能的流行捷径,但 Krea 发现,即使是一小部分 AI 生成的图像也会给模型的输出分布带来偏差。

推理很简单:合成图像往往更容易让模型学习,这有效地对质量施加了人为的上限。为了执行该政策,Krea 专门构建了内部分类器,以从其数据集中过滤人工智能生成的图像,而不是依赖现成的过滤器。

该公司在数据质量方面也采取了相反的观点。 Krea 主张多样性和广泛的领域覆盖,而不是积极地过滤高审美分数,这可能会故意删除代表有效艺术选择的模糊、颗粒状或非常规图像。据称,其结果是一个比仅接受传统美丽图像训练的系统具有更广泛表达范围的模型。

架构和培训管道

Krea 2 基于变压器架构,其最终设计是通过报告中记录的广泛消融研究选择的。在测试替代方案后,团队决定采用分组查询注意力 (GQA),并使用门控 sigmoid 注意力、SwiGLU MLP 和 Qwen 3 VL 作为其文本编码器。位置编码使用 3D 轴向旋转嵌入,自动编码器结合了 Qwen Image VAE 和 FLUX 2 AE。

培训遵循多阶段课程。预训练经历了 256px、512px 和 1024px 分辨率阶段,将大量计算专用于低分辨率工作,以有效构建核心功能,然后以更高分辨率锐化高保真生成。然后,中间训练阶段使用语义聚类和基于检索的策略将广泛的预训练分布和高质量的监督微调分布联系起来,以保留稀有和长尾概念的覆盖范围。

让一代具有探索性和可引导性

Krea 发现模型的训练方式与用户实际表达意图的方式之间存在持续的差距。在训练过程中,模型从丰富、密集的字幕中学习。在推理时,用户经常输入简短、模糊的提示,或者针对情绪或参考图像做出手势,而不是精确地描述场景。

为了缩小这一差距,Krea 2 配备了两个系统。第一个是提示扩展器,通过在开源大型语言模型之上的两阶段监督微调和强化学习管道进行训练,它将简单的提示映射到更丰富的视觉方向,而不会覆盖用户的意图。第二个是风格参考系统,允许用户以最小的内容泄漏注入一张或多张参考图像的风格或情绪,提供对风格强度和加权混合的细粒度控制。

这些组件共同将 Krea 2 重新定义为探索性介质。该模型不是返回单一答案,而是旨在揭示可能性的空间,并为用户提供使用基于文本和图像的控制来移动的实用方法。

保存真实实体的知识

对于任何图像生成器来说,一个微妙但重要的功能是能够忠实地表示用户可能仅通过名称引用的已知实体、人物、地点和对象。 Krea 担心标准抽样方法可能会在数据管理过程中意外丢弃罕见或重要的概念。

为了防止这种情况发生,该团队对英语维基百科运行了 PageRank,按排名保留了前 90% 的文章,过滤掉了无法有意义描述的概念,然后验证了其标题数据集的覆盖范围,优先考虑标题引用了罕见概念的图像。该团队后来确认,初始数据集中存在的概念没有从最终训练样本中完全删除。

图像 AI 的竞争开放前沿

Krea 2 的到来加剧了拥挤的开放权重图像生成领域。该公司将其模型定位为人工分析文本到图像排行榜上的“前十名”和“独立实验室模型中的第二名”,这一说法如果受到更广泛的社区审查,将使 K2 成为最强大的公开可用图像生成器之一。

这份技术报告近 12,000 字,详细介绍了从数据管理原则到分布式培训基础设施的所有内容,也具有战略目的。通过发布竞争模型背后的方法论,Krea 正在邀请人们进行审查、复制和改进,这是开放研究社区中可信度的货币。

对于创作者和开发者来说,结果是一个强大的、公开许可的图像模型,它优先考虑创意范围而不是单一的安全默认值。借助 Hugging Face 上提供的权重和 GitHub 上的代码,Krea 2 为任何想要按照自己的方式构建、微调或简单试验最先进的图像生成器的人降低了障碍。

---

掌握AI最新动态

获取最新的AI新闻、分析和突破——尽在一处。

阅读更多AI新闻 →