クリエイティブな AI ツールを開発するスタートアップ企業である Krea は、オープンウェイトのテキストから画像への基礎モデル ファミリである Krea 2 (K2) をリリースしました。同社によると、これは人工分析リーダーボードの画像ジェネレーターのトップ 10 にランクされ、独立した研究所のモデルの中で 2 位にランクされています。 2026 年 6 月 23 日に発行された技術レポートで詳しく説明されているこのリリースには、2 つのモデル チェックポイントと、コミュニティによる微調整とその上での構築を促す寛容なライセンスが同梱されています。
単一の洗練されたデフォルト出力を最適化する最近の多くの画像モデルとは異なり、Krea はクリエイティブな探求というアイデアを中心に Krea 2 を設計し、1 つの狭い美学を強制するのではなく、ユーザーがナビゲートできる幅広いビジュアル分布を公開しました。 この件の詳細は、AIニュースをご覧ください。
さまざまなニーズに対応する 2 つのチェックポイント
Krea 2 リリースには 2 つの異なるチェックポイントが含まれています。 1 つ目の K2 Raw は、微調整とトレーニング後の研究を目的とした未精製の基本モデルであり、開発者が適応するためのクリーンな基盤を提供します。 2 つ目の K2 Turbo は、クリエイティブなワークフローに求められる素早い反復を高速で数ステップで生成できるように設計された、ガイダンスとタイムステップを抽出したモデルです。
研究しやすいベースと速度が最適化されたバリアントの両方を提供することは、実用的な分割を反映しています。研究者や改造担当者は実験用の生のモデルを入手でき、実稼働ユーザーは速度のために品質をほとんど犠牲にしない高速なチェックポイントを入手できます。
AI 生成のトレーニング データに対する意図的な姿勢
Krea の技術レポートで最も印象的な主張の 1 つは、トレーニング データに関するものです。チームは、事前トレーニング ミックスに AI で生成された画像を使用していないと述べています。合成データと蒸留は、モデルの機能を取得するための一般的な近道となっていますが、Krea は、AI によって生成された画像のごく一部であっても、モデルの出力分布に偏りが生じていることを発見しました。
理由は簡単です。合成画像はモデルの学習が容易な傾向があり、品質に人為的な上限を事実上課すことになります。このポリシーを適用するために、Krea は、既製のフィルターに依存するのではなく、AI によって生成された画像をデータセットからフィルター処理するための専用の社内分類器を構築しました。
同社はデータ品質についても逆の見解をとりました。 Krea 氏は、有効な芸術的選択を表す、意図的にぼやけた画像、粒子の粗い画像、または型破りな画像を除去して高い美的スコアを求める積極的なフィルタリングを行うのではなく、多様性と幅広い領域をカバーすることを主張しました。その結果、従来の美しい画像のみを学習させたシステムよりも表現範囲が広いモデルが得られるという。
アーキテクチャとトレーニング パイプライン
Krea 2 は、レポートに記載されている広範なアブレーション研究を通じて最終設計が選択された変圧器アーキテクチャに基づいて構築されています。代替案をテストした後、チームはゲート シグモイド アテンション、SwiGLU MLP、およびテキスト エンコーダーとしての Qwen 3 VL を備えたグループ化クエリ アテンション (GQA) に落ち着きました。位置エンコードでは 3D 軸回転埋め込みが使用され、オートエンコーダーは Qwen Image VAE と FLUX 2 AE を組み合わせています。
トレーニングは多段階のカリキュラムに従って行われました。事前トレーニングは 256 ピクセル、512 ピクセル、および 1024 ピクセルの解像度の段階で進行し、高解像度での高忠実度の生成を強化する前に、コア機能を効率的に構築するための低解像度の作業に大量のコンピューティングを割り当てました。その後、中間トレーニング段階で、セマンティック クラスタリングと検索ベースの戦略を使用して、広範な事前トレーニング ディストリビューションと高品質の教師付き微調整ディストリビューションを橋渡しして、まれでロングテールの概念の範囲を維持しました。
生成を探索的かつ操作可能にする
Krea は、モデルのトレーニング方法とユーザーが実際に意図を表現する方法との間に永続的なギャップがあることを特定しました。トレーニング中、モデルは豊富で密度の高いキャプションから学習します。推論時、ユーザーはシーンを正確に説明するのではなく、短く曖昧なプロンプトを入力したり、雰囲気や参照画像に向けてジェスチャーをしたりすることがよくあります。
そのギャップを埋めるために、Krea 2 には 2 つのシステムが付属しています。 1 つ目はプロンプト エキスパンダーで、オープンソースの大規模言語モデル上で 2 段階の教師あり微調整および強化学習パイプラインを通じてトレーニングされ、ユーザーの意図を上書きすることなく、単純なプロンプトをより豊富な視覚的方向にマッピングします。 2 つ目はスタイル参照システムです。これにより、ユーザーはコンテンツの漏洩を最小限に抑えながら 1 つまたは複数の参照画像のスタイルや雰囲気を注入でき、スタイルの強さや加重ミキシングをきめ細かく制御できます。
これらのコンポーネントを組み合わせることで、Krea 2 が探索的メディアとして再定義されます。このモデルは、単一の答えを返すのではなく、可能性のある空間を明らかにし、テキストと画像ベースのコントロールの両方を使用してその空間を移動するための実用的な方法をユーザーに提供するように設計されています。
実体に関する知識の保存
画像ジェネレーターにとって微妙だが重要な機能は、ユーザーが名前だけで参照する可能性のある既知のエンティティ、人物、場所、オブジェクトを忠実に表現する機能です。 Krea 氏は、標準的なサンプリング手法が、データのキュレーション中にまれな概念や重要な概念を誤って落としてしまう可能性があることを懸念していました。
これを防ぐために、チームは英語版 Wikipedia で PageRank を実行し、記事の上位 90% をランク別に保持し、意味のある表現ができない概念を除外して、キャプション データセット全体のカバレッジを検証し、キャプションがまれな概念を参照している画像を優先しました。その後チームは、初期データセットに存在する概念が最終トレーニング サンプルから完全に削除されていないことを確認しました。
画像 AI の競争力のあるオープンフロンティア
Krea 2 の登場により、混雑したオープンウェイト画像生成の状況がさらに強化されています。同社は自社のモデルをArtificial Analysis text-to-imageリーダーボードの「トップ10に入っている」、「独立した研究所のモデルの中では2位」と位置づけており、これがコミュニティの広範な監視下で維持されれば、K2はオープンに利用できる最強の画像ジェネレータの1つになるだろうと主張している。
この技術レポートは 12,000 語近くに及び、データキュレーションの原則から分散型トレーニングインフラストラクチャに至るまでの詳細を詳述しており、戦略的な目的も果たしています。 Krea は、競争モデルの背後にある方法論を公開することで、オープンな研究コミュニティにおける信頼性の通貨である精査、再現、改善を促しています。
クリエーターと開発者にとって、結果は、単一の安全なデフォルトよりもクリエイティブな範囲を優先する、有能でオープンにライセンスされた画像モデルです。 Hugging Face で利用可能なウェイトと GitHub のコードを使用することで、Krea 2 は、最先端の画像ジェネレーターを自分の方法で構築、微調整、または単に実験したい人にとって障壁を低くします。
---
AIの最新情報をお届けAIの最新ニュース、分析、ブレイクスルーを一箇所で。
AIニュースをもっと読む →
