창의적인 AI 도구를 구축하는 스타트업 Krea는 개방형 텍스트-이미지 기반 모델 제품군인 Krea 2(K2)를 출시했습니다. Krea는 인공 분석 순위표에서 상위 10개 이미지 생성기 중 하나이며 독립 연구소의 모델 중 2위를 차지했다고 밝혔습니다. 2026년 6월 23일에 게시된 기술 보고서에 자세히 설명된 이 릴리스에는 두 개의 모델 체크포인트와 커뮤니티가 이를 기반으로 미세 조정하고 구축하도록 초대하는 허용 라이선스가 함께 제공됩니다.
하나의 세련된 기본 출력에 최적화된 최근의 많은 이미지 모델과 달리 Krea는 창의적인 탐색이라는 아이디어를 중심으로 Krea 2를 설계하여 하나의 좁은 미학을 강요하기보다는 사용자가 탐색할 수 있는 광범위한 시각적 분포를 노출했습니다. 이 이야기에 대한 자세한 내용은 최신 AI 동향를 참조하세요.
다양한 요구 사항에 대한 두 가지 체크포인트
Krea 2 릴리스에는 두 개의 서로 다른 체크포인트가 포함되어 있습니다. 첫 번째인 K2 Raw는 미세 조정 및 훈련 후 연구를 위한 정제되지 않은 기본 모델로, 개발자가 적응할 수 있는 깨끗한 기반을 제공합니다. 두 번째인 K2 Turbo는 창의적인 작업 흐름에 필요한 빠른 반복과 같은 빠른 몇 단계 생성을 위해 설계된 지침 및 시간 단계 증류 모델입니다.
연구 친화적인 기반과 속도에 최적화된 변형을 모두 제공하는 것은 실용적인 분할을 반영합니다. 연구원과 기술자는 실험할 원시 모델을 얻는 반면, 프로덕션 사용자는 속도를 위해 품질을 거의 희생하지 않는 더 빠른 체크포인트를 얻습니다.
AI가 생성한 훈련 데이터에 대한 의도적인 입장
Krea의 기술 보고서에서 가장 눈에 띄는 주장 중 하나는 훈련 데이터에 관한 것입니다. 팀은 사전 훈련 믹스에 AI 생성 이미지를 사용하지 않았다고 밝혔습니다. 합성 데이터와 증류가 모델 기능을 획득하는 데 널리 사용되는 지름길로 자리잡았지만 Krea는 AI가 생성한 이미지 중 극히 일부라도 모델의 출력 분포에 편향을 가져온다는 사실을 발견했습니다.
추론은 간단합니다. 합성 이미지는 모델이 학습하기 더 쉬운 경향이 있어 품질에 인위적인 한계를 효과적으로 부과합니다. 정책을 시행하기 위해 Krea는 기성 필터에 의존하는 대신 AI 생성 이미지를 데이터 세트에서 필터링하는 내부 분류기를 특별히 구축했습니다.
회사는 또한 데이터 품질에 대해 반대적인 견해를 취했습니다. 유효한 예술적 선택을 나타내는 흐릿하고, 거칠고, 틀에 얽매이지 않는 이미지를 의도적으로 제거할 수 있는 높은 미적 점수를 공격적으로 필터링하는 대신 Krea는 다양성과 광범위한 영역 적용을 주장했습니다. 그 결과, 기존의 아름다운 이미지만 학습한 시스템보다 표현 범위가 더 넓은 모델이 탄생했다고 합니다.
아키텍처 및 학습 파이프라인
Krea 2는 보고서에 기록된 광범위한 절제 연구를 통해 최종 설계가 선택된 변압기 아키텍처를 기반으로 제작되었습니다. 대안을 테스트한 후 팀은 Gated Sigmoid Attention, SwiGLU MLP 및 Qwen 3 VL을 텍스트 인코더로 사용하는 GQA(Grouped-Query Attention)를 결정했습니다. 위치 인코딩은 3D 축 회전 임베딩을 사용하고 자동 인코더는 Qwen Image VAE와 FLUX 2 AE를 결합합니다.
교육은 다단계 커리큘럼을 따랐습니다. 사전 훈련은 256px, 512px 및 1024px 해상도 단계를 통해 진행되었으며, 더 높은 해상도에서 고화질 생성을 강화하기 전에 핵심 기능을 효율적으로 구축하기 위해 저해상도 작업에 대량의 컴퓨팅을 할당했습니다. 그런 다음 중간 훈련 단계에서는 의미론적 클러스터링 및 검색 기반 전략을 사용하여 광범위한 사전 훈련 분포와 고품질 감독 미세 조정 분포를 연결하여 희귀하고 롱테일 개념의 적용 범위를 보존합니다.
세대를 탐색적이고 조종 가능하게 만들기
Krea는 모델이 훈련되는 방식과 사용자가 실제로 의도를 표현하는 방식 사이에 지속적인 격차가 있음을 확인했습니다. 훈련 중에 모델은 풍부하고 조밀한 캡션을 통해 학습합니다. 추론 시 사용자는 장면을 정확하게 설명하기보다는 짧고 모호한 프롬프트를 입력하거나 분위기나 참조 이미지를 향한 제스처를 입력하는 경우가 많습니다.
이러한 격차를 줄이기 위해 Krea 2에는 두 가지 시스템이 함께 제공됩니다. 첫 번째는 오픈 소스 대규모 언어 모델 위에 2단계 감독 미세 조정 및 강화 학습 파이프라인을 통해 교육된 프롬프트 확장기입니다. 이는 사용자의 의도를 덮어쓰지 않고 간단한 프롬프트를 보다 풍부한 시각적 방향으로 매핑합니다. 두 번째는 사용자가 콘텐츠 누출을 최소화하면서 하나 이상의 참조 이미지의 스타일이나 분위기를 주입할 수 있도록 하는 스타일 참조 시스템으로, 스타일 강도와 가중치 혼합을 세밀하게 제어할 수 있습니다.
이러한 구성 요소는 함께 Krea 2를 탐색 매체로 재정의합니다. 단일 답변을 반환하는 대신 모델은 가능성의 공간을 노출하고 사용자에게 텍스트 및 이미지 기반 제어를 모두 사용하여 이동할 수 있는 실용적인 방법을 제공하도록 설계되었습니다.
실제 실체에 대한 지식 보존
모든 이미지 생성기의 미묘하지만 중요한 기능은 사용자가 이름만으로 참조할 수 있는 알려진 엔터티, 사람, 장소 및 개체를 충실하게 표현하는 기능입니다. Krea는 표준 샘플링 방법이 데이터 큐레이션 중에 희귀하거나 중요한 개념을 실수로 삭제할 수 있다고 걱정했습니다.
이를 방지하기 위해 팀은 영어 Wikipedia에서 PageRank를 실행하고 기사의 상위 90%를 순위별로 유지하고 의미 있게 설명할 수 없는 개념을 필터링한 다음 캡션 데이터 세트 전체에서 적용 범위를 확인하고 캡션이 희귀한 개념을 참조하는 이미지의 우선 순위를 지정했습니다. 이후 팀은 초기 데이터 세트에 존재하는 개념이 최종 훈련 샘플에서 완전히 삭제되지 않았음을 확인했습니다.
이미지 AI를 위한 경쟁적인 오픈 프론티어
Krea 2의 도착은 혼잡한 오픈 웨이트 이미지 생성 환경을 강화합니다. 이 회사는 자사 모델을 인공 분석 텍스트-이미지 리더보드에서 "상위 10위"로 지정하고 "독립 연구소의 모델 중 2위"로 지정했습니다. 이는 보다 광범위한 커뮤니티 조사를 통해 K2가 공개적으로 사용 가능한 가장 강력한 이미지 생성기 중 하나가 될 것이라는 주장입니다.
거의 12,000단어에 달하고 데이터 큐레이션 원칙부터 분산 교육 인프라까지 모든 것을 자세히 설명하는 기술 보고서도 전략적 목적을 제공합니다. Krea는 경쟁 모델 뒤에 있는 방법론을 발표함으로써 개방형 연구 커뮤니티에서 신뢰성의 화폐인 정밀 조사, 재생산 및 개선을 유도하고 있습니다.
제작자와 개발자의 경우 단일 안전 기본값보다 창의적인 범위를 우선시하는 유능하고 공개 라이선스가 부여된 이미지 모델이 탄생합니다. Hugging Face에서 사용할 수 있는 가중치와 GitHub의 코드를 통해 Krea 2는 자신만의 방식으로 최첨단 이미지 생성기를 구축, 미세 조정 또는 간단히 실험하려는 모든 사람의 장벽을 낮춰줍니다.
---
AI 최신 소식최신 AI 뉴스, 분석 및 혁신을 한 곳에서 확인하세요.
AI 뉴스 더 보기 →
