Devin AI 소프트웨어 엔지니어를 지원하는 회사인 Cognition은 목요일에 SWE-2를 출시하여 지금까지 가장 발전된 코딩 모델이라고 설명했습니다. 9월 10일 게시된 블로그 게시물에서 회사는 새로운 모델이 FrontierCode 1.1 Main 벤치마크에서 50.0%를 기록하면서 파레토 프론티어라고 부르는 기능과 비용을 확장했으며, Fable 5.1보다 비용이 64% 저렴하다고 밝혔습니다. Fable 5.1은 50.9%로 한 단계 앞서 있는 Anthropic 모델입니다.
이번 출시는 Cognition이 480억 달러 가치로 20억 달러 자금 조달 라운드를 확인한 지 불과 하루 만에 이루어졌으며, 이는 에이전트 코딩 스타트업이 타사 프론티어 모델에만 의존하지 않고 자체 모델 개발에 얼마나 공격적으로 투자하고 있는지를 나타냅니다. AI 코딩 경쟁과 업계를 움직이는 모든 것에 대한 지속적인 보도를 보려면 AI 뉴스 속보를 매일 제공하는 AI Buzz Wire를 북마크에 추가하세요.
SWE-2가 벤치마크에 포함된 위치
Cognition이 발표한 결과에 따르면 SWE-2는 FrontierCode 1.1 Main에서 50.0%를 기록했고, Grok 4.6은 48.0%, GPT-5.6 Sol은 47.5%로 앞섰으며, 필드를 선도하는 GPT-6 Astra의 타격 거리 내에 53.3%를 기록했습니다. DeepSWE 1.1 벤치마크에서 SWE-2는 73.0%에 도달했는데, 이는 인지 목록 모델 중 Astra의 74.1%에 이어 두 번째입니다.
가장 강력한 결과는 Terminal-Bench 2.1에서 나타납니다. 여기서 SWE-2는 92.8%를 기록했는데, 이는 Cognition의 비교표에서 가장 높은 수치이며 Fable 5.1의 91.4%, GPT-6 Astra의 89.9%보다 앞서 있습니다. SWE-2가 GPT-6 Astra의 경우 57.9%, Fable 5.1의 경우 55.8%에 비해 27.3%를 관리하는 더 어려운 Terminal-Bench 4에서는 그림이 변경됩니다. 이는 모델의 효율성 우선 설계가 작업 난이도의 최고 수준에 헤드룸을 남겨둔다는 것을 상기시켜줍니다.
Cognition은 포지셔닝을 직설적으로 요약합니다. FrontierCode 1.1 Main 및 DeepSWE 1.1에서 SWE-2는 점수와 비용 모두에서 이전 모델 SWE-1.7 및 Grok 4.6을 능가하고 가격의 일부만으로 GPT-5.6 Sol 및 Fable 5/5.1과 일치하며 비용의 4분의 1로 GPT-6 Astra와 몇 포인트 이내입니다.
수조 규모의 Kimi K3에서 사후 훈련됨
SWE-2는 처음부터 만들어지지 않았습니다. Cognition은 이미 에이전트 코딩을 위한 광범위한 강화 학습을 거친 Moonshot AI의 2.8조 매개변수 기본 모델인 Kimi K3의 모델을 사후 훈련했습니다. 이러한 기반 위에 Cognition은 자사의 RL 프로세스가 많은 벤치마크에서 5~6점을 추가했으며 K3의 전체 비용 대비 성능 한계를 이동했다고 말합니다.
회사는 SWE-2가 SWE-1.7용으로 개발된 훈련 인프라와 레시피를 기반으로 강화 학습을 수조 매개변수 체계로 확장한 최초의 사례라고 밝혔습니다. 핵심 추가 사항은 낮은 노력, 중간 노력, 높은 노력을 별도의 훈련 목표로 처리하는 대신 단일 실행에서 모든 추론 노력 수준을 훈련하는 RL 알고리즘입니다.
비용 불이익이 전체 경계를 형성합니다
SWE-2 훈련의 핵심 아이디어는 단일 RL 실행 내에서 노력 수준당 적용되는 선형 비용 페널티이며, 각 페널티는 기본 모델의 파레토 경계선의 로컬 경사에 맞춰 조정됩니다. Cognition은 첫 번째 원칙에서 파생된 이 접근 방식이 모델의 모양을 유지하고 실제 사용자 비용을 훈련에 최대한 직접 반영하면서 모델의 전체 비용 대비 성능 한계를 발전시킨다고 말합니다.
또한 회사는 SWE-1.6부터 사용해 온 길이 가중 보상 기준을 자세히 설명했습니다. 이는 디코딩 처리량을 높이기 위한 온라인 초안 모델을 포함하는 RL 롤아웃 서비스 개선과 함께 교육을 상당히 안정화한 것으로 평가됩니다. Cognition은 NVFP4 및 FP8 커널과 양자화 인식 교육을 통해 기본 모델이 이전 모델보다 거의 3배에 달하는 매개변수를 갖고 있음에도 불구하고 전체 메모리 사용량을 줄였다고 말합니다.
교육 데이터 파이프라인도 확장되었습니다. Cognition은 RL 환경의 수를 3배로 늘리고, 지침에 따른 오버레이를 추가했으며, 모델 점수를 매기는 데 사용되는 검증기를 반복적으로 강화하는 이전 SWE-2 체크포인트로 구동되는 플라이휠을 구축했습니다.
지능만큼 효율성
인지 프레임 SWE-2의 이점은 효율성과 밀접하게 연관되어 있습니다. 더 강력한 엔지니어링 판단을 통해 에이전트는 더 적은 우회와 중복 읽기로 더욱 완전한 솔루션을 작성할 수 있다고 회사는 말합니다. FrontierCode 1.1 Main에서 SWE-2의 중간 노력 구성은 SWE-1.7보다 높은 점수를 얻었으며 회전 수는 58% 적고 비용은 81% 적습니다.
이러한 프레임은 Cognition의 비즈니스에 중요합니다. Devin은 자율 소프트웨어 엔지니어로 판매되며 추론 비용은 가격 책정 및 마진에 직접 입력됩니다. 작업당 턴과 토큰을 줄이면서 최전선에 인접한 품질을 유지하는 모델은 회사가 제공하는 모든 Devin 세션의 경제성을 변화시킵니다.
가용성
SWE-2는 오늘부터 Devin Desktop과 Devin CLI에서 사용할 수 있으며 Devin Web과 Fusion에서도 출시가 진행 중입니다. Cognition에 따르면 사용자는 앞으로 며칠 동안 모델이 여러 표면에 나타나는 것을 볼 수 있습니다.
코딩 모델 시장에 미치는 영향
이 릴리스는 GPT-6 Astra 뒤에 이미 붐비는 팩을 강화합니다. Cognition은 이제 훨씬 저렴한 비용으로 Anthropic, OpenAI 및 xAI의 제품을 사용하여 타격을 주고받는 모델을 소유하고 있으며 모델에서 에이전트 제품까지 전체 스택을 제어합니다. 경쟁업체는 특히 SWE-2의 비용 프로필이 가장 강력한 대용량, 중간 난이도 작업의 경우 성능만큼 가격에 대응해야 한다는 압력에 직면하게 될 것입니다.
AI 코딩 도구 구매자의 경우 실질적인 시사점은 프론티어 수준 코딩 지원에 더 이상 프론티어 수준 가격이 필요하지 않다는 것입니다. 나머지 업계에서 SWE-2는 기본 모델 규모뿐만 아니라 교육 후 및 인프라 효율성이 결정적인 경쟁 수단이 되었다는 증거입니다.
---
AI보다 앞서 나가세요최신 AI 뉴스, 분석, 획기적인 소식을 모두 한 곳에서 받아보세요.
AI 뉴스 자세히 보기 →