인공 지능이 단일 턴 챗봇에서 지속적으로 실행되는 자율 에이전트로 전환함에 따라 NVIDIA는 그 순간에 맞춰 개방형 모델 라인업을 확장하고 있습니다. 2026년 8월 11일, 회사는 300억 매개변수의 전문가 혼합 모델인 Nemotron 3.5 Lightning을 공개했습니다. 이는 장기 실행 에이전트 AI 워크로드를 위한 동급 최고 효율성 모델이라고 합니다. Kari Briski가 NVIDIA 블로그에 자세히 설명한 이번 릴리스는 각 작업을 가장 유능하고 비용 효율적인 모델에 자동으로 연결하도록 설계된 오픈 소스 라우팅 라이브러리인 NeMo Switchyard와 함께 출시됩니다. 최신 AI 산업 보도를 통해 에이전트 AI 스택이 형성되는 과정을 따라가보세요.

상시 가동 에이전트를 위해 구축된 모델

최신 에이전트 시스템은 NVIDIA가 "모델 시스템" 또는 모델 앙상블로 설명하는 방식으로 점점 더 작동하고 있습니다. Nemotron 3 Ultra 또는 GPT-5.6과 같은 개척지 추론 모델은 워크플로를 계획하고 조정할 수 있는 반면, 소규모 전문 모델은 코드 검토, 도구 사용, 보안 경고 모니터링 또는 청구 질문에 대한 답변과 같은 대상 작업을 처리할 수 있습니다. Nemotron 3.5 Lightning은 두 번째 계층인 상시 가동 에이전트를 지원하는 대용량 전문 작업을 위해 특별히 제작되었습니다.

NVIDIA에 따르면 이 모델은 최대 4배 더 빠른 출력 속도를 제공하여 동급의 다른 모델에 비해 약 30% 더 빠른 에이전트 작업 완료를 제공합니다. NVIDIA의 자체 PinchBench 벤치마크에서는 Nemotron 3.5 Lightning이 동종 제품보다 더 빠르게 작업을 완료하면서 최전방 수준의 정확성을 유지하는 것으로 나타났습니다. 이 모델은 모델 발전에 도움이 되는 평가 방법론, 추론 소프트웨어 및 데이터 세트를 제공한 회원인 Nemotron Coalition의 기여를 통해 개발되었습니다.

개방형이고 사용자 정의가 가능하기 때문에 조직은 자체 도메인 데이터, 도구 및 워크플로우에 대해 NVIDIA NeMo를 사용하여 Nemotron 3.5 Lightning을 사후 교육하여 전문 작업의 정확성을 향상시킬 수 있습니다. NVIDIA는 코딩 에이전트 기능에 대한 모델을 사후 훈련하는 데 사용되는 에이전트 강화 학습 데이터 세트인 Nemotron-RL-Agentic-Terminal-Pivot도 출시합니다.

엣지에서 클라우드까지 어디서나 실행

Nemotron 3.5 Lightning의 주요 판매 포인트 중 하나는 배포 유연성입니다. 이 모델은 NVIDIA RTX PC, NVIDIA DGX Spark, NVIDIA DGX Station, NVIDIA Jetson을 포함한 로컬 AI 시스템에서 실행될 수 있으므로 조직은 기존 인프라 투자를 극대화할 수 있습니다. 또한 기업 사용 사례를 위해 엣지 AI 장치, NVIDIA RTX PRO 워크스테이션, 데이터 센터 및 클라우드 환경 전반에 걸쳐 확장할 수 있습니다. 이러한 유연성은 온프레미스에 남아 있어야 하는 민감한 데이터를 처리하는 조직에 중요합니다.

모든 Nemotron 출시와 마찬가지로 NVIDIA는 라이선스가 허용하는 만큼의 교육 데이터와 기술을 게시하여 다른 모델의 추적, 감사 및 교육을 허용한다고 밝혔습니다. 투명성에 대한 이러한 약속은 기업이 개방형 모델과 구축 방식에 대한 가시성을 덜 제공하는 독점 대안을 비교하면서 경쟁 차별화 요소가 되었습니다.

NeMo Switchyard: 모델 시스템을 위한 스마트 라우팅

Nemotron 3.5 Lightning이 주력이라면 NeMo Switchyard가 디스패처입니다. 오픈 소스 라이브러리는 특정 요구 사항에 따라 에이전트 워크플로의 각 단계에 대해 가장 유능하고 효율적인 모델을 자동으로 안내합니다. 일부 모델은 코딩에 더 좋고, 일부 모델은 추론에 더 적합하고, 일부 모델은 경량 작업에 적합하며, 일부 모델은 개인 정보 보호 및 효율성 향상을 위해 로컬로 실행하도록 최적화되어 있습니다. 단일 기본 모델에 의존한다는 것은 과도한 지출이나 품질 저하를 의미할 수 있습니다. 한편 라우팅을 수동으로 관리하는 것은 배포 속도를 늦출 수 있는 통합 작업이 됩니다.

에이전트 애플리케이션 개발자는 품질, 대기 시간, 비용 요구 사항 등 우선 순위에 맞게 다양한 라우팅 알고리즘을 사용하여 라우터를 조정하거나 수정할 수 있습니다. NVIDIA의 내부 벤치마크에 따르면 NeMo Switchyard는 작업 완료 비용을 Opus 4.8 단독의 거의 1/3로 줄이면서 최전방 수준의 정확성을 유지하는 것으로 나타났습니다. 이는 많은 수의 에이전트 작업을 실행하는 조직에 놀라운 효율성 향상을 제공합니다.

회사는 일련의 파트너 통합을 강조했습니다. Boomi는 100% 도메인 라우팅 정확도를 보고했으며 트래픽의 59%를 5배 더 빠른 미세 조정 모델로 보냈습니다. Cadence는 공식 검증 사용 사례에서 효율성을 9.9% 향상시켰습니다. Cognition은 Switchyard를 Devin Desktop에 통합하여 FrontierCode Main에서 최전선에 가까운 성능을 달성하는 동시에 평균 비용을 28% 절감했습니다. LangChain은 통화의 7%만 프론티어 모델로 라우팅하여 145개의 다중 턴 Deep Agents 작업에서 비용이 74% 절감되었다고 보고했습니다. LiteLLM은 NeMo Switchyard를 프록시 레이어에 플러그인으로 추가하고 있으며 Kong은 이제 Kong AI Gateway를 통해 기본적으로 라우팅을 제공합니다. 특히 Nous Research는 NeMo Switchyard를 Hermes에 통합하여 개발자에게 에이전트 효율성을 위한 구성하기 쉬운 라우팅 시스템을 제공했습니다.

산업 채택과 더 큰 그림

업계 전반의 AI 리더들은 이미 워크로드에 맞게 Nemotron 3.5 Lightning을 사용자 정의하고 있습니다. CrowdStrike는 이를 사이버 보안에 적용하고 있고, Harvey는 법률 서비스에 사용하고 있으며, CodeRabbit은 코드 검토를 위해 배포하고 있습니다. Lila Sciences는 물리 및 생명 과학 전반에 걸쳐 에이전트 작업에 대한 추론 능력을 향상시키는 데 도움을 주고 있으며 Fastino Labs는 모델을 맞춤화하고 소프트웨어 개발, 금융 및 의료 워크로드에 대한 최고의 정확성을 보고했습니다.

이번 릴리스는 보다 광범위한 업계 동향을 강조합니다. 즉, 에이전트 AI가 성숙해짐에 따라 어떤 단일 모델도 수용 가능한 비용으로 모든 것을 잘 수행할 수는 없습니다. 미래는 전문 인력 집단을 조정하는 프론티어 기획자인 앙상블과 이들을 하나로 묶는 도구에 달려 있습니다. NVIDIA는 개방형 모델과 지능형 라우팅을 통해 기업이 단일 공급자의 스택에 얽매이지 않고 이러한 시스템을 조립할 수 있을 것이라고 확신합니다.

AI보다 앞서 나가세요

NVIDIA의 Nemotron 3.5 Lightning 및 NeMo Switchyard는 에이전트 AI가 어디로 향하고 있는지 신호합니다. 즉, 더 빠르고, 저렴하고, 투명하며, 어디서나 배포가 가능합니다. 환경을 재편하는 모델 출시와 엔터프라이즈 도구를 따라가려면 AI 속보를 살펴보세요.

AI 뉴스 자세히 보기 →