DeepMind 제품 관리자인 Anish Nangia와 Alisa Fortin이 공식 Google 블로그에 게시한 게시물에 따르면, Google은 목요일에 장면 확장, 영화 카메라 제어 및 4K 출력을 추가하는 생성 비디오 모델의 프로덕션 준비 업데이트인 Gemini Omni 1.1 Flash를 발표했습니다.
이 업데이트는 Omni를 실험적 모델에서 Google이 Google AI Studio의 Gemini API를 통해 전문적인 사용을 위한 생산 준비 상태로 전환했으며 가용성은 Gemini Enterprise Agent Platform을 통해서도 나열됩니다. Google은 Gemini Omni가 생성적 창작에 실제 추론을 도입했다고 설명하고 1.1 릴리스를 비디오 워크플로, 창의적인 도구 및 미디어 편집 소프트웨어를 구축하는 개발자에게 모델이 충분히 신뢰할 수 있는 지점으로 자리매김했습니다.
장면 확장을 통한 더 긴 이야기
헤드라인 기능은 장면 확장으로, 이를 통해 개발자는 기존에 생성된 비디오를 가져와 중단된 부분부터 원활하게 영상을 계속 생성할 수 있습니다. Google은 Omni 1.1을 통해 모델이 최대 10초의 이전 컨텍스트를 분석할 수 있다고 밝혔습니다. 이는 마지막 순간만 참조했던 이전 모델보다 향상된 성능입니다. 회사에 따르면 그 결과 긴 스토리를 구축하거나 새로운 창의적인 방향으로 나아갈 때 시각적 일관성과 내러티브 일관성이 향상된다고 합니다.
동영상은 10초 단위로 최대 총 누적 길이 40초까지 연장할 수 있습니다. 이는 전통적인 비디오 길이에 비해 여전히 짧지만 짧은 콘텐츠, 광고 크리에이티브 및 사전 시각화 작업의 경우 Google은 기간보다 제어와 일관성이 더 중요하다고 확신합니다.
발표와 함께 게시된 데모 자료는 워크플로우가 실제로 어떻게 작동하는지 보여줍니다. 각각의 새로운 프롬프트는 이전 장면을 이어가고 모델은 시각적 컨텍스트를 앞으로 전달하는 동시에 프롬프트는 카메라 움직임, 설정 및 심지어 분위기의 변화를 지시합니다. 하나의 시퀀스는 친밀한 대화에서 먼지가 자욱한 지하 묘지를 통과하는 느린 풀아웃으로 이동한 다음 거대한 떠다니는 도서관으로 이동합니다. 한 장면에서 장면을 생성하는 대신 레이어로 장면을 구축하는 것은 초기의 텍스트-비디오 도구가 작동했던 방식보다 편집자가 영상을 조립하는 방식에 더 가깝습니다.
카메라 제어 및 프레임 보간
이번 릴리스에는 Google이 스튜디오 품질의 비디오 제작 도구라고 설명하는 기능도 추가되었습니다. 발표 게시물에 표시된 예 중에는 축소하는 동안 카메라를 앞으로 이동시키는 시네마틱 돌리 줌, 캐릭터의 눈에 대한 기계적 스냅 줌, 3D 깊이와 시차를 보여주기 위해 정지된 캐릭터 주위의 360도 궤도 회전 등이 있습니다.
개발자는 장면 사이의 부드러운 전환을 보간하는 모델을 사용하여 장면의 첫 번째 프레임과 마지막 프레임을 지정할 수도 있습니다. 이는 장면이 시작되고 끝나는 위치를 세밀하게 제어할 수 있는 전문 애니메이터에게 친숙한 기술입니다. Google이 계속해서 빠른 출시 흐름을 이어가는 가운데 최신 AI 개발을 팔로우하세요.
360p로 반복하고 4K로 전달
Omni 1.1 Flash에는 비용 제어를 목표로 하는 2단계 품질 워크플로우가 도입되었습니다. 개발자는 빠른 360p 미리보기를 생성하여 창의적인 프로세스 중에 아이디어를 더 빠르고 저렴하게 반복한 다음 최종 프로젝트를 4K 해상도로 업스케일하여 세련된 결과를 얻을 수 있습니다. Google은 업스케일링을 통해 전문가용으로 적합한 선명한 고해상도 출력을 생성한다고 말합니다.
4K 미리보기 파이프라인은 생성 비디오의 지속적인 경제적 문제 중 하나, 즉 프롬프트가 변경될 때마다 전체 해상도 출력을 재생성하는 비용을 해결합니다. 탐색과 전달을 분리함으로써 Google은 최종 렌더링에 앞서 수십 번의 반복을 수행하는 상업용 파이프라인에 대한 모델을 더욱 실용적으로 만들고 있습니다.
그것이 중요한 이유
이 업데이트는 원시 생성 품질에서 제어성, 즉 감독이나 편집자가 하는 방식으로 카메라 이동을 지시하고, 캐릭터 일관성을 유지하고, 정확한 프레임에 도달하는 기능으로 업계의 전환을 반영합니다. 창의적인 소프트웨어를 구축하는 개발자의 경우 데모와 배포 가능한 제품의 차이는 원시 충실도보다는 이러한 제어에 따라 결정되는 경우가 많습니다.
Google의 출시 구성은 대상 독자를 명시적으로 만듭니다. 이 회사는 제너레이티브 비디오 워크플로, 크리에이티브 도구, 미디어 편집 소프트웨어라는 세 가지 목표 범주를 지정하고, 업데이트를 통해 제너레이티브 비디오를 보다 쉽게 제어하고, 더 빠르게 반복하고, 실제 배포를 위해 다듬는 것으로 설명합니다. 더 빠른 프로토타이핑은 릴리스 요약에서 4K 업스케일링과 함께 나타나며 반복 속도가 그 자체의 기능으로 판매되고 있음을 강조합니다.
AI Studio와 Gemini API를 통해 사용할 수 있는 Omni 1.1 Flash를 통해 Google은 Gemini Enterprise Agent Platform을 통해 기업 사용자를 대상으로 이 모델을 추진하고 있으며, 이는 생성 비디오가 소비자의 참신함이 아닌 비즈니스 인프라로 자리매김하고 있음을 나타냅니다.
볼만한 것
4K 출력에 대한 세부 가격은 발표에서 강조되지 않았으며 개발자들은 40초 누적 제한이 실제 제작 계획에 어떤 영향을 미치는지 지켜볼 것입니다. AI 비디오에서의 경쟁은 여전히 치열하며 경쟁사들은 자체 제어 기능을 빠른 속도로 출시하고 있습니다. 이는 올해 최첨단 주장의 유효 기간을 반복적으로 단축시키는 역동성입니다.
현재 Google이 개발자에게 보내는 메시지는 직접적입니다. 한때 즉각적인 연금술과 행운이 필요했던 생성 비디오를 이제 단일 API를 통해 4K로 연출하고 확장하고 마무리할 수 있습니다.
---
AI보다 앞서 나가세요최신 AI 뉴스, 분석, 획기적인 소식을 모두 한 곳에서 받아보세요.
AI 뉴스 자세히 보기 →