Firma ogłosiła w ten weekend, że Google wypuściło Lyrię 3.5, najnowszą wersję swojego modelu generowania muzyki opartego na sztucznej inteligencji, bezpośrednio w aplikacji Gemini i za pośrednictwem interfejsu API dla programistów. To wdrożenie stawia generację tekstu na muzykę przed ogromną bazą użytkowników Gemini i zapewnia programistom programowy dostęp do modelu po raz pierwszy w tej generacji.
O premierze poinformował The Decoder i inne sklepy, które zauważyły, że Google pozycjonuje Lyrię 3.5 jako swój najpotężniejszy model muzyczny w historii, z lepszym wokalem i pełniejszymi aranżacjami niż jego poprzednik. Jest to również najnowszy znak, że wyścig w zakresie narzędzi AI toczy się teraz bezpośrednio w mediach kreatywnych – co szczegółowo śledzimy w naszym relacjonowaniu narzędzi AI.
Co potrafi Lyria 3.5
Według Google Lyria 3.5 zapewnia bardziej wyrazisty wokal i bogatsze aranżacje muzyczne niż wersja, którą zastępuje. Użytkownicy mogą wybrać gatunek i styl w aplikacji Gemini, wybierać pomiędzy wokalem a instrumentami oraz generować utwory, od krótkich klipów po dłuższe utwory muzyczne.
Google dodał także szablony zaprojektowane, aby pomóc nowym użytkownikom rozpocząć pracę, w tym gotowe ustawienia muzyki w tle i spersonalizowane piosenki urodzinowe — znak, że firma jest skierowana w równym stopniu do zwykłych użytkowników i uroczystości, jak i do muzyków. Tonacja jest znana z innych funkcji Google Gemini: obniżaj barierę, aż ktokolwiek będzie w stanie stworzyć gotowy artefakt na podstawie jednego lub dwóch zdań opisu.
Przepływ pracy odzwierciedla tę prostotę. Użytkownik opisuje rodzaj utworu, jaki chce, wybiera parametry gatunku i stylu oraz decyduje, czy wynik powinien zawierać wokal, czy pozostać instrumentalny. Ponieważ model obsługuje zarówno krótkie ujęcia, jak i dłuższe kompozycje, to samo narzędzie obsługuje wiadomość urodzinową, łóżko podcastu lub ścieżkę dźwiękową do domowego wideo — przypadki użycia, które wcześniej wymagały albo subskrypcji muzyki stockowej, albo wynajętego kompozytora.
Gdzie model jest dostępny
Wdrożenie wykracza poza aplikację Gemini. Zgodnie z zapowiedzią Google Lyria 3.5 jest także dostępna w Google Flow Music z dodatkowymi funkcjami, w Google AI Studio dla programistów oraz w Google Vids, firmowym narzędziu do tworzenia wideo opartym na sztucznej inteligencji. Dostęp do interfejsu API oznacza, że aplikacje innych firm mogą bezpośrednio bazować na modelu, co może zaowocować falą funkcji opartych na muzyce w aplikacjach innych firm w nadchodzących miesiącach.
Ta szerokość ma znaczenie. Osadzanie modelu muzycznego w asystencie klienta, platformie programistycznej i edytorze wideo zapewnia Google wiele przestrzeni, w których wygenerowany dźwięk staje się domyślną opcją kreatywną, a nie samodzielną nowością.
Dla programistów dostęp do AI Studio jest godnym uwagi elementem. Dzięki temu Lyria przestała być ciekawostką konsumencką i stała się elementem konstrukcyjnym: aplikacje fitness mogą generować adaptacyjną muzykę do ćwiczeń, studia gier mogą zdobywać poziomy w sposób proceduralny, a narzędzia edukacyjne mogą tworzyć niestandardowe piosenki na lekcje. Google nie ogłosił dotychczas cen API w zgłoszonych dotychczas materiałach, więc nie wiadomo jeszcze, w jaki sposób model będzie mierzony, ale sama dostępność sygnalizuje, że firma chce, aby Lyria 3.5 była osadzona w szerszej ekonomii aplikacji, a nie ograniczała się do jej własnych produktów.
Licencjonowana oferta szkoleniowa
Najbardziej wymowna część zapowiedzi Google'a dotyczy danych treningowych. Google twierdzi, że model Lyria był szkolony wyłącznie w oparciu o licencjonowane treści, co stanowi wyraźny kontrast w porównaniu z Suno, start-upem muzycznym opartym na sztucznej inteligencji, którego praktyki szkoleniowe wywołały spory dotyczące praw autorskich, w tym przełomowy niemiecki pozew wniesiony przez grupę GEMA zajmującą się prawami do muzyki, który Suno przegrał na początku tego roku.
Jak zauważył The Decoder, Google nie udostępnił szczegółów na temat tego, z jakich danych treningowych faktycznie korzystał. Jednak ramy dotyczące treści licencjonowanych wyznaczają wyraźną granicę w branży, w której pochodzenie danych szkoleniowych staje się prawnym i komercyjnym wyróżnikiem. Dla posiadaczy praw duże laboratorium korzystające z w pełni licencjonowanych szkoleń podnosi poprzeczkę dla konkurentów; dla użytkowników biznesowych zmniejsza to przynajmniej część ryzyka prawnego, które sprawiło, że dźwięk generowany przez sztuczną inteligencję stał się uciążliwym atutem w produkcji reklam i mediów.
Zatłoczony rynek sporny
Generowanie muzyki oparte na sztucznej inteligencji staje się jednym z bardziej kwestionowanych obszarów mediów generatywnych. Porażka Suno w niemieckim sądzie w kwestiach praw autorskich zasygnalizowała, że otoczenie prawne modelek szkolonych na chronionych nagraniach zaostrza się, szczególnie w Europie. W tym kontekście decyzja Google o położeniu nacisku na licencjonowanie – przy zachowaniu poufności szczegółów – można odczytać zarówno jako tarczę prawną, jak i przekaz marketingowy skierowany do ostrożnych klientów korporacyjnych.
Konkurencja dotyczy także dystrybucji. Baza użytkowników Gemini zapewnia Lyrii 3.5 zasięg, z jakim borykają się niezależne start-upy muzyczne, a integracja z Google Vids oznacza, że ścieżki dźwiękowe oparte na sztucznej inteligencji mogą niemal z dnia na dzień stać się standardowym elementem tworzenia filmów w miejscu pracy.
Co to oznacza dla twórców
Dla pracujących muzyków pojawienie się dopracowanego modelu muzycznego z licencjonowanymi danymi w głównym asystencie jest rozwiązaniem obosiecznym. Obniża koszt jingli, podkładów i spersonalizowanych piosenek niemal do zera, jednocześnie stawiając znane pytania o to, w jaki sposób artyści-ludzie konkurują z natychmiastową, odpowiednią wydajnością. Na razie komunikaty Google skupiają się na pomocy i kreatywności na skalę uroczystości, a nie na zastąpieniu produkcji studyjnej.
Jasne jest, że muzyka AI wychodzi z fazy demonstracyjnej. Ponieważ Lyria 3.5 znajduje się w aplikacji Gemini, Flow Music, AI Studio, Google Vids i publicznym interfejsie API, generowanie użytecznego utworu jest teraz funkcją, a nie osobną kategorią produktu – a branża będzie obserwować, czy roszczenie dotyczące licencjonowanego szkolenia wytrzyma weryfikację.
Wyprzedź sztuczną inteligencję
Krajobraz narzędzi AI zmienia się codziennie. Zdobądź najnowsze osiągnięcia AI w jednym miejscu.
Przeczytaj więcej aktualności o sztucznej inteligencji →