Co H3 wnosi do stołu
Według Reuters model MiniMax H3 może generować klipy wideo w rozdzielczości 2K — co stanowi znaczący krok naprzód w porównaniu z rozdzielczością 1080p, która jest de facto standardem w przypadku większości narzędzi wideo AI przeznaczonych dla konsumentów. Model wytwarza także dźwięk stereo zsynchronizowany z generowanym materiałem filmowym, co jest rzadkością w obszarze generowania wideo, gdzie większość modeli generuje ciche klipy wymagające osobnego potoku audio.
Być może najbardziej strategiczną decyzją jest zaangażowanie MiniMax w otwarte ciężary. „South China Morning Post” doniósł, że MiniMax wypuszcza H3 z modelami o otwartym kodzie źródłowym i po cenie, która celowo podcina konkurencję, co w publikacji określono jako bezpośrednie wyzwanie dla zamkniętego, komercyjnego podejścia ByteDance. Otwarte wagi pozwalają programistom i badaczom pobierać, sprawdzać, dostrajać i wdrażać model we własnej infrastrukturze, zamiast polegać wyłącznie na hostowanym interfejsie API.
Według AIBase MiniMax opisał H3 jako model „w pełni modalny”, sugerując, że jest on zaprojektowany do obsługi wielu typów danych wejściowych i wyjściowych — tekstu, obrazu, dźwięku i wideo — w ramach jednej architektury, zamiast wymagać połączonych ze sobą oddzielnych wyspecjalizowanych modeli.
Reakcja rynku
Inwestorzy zareagowali szybko. Finance.biggo.com poinformowało, że akcje MiniMax wzrosły o prawie 13% po ogłoszeniu na półroczu 3, co odzwierciedla pewność rynku, że agresywna polityka cenowa firmy i strategia otwartej wagi mogą przyciągnąć uwagę programistów w kategorii, w której ekosystem Doubao firmy ByteDance zajmuje dominującą pozycję lidera.
Wojna cenowa jest faktem. SCMP zauważył, że MiniMax oferuje wideo generowane w formacie H3 po kosztach znacznie niższych od obowiązujących stawek, zakładając, że niższe ceny za generację przyciągną dużych użytkowników – od twórców mediów społecznościowych, przez agencje marketingowe po niezależnych twórców filmowych – którzy są bardzo wrażliwi na koszty za klip.
ByteDance powraca z Seedance 2.5
ByteDance nie pozostawiło tej chwili bez odpowiedzi. W tym samym czasie wypuściła Seedance 2.5, najnowszą wersję swojego modelu generowania wideo. Według Pandaily i CineD Seedance 2.5 może wygenerować 30-sekundowe filmy w ciągu jednej generacji — to znaczące ulepszenie w porównaniu z wcześniejszymi modelami, które zazwyczaj wymagały łączenia krótszych klipów w celu uzyskania dłuższych sekwencji.
CineD poinformowało, że Seedance 2.5 akceptuje do 50 wejść referencyjnych, umożliwiając użytkownikom kierowanie generowaniem za pomocą wielu obrazów, podpowiedzi tekstowych i odniesień wizualnych jednocześnie. W modelu wprowadzono także blokowanie kamer 3D, dające twórcom kontrolę na poziomie reżysera nad ruchami wirtualnej kamery — patelniami, wózkami i ścieżkami orbit — w generowanych scenach. TechNode i Tech w Azji potwierdziły możliwości wielu wejść i edycji modelu, pozycjonując go jako narzędzie do bardziej wyrafinowanej produkcji wideo opartej na narracji.
CNET wcześniej informowało, że premiera Seedance 2.5 miała nastąpić „już w tym tygodniu”, a równoczesna premiera z MiniMax H3 podkreśla, jak skompresowany został cykl rywalizacji w chińskim wideo AI.
Dlaczego wyścig wideo AI ma znaczenie
Rywalizacja MiniMax kontra ByteDance to coś więcej niż regionalna potyczka. Generowanie wideo oparte na sztucznej inteligencji stało się jednym z najbardziej kapitałochłonnych i technicznie wymagających obszarów sztucznej inteligencji, wymagającym ogromnych zasobów obliczeniowych do celów szkolenia i wnioskowania. Globalni konkurenci — w tym Sora z OpenAI, Veo z Google i rosnąca grupa start-upów — ścigają się, aby wyprodukować dłuższe wideo o wyższej rozdzielczości i łatwiejsze do kontrolowania za pomocą podpowiedzi tekstowych i graficznych.
Chiński ekosystem wideo AI rozwijał się ze szczególną szybkością. Decyzja MiniMax o udostępnieniu wag H3 na otwartym kodzie źródłowym wynika z szerszego wzorca panującego wśród chińskich laboratoriów zajmujących się sztuczną inteligencją – w tym DeepSeek, producenta Qwen Alibaba i innych – polegającego na udostępnianiu potężnych modeli o otwartej wadze w celu budowy ekosystemów programistycznych i ustalenia wiarygodności technicznej, nawet kosztem krótkoterminowej wyłączności komercyjnej.
Szczególnie godne uwagi jest włączenie dźwięku stereo do H3. Większość współczesnych modeli generowania wideo generuje wyłącznie obraz, pozostawiając dźwięk jako oddzielny, często ręczny etap. Jeśli MiniMax rzeczywiście rozwiązał zsynchronizowane generowanie dźwięku w rozdzielczości 2K, stanowiłoby to znaczący kamień milowy w integracji – chociaż potrzebne będą niezależne testy porównawcze i praktyczne oceny, aby ocenić rzeczywistą jakość i niezawodność sygnału wyjściowego.
Pytanie otwarte
Otwarta premiera MiniMaxa również ponownie wywołuje debatę, która podzieliła branżę sztucznej inteligencji. Zwolennicy argumentują, że otwarte wagi przyspieszają badania, umożliwiają kontrolę bezpieczeństwa i obniżają bariery dla mniejszych deweloperów. Krytycy – w tym niektóre zachodnie laboratoria graniczne – twierdzą, że otwarte udostępnianie potężnych modeli generatywnych otwarcie zwiększa ryzyko nadużyć, od deepfakes po dezinformację.
Na razie MiniMax obstawia, że dobra wola dewelopera i zamknięcie ekosystemu w wyniku otwartych wag przeważą nad wszelkimi wadami konkurencyjnymi. To, czy ten zakład się opłaci, będzie zależeć od przyjęcia: jeśli H3 stanie się domyślnym narzędziem dla twórców wideo w Chinach i poza nimi, strategia otwartej wagi może okazać się równie istotna dla sztucznej inteligencji wideo, jak wydania Meta Lamy dla tekstu.
Jednak bezpośrednia konkurencja jest wyraźna. Dwie z największych chińskich firm zajmujących się sztuczną inteligencją wykonały swoje najnowsze zdjęcia w ramach wojen generacji wideo tego samego dnia, a tempo tylko przyspiesza.
---
Wyprzedź sztuczną inteligencjęOtrzymuj najnowsze wiadomości, analizy i przełomowe informacje dotyczące sztucznej inteligencji — wszystko w jednym miejscu.

