آنچه H3 به میز می آورد
بر اساس گزارش رویترز، مدل H3 MiniMax میتواند کلیپهای ویدیویی با وضوح 2K تولید کند - یک گام قابلتوجه از خروجی 1080p که استاندارد واقعی برای اکثر ابزارهای هوش مصنوعی ویدیویی مصرفکننده بوده است. این مدل همچنین صدای استریو هماهنگ با فیلم تولید شده را تولید میکند، قابلیتی که در فضای تولید ویدیو نادر است، جایی که اکثر مدلها کلیپهای بیصدا را تولید میکنند که نیاز به خط لوله صوتی جداگانه دارند.
شاید مهم ترین تصمیم استراتژیک، تعهد MiniMax به وزن باز باشد. ساوت چاینا مورنینگ پست گزارش داد که MiniMax H3 را با وزن های مدل منبع باز و با قیمتی که عمداً رقبا را کاهش می دهد منتشر می کند - ترکیبی که انتشار به عنوان یک چالش مستقیم برای رویکرد بسته و تجاری ByteDance در نظر گرفته است. وزنهای باز به توسعهدهندگان و محققین این امکان را میدهد که به جای اتکا به API میزبان، مدل را دانلود، بررسی، تنظیم دقیق و استقرار در زیرساخت خود کنند.
طبق گفته AIBase، MiniMax H3 را به عنوان یک مدل "همه مودال" توصیف میکند و پیشنهاد میکند که این مدل برای مدیریت انواع ورودی و خروجی - متن، تصویر، صدا و ویدئو - در یک معماری واحد طراحی شده است نه نیاز به مدلهای تخصصی جداگانه که به هم متصل شدهاند.
واکنش بازار
سرمایه گذاران به سرعت پاسخ دادند. Finance.biggo.com گزارش داد که سهام MiniMax تقریباً 13% افزایش یافت و پس از اعلام H3، منعکس کننده اطمینان بازار است که قیمت گذاری تهاجمی و استراتژی وزن باز این شرکت می تواند افکار توسعه دهندگان را در رده ای جلب کند که در آن اکوسیستم Doubao توسط ByteDance پیشرو است.
جنگ قیمت واقعی است. SCMP خاطرنشان کرد که MiniMax ویدیوی تولید شده توسط H3 را با هزینه ای بسیار کمتر از نرخ های رایج ارائه می دهد، و شرط می بندم که قیمت های پایین تر برای هر نسل، کاربران پرحجمی را جذب می کند - از سازندگان رسانه های اجتماعی گرفته تا آژانس های بازاریابی گرفته تا فیلمسازان مستقل - که به شدت به هزینه های هر کلیپ حساس هستند.
ByteDance با Seedance 2.5 بازمی گردد
ByteDance نگذاشت این لحظه بی پاسخ بگذرد. در همان جدول زمانی، Seedance 2.5، آخرین نسخه از مدل تولید ویدیوی خود را منتشر کرد. طبق گفتههای Pandaily و CineD، Seedance 2.5 میتواند ویدئوهای 30 ثانیهای را در یک نسل واحد تولید کند - یک پیشرفت معنیدار نسبت به مدلهای قبلی که معمولاً برای دستیابی به دنبالههای طولانیتر نیاز به دوخت کلیپهای کوتاهتری داشتند.
CineD گزارش داد که Seedance 2.5 حداکثر 50 ورودی مرجع را می پذیرد و به کاربران امکان می دهد تولید را با چندین تصویر، درخواست های متنی و مراجع بصری به طور همزمان هدایت کنند. این مدل همچنین بلاکهای دوربین سهبعدی را معرفی میکند که به سازندگان امکان کنترل در سطح کارگردان بر حرکت دوربین مجازی - تابهها، عروسکها و مسیرهای مداری - در صحنههای تولید شده را میدهد. TechNode و Tech در آسیا قابلیتهای چند ورودی و ویرایش مدل را تأیید کردند و آن را به عنوان ابزاری برای تولید ویدیوی پیچیدهتر و مبتنی بر روایت قرار دادند.
CNET قبلاً گزارش داده بود که انتظار میرود Seedance 2.5 "به زودی این هفته" عرضه شود و انتشار همزمان با MiniMax H3 نشان میدهد که چرخه رقابتی در ویدئوهای هوش مصنوعی چین چقدر فشرده شده است.
چرا مسابقه هوش مصنوعی ویدیویی مهم است
رقابت MiniMax در مقابل ByteDance چیزی بیش از یک درگیری منطقه ای است. تولید ویدیوی هوش مصنوعی به یکی از سرمایه برترین و از نظر فنی نیازمندترین مرزها در هوش مصنوعی تبدیل شده است که به منابع محاسباتی عظیمی برای آموزش و استنتاج نیاز دارد. رقبای جهانی - از جمله OpenAI's Sora، Google's Veo، و حوزه در حال رشد استارت آپ ها - همگی در حال رقابت برای تولید ویدیوهای طولانی تر، با وضوح بالاتر و قابل کنترل تر از پیام های متنی و تصویری هستند.
اکوسیستم ویدئویی هوش مصنوعی چین با سرعت خاصی حرکت کرده است. تصمیم MiniMax برای وزنهای H3 منبع باز از الگوی گستردهتری در میان آزمایشگاههای هوش مصنوعی چینی - از جمله DeepSeek، سازنده Qwen Alibaba و سایرین - پیروی میکند که مدلهای با وزن باز قدرتمند را برای ساخت اکوسیستمهای توسعهدهنده و ایجاد اعتبار فنی، حتی به قیمت انحصار تجاری کوتاهمدت عرضه میکنند.
گنجاندن صدای استریو در H3 به ویژه قابل توجه است. اکثر مدلهای تولید ویدیو امروزه تنها خروجی بصری تولید میکنند و صدا را به عنوان یک مرحله جداگانه و اغلب دستی باقی میگذارند. اگر MiniMax واقعاً تولید صدای هماهنگ شده را با وضوح 2K حل کرده باشد، یک نقطه عطف ادغام معنیدار را نشان میدهد - اگرچه معیارهای مستقل و ارزیابیهای عملی برای ارزیابی کیفیت واقعی و قابلیت اطمینان خروجی مورد نیاز است.
سوال وزن باز
انتشار وزن باز MiniMax نیز بحثی را برانگیخت که صنعت هوش مصنوعی را از هم جدا کرده است. طرفداران استدلال می کنند که وزن های باز تحقیقات را تسریع می بخشد، بررسی ایمنی را امکان پذیر می کند و موانع را برای توسعه دهندگان کوچکتر کاهش می دهد. منتقدان - از جمله برخی از آزمایشگاههای مرزی غربی - معتقدند که انتشار مدلهای قدرتمند مولد آشکارا خطر سوء استفاده را افزایش میدهد، از جعل عمیق تا اطلاعات نادرست.
در حال حاضر، MiniMax شرط میبندد که حسن نیت توسعهدهنده و قفل شدن اکوسیستم از وزنهای باز بیشتر از هر نقطه ضعف رقابتی باشد. اینکه آیا این شرطبندی به نتیجه میرسد بستگی به پذیرش دارد: اگر H3 به ابزاری پیشفرض برای سازندگان ویدیو در سراسر چین و فراتر از آن تبدیل شود، استراتژی وزن باز میتواند به همان اندازه برای هوش مصنوعی ویدیویی تأثیرگذار باشد که نسخههای لاما متا برای متن.
با این حال، رقابت فوری واضح است. دو تا از بزرگترین شرکتهای هوش مصنوعی چین آخرین عکسهای خود را در جنگهای تولید ویدیو در همان روز شلیک کردهاند - و سرعت آن فقط در حال افزایش است.
---
از هوش مصنوعی جلوتر بمانیدآخرین اخبار، تحلیل ها و پیشرفت های هوش مصنوعی را دریافت کنید - همه در یک مکان.

