MiniMax، استارتاپ هوش مصنوعی مستقر در پکن، آخرین مدل نسل ویدیویی خود، H3 را در 31 ژوئیه 2026 رونمایی کرد و رقابت شدیدی را برای تسلط بر ویدیوهای تولید شده توسط هوش مصنوعی تشدید کرد. این نسخه، MiniMax را مستقیماً در برابر ByteDance قرار می‌دهد، که در همان هفته مدل به روز شده Seedance 2.5 خود را در آنچه بلومبرگ به عنوان یک مسابقه دوئل بین دو شرکت جاه‌طلبانه هوش مصنوعی چین توصیف کرد، عرضه کرد. برای پوشش مداوم [آخرین تحولات هوش مصنوعی] (https://aibuzzwire.news)، گزارش زنده ما را دنبال کنید.

آنچه H3 به میز می آورد

بر اساس گزارش رویترز، مدل H3 MiniMax می‌تواند کلیپ‌های ویدیویی با وضوح 2K تولید کند - یک گام قابل‌توجه از خروجی 1080p که استاندارد واقعی برای اکثر ابزارهای هوش مصنوعی ویدیویی مصرف‌کننده بوده است. این مدل همچنین صدای استریو هماهنگ با فیلم تولید شده را تولید می‌کند، قابلیتی که در فضای تولید ویدیو نادر است، جایی که اکثر مدل‌ها کلیپ‌های بی‌صدا را تولید می‌کنند که نیاز به خط لوله صوتی جداگانه دارند.

شاید مهم ترین تصمیم استراتژیک، تعهد MiniMax به وزن باز باشد. ساوت چاینا مورنینگ پست گزارش داد که MiniMax H3 را با وزن های مدل منبع باز و با قیمتی که عمداً رقبا را کاهش می دهد منتشر می کند - ترکیبی که انتشار به عنوان یک چالش مستقیم برای رویکرد بسته و تجاری ByteDance در نظر گرفته است. وزن‌های باز به توسعه‌دهندگان و محققین این امکان را می‌دهد که به جای اتکا به API میزبان، مدل را دانلود، بررسی، تنظیم دقیق و استقرار در زیرساخت خود کنند.

طبق گفته AIBase، MiniMax H3 را به عنوان یک مدل "همه مودال" توصیف می‌کند و پیشنهاد می‌کند که این مدل برای مدیریت انواع ورودی و خروجی - متن، تصویر، صدا و ویدئو - در یک معماری واحد طراحی شده است نه نیاز به مدل‌های تخصصی جداگانه که به هم متصل شده‌اند.

واکنش بازار

سرمایه گذاران به سرعت پاسخ دادند. Finance.biggo.com گزارش داد که سهام MiniMax تقریباً 13% افزایش یافت و پس از اعلام H3، منعکس کننده اطمینان بازار است که قیمت گذاری تهاجمی و استراتژی وزن باز این شرکت می تواند افکار توسعه دهندگان را در رده ای جلب کند که در آن اکوسیستم Doubao توسط ByteDance پیشرو است.

جنگ قیمت واقعی است. SCMP خاطرنشان کرد که MiniMax ویدیوی تولید شده توسط H3 را با هزینه ای بسیار کمتر از نرخ های رایج ارائه می دهد، و شرط می بندم که قیمت های پایین تر برای هر نسل، کاربران پرحجمی را جذب می کند - از سازندگان رسانه های اجتماعی گرفته تا آژانس های بازاریابی گرفته تا فیلمسازان مستقل - که به شدت به هزینه های هر کلیپ حساس هستند.

ByteDance با Seedance 2.5 بازمی گردد

ByteDance نگذاشت این لحظه بی پاسخ بگذرد. در همان جدول زمانی، Seedance 2.5، آخرین نسخه از مدل تولید ویدیوی خود را منتشر کرد. طبق گفته‌های Pandaily و CineD، Seedance 2.5 می‌تواند ویدئوهای 30 ثانیه‌ای را در یک نسل واحد تولید کند - یک پیشرفت معنی‌دار نسبت به مدل‌های قبلی که معمولاً برای دستیابی به دنباله‌های طولانی‌تر نیاز به دوخت کلیپ‌های کوتاه‌تری داشتند.

CineD گزارش داد که Seedance 2.5 حداکثر 50 ورودی مرجع را می پذیرد و به کاربران امکان می دهد تولید را با چندین تصویر، درخواست های متنی و مراجع بصری به طور همزمان هدایت کنند. این مدل همچنین بلاک‌های دوربین سه‌بعدی را معرفی می‌کند که به سازندگان امکان کنترل در سطح کارگردان بر حرکت دوربین مجازی - تابه‌ها، عروسک‌ها و مسیرهای مداری - در صحنه‌های تولید شده را می‌دهد. TechNode و Tech در آسیا قابلیت‌های چند ورودی و ویرایش مدل را تأیید کردند و آن را به عنوان ابزاری برای تولید ویدیوی پیچیده‌تر و مبتنی بر روایت قرار دادند.

CNET قبلاً گزارش داده بود که انتظار می‌رود Seedance 2.5 "به زودی این هفته" عرضه شود و انتشار همزمان با MiniMax H3 نشان می‌دهد که چرخه رقابتی در ویدئوهای هوش مصنوعی چین چقدر فشرده شده است.

چرا مسابقه هوش مصنوعی ویدیویی مهم است

رقابت MiniMax در مقابل ByteDance چیزی بیش از یک درگیری منطقه ای است. تولید ویدیوی هوش مصنوعی به یکی از سرمایه برترین و از نظر فنی نیازمندترین مرزها در هوش مصنوعی تبدیل شده است که به منابع محاسباتی عظیمی برای آموزش و استنتاج نیاز دارد. رقبای جهانی - از جمله OpenAI's Sora، Google's Veo، و حوزه در حال رشد استارت آپ ها - همگی در حال رقابت برای تولید ویدیوهای طولانی تر، با وضوح بالاتر و قابل کنترل تر از پیام های متنی و تصویری هستند.

اکوسیستم ویدئویی هوش مصنوعی چین با سرعت خاصی حرکت کرده است. تصمیم MiniMax برای وزن‌های H3 منبع باز از الگوی گسترده‌تری در میان آزمایشگاه‌های هوش مصنوعی چینی - از جمله DeepSeek، سازنده Qwen Alibaba و سایرین - پیروی می‌کند که مدل‌های با وزن باز قدرتمند را برای ساخت اکوسیستم‌های توسعه‌دهنده و ایجاد اعتبار فنی، حتی به قیمت انحصار تجاری کوتاه‌مدت عرضه می‌کنند.

گنجاندن صدای استریو در H3 به ویژه قابل توجه است. اکثر مدل‌های تولید ویدیو امروزه تنها خروجی بصری تولید می‌کنند و صدا را به عنوان یک مرحله جداگانه و اغلب دستی باقی می‌گذارند. اگر MiniMax واقعاً تولید صدای هماهنگ شده را با وضوح 2K حل کرده باشد، یک نقطه عطف ادغام معنی‌دار را نشان می‌دهد - اگرچه معیارهای مستقل و ارزیابی‌های عملی برای ارزیابی کیفیت واقعی و قابلیت اطمینان خروجی مورد نیاز است.

سوال وزن باز

انتشار وزن باز MiniMax نیز بحثی را برانگیخت که صنعت هوش مصنوعی را از هم جدا کرده است. طرفداران استدلال می کنند که وزن های باز تحقیقات را تسریع می بخشد، بررسی ایمنی را امکان پذیر می کند و موانع را برای توسعه دهندگان کوچکتر کاهش می دهد. منتقدان - از جمله برخی از آزمایشگاه‌های مرزی غربی - معتقدند که انتشار مدل‌های قدرتمند مولد آشکارا خطر سوء استفاده را افزایش می‌دهد، از جعل عمیق تا اطلاعات نادرست.

در حال حاضر، MiniMax شرط می‌بندد که حسن نیت توسعه‌دهنده و قفل شدن اکوسیستم از وزن‌های باز بیشتر از هر نقطه ضعف رقابتی باشد. اینکه آیا این شرط‌بندی به نتیجه می‌رسد بستگی به پذیرش دارد: اگر H3 به ابزاری پیش‌فرض برای سازندگان ویدیو در سراسر چین و فراتر از آن تبدیل شود، استراتژی وزن باز می‌تواند به همان اندازه برای هوش مصنوعی ویدیویی تأثیرگذار باشد که نسخه‌های لاما متا برای متن.

با این حال، رقابت فوری واضح است. دو تا از بزرگ‌ترین شرکت‌های هوش مصنوعی چین آخرین عکس‌های خود را در جنگ‌های تولید ویدیو در همان روز شلیک کرده‌اند - و سرعت آن فقط در حال افزایش است.

---

از هوش مصنوعی جلوتر بمانید

آخرین اخبار، تحلیل ها و پیشرفت های هوش مصنوعی را دریافت کنید - همه در یک مکان.

**اخبار هوش مصنوعی را بیشتر بخوانید →