این فهرست تاریخ انقضا دارد. آنچه تاریخ انقضا ندارد، منطق انتخاب است — و آن را جای دیگری نوشته‌ایم.

تعداد مدل‌های تولید ویدیو و تصویر آنقدر زیاد شده که خودِ انتخاب بین آن‌ها به یک مسئله تبدیل شده. هر چند ماه نسخه جدیدی می‌آید، رتبه‌بندی‌ها جابه‌جا می‌شوند، و مقایسه‌هایی که سه ماه پیش نوشته شده‌اند دیگر درست نیستند.

به همین دلیل این موضوع را به دو مقاله تقسیم کرده‌ایم:

این مقالهمقاله چارچوب انتخاب
چه می‌گویدچه مدل‌هایی الان وجود دارند و هرکدام چه کاری می‌کنندچطور بین هر دو گزینه‌ای تصمیم بگیری
عمرچند ماه؛ فصلی بازبینی می‌شودچند سال؛ معیارها تغییر نمی‌کنند
نام ابزاردارد — هدفش همین استعمداً ندارد
کِی بخوانشوقتی می‌خواهی بدانی چه چیزی موجود استوقتی می‌خواهی تصمیم بگیری

اگر فقط وقت خواندن یکی را داری، آن یکی را بخوان: انتخاب ابزار هوش مصنوعی؛ چارچوب تصمیم. این صفحه بدون آن، فهرستی است که نمی‌گوید با آن چه کنی.

در ادامه، مدل‌ها بر اساس کاری که انجام می‌دهند دسته‌بندی شده‌اند، نه بر اساس رتبه. چون آنچه واقعاً تصمیم را می‌سازد این نیست که کدام «بهترین» است — این است که کدام ورودی‌هایی را می‌پذیرد که تو داری، و کدام خروجی‌ای می‌دهد که لازم داری.

قبل از فهرست: سه سؤال که انتخاب را می‌سازند

  • چه ورودی‌ای داری؟ — فقط متن، یک تصویر، چند تصویر، ویدیوی مرجع، یا فایل صوتی. این بیشتر از هر چیزی گزینه‌ها را محدود می‌کند
  • خروجی کجا منتشر می‌شود؟ — رزولوشن و نسبت تصویر لازم را همین تعیین می‌کند، نه سلیقه
  • چند نسخه لازم داری؟ — برای یک تیزر واحد، گران‌ترین مدل منطقی است؛ برای صد ویدیوی کوتاه، نه

سؤال اول را جدی بگیر. بیشتر ناامیدی‌ها از این می‌آید که مدلی انتخاب شده که ورودی موجود را اصلاً نمی‌پذیرد — مثلاً کسی می‌خواهد ویدیویی را ادامه بدهد و مدلی انتخاب کرده که فقط تصویر ثابت می‌گیرد.

مدل‌های ویدیو

سازنده و سایت رسمی هر کدام در ستون دوم آمده. ستون سوم چیزی است که آن مدل را از بقیه جدا می‌کند:

مدلسازندهچه چیزی خاصش می‌کند
Seedance 2.5ByteDance — seed.bytedance.comچهار حالت: تولید از متن، مرجع‌محور، ویرایش ویدیوی موجود، و ادامه‌دادن ویدیو. تا ۳۰ ثانیه
Seedance 2.0ByteDance — seed.bytedance.comحفظ هویت شخصیت و چند محصول هم‌زمان؛ خروجی تا ۴K
Kling 3.0Kuaishou — kling.aiچند نما در یک تولید، صدای هم‌زمان، انتقال حرکت از ویدیوی مرجع
MiniMax H3MiniMax — minimax.ioمتن، تصویر، ویدیو و صدا را به‌عنوان یک زمینه واحد می‌خواند. خروجی ۲K
Veo 3.1Google — deepmind.googleواقع‌گرایی بالا و کیفیت سینمایی؛ نسخه Lite برای تولید انبوه
FLUX 3 VideoBlack Forest Labs — bfl.aiاستوری‌برد چندفریمی و ادامه‌دادن ویدیو، با صدای هماهنگ
Grok Video 1.5xAI — x.aiفیزیک و حرکت دوربین، با پذیرش مرجع صوتی
Wan 2.7Alibaba — wan.videoصدای هم‌زمان با تداوم شخصیت

تفاوت عملی که بیشترین اثر را دارد: بعضی از این مدل‌ها فقط فریم اول می‌گیرند، بعضی فریم اول و آخر، و بعضی مرجع تصویر و ویدیو و صدا. اگر می‌خواهی شخصیت یا محصول مشخصی در ویدیو حفظ شود، باید سراغ گروه سوم بروی.

قابلیتی که در بیشتر مقایسه‌ها گم می‌شود: ادامه‌دادن ویدیوی موجود. برای پروژه‌هایی که یک نمای خوب دارند و لازم است چند ثانیه بیشتر ادامه پیدا کند، این یک قابلیت است نه یک تفاوت جزئی.

مدل‌های تصویر

مدلسازندهچه چیزی خاصش می‌کند
Nano Banana ProGoogle — gemini.google.comبالاترین کیفیت، و بهترین گزینه وقتی متن یا دیاگرام داخل تصویر لازم است
Nano Banana 2Google — gemini.google.comهمان خانواده، سریع‌تر و ارزان‌تر. تا ۴K
GPT Image 2OpenAI — openai.comتایپوگرافی و ویرایش تصویر، سه سطح کیفیت
Seedream 5.0ByteDance — seed.bytedance.comویرایش دستوری: با جمله می‌گویی چه چیزی عوض شود. نسخه Pro اینپینت دارد
Seedream 4.5ByteDance — seed.bytedance.comرزولوشن بسیار بالا و کنترل دقیق تبدیل
FLUX.2Black Forest Labs — bfl.aiپیروی دقیق از پرامپت، سه واریانت با هزینه متفاوت
Recraft V4.1Recraft — recraft.aiوکتور، لوگو و آیکون؛ حالت utility برای عکس محصول با پالت ثابت
Grok ImagexAI — x.aiسبک پرکنتراست و بیانگر

سه مدل این فهرست در یک چیز مشخص از بقیه بهترند و آن رندر متن داخل تصویر است — کاری که تا مدتی نقطه ضعف همه این مدل‌ها بود. برای پوستر، اینفوگرافیک و هر تصویری که متن فارسی یا انگلیسی دارد، همین یک تفاوت انتخاب را تعیین می‌کند.

و Recraft در فهرست بالا استثناست: تنها موردی است که خروجی وکتور می‌دهد، یعنی برای لوگو و آیکون قابل استفاده در ابعاد مختلف.

مدل‌های صدا و گفتار

مدلسازندهچه چیزی خاصش می‌کند
Seed Audio 1.0ByteDance — seed.bytedance.comکلون صدا از فایل مرجع، با کنترل سرعت و بلندی و زیروبمی
Qwen Audio 3.0 TTSAlibaba — qwen.aiدستور زبان طبیعی برای احساس و لهجه: «با لحن آرام و کمی کند بخوان»
ElevenLabs / MiniMax و…چند سازندهچند موتور گفتار که از یک رابط واحد قابل انتخاب‌اند

یک واقعیت که باید صریح گفته شود: فارسی در فهرست رسمی زبان‌های پشتیبانی‌شده بیشتر این موتورها نیست. خروجی فارسی گرفتنی است — مخصوصاً از طریق کلون صدا با فایل مرجع — ولی کیفیتش به سطح انگلیسی نمی‌رسد و برای متن‌های احساسی هنوز محدودیت جدی دارد.

مرزهای دقیق این محدودیت و روش آماده‌سازی متن فارسی برای صداگذاری را در صداگذاری با هوش مصنوعی؛ کجا جواب می‌دهد، کجا نه توضیح داده‌ایم.

مدل‌های سه‌بعدی

مدلسازندهچه چیزی خاصش می‌کند
SAM 3Meta — ai.meta.comاز یک تصویر، مش سه‌بعدی بافت‌دار می‌سازد
MeshyMeshy — meshy.aiریگ خودکار اسکلت و کتابخانه بزرگ کلیپ‌های انیمیشن آماده
Tripo H3.1Tripo — tripo3d.aiاز یک تصویر یا چند نما؛ چند نما دقت هندسی بهتری می‌دهد
Hunyuan 3DTencent — hunyuan.tencent.comاز متن یا تصویر، با کنترل تعداد پالیگان

این دسته برای بیشتر پروژه‌های بازاریابی هنوز کاربرد مستقیم ندارد، ولی برای نمایش محصول در زوایای مختلف و ساخت دارایی قابل استفاده در موشن گرافیک، مسیر تازه‌ای باز کرده.

ابزارهایی که تولید نمی‌کنند، اصلاح می‌کنند

این دسته کمتر دیده می‌شود و در عمل بیشترین وقت را صرفه‌جویی می‌کند:

  • افزایش رزولوشن ویدیو و تصویر — Topaz و نسخه ByteDance
  • انتقال حرکت از ویدیوی مرجع به تصویر شخصیت ثابت
  • دوبله چندزبانه با لیپ‌سینک
  • تغییر صدای گوینده در ویدیوی موجود
  • تغییر نسبت تصویر ویدیو با پرکردن هوشمند لبه‌ها
  • حذف پس‌زمینه از تصویر و ویدیو، بدون پرده سبز

مورد پنجم برای تیم‌های محتوایی بیشترین کاربرد روزمره را دارد: تبدیل ویدیوی افقی موجود به نسخه عمودی، بدون تصویربرداری دوباره.

محدودیت‌های این کار — و اینکه چرا جای برنامه‌ریزی قاب در تصویربرداری را نمی‌گیرد — در هوش مصنوعی در تدوین و پس‌تولید ویدیو توضیح داده شده.

هفت معیار، اعمال‌شده روی همین فهرست

در مقاله چارچوب انتخاب، هفت معیاری آمده که با تغییر نسل مدل‌ها عوض نمی‌شوند. جدول زیر همان هفت معیار را روی مدل‌های این صفحه اعمال می‌کند — یعنی برای هر معیار، دقیقاً چه چیزی را باید بررسی کنی:

معیاردر این دسته مدل‌ها یعنی چهچطور بررسی‌اش کنی
تناسب با مسئلهکدام ورودی‌ها را می‌پذیرد: متن، فریم، مرجع تصویر/ویدیو/صداورودی واقعی پروژه‌ات را با فهرست ورودی‌های مدل مقایسه کن
کیفیت فارسیبرای گفتار حیاتی؛ برای تصویر فقط وقتی متن داخل قاب باشدبا متن و صدای واقعی خودت تست کن، نه نمونه سایتشان
خروجی قابل انتقالآیا فایل خام قابل دانلود و استفاده در تدوین استیک خروجی بگیر و ببین بیرون بردنش چقدر ساده است
مدل قیمتبر اساس ثانیه، رزولوشن یا تعداد تولیدهزینه یک پروژه واقعی را حساب کن، نه هزینه یک تولید
حریم دادهآیا تصویر مشتری یا محصول برای آموزش استفاده می‌شودشرایط استفاده را بخوان؛ برای پروژه مشتری الزامی است
پایداریاین حوزه پرنوسان است و مدل‌ها سریع جایگزین می‌شوندبررسی کن پشت مدل چه شرکتی است و چند وقت فعال بوده
جای در گردش کارآیا با بقیه مراحل تولید تو جفت می‌شودیک پروژه کامل را با آن ببر تا انتها، نه فقط یک تولید

معیار دوم برای بازار ایران تعیین‌کننده‌ترین است و در هیچ رتبه‌بندی جهانی سنجیده نمی‌شود. مدلی که در جدول‌های بین‌المللی بالاست، ممکن است برای فارسی خروجی غیرقابل استفاده بدهد — و برعکس.

و معیار چهارم در این حوزه ظرافتی دارد: بیشتر این مدل‌ها بر اساس ثانیه و رزولوشن قیمت می‌گیرند، نه اشتراک ثابت. یعنی هزینه واقعی را فقط با محاسبه یک پروژه کامل می‌فهمی، نه با نگاه به قیمت هر تولید.

توضیح کامل هر هفت معیار، به‌علاوه آزمون بیست‌دقیقه‌ای پیش از تعهد و پنج قلم هزینه پنهان، در انتخاب ابزار هوش مصنوعی؛ چارچوب تصمیم آمده است. آن مقاله عمداً نام ابزار ندارد تا کهنه نشود؛ این صفحه نام‌ها را دارد و فصلی به‌روز می‌شود.

چهار اشتباه رایج

  • انتخاب مدل بر اساس رتبه‌بندی‌های عمومی به‌جای ورودی و خروجی موردنیاز خودت
  • قضاوت درباره کیفیت فارسی بر اساس نمونه‌های انگلیسی
  • استفاده از گران‌ترین مدل برای محتوای پرتعداد و کوتاه
  • نادیده گرفتن ابزارهای اصلاحی، که معمولاً بیشتر از مدل‌های تولیدی وقت صرفه‌جویی می‌کنند

برای مبانی کار با این ابزارها، تولید محتوا با هوش مصنوعی چیست؟ راهنمای عملی برای برندها و برای نوشتن ورودی درست، پرامپت‌نویسی برای تولید محتوای حرفه‌ای نقطه شروع‌اند.

برای آموزش عملی کار با این ابزارها، آموزش هوش مصنوعی و تولید محتوا و برای برون‌سپاری تولید، خدمات تولید ویدیو موج پرو در دسترس‌اند.

پرسش‌های متداول

کدام مدل بهترین است؟

این سؤال جواب واحدی ندارد و هر جوابی که بگیری چند ماه بعد غلط است. سؤال درست این است: چه ورودی‌ای داری و خروجی کجا منتشر می‌شود. دو مدل که هر دو در رتبه‌بندی‌ها بالا هستند، ممکن است برای کار مشخص تو کاملاً متفاوت عمل کنند.

برای فارسی کدام‌ها بهترند؟

برای تصویر و ویدیو، زبان اهمیت چندانی ندارد مگر اینکه متن داخل تصویر باشد — آنجا مدل‌هایی که رندر متن قوی دارند تفاوت می‌سازند. برای گفتار، فارسی هنوز محدودیت جدی دارد و بهترین مسیر فعلی، کلون صدا با فایل مرجع است.

آیا لازم است در همه این ابزارها اشتراک بگیریم؟

نه. برای بیشتر تیم‌ها یک پلتفرم که چند مدل را یکجا ارائه می‌دهد، از چند اشتراک جداگانه عملی‌تر است. اضافه‌کردن ابزار جدید باید دلیل عددی داشته باشد: کاری که تکرار بالایی دارد و وقت مشخصی می‌گیرد.

خروجی این مدل‌ها را می‌شود تجاری استفاده کرد؟

به شرایط استفاده هر سرویس بستگی دارد و یکسان نیست؛ در نسخه‌های رایگان معمولاً محدودتر است. پیش از استفاده در پروژه مشتری، شرایط را بخوان و یک نسخه از آن را کنار فایل پروژه نگه دار.

این فهرست چند وقت یک بار به‌روز می‌شود؟

فصلی. تاریخ آخرین به‌روزرسانی در بالای همین صفحه دیده می‌شود. اگر مدلی را می‌بینی که اینجا نیست، احتمالاً بعد از آخرین بازبینی منتشر شده.

از کجا شروع کنیم؟

با یک کار مشخص و تکرارشونده، نه با امتحان کردن همه. یک کاری که این هفته انجام دادی انتخاب کن، با دو مدل تکرارش کن، و زمان کل — شامل اصلاح خروجی — را با روش فعلی مقایسه کن.