بازگشت به ابزارهای هوش مصنوعی

نوشتن متن فارسی روی عکس با هوش مصنوعی

برای نوشتن متن فارسی روی عکس با هوش مصنوعی باید دو مسئله را جدا کنید: آیا مدل منظورِ پرامپت فارسی را فهمیده، و آیا توانسته خودِ حروف را درست روی تصویر بنویسد؟ ممکن است تصویر دقیقاً همان پوستر کافه‌ای باشد

·۱۳ دقیقه مطالعه
بررسی اتصال حروف و جهت راست‌به‌چپ در متن فارسی روی تصویر هوش مصنوعی

برای نوشتن متن فارسی روی عکس با هوش مصنوعی باید دو مسئله را جدا کنید: آیا مدل منظورِ پرامپت فارسی را فهمیده، و آیا توانسته خودِ حروف را درست روی تصویر بنویسد؟ ممکن است تصویر دقیقاً همان پوستر کافه‌ای باشد که خواسته‌اید، اما «قهوهٔ تازه» را با حروف جدا، ترتیب وارونه یا یک نقطهٔ اضافه تحویل بدهد. این شکستِ تایپوگرافی است، نه شکستِ فهم زبان.

پاسخ عملی هم روشن است: عبارت کوتاه را داخل گیومه بدهید، خروجی را با معیار ثابت بررسی کنید و فقط یک خطا را در هر نوبت اصلاح کنید. اگر متن باید بی‌نقص، قابل ویرایش یا حقوقی باشد، از همان ابتدا تصویر را بدون نوشته بسازید و تایپوگرافی را در ابزار طراحی اضافه کنید. اصرار بر بازتولید بی‌پایان، معمولاً طراحی نیست؛ قرعه‌کشی با اعتبار حساب است.

نکات کلیدی:

  • فهم پرامپت فارسی و رندر درست الفبای فارسی دو قابلیت مستقل‌اند؛ هر دو را جداگانه امتیاز بدهید.
  • آزمون منصفانه یعنی عبارت، نسبت تصویر، تعداد خروجی و تنظیمات برای همهٔ مدل‌ها یکسان باشد.
  • خوانایی ظاهری کافی نیست؛ اتصال حروف، ترتیب راست‌به‌چپ، نقطه‌ها، فاصله و وفاداری حرف‌به‌حرف را کنترل کنید.
  • برای لوگو، قیمت، نشانی، فراخوان اقدام و متن مشتری، مسیر امن «تصویر بدون متن + تایپوگرافی دستی» است.

در این مقاله

اول بفهمیم چه چیزی خراب شده است

فرض کنید نوشته‌اید: «یک پوستر مینیمال برای فروشگاه چای ایرانی، با فنجان روی میز چوبی و عبارت “یک فنجان آرامش”». خروجی فنجان، نور و حال‌وهوای ایرانی را درست دارد، ولی نوشته شبیه «یک فنجان ا رامش» است. مدل صحنه را فهمیده؛ موتور تصویر در شکل‌دادن واژه شکست خورده است.

برعکس، اگر متن «یک فنجان آرامش» سالم باشد اما تصویر به‌جای چای، لیوان نوشابه نشان دهد، رندر متن موفق و پیروی معنایی ناموفق بوده است. نتیجه را با این ماتریس تشخیص دهید:

فهم صحنهرندر متنتشخیصاقدام بعدی
درستدرستخروجی قابل استفادهکنترل نهایی در اندازهٔ انتشار
درستغلطخطای تایپوگرافیمتن را کوتاه و ناحیهٔ نوشته را ویرایش کنید
غلطدرستخطای فهم یا پیروی از دستورتوصیف صحنه را شفاف‌تر کنید
غلطغلطشکست ترکیبیتصویر و متن را در دو مرحله بسازید

این تفکیک جلوی یک اشتباه رایج را می‌گیرد: ترجمهٔ پرامپت به انگلیسی شاید فهم صحنه را بهتر کند، اما تضمین نمی‌کند حروف فارسی ناگهان درست متصل شوند. همچنین عبارت «فونت فارسی زیبا» نوع قلم، وزن یا میزان خوانایی را دقیق مشخص نمی‌کند.

بر اساس مستندات رسمی، قابلیت‌های متنی ابزارها یکسان نیست. گوگل برای مدل‌های تصویری جدید Gemini از رندر پیشرفتهٔ متن سخن می‌گوید، اما در راهنمای Imagen هم توصیه می‌کند متن کوتاه باشد و احتمال نیاز به چند بار تولید را می‌پذیرد. ادوبی نیز «متن مخدوش در تصاویر تولیدشده» را در فهرست محدودیت‌های شناخته‌شدهٔ Firefly آورده است. هیچ‌کدام از این گزاره‌ها به‌تنهایی اثبات نمی‌کند فارسی در همهٔ واژه‌ها درست رندر می‌شود؛ این همان چیزی است که باید خودتان بسنجید. منابع: راهنمای تولید تصویر Gemini، راهنمای متن در Imagen و محدودیت‌های شناخته‌شدهٔ Firefly. آخرین بررسی: ۲۱ ژوئیهٔ ۲۰۲۶.

اگر هنوز ابزار را انتخاب نکرده‌اید، مقایسهٔ گسترده‌تر را در راهنمای هوش مصنوعی‌های ساخت تصویر برای فارسی ببینید. صفحهٔ حاضر عمداً برنده اعلام نمی‌کند: خروجی خامِ چندمدلی و ثبت‌شده‌ای در مخزن کلادی نداریم و ادعای نرخ موفقیت بدون آن، عددسازی شیک‌پوش است.

پروتکل آزمون بازتولیدپذیر

برای مقایسه، «به‌نظرم این یکی بهتر بود» کافی نیست. یک پوشه برای هر ابزار بسازید و نام مدل، رابط استفاده‌شده و تاریخ را ثبت کنید؛ سرویس‌ها ممکن است مدل پشت رابط را عوض کنند.

گام ۱: شرایط را قفل کنید

برای همهٔ ابزارها این موارد را یکسان نگه دارید:

  1. همان متن پرامپت، بدون بازنویسی پنهانی؛
  2. نسبت تصویر ۴:۵ و نزدیک‌ترین وضوح موجود؛
  3. سبک «پوستر مینیمال» و یک عبارت دقیق داخل گیومه؛
  4. چهار خروجی مستقل برای هر عبارت، نه انتخاب بهترین نمونه از ده‌ها تلاش؛
  5. تنظیمات پیش‌فرض، مگر اینکه تنظیم متفاوت را صریح ثبت کنید؛
  6. ذخیرهٔ فایل خام همراه با پرامپت و شمارهٔ تلاش.

چهار خروجی حکم جادویی یا نمونهٔ آماری جامع نیست؛ فقط یک قرارداد عملی برای دیدن ناپایداری است. اگر ابزار در هر بار فقط یک تصویر می‌دهد، چهار بار با همان دستور اجرا کنید. اگر seed در دسترس است، آن را ثبت کنید؛ اگر نیست، بنویسید «seed در رابط قابل تنظیم نبود».

گام ۲: پرامپت پایه را بدون دست‌کاری اجرا کنید

پرامپت، هم فهم فارسی را می‌سنجد و هم رندر را. بعد از تولید، اول بدون زوم خروجی را در اندازهٔ واقعی مصرف—مثلاً عرض یک پست موبایل—ببینید؛ سپس برای بررسی نقطه‌ها بزرگ‌نمایی کنید.

گام ۳: داوری را کورتر و قابل پیگیری کنید

نام ابزار را از فایل داوری حذف و تصاویر را با کدهایی مثل A1 تا D4 مشخص کنید. متن مرجع را کنار تصویر بگذارید و دو نفر مستقل امتیاز بدهند. اگر تنها هستید، دست‌کم ارزیابی را یک روز بعد انجام دهید تا شیفتگیِ «همین الان ساختمش» کمتر شود.

نتیجهٔ هر ابزار باید شامل هر چهار خروجی باشد، نه فقط نمونهٔ قهرمان. در مقالهٔ روش بنچمارک هوش مصنوعی فارسی دربارهٔ اهمیت معیار ثابت و محدودیت آزمون بیشتر توضیح داده‌ایم؛ همان منطق اینجا هم کاربرد دارد.

عبارت‌های تست فارسی

یک عبارت آسان نمی‌تواند ضعف‌های خط فارسی را آشکار کند. بستهٔ زیر از کوتاه به سخت می‌رود و هر سطر هدف مشخصی دارد:

سطحعبارت دقیقچه چیزی را می‌سنجد؟
۱«سلام»واژهٔ کوتاه و شکل پایهٔ حروف
۲«خانهٔ آبی»فاصله، هکسره و جای همزه
۳«یک فنجان آرامش»اتصال چند واژه و نقطه‌ها
۴«پژوهش و فناوری»حروف پ، ژ، گ و توالی واژگان
۵«از ایده تا تصویر»ترتیب راست‌به‌چپ در یک عبارت طبیعی
۶«تخفیف ۲۵٪ تا ۳۱ تیر»ترکیب عدد، درصد و متن فارسی
۷«claudy.irکلادی»
۸«می‌روم؛ برمی‌گردم»نیم‌فاصله و نشانه‌گذاری

برای دور اول، هر عبارت را روی یک خط بخواهید. شکستن خط، مسئله‌ای تازه دربارهٔ چینش و ترتیب واژه‌ها وارد آزمون می‌کند. بعداً می‌توانید یک تست دوخطی جدا بسازید، اما نتایجش را با تک‌خطی قاطی نکنید.

عبارت‌ها را پیش از آزمون در یک فایل متنی UTF-8 نگه دارید و همیشه کپی کنید. تایپ دوباره ممکن است «ی» فارسی را با ي عربی یا «ک» را با ك عوض کند. این تفاوت‌ها همیشه روی ظاهر نهایی آشکار نیستند، اما ورودی دیگر یکسان نخواهد بود.

اگر هدف شما یادگیری ساخت خودِ صحنه و سبک است، کتابخانهٔ پرامپت تصویر فارسی مکمل مناسب‌تری است. اینجا متن داخل قاب موضوع اصلی است، نه کیفیت سینمایی نور روی کوزه.

جدول امتیازدهی متن فارسی

هر خروجی را در شش معیار از صفر تا دو نمره بدهید. مجموع از ۱۲ است، اما عدد کل را بدون جزئیات منتشر نکنید؛ دو تصویر با امتیاز ۸ ممکن است شکست‌های کاملاً متفاوتی داشته باشند.

معیار۰۱۲
وفاداری حرف‌به‌حرفواژه عوض یا حروف حذف شدهیک خطای جزئیکاملاً مطابق مرجع
اتصال حروفبیشتر اتصالات غلطیک یا دو شکستاتصالات طبیعی
راست‌به‌چپترتیب وارونه یا آشفتهبخشی مشکوکترتیب کاملاً درست
نقطه و نشانهخطا معنای واژه را عوض می‌کندنقص کوچکهمه درست
فاصله و نیم‌فاصلهواژه‌ها چسبیده/گسستهقابل فهم ولی نادرستمطابق مرجع
خوانایی در اندازهٔ مصرفناخوانابا مکث خوانده می‌شوددر نگاه اول خواناست

دو قانون داوری که نباید دور زده شوند

اول، «می‌شود حدس زد چه نوشته» نمرهٔ خوانایی کامل نمی‌گیرد. مخاطب نباید جدول رمزگشایی جلوی دستش داشته باشد. دوم، زیبایی را از صحت جدا نگه دارید. یک نوشته ممکن است بسیار خوش‌فرم و از نظر املایی غلط باشد؛ همان‌طور که یک فونت ساده می‌تواند دقیق و کاملاً قابل استفاده باشد.

برای کاربرد واقعی یک ستون «رد/قبول» نیز اضافه کنید. پیشنهاد عملی ما این است که هر خطای حرف‌به‌حرف، RTL یا عدد در اطلاعات حساس باعث رد شود؛ حتی اگر مجموع امتیاز بالا باشد. در قیمت «۲۵۰» و «۲۵» میانگین‌گیری معنایی ندارد.

پرامپت‌های رفع خطا

پرامپت را مرحله‌ای اصلاح کنید. اگر هم‌زمان سبک، رنگ، ترکیب‌بندی و متن را عوض کنید، نمی‌فهمید کدام تغییر اثر داشته است.

اصلاح ۱: متن را ایزوله کنید

وقتی مدل نوشتهٔ اضافی می‌سازد:

اصلاح ۲: اتصال و جهت را صریح کنید

وقتی حروف جدا یا ترتیب کلمات غلط است:

اصلاح ۳: فقط ناحیهٔ متن را ویرایش کنید

اگر ابزار ویرایش موضعی دارد، کل تصویر خوب را دوباره تولید نکنید. ناحیهٔ نوشته را ماسک و این دستور را اجرا کنید:

مستندات رسمی OpenAI ابزار تولید و ویرایش تصویر را در یک گردش چندمرحله‌ای توضیح می‌دهد و Adobe نیز ویرایش ناحیهٔ انتخاب‌شده با Generative Fill را مستند کرده است؛ وجود قابلیت ویرایش، با تضمین صحت فارسی یکی نیست. منابع: راهنمای تولید تصویر OpenAI و راهنمای Generative Fill ادوبی. آخرین بررسی: ۲۱ ژوئیهٔ ۲۰۲۶.

اصلاح ۴: پیچیدگی را کم کنید

عبارت هشت‌کلمه‌ای را به سه یا چهار واژه کاهش دهید، متن را روی یک خط نگه دارید و از چند فونت یا چند محل نوشته صرف‌نظر کنید. توصیهٔ رسمی Imagen نیز کوتاه نگه‌داشتن متن و محدود کردن تعداد عبارت‌هاست. این کار احتمال موفقیت را بالا می‌برد، اما نتیجهٔ فارسی را تضمین نمی‌کند.

اگر نسخهٔ رایگان ابزار را امتحان می‌کنید، تعداد تکرارها و محدودیت خروجی مهم می‌شود؛ راهنمای تصویرسازهای رایگان فارسی را برای همین زاویه ببینید.

گردش‌کار مطمئن برای خروجی نهایی

این موضع شاید محافظه‌کارانه به نظر برسد، ولی برای کار سفارشی درست است: تصویرساز را طراح پس‌زمینه بدانید، نه حروف‌چین نهایی. هرجا غلط املایی هزینه دارد، نوشته را دستی اضافه کنید.

۱. تصویر را بدون هیچ نوشته‌ای بسازید

در پرامپت بگویید «هیچ متن، حرف، لوگو، واترمارک یا شبه‌نوشته‌ای در تصویر نباشد» و محل تیتر را خالی بگذارید. اگر تصویرساز باز هم نشانه‌های جعلی ساخت، آن بخش را حذف یا دوباره ویرایش کنید.

۲. حاشیهٔ امن تعریف کنید

پیش از تولید بدانید متن کجا می‌نشیند. برای استوری، تیتر را به لبه‌ها نچسبانید؛ برای کاور وب، محل برش نسخهٔ موبایل را در نظر بگیرید. پس‌زمینهٔ شلوغ پشت نوشته، حتی با تایپ صحیح هم خوانایی را خراب می‌کند.

۳. متن را در ابزار طراحی اضافه کنید

در Figma، Photoshop، Illustrator، Canva یا هر ویرایشگر دارای پشتیبانی درست از RTL، یک کادر متن واقعی بسازید. زبان و جهت پاراگراف را فارسی/راست‌به‌چپ بگذارید، سپس فونتِ دارای مجوز مناسب را انتخاب کنید. متن واقعی قابل جست‌وجو و ویرایش، از پیکسل‌هایی که فقط شبیه حروف‌اند قابل اعتمادتر است.

اگر خروجی فقط تصویر تخت است، نسخهٔ لایه‌باز را هم نگه دارید. فردا ممکن است قیمت، تاریخ یا نام سخنران عوض شود؛ تولید دوبارهٔ کل تصویر برای یک عدد، هزینهٔ بی‌دلیل است.

۴. کنترل چهارچشمی انجام دهید

متن را از سند مرجع کپی و با نسخهٔ روی تصویر حرف‌به‌حرف مقایسه کنید. عدد، تاریخ، نشانی وب و نام برند را جداگانه بخوانید. سپس خروجی را در اندازهٔ واقعی موبایل بررسی کنید، نه فقط روی مانیتور با زوم ۲۰۰ درصد.

نوع خروجیمتن مولد داخل تصویرتایپوگرافی دستی
اتود شخصی و موقتقابل امتحاناختیاری
پست برند با تیتر کوتاهفقط پس از کنترل دقیقتوصیه‌شده
قیمت، تاریخ و اطلاعات تماسپرریسکلازم
لوگو و نام تجارینامناسب برای نسخهٔ نهاییلازم
پوستر چاپی یا قرارداد مشترینامناسب برای تحویل مستقیملازم و همراه فایل لایه‌باز

برگهٔ ثبت نتیجه

برای اینکه آزمون بعداً قابل تکرار باشد، این قالب را برای هر تلاش پر کنید:

نام مدل را از صفحه یا پاسخ API ثبت کنید، نه از حافظه. همچنین مشخص کنید نتیجه «قابلیت مستندشده»، «مشاهدهٔ همین آزمون» یا «برداشت داور» است. این سه سطح شواهد نباید در یک جمله مخلوط شوند.

پرسش‌های متداول

آیا هوش مصنوعی می‌تواند متن فارسی را درست روی عکس بنویسد؟

گاهی بله، به‌ویژه برای عبارت کوتاه؛ اما نتیجه به مدل، نسخه، رابط و خود واژه بستگی دارد. قابلیت عمومی رندر متن، تضمین پشتیبانی بی‌خطای فارسی نیست، پس خروجی باید حرف‌به‌حرف بررسی شود.

چرا حروف فارسی در تصویر جدا می‌شوند؟

مدل تصویر لزوماً مانند موتور حروف‌چینی، متن را با قواعد قطعی Unicode و شکل‌دهی خط فارسی نمی‌چیند؛ ممکن است الگوی بصری حروف را بسازد. نتیجه می‌تواند ظاهری شبیه فارسی داشته باشد، اما اتصال درست نداشته باشد.

آیا نوشتن پرامپت به انگلیسی مشکل فارسی را حل می‌کند؟

نه لزوماً. انگلیسی ممکن است توصیف صحنه را برای بعضی ابزارها روشن‌تر کند، ولی رندر عبارت فارسی مسئله‌ای جداست. متن نهایی را همچنان فارسی، داخل گیومه و بدون ترجمه مشخص کنید.

بهترین عبارت برای شروع آزمون چیست؟

از «سلام» شروع کنید، سپس به «خانهٔ آبی»، «از ایده تا تصویر» و نمونه‌های عدددار برسید. یک واژهٔ آسان برای تصمیم حرفه‌ای کافی نیست؛ بستهٔ تست باید اتصال، نقطه، RTL و متن دوجهته را پوشش دهد.

چند بار باید یک پرامپت را اجرا کنم؟

برای یک بررسی عملی، چهار خروجی با شرایط ثابت تصویر بهتری از ناپایداری می‌دهد، اما برآورد آماری جامع نیست. تعداد تلاش‌ها را از قبل تعیین کنید و همهٔ خروجی‌ها، نه فقط بهترین مورد، در گزارش بمانند.

برای اصلاح متن، کل تصویر را دوباره بسازم؟

اگر ابزار ماسک یا ویرایش موضعی دارد، فقط ناحیهٔ متن را انتخاب کنید تا ترکیب‌بندی سالم کمتر تغییر کند. اگر پس از چند تلاش هنوز خطا باقی است، تصویر بدون متن را نگه دارید و تایپوگرافی دستی انجام دهید.

نیم‌فاصله و ترکیب عدد با فارسی را چگونه تست کنم؟

عبارت‌هایی مثل «می‌روم؛ برمی‌گردم» و «تخفیف ۲۵٪ تا ۳۱ تیر» را در آزمون جدا بیاورید. ترتیب عدد و نشانهٔ درصد را هم بصری و هم حرف‌به‌حرف کنترل کنید.

چه زمانی تایپوگرافی دستی اجباری است؟

برای لوگو، قیمت، تاریخ، اطلاعات تماس، نام اشخاص، متن حقوقی و هر خروجی مشتری‌محور. در این موارد حتی یک نقطهٔ اشتباه می‌تواند پیام یا اعتبار برند را خراب کند.

حرف آخر: یک بار بسنجید، بعد مسیر را انتخاب کنید

نوشتن متن فارسی روی عکس با هوش مصنوعی با یک پرامپت «جادویی» حل نمی‌شود. ابتدا فهم صحنه را از رندر حروف جدا کنید، بعد با عبارت ثابت و rubric مشخص خروجی‌ها را بسنجید. اگر یک مدل در آزمون شما موفق شد، همان نتیجه را با نام نسخه و تاریخ ثبت کنید—نه اینکه آن را به همهٔ فارسی و همهٔ زمان‌ها تعمیم دهید.

برای اتود و تیتر کوتاه، اصلاح مرحله‌ای ارزش امتحان دارد. برای خروجی‌ای که باید فردا هم دقیق، قابل ویرایش و قابل دفاع باشد، تصویر بدون متن بسازید و حروف‌چینی را دستی انجام دهید. راه کم‌هیجان‌تری است؛ و دقیقاً به همین دلیل، راه حرفه‌ای‌تری است.


کلادی یک مجلهٔ مستقل فناوری و هوش مصنوعی است. این راهنما بر پایهٔ مستندات اولیه و روش آزمون قابل بازتولید تهیه شده و نتیجهٔ مقایسهٔ انجام‌نشده را جایگزین شواهد نمی‌کند.

#ساخت تصویر با هوش مصنوعی#متن فارسی#تایپوگرافی فارسی#پرامپت تصویر
Share this article