نوشتن متن فارسی روی عکس با هوش مصنوعی
برای نوشتن متن فارسی روی عکس با هوش مصنوعی باید دو مسئله را جدا کنید: آیا مدل منظورِ پرامپت فارسی را فهمیده، و آیا توانسته خودِ حروف را درست روی تصویر بنویسد؟ ممکن است تصویر دقیقاً همان پوستر کافهای باشد

برای نوشتن متن فارسی روی عکس با هوش مصنوعی باید دو مسئله را جدا کنید: آیا مدل منظورِ پرامپت فارسی را فهمیده، و آیا توانسته خودِ حروف را درست روی تصویر بنویسد؟ ممکن است تصویر دقیقاً همان پوستر کافهای باشد که خواستهاید، اما «قهوهٔ تازه» را با حروف جدا، ترتیب وارونه یا یک نقطهٔ اضافه تحویل بدهد. این شکستِ تایپوگرافی است، نه شکستِ فهم زبان.
پاسخ عملی هم روشن است: عبارت کوتاه را داخل گیومه بدهید، خروجی را با معیار ثابت بررسی کنید و فقط یک خطا را در هر نوبت اصلاح کنید. اگر متن باید بینقص، قابل ویرایش یا حقوقی باشد، از همان ابتدا تصویر را بدون نوشته بسازید و تایپوگرافی را در ابزار طراحی اضافه کنید. اصرار بر بازتولید بیپایان، معمولاً طراحی نیست؛ قرعهکشی با اعتبار حساب است.
نکات کلیدی:
- فهم پرامپت فارسی و رندر درست الفبای فارسی دو قابلیت مستقلاند؛ هر دو را جداگانه امتیاز بدهید.
- آزمون منصفانه یعنی عبارت، نسبت تصویر، تعداد خروجی و تنظیمات برای همهٔ مدلها یکسان باشد.
- خوانایی ظاهری کافی نیست؛ اتصال حروف، ترتیب راستبهچپ، نقطهها، فاصله و وفاداری حرفبهحرف را کنترل کنید.
- برای لوگو، قیمت، نشانی، فراخوان اقدام و متن مشتری، مسیر امن «تصویر بدون متن + تایپوگرافی دستی» است.
در این مقاله
- اول بفهمیم چه چیزی خراب شده است
- پروتکل آزمون بازتولیدپذیر
- عبارتهای تست فارسی
- جدول امتیازدهی متن فارسی
- پرامپتهای رفع خطا
- گردشکار مطمئن برای خروجی نهایی
- پرسشهای متداول
اول بفهمیم چه چیزی خراب شده است
فرض کنید نوشتهاید: «یک پوستر مینیمال برای فروشگاه چای ایرانی، با فنجان روی میز چوبی و عبارت “یک فنجان آرامش”». خروجی فنجان، نور و حالوهوای ایرانی را درست دارد، ولی نوشته شبیه «یک فنجان ا رامش» است. مدل صحنه را فهمیده؛ موتور تصویر در شکلدادن واژه شکست خورده است.
برعکس، اگر متن «یک فنجان آرامش» سالم باشد اما تصویر بهجای چای، لیوان نوشابه نشان دهد، رندر متن موفق و پیروی معنایی ناموفق بوده است. نتیجه را با این ماتریس تشخیص دهید:
| فهم صحنه | رندر متن | تشخیص | اقدام بعدی |
|---|---|---|---|
| درست | درست | خروجی قابل استفاده | کنترل نهایی در اندازهٔ انتشار |
| درست | غلط | خطای تایپوگرافی | متن را کوتاه و ناحیهٔ نوشته را ویرایش کنید |
| غلط | درست | خطای فهم یا پیروی از دستور | توصیف صحنه را شفافتر کنید |
| غلط | غلط | شکست ترکیبی | تصویر و متن را در دو مرحله بسازید |
این تفکیک جلوی یک اشتباه رایج را میگیرد: ترجمهٔ پرامپت به انگلیسی شاید فهم صحنه را بهتر کند، اما تضمین نمیکند حروف فارسی ناگهان درست متصل شوند. همچنین عبارت «فونت فارسی زیبا» نوع قلم، وزن یا میزان خوانایی را دقیق مشخص نمیکند.
بر اساس مستندات رسمی، قابلیتهای متنی ابزارها یکسان نیست. گوگل برای مدلهای تصویری جدید Gemini از رندر پیشرفتهٔ متن سخن میگوید، اما در راهنمای Imagen هم توصیه میکند متن کوتاه باشد و احتمال نیاز به چند بار تولید را میپذیرد. ادوبی نیز «متن مخدوش در تصاویر تولیدشده» را در فهرست محدودیتهای شناختهشدهٔ Firefly آورده است. هیچکدام از این گزارهها بهتنهایی اثبات نمیکند فارسی در همهٔ واژهها درست رندر میشود؛ این همان چیزی است که باید خودتان بسنجید. منابع: راهنمای تولید تصویر Gemini، راهنمای متن در Imagen و محدودیتهای شناختهشدهٔ Firefly. آخرین بررسی: ۲۱ ژوئیهٔ ۲۰۲۶.
اگر هنوز ابزار را انتخاب نکردهاید، مقایسهٔ گستردهتر را در راهنمای هوش مصنوعیهای ساخت تصویر برای فارسی ببینید. صفحهٔ حاضر عمداً برنده اعلام نمیکند: خروجی خامِ چندمدلی و ثبتشدهای در مخزن کلادی نداریم و ادعای نرخ موفقیت بدون آن، عددسازی شیکپوش است.
پروتکل آزمون بازتولیدپذیر
برای مقایسه، «بهنظرم این یکی بهتر بود» کافی نیست. یک پوشه برای هر ابزار بسازید و نام مدل، رابط استفادهشده و تاریخ را ثبت کنید؛ سرویسها ممکن است مدل پشت رابط را عوض کنند.
گام ۱: شرایط را قفل کنید
برای همهٔ ابزارها این موارد را یکسان نگه دارید:
- همان متن پرامپت، بدون بازنویسی پنهانی؛
- نسبت تصویر ۴:۵ و نزدیکترین وضوح موجود؛
- سبک «پوستر مینیمال» و یک عبارت دقیق داخل گیومه؛
- چهار خروجی مستقل برای هر عبارت، نه انتخاب بهترین نمونه از دهها تلاش؛
- تنظیمات پیشفرض، مگر اینکه تنظیم متفاوت را صریح ثبت کنید؛
- ذخیرهٔ فایل خام همراه با پرامپت و شمارهٔ تلاش.
چهار خروجی حکم جادویی یا نمونهٔ آماری جامع نیست؛ فقط یک قرارداد عملی برای دیدن ناپایداری است. اگر ابزار در هر بار فقط یک تصویر میدهد، چهار بار با همان دستور اجرا کنید. اگر seed در دسترس است، آن را ثبت کنید؛ اگر نیست، بنویسید «seed در رابط قابل تنظیم نبود».
گام ۲: پرامپت پایه را بدون دستکاری اجرا کنید
پرامپت، هم فهم فارسی را میسنجد و هم رندر را. بعد از تولید، اول بدون زوم خروجی را در اندازهٔ واقعی مصرف—مثلاً عرض یک پست موبایل—ببینید؛ سپس برای بررسی نقطهها بزرگنمایی کنید.
گام ۳: داوری را کورتر و قابل پیگیری کنید
نام ابزار را از فایل داوری حذف و تصاویر را با کدهایی مثل A1 تا D4 مشخص کنید. متن مرجع را کنار تصویر بگذارید و دو نفر مستقل امتیاز بدهند. اگر تنها هستید، دستکم ارزیابی را یک روز بعد انجام دهید تا شیفتگیِ «همین الان ساختمش» کمتر شود.
نتیجهٔ هر ابزار باید شامل هر چهار خروجی باشد، نه فقط نمونهٔ قهرمان. در مقالهٔ روش بنچمارک هوش مصنوعی فارسی دربارهٔ اهمیت معیار ثابت و محدودیت آزمون بیشتر توضیح دادهایم؛ همان منطق اینجا هم کاربرد دارد.
عبارتهای تست فارسی
یک عبارت آسان نمیتواند ضعفهای خط فارسی را آشکار کند. بستهٔ زیر از کوتاه به سخت میرود و هر سطر هدف مشخصی دارد:
| سطح | عبارت دقیق | چه چیزی را میسنجد؟ |
|---|---|---|
| ۱ | «سلام» | واژهٔ کوتاه و شکل پایهٔ حروف |
| ۲ | «خانهٔ آبی» | فاصله، هکسره و جای همزه |
| ۳ | «یک فنجان آرامش» | اتصال چند واژه و نقطهها |
| ۴ | «پژوهش و فناوری» | حروف پ، ژ، گ و توالی واژگان |
| ۵ | «از ایده تا تصویر» | ترتیب راستبهچپ در یک عبارت طبیعی |
| ۶ | «تخفیف ۲۵٪ تا ۳۱ تیر» | ترکیب عدد، درصد و متن فارسی |
| ۷ | «claudy.ir | کلادی» |
| ۸ | «میروم؛ برمیگردم» | نیمفاصله و نشانهگذاری |
برای دور اول، هر عبارت را روی یک خط بخواهید. شکستن خط، مسئلهای تازه دربارهٔ چینش و ترتیب واژهها وارد آزمون میکند. بعداً میتوانید یک تست دوخطی جدا بسازید، اما نتایجش را با تکخطی قاطی نکنید.
عبارتها را پیش از آزمون در یک فایل متنی UTF-8 نگه دارید و همیشه کپی کنید. تایپ دوباره ممکن است «ی» فارسی را با ي عربی یا «ک» را با ك عوض کند. این تفاوتها همیشه روی ظاهر نهایی آشکار نیستند، اما ورودی دیگر یکسان نخواهد بود.
اگر هدف شما یادگیری ساخت خودِ صحنه و سبک است، کتابخانهٔ پرامپت تصویر فارسی مکمل مناسبتری است. اینجا متن داخل قاب موضوع اصلی است، نه کیفیت سینمایی نور روی کوزه.
جدول امتیازدهی متن فارسی
هر خروجی را در شش معیار از صفر تا دو نمره بدهید. مجموع از ۱۲ است، اما عدد کل را بدون جزئیات منتشر نکنید؛ دو تصویر با امتیاز ۸ ممکن است شکستهای کاملاً متفاوتی داشته باشند.
| معیار | ۰ | ۱ | ۲ |
|---|---|---|---|
| وفاداری حرفبهحرف | واژه عوض یا حروف حذف شده | یک خطای جزئی | کاملاً مطابق مرجع |
| اتصال حروف | بیشتر اتصالات غلط | یک یا دو شکست | اتصالات طبیعی |
| راستبهچپ | ترتیب وارونه یا آشفته | بخشی مشکوک | ترتیب کاملاً درست |
| نقطه و نشانه | خطا معنای واژه را عوض میکند | نقص کوچک | همه درست |
| فاصله و نیمفاصله | واژهها چسبیده/گسسته | قابل فهم ولی نادرست | مطابق مرجع |
| خوانایی در اندازهٔ مصرف | ناخوانا | با مکث خوانده میشود | در نگاه اول خواناست |
دو قانون داوری که نباید دور زده شوند
اول، «میشود حدس زد چه نوشته» نمرهٔ خوانایی کامل نمیگیرد. مخاطب نباید جدول رمزگشایی جلوی دستش داشته باشد. دوم، زیبایی را از صحت جدا نگه دارید. یک نوشته ممکن است بسیار خوشفرم و از نظر املایی غلط باشد؛ همانطور که یک فونت ساده میتواند دقیق و کاملاً قابل استفاده باشد.
برای کاربرد واقعی یک ستون «رد/قبول» نیز اضافه کنید. پیشنهاد عملی ما این است که هر خطای حرفبهحرف، RTL یا عدد در اطلاعات حساس باعث رد شود؛ حتی اگر مجموع امتیاز بالا باشد. در قیمت «۲۵۰» و «۲۵» میانگینگیری معنایی ندارد.
پرامپتهای رفع خطا
پرامپت را مرحلهای اصلاح کنید. اگر همزمان سبک، رنگ، ترکیببندی و متن را عوض کنید، نمیفهمید کدام تغییر اثر داشته است.
اصلاح ۱: متن را ایزوله کنید
وقتی مدل نوشتهٔ اضافی میسازد:
اصلاح ۲: اتصال و جهت را صریح کنید
وقتی حروف جدا یا ترتیب کلمات غلط است:
اصلاح ۳: فقط ناحیهٔ متن را ویرایش کنید
اگر ابزار ویرایش موضعی دارد، کل تصویر خوب را دوباره تولید نکنید. ناحیهٔ نوشته را ماسک و این دستور را اجرا کنید:
مستندات رسمی OpenAI ابزار تولید و ویرایش تصویر را در یک گردش چندمرحلهای توضیح میدهد و Adobe نیز ویرایش ناحیهٔ انتخابشده با Generative Fill را مستند کرده است؛ وجود قابلیت ویرایش، با تضمین صحت فارسی یکی نیست. منابع: راهنمای تولید تصویر OpenAI و راهنمای Generative Fill ادوبی. آخرین بررسی: ۲۱ ژوئیهٔ ۲۰۲۶.
اصلاح ۴: پیچیدگی را کم کنید
عبارت هشتکلمهای را به سه یا چهار واژه کاهش دهید، متن را روی یک خط نگه دارید و از چند فونت یا چند محل نوشته صرفنظر کنید. توصیهٔ رسمی Imagen نیز کوتاه نگهداشتن متن و محدود کردن تعداد عبارتهاست. این کار احتمال موفقیت را بالا میبرد، اما نتیجهٔ فارسی را تضمین نمیکند.
اگر نسخهٔ رایگان ابزار را امتحان میکنید، تعداد تکرارها و محدودیت خروجی مهم میشود؛ راهنمای تصویرسازهای رایگان فارسی را برای همین زاویه ببینید.
گردشکار مطمئن برای خروجی نهایی
این موضع شاید محافظهکارانه به نظر برسد، ولی برای کار سفارشی درست است: تصویرساز را طراح پسزمینه بدانید، نه حروفچین نهایی. هرجا غلط املایی هزینه دارد، نوشته را دستی اضافه کنید.
۱. تصویر را بدون هیچ نوشتهای بسازید
در پرامپت بگویید «هیچ متن، حرف، لوگو، واترمارک یا شبهنوشتهای در تصویر نباشد» و محل تیتر را خالی بگذارید. اگر تصویرساز باز هم نشانههای جعلی ساخت، آن بخش را حذف یا دوباره ویرایش کنید.
۲. حاشیهٔ امن تعریف کنید
پیش از تولید بدانید متن کجا مینشیند. برای استوری، تیتر را به لبهها نچسبانید؛ برای کاور وب، محل برش نسخهٔ موبایل را در نظر بگیرید. پسزمینهٔ شلوغ پشت نوشته، حتی با تایپ صحیح هم خوانایی را خراب میکند.
۳. متن را در ابزار طراحی اضافه کنید
در Figma، Photoshop، Illustrator، Canva یا هر ویرایشگر دارای پشتیبانی درست از RTL، یک کادر متن واقعی بسازید. زبان و جهت پاراگراف را فارسی/راستبهچپ بگذارید، سپس فونتِ دارای مجوز مناسب را انتخاب کنید. متن واقعی قابل جستوجو و ویرایش، از پیکسلهایی که فقط شبیه حروفاند قابل اعتمادتر است.
اگر خروجی فقط تصویر تخت است، نسخهٔ لایهباز را هم نگه دارید. فردا ممکن است قیمت، تاریخ یا نام سخنران عوض شود؛ تولید دوبارهٔ کل تصویر برای یک عدد، هزینهٔ بیدلیل است.
۴. کنترل چهارچشمی انجام دهید
متن را از سند مرجع کپی و با نسخهٔ روی تصویر حرفبهحرف مقایسه کنید. عدد، تاریخ، نشانی وب و نام برند را جداگانه بخوانید. سپس خروجی را در اندازهٔ واقعی موبایل بررسی کنید، نه فقط روی مانیتور با زوم ۲۰۰ درصد.
| نوع خروجی | متن مولد داخل تصویر | تایپوگرافی دستی |
|---|---|---|
| اتود شخصی و موقت | قابل امتحان | اختیاری |
| پست برند با تیتر کوتاه | فقط پس از کنترل دقیق | توصیهشده |
| قیمت، تاریخ و اطلاعات تماس | پرریسک | لازم |
| لوگو و نام تجاری | نامناسب برای نسخهٔ نهایی | لازم |
| پوستر چاپی یا قرارداد مشتری | نامناسب برای تحویل مستقیم | لازم و همراه فایل لایهباز |
برگهٔ ثبت نتیجه
برای اینکه آزمون بعداً قابل تکرار باشد، این قالب را برای هر تلاش پر کنید:
نام مدل را از صفحه یا پاسخ API ثبت کنید، نه از حافظه. همچنین مشخص کنید نتیجه «قابلیت مستندشده»، «مشاهدهٔ همین آزمون» یا «برداشت داور» است. این سه سطح شواهد نباید در یک جمله مخلوط شوند.
پرسشهای متداول
آیا هوش مصنوعی میتواند متن فارسی را درست روی عکس بنویسد؟
گاهی بله، بهویژه برای عبارت کوتاه؛ اما نتیجه به مدل، نسخه، رابط و خود واژه بستگی دارد. قابلیت عمومی رندر متن، تضمین پشتیبانی بیخطای فارسی نیست، پس خروجی باید حرفبهحرف بررسی شود.
چرا حروف فارسی در تصویر جدا میشوند؟
مدل تصویر لزوماً مانند موتور حروفچینی، متن را با قواعد قطعی Unicode و شکلدهی خط فارسی نمیچیند؛ ممکن است الگوی بصری حروف را بسازد. نتیجه میتواند ظاهری شبیه فارسی داشته باشد، اما اتصال درست نداشته باشد.
آیا نوشتن پرامپت به انگلیسی مشکل فارسی را حل میکند؟
نه لزوماً. انگلیسی ممکن است توصیف صحنه را برای بعضی ابزارها روشنتر کند، ولی رندر عبارت فارسی مسئلهای جداست. متن نهایی را همچنان فارسی، داخل گیومه و بدون ترجمه مشخص کنید.
بهترین عبارت برای شروع آزمون چیست؟
از «سلام» شروع کنید، سپس به «خانهٔ آبی»، «از ایده تا تصویر» و نمونههای عدددار برسید. یک واژهٔ آسان برای تصمیم حرفهای کافی نیست؛ بستهٔ تست باید اتصال، نقطه، RTL و متن دوجهته را پوشش دهد.
چند بار باید یک پرامپت را اجرا کنم؟
برای یک بررسی عملی، چهار خروجی با شرایط ثابت تصویر بهتری از ناپایداری میدهد، اما برآورد آماری جامع نیست. تعداد تلاشها را از قبل تعیین کنید و همهٔ خروجیها، نه فقط بهترین مورد، در گزارش بمانند.
برای اصلاح متن، کل تصویر را دوباره بسازم؟
اگر ابزار ماسک یا ویرایش موضعی دارد، فقط ناحیهٔ متن را انتخاب کنید تا ترکیببندی سالم کمتر تغییر کند. اگر پس از چند تلاش هنوز خطا باقی است، تصویر بدون متن را نگه دارید و تایپوگرافی دستی انجام دهید.
نیمفاصله و ترکیب عدد با فارسی را چگونه تست کنم؟
عبارتهایی مثل «میروم؛ برمیگردم» و «تخفیف ۲۵٪ تا ۳۱ تیر» را در آزمون جدا بیاورید. ترتیب عدد و نشانهٔ درصد را هم بصری و هم حرفبهحرف کنترل کنید.
چه زمانی تایپوگرافی دستی اجباری است؟
برای لوگو، قیمت، تاریخ، اطلاعات تماس، نام اشخاص، متن حقوقی و هر خروجی مشتریمحور. در این موارد حتی یک نقطهٔ اشتباه میتواند پیام یا اعتبار برند را خراب کند.
حرف آخر: یک بار بسنجید، بعد مسیر را انتخاب کنید
نوشتن متن فارسی روی عکس با هوش مصنوعی با یک پرامپت «جادویی» حل نمیشود. ابتدا فهم صحنه را از رندر حروف جدا کنید، بعد با عبارت ثابت و rubric مشخص خروجیها را بسنجید. اگر یک مدل در آزمون شما موفق شد، همان نتیجه را با نام نسخه و تاریخ ثبت کنید—نه اینکه آن را به همهٔ فارسی و همهٔ زمانها تعمیم دهید.
برای اتود و تیتر کوتاه، اصلاح مرحلهای ارزش امتحان دارد. برای خروجیای که باید فردا هم دقیق، قابل ویرایش و قابل دفاع باشد، تصویر بدون متن بسازید و حروفچینی را دستی انجام دهید. راه کمهیجانتری است؛ و دقیقاً به همین دلیل، راه حرفهایتری است.
کلادی یک مجلهٔ مستقل فناوری و هوش مصنوعی است. این راهنما بر پایهٔ مستندات اولیه و روش آزمون قابل بازتولید تهیه شده و نتیجهٔ مقایسهٔ انجامنشده را جایگزین شواهد نمیکند.




