بهترین هوش مصنوعی فارسی؛ بنچمارک علمی و راهنمای دسترسی از ایران
اگر عبارت «بهترین هوش مصنوعی فارسی» را در گوگل جستوجو کنید، دهها مقاله پیدا میشود. اما اگر از هر کدام بپرسید «این پرامپت مشخص را دادید و چه جوابی گرفتید؟» — جوابی نمیآید. فهرست مینویسند، توصیف میکنند، رتبهبندی میکنند؛ بدون

اگر عبارت «بهترین هوش مصنوعی فارسی» را در گوگل جستوجو کنید، دهها مقاله پیدا میشود. اما اگر از هر کدام بپرسید «این پرامپت مشخص را دادید و چه جوابی گرفتید؟» — جوابی نمیآید. فهرست مینویسند، توصیف میکنند، رتبهبندی میکنند؛ بدون یک بنچمارک قابل بازتولید.
این مقاله متفاوت عمل میکند. بنچمارکهای علمی منتشرشده که فارسی را در مدلهای مختلف سنجیدهاند مرور میکنیم، چارچوب آزمون قابل بازتولید را توضیح میدهیم و یک تمایز اساسی را روشن میکنیم که اکثر مقالات فارسی نادیده میگیرند.
یک نکته مهم از همین اول: هیچ مدل واحدی برای همه کاربردها «بهترین» نیست. جدول مقایسه این مقاله بر اساس نیاز شما طراحی شده، نه یک برنده مطلق.
یک کار واقعی را در نقطه امتحان کنید
آخرین بررسی: ۲۹ تیر ۱۴۰۵
نکات کلیدی:
- «مدل» (مثل GPT-4o) با «پلتفرم» (مثل نقطه) یکی نیست؛ این تمایز برای انتخاب درست و اطلاع از حریم خصوصی حیاتی است
- مدلهای frontier کیفیت فارسی بهتری دارند اما دسترسی مستقیم از ایران به اکثر آنها محدود یا مسدود است
- در میان مدلهای متنباز، Gemma2 در یک بنچمارک ۲۰۲۵ بالاترین امتیاز فارسی را در میان مدلهای آزمونشده کسب کرد
- هر پلتفرمی را پیش از ورود اطلاعات حساس، از نظر سیاست حریم خصوصی بررسی کنید
برای آشنایی با خود محصول، خانواده مدلها و قابلیتهایش، راهنمای هوش مصنوعی Claude چیست؟ را بخوانید.
در این مقاله
- اول مدل را از پلتفرم جدا کنید
- چارچوب آزمون: چطور مقایسه کردیم
- مدلهای بینالمللی frontier
- نقطه برای کاربر فارسیزبان
- مدلهای متنباز با پشتیبانی فارسی
- مدلهای بومی فارسی
- جدول مقایسه نهایی
- حریم خصوصی و داده شما
- محدودیتهای این آزمون
- سؤالات متداول
اول مدل را از پلتفرم جدا کنید
این تمایز را اکثر مقالات فارسی نادیده میگیرند، اما برای انتخاب درست ضروری است. وقتی از «هوش مصنوعی فارسی» حرف میزنیم، در واقع سه لایه جداگانه وجود دارد:
لایه اول — مدلهای frontier بینالمللی: مثل GPT-4o (OpenAI)، Claude Sonnet (Anthropic)، Gemini 2.5 (Google) و DeepSeek V3. اینها مدلهای پایهای هستند که کیفیت واقعی زبان فارسی را تعیین میکنند. دسترسی مستقیم از ایران برای بیشتر آنها محدود یا مسدود است.
لایه سوم — مدلهای متنباز و محلی: مثل Gemma2، Qwen2.5، LLaMA 3.3، یا مدلهای بومی فارسی مثل PersianLLaMA و Maral. اینها را میتوانید با Ollama روی کامپیوتر خودتان اجرا کنید. کیفیت پایینتر از frontier models است، اما حریم خصوصی کامل دارید.
چرا این تمایز مهم است؟ چون اگر میخواهید بهترین کیفیت فارسی را داشته باشید، باید خروجی واقعی محصول و مدل فعال را بسنجید، نه فقط نام روی صفحه را. اگر نگران حریم خصوصی هستید نیز سیاست دادهٔ خود محصول و ارائهدهندهٔ مدل هر دو اهمیت دارند.
چارچوب آزمون: چطور مقایسه کردیم
برای مقایسه منصفانه، یک چارچوب آزمون ثابت نیاز است. چارچوب پیشنهادی زیر از چهار دسته پرامپت تشکیل شده که هر کدام جنبه متفاوتی از توانایی فارسی مدل را میسنجد:
| دسته | پرامپت آزمون | معیارهای ارزیابی |
|---|---|---|
| تولید محتوای فارسی | یک پاراگراف ۱۵۰ کلمهای درباره مزایا و معایب هوش مصنوعی برای مشاغل کوچک ایرانی بنویس. | روانی نثر، دقت نیمفاصله، انسجام معنایی |
| درک و خلاصهسازی | این متن را خلاصه کن و سه نکته اصلی را استخراج کن. [متن پیچیده فارسی] | دقت خلاصه، حفظ اطلاعات کلیدی، کیفیت فارسی |
| استدلال و تحلیل | مزایا و معایب هوش مصنوعی در آموزش را با استدلال منطقی به فارسی بنویس. | کیفیت استدلال، ساختار پاسخ، دقت ادعاها |
| کد + توضیح فارسی | یک تابع پایتون برای شمارش کلمات فارسی بنویس و آن را به فارسی توضیح بده. | صحت کد، کیفیت توضیح، درک زبان فارسی |
روش امتیازدهی: هر پاسخ در سه بُعد امتیاز میگیرد (هر کدام ۰ تا ۵): کیفیت فارسی (نثر، نیمفاصله، ویرگولگذاری)، دقت محتوایی، انسجام و ساختار. امتیاز نهایی از ۱۵ است.
این پرامپتها قابل بازتولید هستند. میتوانید همین پرامپتهای جدول را در هر ابزاری امتحان کنید و خودتان مقایسه کنید. نکته مهم: ورژن دقیق مدل را یادداشت کنید (مثلاً GPT-4o-2024-11 یا claude-sonnet-4-6). مدلها بهسرعت آپدیت میشوند و نتایج ممکن است با ورژنهای جدیدتر تفاوت داشته باشد.
بنچمارکهای علمی که استفاده کردیم:
در کنار چارچوب بالا، سه مطالعه علمی منتشرشده را بهعنوان داده مرجع در نظر گرفتیم:
- TARAZ: بنچمارک ایرانی که فهم فرهنگی و زبانی فارسی را میسنجد — از جمله ضربالمثل، اصطلاحات روزمره و بافت اجتماعی ایران. این پژوهش ۱۵ مدل متنباز و تجاری را ارزیابی کرده است.
- MasalBench: تمرکز اختصاصی روی درک ضربالمثلهای فارسی و متن پیچیده فرهنگی — چیزی که اکثر بنچمارکهای عمومی نمیسنجند. پژوهش هشت مدل را ارزیابی کرده است.
- بنچمارک مقایسهای مدلهای متنباز: مطالعهای که در ۲۰۲۵ منتشر شد و یازده مدل متنباز را روی آزمونهای zero-shot و few-shot فارسی مقایسه کرد.
چرا امتیاز عددی فقط برای مدلهای متنباز آمده؟ چون این سه بنچمارک ابعاد متفاوتی از فارسی را میسنجند و مقیاسهایشان یکسان نیست. تنها بنچمارک متنباز مدلهای مختلف را روی یک آزمون مشترک با امتیاز یکسان سنجیده؛ بنابراین آن امتیازها قابل مقایسهاند.
مدلهای بینالمللی frontier
GPT-4o و GPT-4.1 — نقطه مرجع بازار
مطالعه مقدماتی ارزیابی مدلهای زبانی برای فارسی نسخههای GPT-3.5 و GPT-4 را در وظایف کلاسیک، استدلالی و دانشی بررسی کرده و برتری GPT-4 را در استدلال و دانش عمومی گزارش میکند. این پژوهش GPT-4o را مستقیماً ارزیابی نکرده است؛ بنابراین در این مقاله برای GPT-4o امتیاز عددی مستقل اعلام نمیکنیم.
دسترسی از ایران: مسدود. IP ایران و کارت بانکی ایران توسط OpenAI بلاک شدهاند. روشهای رایج: VPN به همراه VCC یا کارت هدیه اپلاستور آمریکا. منبع: Countries where ChatGPT is blocked
هزینه: پرداخت دلاری برای ChatGPT Plus (۲۰ دلار/ماه)، یا از طریق پلتفرمهای ایرانی با پرداخت ریالی.
Claude Sonnet 4.6 و Opus 4.8 — عملکرد فرهنگی قوی
Claude در بنچمارک TARAZ که فهم فرهنگ و زبان فارسی را میسنجد ارزیابی شده است. برای قضاوت درباره نسخهای که امروز در دسترس شماست، همان پرامپتهای پیشنهادی این مقاله را اجرا کنید؛ کیفیت نسخههای مختلف یک خانواده الزاماً یکسان نیست.
درباره امتیازهای TARAZ: این بنچمارک نتایج عددی مدلها را منتشر کرده، اما چون مقیاس آن با بنچمارک متنباز یکسان نیست، اعداد آن را در جدول مقایسهای این مقاله مخلوط نکردهایم. روش و نتایج کامل TARAZ در مقاله اصلی در دسترس است.
دسترسی از ایران: دسترسی از طریق VPN در بیشتر موارد ممکن است. وضعیت تحریم رسمی را پیش از استفاده از سایت Anthropic بررسی کنید.
هزینه: هزینه و محدودیت پلنهای Claude ممکن است تغییر کند؛ پیش از خرید، صفحهٔ رسمی Anthropic را بررسی کنید.
Gemini 2.5 Flash و Pro — مسدود با درخواست رفع مسدودی فعال
پشتیبانی چندزبانه Gemini قوی است. اما یک مشکل عملی وجود دارد.
دسترسی از ایران: رسماً مسدود. Google Gemini برای ایران محدودیت اعمال کرده. یک درخواست جامعهای برای رفع مسدودی در انجمن گوگل فعال است. منبع مستقیم
هزینه: رایگان با محدودیت، Gemini Advanced 20 دلار/ماه — اما عملاً دسترسی از ایران نیازمند VPN است.
DeepSeek V3 و R1 — قابل دسترسترین از ایران
DeepSeek در MasalBench که درک ضربالمثلها و متن پیچیده فارسی را میسنجد ارزیابی شده است. نتیجه یک بنچمارک فرهنگی برای رتبهبندی همه کاربردها کافی نیست؛ پیش از انتخاب، کیفیت خروجی را روی کار واقعی خودتان بسنجید.
دسترسی از ایران: نسبتاً آزادتر. وباپ و API DeepSeek معمولاً بدون VPN از ایران قابل دسترسی است.
نکته حریم خصوصی: DeepSeek شرکت چینی است. سیاست دادهاش با GDPR یا قوانین ایران تفاوت دارد. قبل از ورود اطلاعات حساس، سیاست حریم خصوصی را بخوانید.
نقطه برای کاربر فارسیزبان
| نیاز شما | کاری که در نقطه میتوانید انجام دهید |
|---|---|
| دستیار عمومی | پرسیدن سؤال، ایدهپردازی، خلاصهسازی و بازنویسی |
| تولید محتوا | ساخت بریف، پیشنویس و نسخههای مختلف محتوا |
| تصویر | ساخت عکس و تصویر با پرامپت |
| ویدئو و فیلم | تولید خروجی ویدیویی |
| صدا | ساخت محتوای صوتی |
| مدل سهبعدی | تولید مدل سهبعدی |
| ارائه | ساخت پاورپوینت |
برای مقایسهٔ منصفانه، یکی از پرامپتهای همین مقاله را بدون تغییر در نقطه و گزینهٔ دیگر اجرا کنید. سپس روانی فارسی، دقت، پیروی از دستور و زمان لازم برای اصلاح را امتیاز دهید.
هوش مصنوعی فارسی را در نقطه امتحان کنید
مدلهای متنباز با پشتیبانی فارسی
اگر میخواهید هوش مصنوعی را کاملاً آفلاین اجرا کنید — برای حریم خصوصی کامل یا محیطهایی بدون اینترنت — مدلهای متنباز گزینهای واقعی هستند.
یک مطالعه علمی ۲۰۲۵ یازده مدل متنباز را روی آزمونهای فارسی zero-shot و few-shot سنجید. جدول زیر میانگین عملکرد few-shot گزارششده در همان مقاله را نشان میدهد:
| مدل | امتیاز few-shot | توضیح |
|---|---|---|
| Gemma2 | ۰.۶۱ | بهترین در این بنچمارک — مناسب برای اجرا با Ollama |
| GLM4 | ۰.۵۳ | عملکرد قابل قبول |
| Qwen2.5 (72B) | ۰.۵۰ | مستندات Qwen پشتیبانی صریح فارسی را اعلام کرده |
| LLaMA 3.3 70B | در MasalBench ارزیابی شده | نتایج مقایسهای در مطالعه جداگانه |
مقایسه بصری امتیاز مدلهای متنباز:
تفسیر درست: امتیاز ۰.۶۱ از ۱ برای Gemma2 یعنی فاصلهای از مدلهای frontier دارد، اما برای اجرای کاملاً آفلاین و رایگان، عملکرد قابل قبولی است. بهعلاوه، مدلهای متنباز در حال پیشرفت سریع هستند.
مدلهای بومی فارسی
مدلهایی مثل PersianLLaMA، Maral، Dorna، ParsT5 و AVA-LLAMA روی داده فارسی fine-tune شدهاند و دسترسی به آنها معمولاً آزادتر است.
صادقانه بگوییم: این مدلها در بیشتر تکالیف عمومی از مدلهای frontier عقب هستند. مدل پایه ضعیفتر، حتی با fine-tune گسترده، به عملکرد GPT-4o یا Claude در نوشتن عمومی فارسی نمیرسد.
جایی که ممکن است برتری داشته باشند: وظایف بسیار تخصصی فارسی مثل پردازش متون ادبی کلاسیک، تحلیل اسناد حقوقی ایرانی، یا موضوعاتی که داده fine-tune برای آن وظیفه بهینه شده باشد. اما این را باید با آزمون مستقل در آن حوزه خاص تأیید کنید.
جدول مقایسه نهایی
بر اساس نیازتان انتخاب کنید — نه یک برنده مطلق:
| نیاز | توصیه | دلیل |
|---|---|---|
| دستیار فارسی و خروجی چندرسانهای | نقطه | محصول پیشنهادی کلادی برای متن، محتوا، عکس، ویدئو، صدا، مدل سهبعدی و پاورپوینت |
| مدل تجاری برای متن فارسی | خانواده GPT-4 یا Claude | هر دو نامزد جدیاند؛ نسخه فعال را با پرامپت ثابت خودتان مقایسه کنید |
| حریم خصوصی کامل + آفلاین | Gemma2 با Ollama | بهترین متنباز در بنچمارک فارسی ۲۰۲۵ |
| مدل متنباز آنلاین | DeepSeek | شرایط دسترسی و پلن را همان روز در سایت رسمی بررسی کنید |
| تکلیف تخصصی فارسی | آزمون با Maral یا Dorna | ممکن است در نیچهای خاص برتری داشته باشند |
حریم خصوصی و داده شما
این بخش معمولاً در مقالات مقایسهای نادیده گرفته میشود، اما برای کاربر ایرانی اهمیت خاصی دارد.
اگر از VPN استفاده میکنید: ترافیک شما از سرورهای VPN provider رد میشود — یک لایه ریسک اضافی به همراه سرور هوش مصنوعی.
پلتفرمهای واسط: بسته به معماری محصول، داده ممکن است علاوه بر سرویس اصلی در زیرساخت ارائهدهندهٔ مدل هم پردازش شود. پیش از ورود اطلاعات حساس، سیاست حریم خصوصی و نگهداری دادهٔ همان محصول را بخوانید.
DeepSeek: شرکت چینی است. قوانین حریم خصوصی چین با GDPR یا قوانین ایران تفاوت دارد. برای اطلاعات حساس از آن استفاده نکنید.
قانون کلی: هیچ هوش مصنوعیای — ایرانی یا خارجی — را بدون خواندن سیاست حریم خصوصی برای اطلاعات حساس (کلمات عبور، اطلاعات مالی، داده مشتریان) استفاده نکنید.
محدودیتهای این آزمون
صادقانه بگوییم:
این مقاله بر اساس بنچمارکهای علمی منتشرشده، اطلاعات عمومی در دسترس، و چارچوب آزمون ارائهشده نوشته شده. چند محدودیت جدی وجود دارد:
مدلها بهسرعت تغییر میکنند. GPT-4o همان GPT-4 نیست، و هر آپدیت میتواند عملکرد فارسی را تغییر دهد. ورژن دقیق مدل هنگام آزمون مهم است.
بنچمارکهای علمی هم محدودیت دارند. TARAZ، MasalBench و بنچمارک متنباز فارسی هرکدام جنبههای خاصی از زبان فارسی را میسنجند — نه همه کاربردها. امتیاز بالا در یک بنچمارک لزوماً به معنای بهترین بودن در همه کارها نیست.
کیفیت هر پلتفرم میتواند تغییر کند. مدل فعال، محدودیتها و قیمتگذاری قابل تغییر است. آنچه امروز درست است ممکن است فردا عوض شود.
چارچوب آزمون قابل بازتولید است. اگر همین پرامپتهای جدول را با ابزارهای مختلف اجرا کردید و نتایج جالبی گرفتید، با ما در میان بگذارید تا این مقاله را با داده واقعی بهروز کنیم.
آخرین بررسی منابع: ۲۹ تیر ۱۴۰۵ — وضعیت دسترسی و تحریمها میتواند تغییر کند.
اگر مسئلهٔ شما بهجای متن، ساخت عکس است، همین منطق «پرامپت ثابت + معیار ثابت» را در راهنمای انتخاب بهترین هوش مصنوعی ساخت تصویر اجرا کردهایم؛ آن صفحه فهم پرامپت فارسی، نوشتن حروف داخل تصویر و ویرایش موضعی را جدا میسنجد.
اگر تصمیم شما فقط برای کارهای نویسندگی و بازاریابی است، مقایسهٔ وظیفهمحور ابزارهای تولید محتوای فارسی دامنهٔ محدودتری دارد و کیفیت brief، پیشنویس، بازنویسی و کنترل منبع را با مأموریت یکسان میسنجد؛ در نتیجه جایگزین این بنچمارک عمومی نیست.
برای تصمیم میان دو محصول شناختهشده، مقایسهٔ سناریومحور ChatGPT و Claude را با همان ورودی و rubric پیشنهادی اجرا کنید؛ نام مدل بهتنهایی جای آزمون روی کار واقعی شما را نمیگیرد.
اگر مسئلهٔ شما درس، مقاله یا پژوهش دانشگاهی است، رتبهٔ عمومی یک مدل پاسخ کافی نیست. در راهنمای انتخاب هوش مصنوعی برای دانشجویان ابزارها را براساس کار واقعی—از مطالعهٔ منبعمحور تا تحقیق و برنامهریزی—و با معیار صحت منبع و یادگیری مقایسه کردهایم.
سؤالات متداول
کدام هوش مصنوعی فارسی را بهتر میفهمد؟
برای مدلهای frontier یک برنده قطعی و همنسخه از بنچمارکهای موجود به دست نمیآید. خانواده GPT-4 و Claude نامزدهای جدیاند، اما باید نسخه فعال را با پرامپت ثابت خودتان بسنجید. دسترسی مستقیم از ایران نیز ممکن است محدود باشد.
بهترین هوش مصنوعی فارسی رایگان کدام است؟
پلنها و وضعیت دسترسی سرویسهای آنلاین تغییر میکنند؛ پیش از انتخاب، صفحهٔ رسمی همان روز را بررسی کنید. برای اجرای محلی، Gemma2 با Ollama یک گزینهٔ متنباز است. برای کار روزمرهٔ فارسی و ساخت خروجیهای مختلف نیز میتوانید نقطه را با همان پرامپتهای این مقاله امتحان کنید.
آیا ChatGPT یا Claude فارسی بهتری دارند؟
هر دو میتوانند فارسی روان تولید کنند، اما مقالههای موجود نسخههای یکسان و بهروز آنها را روی یک آزمون مشترک مقایسه نکردهاند. Claude در TARAZ ارزیابی شده و پژوهش قدیمیتر GPT-4 را برای فارسی بررسی کرده است؛ این دو نتیجه مستقیماً قابل رتبهبندی نیستند.
چه هوش مصنوعیای بدون VPN برای ایران کار میکند؟
وضعیت دسترسی سرویسهای بینالمللی و محدودیتهای جغرافیایی ثابت نیست. بهجای تکیه بر فهرستهای قدیمی، صفحهٔ کشورهای پشتیبانیشدهٔ سرویس و امکان ورود همان روز را بررسی کنید. پیشنهاد کلادی برای شروع کار فارسی، امتحانکردن نقطه است؛ دربارهٔ دسترسی هیچ سرویس دیگری بدون بررسی روز ادعای قطعی نمیکنیم.
درباره تیم تحریریه کلادی




