بازگشت به ابزارهای هوش مصنوعی

بهترین هوش مصنوعی فارسی؛ بنچمارک علمی و راهنمای دسترسی از ایران

اگر عبارت «بهترین هوش مصنوعی فارسی» را در گوگل جست‌وجو کنید، ده‌ها مقاله پیدا می‌شود. اما اگر از هر کدام بپرسید «این پرامپت مشخص را دادید و چه جوابی گرفتید؟» — جوابی نمی‌آید. فهرست می‌نویسند، توصیف می‌کنند، رتبه‌بندی می‌کنند؛ بدون

·۱۳ دقیقه مطالعه
بهترین هوش مصنوعی فارسی؛ بنچمارک علمی و راهنمای دسترسی از ایران

اگر عبارت «بهترین هوش مصنوعی فارسی» را در گوگل جست‌وجو کنید، ده‌ها مقاله پیدا می‌شود. اما اگر از هر کدام بپرسید «این پرامپت مشخص را دادید و چه جوابی گرفتید؟» — جوابی نمی‌آید. فهرست می‌نویسند، توصیف می‌کنند، رتبه‌بندی می‌کنند؛ بدون یک بنچمارک قابل بازتولید.

این مقاله متفاوت عمل می‌کند. بنچمارک‌های علمی منتشرشده که فارسی را در مدل‌های مختلف سنجیده‌اند مرور می‌کنیم، چارچوب آزمون قابل بازتولید را توضیح می‌دهیم و یک تمایز اساسی را روشن می‌کنیم که اکثر مقالات فارسی نادیده می‌گیرند.

یک نکته مهم از همین اول: هیچ مدل واحدی برای همه کاربردها «بهترین» نیست. جدول مقایسه این مقاله بر اساس نیاز شما طراحی شده، نه یک برنده مطلق.

یک کار واقعی را در نقطه امتحان کنید

آخرین بررسی: ۲۹ تیر ۱۴۰۵


نکات کلیدی:

  • «مدل» (مثل GPT-4o) با «پلتفرم» (مثل نقطه) یکی نیست؛ این تمایز برای انتخاب درست و اطلاع از حریم خصوصی حیاتی است
  • مدل‌های frontier کیفیت فارسی بهتری دارند اما دسترسی مستقیم از ایران به اکثر آن‌ها محدود یا مسدود است
  • در میان مدل‌های متن‌باز، Gemma2 در یک بنچمارک ۲۰۲۵ بالاترین امتیاز فارسی را در میان مدل‌های آزمون‌شده کسب کرد
  • هر پلتفرمی را پیش از ورود اطلاعات حساس، از نظر سیاست حریم خصوصی بررسی کنید

برای آشنایی با خود محصول، خانواده مدل‌ها و قابلیت‌هایش، راهنمای هوش مصنوعی Claude چیست؟ را بخوانید.

در این مقاله

اول مدل را از پلتفرم جدا کنید

این تمایز را اکثر مقالات فارسی نادیده می‌گیرند، اما برای انتخاب درست ضروری است. وقتی از «هوش مصنوعی فارسی» حرف می‌زنیم، در واقع سه لایه جداگانه وجود دارد:

لایه اول — مدل‌های frontier بین‌المللی: مثل GPT-4o (OpenAI)، Claude Sonnet (Anthropic)، Gemini 2.5 (Google) و DeepSeek V3. این‌ها مدل‌های پایه‌ای هستند که کیفیت واقعی زبان فارسی را تعیین می‌کنند. دسترسی مستقیم از ایران برای بیشتر آن‌ها محدود یا مسدود است.

لایه سوم — مدل‌های متن‌باز و محلی: مثل Gemma2، Qwen2.5، LLaMA 3.3، یا مدل‌های بومی فارسی مثل PersianLLaMA و Maral. این‌ها را می‌توانید با Ollama روی کامپیوتر خودتان اجرا کنید. کیفیت پایین‌تر از frontier models است، اما حریم خصوصی کامل دارید.

چرا این تمایز مهم است؟ چون اگر می‌خواهید بهترین کیفیت فارسی را داشته باشید، باید خروجی واقعی محصول و مدل فعال را بسنجید، نه فقط نام روی صفحه را. اگر نگران حریم خصوصی هستید نیز سیاست دادهٔ خود محصول و ارائه‌دهندهٔ مدل هر دو اهمیت دارند.

چارچوب آزمون: چطور مقایسه کردیم

برای مقایسه منصفانه، یک چارچوب آزمون ثابت نیاز است. چارچوب پیشنهادی زیر از چهار دسته پرامپت تشکیل شده که هر کدام جنبه متفاوتی از توانایی فارسی مدل را می‌سنجد:

دستهپرامپت آزمونمعیارهای ارزیابی
تولید محتوای فارسییک پاراگراف ۱۵۰ کلمه‌ای درباره مزایا و معایب هوش مصنوعی برای مشاغل کوچک ایرانی بنویس.روانی نثر، دقت نیم‌فاصله، انسجام معنایی
درک و خلاصه‌سازیاین متن را خلاصه کن و سه نکته اصلی را استخراج کن. [متن پیچیده فارسی]دقت خلاصه، حفظ اطلاعات کلیدی، کیفیت فارسی
استدلال و تحلیلمزایا و معایب هوش مصنوعی در آموزش را با استدلال منطقی به فارسی بنویس.کیفیت استدلال، ساختار پاسخ، دقت ادعاها
کد + توضیح فارسییک تابع پایتون برای شمارش کلمات فارسی بنویس و آن را به فارسی توضیح بده.صحت کد، کیفیت توضیح، درک زبان فارسی

روش امتیازدهی: هر پاسخ در سه بُعد امتیاز می‌گیرد (هر کدام ۰ تا ۵): کیفیت فارسی (نثر، نیم‌فاصله، ویرگول‌گذاری)، دقت محتوایی، انسجام و ساختار. امتیاز نهایی از ۱۵ است.

این پرامپت‌ها قابل بازتولید هستند. می‌توانید همین پرامپت‌های جدول را در هر ابزاری امتحان کنید و خودتان مقایسه کنید. نکته مهم: ورژن دقیق مدل را یادداشت کنید (مثلاً GPT-4o-2024-11 یا claude-sonnet-4-6). مدل‌ها به‌سرعت آپدیت می‌شوند و نتایج ممکن است با ورژن‌های جدیدتر تفاوت داشته باشد.

بنچمارک‌های علمی که استفاده کردیم:

در کنار چارچوب بالا، سه مطالعه علمی منتشرشده را به‌عنوان داده مرجع در نظر گرفتیم:

  • TARAZ: بنچمارک ایرانی که فهم فرهنگی و زبانی فارسی را می‌سنجد — از جمله ضرب‌المثل، اصطلاحات روزمره و بافت اجتماعی ایران. این پژوهش ۱۵ مدل متن‌باز و تجاری را ارزیابی کرده است.
  • MasalBench: تمرکز اختصاصی روی درک ضرب‌المثل‌های فارسی و متن پیچیده فرهنگی — چیزی که اکثر بنچمارک‌های عمومی نمی‌سنجند. پژوهش هشت مدل را ارزیابی کرده است.
  • بنچمارک مقایسه‌ای مدل‌های متن‌باز: مطالعه‌ای که در ۲۰۲۵ منتشر شد و یازده مدل متن‌باز را روی آزمون‌های zero-shot و few-shot فارسی مقایسه کرد.

چرا امتیاز عددی فقط برای مدل‌های متن‌باز آمده؟ چون این سه بنچمارک ابعاد متفاوتی از فارسی را می‌سنجند و مقیاس‌هایشان یکسان نیست. تنها بنچمارک متن‌باز مدل‌های مختلف را روی یک آزمون مشترک با امتیاز یکسان سنجیده؛ بنابراین آن امتیازها قابل مقایسه‌اند.

این پرامپت را امتحان کنید
Ctrl/⌘ + Enter برای کپی سریع

مدل‌های بین‌المللی frontier

GPT-4o و GPT-4.1 — نقطه مرجع بازار

مطالعه مقدماتی ارزیابی مدل‌های زبانی برای فارسی نسخه‌های GPT-3.5 و GPT-4 را در وظایف کلاسیک، استدلالی و دانشی بررسی کرده و برتری GPT-4 را در استدلال و دانش عمومی گزارش می‌کند. این پژوهش GPT-4o را مستقیماً ارزیابی نکرده است؛ بنابراین در این مقاله برای GPT-4o امتیاز عددی مستقل اعلام نمی‌کنیم.

دسترسی از ایران: مسدود. IP ایران و کارت بانکی ایران توسط OpenAI بلاک شده‌اند. روش‌های رایج: VPN به همراه VCC یا کارت هدیه اپل‌استور آمریکا. منبع: Countries where ChatGPT is blocked

هزینه: پرداخت دلاری برای ChatGPT Plus (۲۰ دلار/ماه)، یا از طریق پلتفرم‌های ایرانی با پرداخت ریالی.


Claude Sonnet 4.6 و Opus 4.8 — عملکرد فرهنگی قوی

Claude در بنچمارک TARAZ که فهم فرهنگ و زبان فارسی را می‌سنجد ارزیابی شده است. برای قضاوت درباره نسخه‌ای که امروز در دسترس شماست، همان پرامپت‌های پیشنهادی این مقاله را اجرا کنید؛ کیفیت نسخه‌های مختلف یک خانواده الزاماً یکسان نیست.

درباره امتیازهای TARAZ: این بنچمارک نتایج عددی مدل‌ها را منتشر کرده، اما چون مقیاس آن با بنچمارک متن‌باز یکسان نیست، اعداد آن را در جدول مقایسه‌ای این مقاله مخلوط نکرده‌ایم. روش و نتایج کامل TARAZ در مقاله اصلی در دسترس است.

دسترسی از ایران: دسترسی از طریق VPN در بیشتر موارد ممکن است. وضعیت تحریم رسمی را پیش از استفاده از سایت Anthropic بررسی کنید.

هزینه: هزینه و محدودیت پلن‌های Claude ممکن است تغییر کند؛ پیش از خرید، صفحهٔ رسمی Anthropic را بررسی کنید.


Gemini 2.5 Flash و Pro — مسدود با درخواست رفع مسدودی فعال

پشتیبانی چندزبانه Gemini قوی است. اما یک مشکل عملی وجود دارد.

دسترسی از ایران: رسماً مسدود. Google Gemini برای ایران محدودیت اعمال کرده. یک درخواست جامعه‌ای برای رفع مسدودی در انجمن گوگل فعال است. منبع مستقیم

هزینه: رایگان با محدودیت، Gemini Advanced 20 دلار/ماه — اما عملاً دسترسی از ایران نیازمند VPN است.


DeepSeek V3 و R1 — قابل دسترس‌ترین از ایران

DeepSeek در MasalBench که درک ضرب‌المثل‌ها و متن پیچیده فارسی را می‌سنجد ارزیابی شده است. نتیجه یک بنچمارک فرهنگی برای رتبه‌بندی همه کاربردها کافی نیست؛ پیش از انتخاب، کیفیت خروجی را روی کار واقعی خودتان بسنجید.

دسترسی از ایران: نسبتاً آزادتر. وب‌اپ و API DeepSeek معمولاً بدون VPN از ایران قابل دسترسی است.

نکته حریم خصوصی: DeepSeek شرکت چینی است. سیاست داده‌اش با GDPR یا قوانین ایران تفاوت دارد. قبل از ورود اطلاعات حساس، سیاست حریم خصوصی را بخوانید.

این پرامپت را امتحان کنید
Ctrl/⌘ + Enter برای کپی سریع

نقطه برای کاربر فارسی‌زبان

نیاز شماکاری که در نقطه می‌توانید انجام دهید
دستیار عمومیپرسیدن سؤال، ایده‌پردازی، خلاصه‌سازی و بازنویسی
تولید محتواساخت بریف، پیش‌نویس و نسخه‌های مختلف محتوا
تصویرساخت عکس و تصویر با پرامپت
ویدئو و فیلمتولید خروجی ویدیویی
صداساخت محتوای صوتی
مدل سه‌بعدیتولید مدل سه‌بعدی
ارائهساخت پاورپوینت

برای مقایسهٔ منصفانه، یکی از پرامپت‌های همین مقاله را بدون تغییر در نقطه و گزینهٔ دیگر اجرا کنید. سپس روانی فارسی، دقت، پیروی از دستور و زمان لازم برای اصلاح را امتیاز دهید.

هوش مصنوعی فارسی را در نقطه امتحان کنید

مدل‌های متن‌باز با پشتیبانی فارسی

اگر می‌خواهید هوش مصنوعی را کاملاً آفلاین اجرا کنید — برای حریم خصوصی کامل یا محیط‌هایی بدون اینترنت — مدل‌های متن‌باز گزینه‌ای واقعی هستند.

یک مطالعه علمی ۲۰۲۵ یازده مدل متن‌باز را روی آزمون‌های فارسی zero-shot و few-shot سنجید. جدول زیر میانگین عملکرد few-shot گزارش‌شده در همان مقاله را نشان می‌دهد:

مدلامتیاز few-shotتوضیح
Gemma2۰.۶۱بهترین در این بنچمارک — مناسب برای اجرا با Ollama
GLM4۰.۵۳عملکرد قابل قبول
Qwen2.5 (72B)۰.۵۰مستندات Qwen پشتیبانی صریح فارسی را اعلام کرده
LLaMA 3.3 70Bدر MasalBench ارزیابی شدهنتایج مقایسه‌ای در مطالعه جداگانه

مقایسه بصری امتیاز مدل‌های متن‌باز:

تفسیر درست: امتیاز ۰.۶۱ از ۱ برای Gemma2 یعنی فاصله‌ای از مدل‌های frontier دارد، اما برای اجرای کاملاً آفلاین و رایگان، عملکرد قابل قبولی است. به‌علاوه، مدل‌های متن‌باز در حال پیشرفت سریع هستند.

مدل‌های بومی فارسی

مدل‌هایی مثل PersianLLaMA، Maral، Dorna، ParsT5 و AVA-LLAMA روی داده فارسی fine-tune شده‌اند و دسترسی به آن‌ها معمولاً آزادتر است.

صادقانه بگوییم: این مدل‌ها در بیشتر تکالیف عمومی از مدل‌های frontier عقب هستند. مدل پایه ضعیف‌تر، حتی با fine-tune گسترده، به عملکرد GPT-4o یا Claude در نوشتن عمومی فارسی نمی‌رسد.

جایی که ممکن است برتری داشته باشند: وظایف بسیار تخصصی فارسی مثل پردازش متون ادبی کلاسیک، تحلیل اسناد حقوقی ایرانی، یا موضوعاتی که داده fine-tune برای آن وظیفه بهینه شده باشد. اما این را باید با آزمون مستقل در آن حوزه خاص تأیید کنید.

جدول مقایسه نهایی

بر اساس نیازتان انتخاب کنید — نه یک برنده مطلق:

نیازتوصیهدلیل
دستیار فارسی و خروجی چندرسانه‌اینقطهمحصول پیشنهادی کلادی برای متن، محتوا، عکس، ویدئو، صدا، مدل سه‌بعدی و پاورپوینت
مدل تجاری برای متن فارسیخانواده GPT-4 یا Claudeهر دو نامزد جدی‌اند؛ نسخه فعال را با پرامپت ثابت خودتان مقایسه کنید
حریم خصوصی کامل + آفلاینGemma2 با Ollamaبهترین متن‌باز در بنچمارک فارسی ۲۰۲۵
مدل متن‌باز آنلاینDeepSeekشرایط دسترسی و پلن را همان روز در سایت رسمی بررسی کنید
تکلیف تخصصی فارسیآزمون با Maral یا Dornaممکن است در نیچ‌های خاص برتری داشته باشند

حریم خصوصی و داده شما

این بخش معمولاً در مقالات مقایسه‌ای نادیده گرفته می‌شود، اما برای کاربر ایرانی اهمیت خاصی دارد.

اگر از VPN استفاده می‌کنید: ترافیک شما از سرورهای VPN provider رد می‌شود — یک لایه ریسک اضافی به همراه سرور هوش مصنوعی.

پلتفرم‌های واسط: بسته به معماری محصول، داده ممکن است علاوه بر سرویس اصلی در زیرساخت ارائه‌دهندهٔ مدل هم پردازش شود. پیش از ورود اطلاعات حساس، سیاست حریم خصوصی و نگهداری دادهٔ همان محصول را بخوانید.

DeepSeek: شرکت چینی است. قوانین حریم خصوصی چین با GDPR یا قوانین ایران تفاوت دارد. برای اطلاعات حساس از آن استفاده نکنید.

قانون کلی: هیچ هوش مصنوعی‌ای — ایرانی یا خارجی — را بدون خواندن سیاست حریم خصوصی برای اطلاعات حساس (کلمات عبور، اطلاعات مالی، داده مشتریان) استفاده نکنید.

محدودیت‌های این آزمون

صادقانه بگوییم:

این مقاله بر اساس بنچمارک‌های علمی منتشرشده، اطلاعات عمومی در دسترس، و چارچوب آزمون ارائه‌شده نوشته شده. چند محدودیت جدی وجود دارد:

مدل‌ها به‌سرعت تغییر می‌کنند. GPT-4o همان GPT-4 نیست، و هر آپدیت می‌تواند عملکرد فارسی را تغییر دهد. ورژن دقیق مدل هنگام آزمون مهم است.

بنچمارک‌های علمی هم محدودیت دارند. TARAZ، MasalBench و بنچمارک متن‌باز فارسی هرکدام جنبه‌های خاصی از زبان فارسی را می‌سنجند — نه همه کاربردها. امتیاز بالا در یک بنچمارک لزوماً به معنای بهترین بودن در همه کارها نیست.

کیفیت هر پلتفرم می‌تواند تغییر کند. مدل فعال، محدودیت‌ها و قیمت‌گذاری قابل تغییر است. آنچه امروز درست است ممکن است فردا عوض شود.

چارچوب آزمون قابل بازتولید است. اگر همین پرامپت‌های جدول را با ابزارهای مختلف اجرا کردید و نتایج جالبی گرفتید، با ما در میان بگذارید تا این مقاله را با داده واقعی به‌روز کنیم.

آخرین بررسی منابع: ۲۹ تیر ۱۴۰۵ — وضعیت دسترسی و تحریم‌ها می‌تواند تغییر کند.

اگر مسئلهٔ شما به‌جای متن، ساخت عکس است، همین منطق «پرامپت ثابت + معیار ثابت» را در راهنمای انتخاب بهترین هوش مصنوعی ساخت تصویر اجرا کرده‌ایم؛ آن صفحه فهم پرامپت فارسی، نوشتن حروف داخل تصویر و ویرایش موضعی را جدا می‌سنجد.

اگر تصمیم شما فقط برای کارهای نویسندگی و بازاریابی است، مقایسهٔ وظیفه‌محور ابزارهای تولید محتوای فارسی دامنهٔ محدودتری دارد و کیفیت brief، پیش‌نویس، بازنویسی و کنترل منبع را با مأموریت یکسان می‌سنجد؛ در نتیجه جایگزین این بنچمارک عمومی نیست.

برای تصمیم میان دو محصول شناخته‌شده، مقایسهٔ سناریومحور ChatGPT و Claude را با همان ورودی و rubric پیشنهادی اجرا کنید؛ نام مدل به‌تنهایی جای آزمون روی کار واقعی شما را نمی‌گیرد.

اگر مسئلهٔ شما درس، مقاله یا پژوهش دانشگاهی است، رتبهٔ عمومی یک مدل پاسخ کافی نیست. در راهنمای انتخاب هوش مصنوعی برای دانشجویان ابزارها را براساس کار واقعی—از مطالعهٔ منبع‌محور تا تحقیق و برنامه‌ریزی—و با معیار صحت منبع و یادگیری مقایسه کرده‌ایم.

سؤالات متداول

کدام هوش مصنوعی فارسی را بهتر می‌فهمد؟

برای مدل‌های frontier یک برنده قطعی و هم‌نسخه از بنچمارک‌های موجود به دست نمی‌آید. خانواده GPT-4 و Claude نامزدهای جدی‌اند، اما باید نسخه فعال را با پرامپت ثابت خودتان بسنجید. دسترسی مستقیم از ایران نیز ممکن است محدود باشد.

بهترین هوش مصنوعی فارسی رایگان کدام است؟

پلن‌ها و وضعیت دسترسی سرویس‌های آنلاین تغییر می‌کنند؛ پیش از انتخاب، صفحهٔ رسمی همان روز را بررسی کنید. برای اجرای محلی، Gemma2 با Ollama یک گزینهٔ متن‌باز است. برای کار روزمرهٔ فارسی و ساخت خروجی‌های مختلف نیز می‌توانید نقطه را با همان پرامپت‌های این مقاله امتحان کنید.

آیا ChatGPT یا Claude فارسی بهتری دارند؟

هر دو می‌توانند فارسی روان تولید کنند، اما مقاله‌های موجود نسخه‌های یکسان و به‌روز آن‌ها را روی یک آزمون مشترک مقایسه نکرده‌اند. Claude در TARAZ ارزیابی شده و پژوهش قدیمی‌تر GPT-4 را برای فارسی بررسی کرده است؛ این دو نتیجه مستقیماً قابل رتبه‌بندی نیستند.

چه هوش مصنوعی‌ای بدون VPN برای ایران کار می‌کند؟

وضعیت دسترسی سرویس‌های بین‌المللی و محدودیت‌های جغرافیایی ثابت نیست. به‌جای تکیه بر فهرست‌های قدیمی، صفحهٔ کشورهای پشتیبانی‌شدهٔ سرویس و امکان ورود همان روز را بررسی کنید. پیشنهاد کلادی برای شروع کار فارسی، امتحان‌کردن نقطه است؛ دربارهٔ دسترسی هیچ سرویس دیگری بدون بررسی روز ادعای قطعی نمی‌کنیم.


درباره تیم تحریریه کلادی

#هوش مصنوعی فارسی#مقایسه ابزار#ChatGPT#Claude#Gemini#DeepSeek#بنچمارک
Share this article