روش ارزیابی

این صفحه توضیح می‌دهد چطور مدل‌ها را می‌سنجیم، امتیازها چه معنایی دارند، قیمت‌ها از کجا می‌آیند و منابع داده کدام‌اند.

امتیاز فارسی چیست؟

«امتیاز فارسی» یک ارزیابیِ دستی و انسانی توسطِ تیمِ مرشد است — نه بنچمارک خودکار. تیم از هر مدل می‌خواهد مجموعه‌ای از وظایف فارسی را انجام دهد و سپس پاسخ‌ها را روی پنج سنجه امتیازدهی می‌کند.

امتیاز نهایی از ۱۰ است (هر سنجه داخلاً ۱ تا ۵ ذخیره می‌شود و در نمایش ×۲ می‌شود). هدف: کمک به کاربر فارسی‌زبان برای انتخاب مدلی که واقعاً فارسیِ خوب تولید می‌کند.

مجموعه‌سؤال‌های ارزیابی خصوصی نگه داشته می‌شوند تا نمره‌ها قابلِ تقلب نباشند، اما متدولوژی کلی (این صفحه) کاملاً شفاف است.

پنج سنجهٔ ارزیابی

هر سنجه داخلاً ۱ تا ۵ امتیاز دارد؛ در جدول رتبه‌بندی ×۲ نمایش داده می‌شود (از ۱۰).

1
نگارش
لحن رسمی، روان‌بودن و طبیعی‌بودن نوشتارِ فارسی. آیا مدل مثل یک نویسندهٔ فارسی‌زبانِ حرفه‌ای می‌نویسد یا ترجمه‌واره به نظر می‌رسد؟
2
استدلال
کیفیتِ استدلالِ گام‌به‌گام به فارسی. آیا توضیحات منطقی، دقیق و به فارسی سلیس بیان می‌شوند؟
3
رسم‌الخط (املا و نیم‌فاصله)
درستیِ املا و کاربردِ صحیحِ نیم‌فاصله. «می‌شود» درست است نه «می شود»؛ «کتاب‌ها» درست است نه «کتابها». این سنجه خطاهای رایج رسم‌الخطی را بررسی می‌کند.
4
پیروی از دستور
پایبندیِ دقیق به قیدهای پرامپت. اگر کاربر بگوید «دقیقاً دو جمله بنویس» یا «بدون مقدمه پاسخ بده»، مدل تا چه حد دستور را اجرا می‌کند؟
5
نشتِ زبانی
افتادنِ کلمات یا عباراتِ انگلیسی، هندی یا سایر زبان‌ها وسطِ یک پاسخِ فارسی — بدون دلیل موجه. این پدیده را «نشتِ زبانی» (language leakage) می‌نامیم. مقدار آن بدون/جزئی/شدید ارزیابی می‌شود.

کاربردهایی که می‌سنجیم

هر مدل بر اساسِ مناسب‌بودن برای این کاربردها دسته‌بندی می‌شود. در صفحهٔ رتبه‌بندی می‌توانید یک کاربرد را انتخاب کنید تا بهترین مدل‌ها و ستون‌های مرتبط با همان کاربرد نمایش داده شوند.

گفتگوکدنویسیاستدلالنوشتنترجمهایجنتبیناییکانتکستِ بلندساخت تصویرساخت ویدیوصدا و گفتارموزیک

نحوهٔ محاسبهٔ قیمت

قیمتِ دلاری هر ۱ میلیون توکن از OpenRouter خوانده می‌شود (به‌روزرسانیِ روزانه). این عدد ضرب‌در نرخِ روزِ دلار — که از دستیار نرخ‌بانِ مرشد خوانده می‌شود — می‌شود تا قیمتِ تومانی هر ۱ هزار توکن به دست آید.

price_toman_per_1K = (price_usd_per_1M / 1,000,000) × usd_rate × 1,000

نرخ دلار لحظه‌ای خوانده می‌شود و ذخیره نمی‌شود؛ هر بار که صفحه بارگذاری می‌شود، تازه‌ترین نرخ اعمال می‌گردد. اگر API نرخ‌بان در دسترس نباشد، قیمت‌ها به دلار نمایش داده می‌شوند.

منابع داده

  • کاتالوگ و قیمتِ مدل‌ها: OpenRouter — به‌روزرسانیِ روزانه از طریق API عمومی.
  • ارزیابیِ فارسی: ارزیابیِ دستیِ تیمِ مرشد روی مجموعه‌سؤال‌های خصوصی. امتیازها به‌صورت دوره‌ای تجدید می‌شوند.
  • نرخ دلار: دستیار نرخ‌بانِ مرشد — نرخ لحظه‌ای بازارِ آزاد.
  • «موجود در مرشد»: مدل هم‌اکنون در سرویسِ مرشد در دسترس است و می‌توانید مستقیماً از آن استفاده کنید.

لایسنس‌ها

اپن
لایسنس‌هایی مثل Apache 2.0 یا MIT — استفادهٔ تجاری کاملاً آزاد است.
مشروط
لایسنس‌هایی مثل Llama License یا Gemma License — استفادهٔ تجاری مشروط به شرایط سازنده است.
محدود
مدل‌های بستهٔ تجاری که فقط از طریق API رسمی در دسترس‌اند.

حوزه‌های ارزیابیِ فارسی

امتیازِ فارسی از میانگینِ وزنیِ این حوزه‌ها به‌دست می‌آید. روی هر حوزه بزنید تا تعریف، معیارها و رتبه‌بندیِ مدل‌ها روی آن را ببینید.

← بازگشت به رتبه‌بندی مدل‌ها