مرشدآزمایشگاه

روش ارزیابی مدل‌ها

این‌جا شفاف می‌گوییم مدل‌ها را با چه شاخص‌هایی و چگونه می‌سنجیم. اصل کار: متدولوژی عمومی است، ولی مجموعه‌سؤال‌ها خصوصی تا نمره‌ها قابل‌تقلب نباشند. هر جا چکِ قطعی ممکن باشد بر داوری مدل مقدم است؛ و داوری همیشه با دو داور از دو خانوادهٔ مدل و روبریک مکتوب انجام می‌شود.

شاخص‌های زندهٔ فعلی

این شاخص‌ها همین حالا روی جدول‌های مدل‌ها نمایش داده می‌شوند.

شاخصمنبعتوضیحوضعیت
امتیاز فارسی (fa-bench)روش مرشدمیانگین وزنی ۱۰ دستهٔ فارسی؛ نگارش و فرمت وزن ۱٫۵×. (فعلاً نمونهٔ اولیه)نمونهٔ اولیه
Elo جهانیLMArenaرتبهٔ کلی از رأی کور کاربران در سراسر جهان.فعال
Elo کدنویسیLMArenaهمان رأی‌گیری، محدود به پرسش‌های کدنویسی.فعال
Elo بیناییLMArenaرأی‌گیری روی ورودی‌های تصویری (مدل‌های چندوجهی).فعال
هوش (AA)Artificial Analysisشاخص ترکیبی هوش از بنچ‌های استاندارد.فعال
سرعت (AA)Artificial Analysisتوکن خروجی بر ثانیه.فعال
قیمت ورودی / خروجیOpenRouterدلار و تومانِ روز به‌ازای هر ۱ میلیون توکن.فعال
هزینهٔ یک صفحهٔ فارسیاندازه‌گیری مرشدتوکنِ یک صفحهٔ استاندارد فارسی × قیمت خروجی — چون توکنایزرها فارسی را متفاوت می‌شمارند.فعال

امتیاز فارسی (fa-bench)

«امتیاز فارسی» میانگین وزنی ۱۰ دستهٔ زیر است (۰ تا ۱۰۰). دو دستهٔ نگارش و فرمت/RTL وزن ۱٫۵× دارند و بقیه ۱×. یک گیت نرم هم هست: اگر نمرهٔ فرمت زیر ۷۰ باشد، آن مدل روی جدول پرچم قرمز می‌گیرد (حذف نمی‌شود). فعلاً این امتیاز نمونهٔ اولیه است و با مجموعهٔ کامل خصوصی به «مرجع» تبدیل می‌شود.

دستهروش سنجشنوعوزن
نگارش فارسیروبریک: روانی، واژه‌گزینی، دستورداور۱٫۵×
فرمت / RTL / نیم‌فاصلهچک قطعی: نیم‌فاصله، ی/ک فارسی، ارقام، جهتقطعی۱٫۵×
اصطلاح و ضرب‌المثلپاسخ مرجع + داورترکیبی۱×
ترجمهٔ دوطرفهٔ فنیروبریک دقت و روانی روی متن فنیداور۱×
درک مطلبپاسخ مرجعِ بستهقطعی۱×
استدلال فارسیپاسخ مرجع + بررسی گام‌هاترکیبی۱×
دانش ایرانپاسخ مرجعقطعی۱×
محاوره و لحنروبریک: تشخیص و تولید لحن خواسته‌شدهداور۱×
سند اداری / حقوقیاستخراج فیلد (قطعی) + خلاصه (داور)ترکیبی۱×
تاریخ و تقویم شمسیچک قطعی: تبدیل، محاسبهٔ فاصله، فهم «امروز»قطعی۱×

قطعی: چک ماشینی بدون داور · داور: دو مدل داور + روبریک · ترکیبی: بخشی قطعی، بخشی داور.

محورهای در راهبه‌زودی

این محورها دردهای واقعی کاربر فارسی‌زبان‌اند و به‌ترتیب اضافه می‌شوند.

محورشاخص‌ها
صدا — گفتار به متن (STT)WER فارسی رسمی و محاوره، دقت اعداد و اسامی خاص، مقاومت به نویز، قیمت هر دقیقه.
صدا — متن به گفتار (TTS)طبیعی‌بودن و لهجه (داوری انسانی کور)، تلفظ اعداد و تاریخ، حفظ لحن، تأخیر، قیمت هر ۱۰۰۰ کاراکتر.
بینایی / OCR فارسیCER روی متن چاپی، دست‌نویس و فاکتور (استخراج فیلد به JSON)، و قیمت هر تصویر.
امبدینگ فارسیبازیابی (recall@k) + زیرمجموعهٔ FaMTEB، تشابه معنایی (STS)، ابعاد بردار و قیمت.
تولید تصویر«فارسی‌نویسی در تصویر» (حروف سالم و درست‌چسبیده)، کیفیت کلی، و قیمت هر تصویر.
ارزون‌ترینِ کافیشاخص مشتق: برای هر کاربرد، ارزان‌ترین مدل با امتیاز دستهٔ مرتبط ≥ ۷۰.