روش ارزیابی مدلها
اینجا شفاف میگوییم مدلها را با چه شاخصهایی و چگونه میسنجیم. اصل کار: متدولوژی عمومی است، ولی مجموعهسؤالها خصوصی تا نمرهها قابلتقلب نباشند. هر جا چکِ قطعی ممکن باشد بر داوری مدل مقدم است؛ و داوری همیشه با دو داور از دو خانوادهٔ مدل و روبریک مکتوب انجام میشود.
شاخصهای زندهٔ فعلی
این شاخصها همین حالا روی جدولهای مدلها نمایش داده میشوند.
امتیاز فارسی (fa-bench)
«امتیاز فارسی» میانگین وزنی ۱۰ دستهٔ زیر است (۰ تا ۱۰۰). دو دستهٔ نگارش و فرمت/RTL وزن ۱٫۵× دارند و بقیه ۱×. یک گیت نرم هم هست: اگر نمرهٔ فرمت زیر ۷۰ باشد، آن مدل روی جدول پرچم قرمز میگیرد (حذف نمیشود). فعلاً این امتیاز نمونهٔ اولیه است و با مجموعهٔ کامل خصوصی به «مرجع» تبدیل میشود.
قطعی: چک ماشینی بدون داور · داور: دو مدل داور + روبریک · ترکیبی: بخشی قطعی، بخشی داور.
محورهای در راهبهزودی
این محورها دردهای واقعی کاربر فارسیزباناند و بهترتیب اضافه میشوند.