ارزیابی کیفیت خروجی LLM با معیارهای سفارشی فارسی
ساخت harness ارزیابی برای مدلهای فارسیزبان: مجموعه سؤال طلایی، معیارهای ارجاعپذیری و چرا benchmarkهای انگلیسی گمراهکنندهاند.
علی رضوانیمعمار ارشد هوش مصنوعی ماه
مدلی که روی benchmarkهای انگلیسی نمره عالی دارد، میتواند در پاسخ به فارسی ساده «بله/خیر» طفره برود یا اعداد را با ارقام عربی بههم ریخته بنویسد. بومیسازی ارزیابی، نیمی از موفقیت محصول LLM است.
مجموعه سؤال طلایی (Golden Set)
۲۵۰ سؤال واقعی از پشتیبانی و دادهکاوی داخلی جمع کردیم و هر کدام را با پاسخ مرجع انسانی نشانهگذاری کردیم. هر تغییر پرامپت یا مدل، اول از این صافی رد میشود.
# harness ارزیابی: اجرای golden set روی هر نسخه پرامپت
def evaluate(prompt_version: str) -> dict:
results = []
for case in GOLDEN_SET:
out = chat(case.question, version=prompt_version)
results.append({
"exact": normalise(out) == normalise(case.reference),
"grounded": contains_citation(out, case.source_doc),
"digits_fa": arabic_digits(out) == 0,
})
return aggregate(results)
سه معیار واقعی، نه یک عدد کلی
- پایبندی به منبع (groundedness): آیا پاسخ به سند استناد میکند؟ بدون آن، «بله» گفتنِ بیاساس خطا محسوب میشود.
- سلامت ارقام: نسبت ارقام عربی به فارسی در خروجی، معیار سلامت متن بومی.
- نرخ طفرهرفتن: پاسخهای «به عنوان یک زبان مدل…» باید صفر شوند.
| نسخه پرامپت | Exact | Groundedness | طفرهرفتن |
|---|---|---|---|
| v1 پایه | ۰.۶۲ | ۰.۷۱ | ۹٪ |
| v2 + ساختار سخت | ۰.۷۱ | ۰.۸۰ | ۳٪ |
| v3 + دستور استناد | ۰.۷۸ | ۰.۹۱ | ۲٪ |

ادغام با CI
هر تغییر پرامپت یک PR است؛ job ارزیابی، نتیجه را بهصورت جدول تفاوت در خود PR میگذارد و اگر هیچ معیاری بیش از ۲٪ افت نکرده باشد، merge آزاد است.
- name: Evaluate prompts
run: python eval/run.py --prompt-version ${{ github.sha }}
# شکست build فقط وقتی که یکی از معیارها >۲٪ افت کرده باشد
نتیجهگیری
بدون harness ارزیابی بومی، بهبود LLM «احساسی» است و هر نسخه جدید پرامپت یک قمار. با سه معیار ساده و یک golden set کوچک، هر تغییر را با عدد میسنجید — و این تنها راهی است که تیم میتواند با اعتماد پیش برود.
برچسبها
علی رضوانی
معمار ارشد هوش مصنوعی ماهدرباره نویسنده
بیش از ۹ سال تجربه در معماری سامانههای جستوجوی معنایی، پایگاهدادههای برداری و استقرار مدلهای زبانی در زیرساختهای داخلی سازمانها.
مقالات نویسنده

