0

دانلود کتاب ارزیابی مدل‌های زبانی بزرگ (LLM) در مقیاس وسیع: آزمون، تشخیص رگرسیون و سنجش کیفیت برای سیستم‌های هوش مصنوعی مولد

  • عنوان کتاب: LLM Evaluation at Scale Testing, Regression Detection, and Quality Measurement for Generative AI Systems
  • نویسنده: Patodiya, Aditi
  • حوزه: مدلهای زبانی بزرگ
  • سال انتشار: 2026
  • تعداد صفحه: 236
  • زبان اصلی: انگلیسی
  • نوع فایل: pdf
  • حجم فایل: 3.86 مگابایت

داشبوردها سبز بودند. همه آنها. تأخیر در محدوده بودجه بود، نرخ خطا ثابت بود، خط لوله استقرار بدون حتی یک بررسی ناموفق طی شده بود و مهندس آماده به کار قبلاً به رختخواب رفته بود. کمی از ساعت دو بامداد گذشته بود و با هر معیاری که سازمان مهندسی موافقت کرده بود به آن اهمیت دهد، انتشار موفقیت‌آمیز بود. چهار روز بعد، یک مدیر محصول یک اسکرین‌شات ارسال کرد. مشتری از دستیار خواسته بود که سه محصول را با هم مقایسه کند. دستیار آنها را به طور مرتب فهرست کرده بود. سپس مشتری یک پیگیری کوتاه، شش کلمه‌ای، تایپ کرده بود و در مورد محصول دوم سوال کرده بود. دستیار در مورد سوال اول پاسخ داد. مشتری آن را اصلاح کرد. دستیار عذرخواهی کرد و در مورد سوال سوم پاسخ داد. اسکرین‌شات در آنجا تمام شد، زیرا در آنجا مشتری مکالمه را تمام کرده بود و به احتمال زیاد، صبر خود را با محصول از دست داده بود. هیچ چیز در نظارت ما فعال نشده بود. هیچ استثنایی ایجاد نشده بود. هیچ وقفه‌ای رخ نداده بود. سرویس در کمتر از یک ثانیه پاسخی خوش‌فرم با کد وضعیت HTTP صحیح و یک payload که اعتبارسنجی طرحواره را پشت سر گذاشته بود، برگرداند. هر آزمایشی که نوشته بودیم هنوز در حال گذراندن بود. سیستم، به معنای دقیق مهندسی کلمه، کار می‌کرد. آن اسکرین‌شات بیشتر از هر قطعی که تا به حال برایم اتفاق افتاده، با من مانده است. قطعی‌ها صادقانه هستند. خودشان به شما می‌گویند که اتفاق افتاده‌اند. این نوع خرابی خودش را نشان نمی‌دهد. بی‌سروصدا در یک سیستم به ظاهر سالم قرار می‌گیرد و محصول را یکی یکی خراب می‌کند و تا زمانی که دستگاه‌های شما چیزی در مورد آن نگویند، این کار را ادامه خواهد داد.

The dashboards were green. All of them. Latency was inside budget, error rates were flat, the deployment pipeline had gone through without a single failed check, and the on-call engineer had already gone to bed. It was a little after two in the morning, and by every measure the engineering organization had agreed to care about, the release was a success. Four days later, a product manager forwarded a screenshot. A customer had asked the assistant to compare three products. The assistant had listed them cleanly. The customer had then typed a short follow-up, six words, asking about the second one. The assistant answered about the first. The customer corrected it. The assistant apologized and answered about the third. The screenshot ended there, because that is where the customer had ended the conversation and, most likely, ended their patience with the product. Nothing in our monitoring had fired. No exception was thrown. No timeout occurred. The service returned a well-formed response in under a second, with a correct HTTP status code and a payload that passed schema validation. Every test we had written was still passing. The system was, in the precise engineering sense of the word, working. That screenshot has stayed with me longer than any outage I have been paged for. Outages are honest. They tell you they happened. This kind of failure does not announce itself. It sits quietly inside a healthy-looking system, degrading the product one conversation at a time, and it will keep doing so for as long as your instruments have nothing to say about it.

این کتاب را میتوانید از لینک زیر بصورت رایگان دانلود کنید:

Download: LLM Evaluation at Scale Testing

نظرات کاربران

  •  چنانچه دیدگاه شما توهین آمیز باشد تایید نخواهد شد.
  •  چنانچه دیدگاه شما جنبه تبلیغاتی داشته باشد تایید نخواهد شد.

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *

بیشتر بخوانید