- عنوان کتاب: Reliable Evaluations for LLMs and AI Agents End-to-End Evaluation Frameworks for LLMs and Autonomous AI Agents
- نویسنده: Alexei Robsky
- حوزه: مدلهای زبانی بزرگ
- تعداد صفحه: 229
- زبان اصلی: انگلیسی
- نوع فایل: pdf
- حجم فایل: 3.62 مگابایت
در فوریه 2024، دادگاه حل اختلاف مدنی بریتیش کلمبیا حکم داد که ایر کانادا پس از آنکه چتبات وبسایتش اطلاعات نادرستی در مورد کرایههای سوگواری به مسافر داد، مسئول ارائه اطلاعات نادرست ناشی از سهلانگاری است و به این شرکت هواپیمایی دستور پرداخت غرامت داد (موفات علیه ایر کانادا 2024). این تصمیم و بررسیهای پس از آن نشان میدهد که وقتی هوش مصنوعی با مشتری مواجه میشود، پاسخهای اشتباه میتواند خطرات مالی، حقوقی و اعتمادی واقعی ایجاد کند. این اشتباهات فاحش، منحصر به فرد نیستند. در سال 2024، جمینی گوگل (که قبلاً بارد نام داشت) پس از تولید تصاویر “نادرست یا حتی توهینآمیز” مجبور شد به طور ناگهانی ویژگی تولید تصویر خود را متوقف کند. مدیران علناً خروجیها را “شرمآور و اشتباه” خواندند و عذرخواهی کردند (راگاوان 2024). مواردی مانند ایر کانادا و جمینی، در مجموع، درس یکسانی را آشکار میکنند: مهم نیست که یک مدل زبان بزرگ (LLM) در نسخههای نمایشی چقدر چشمگیر به نظر برسد، اگر تحت شرایط عملیاتی واقعی به طور دقیق ارزیابی و آزمایش نشود، میتواند یک محصول را از کار بیندازد یا اعتماد عمومی به آن را از بین ببرد. در شکل 1.1، منحنی ریسک استقرار هوش مصنوعی نشان میدهد که با حرکت سیستمها از آزمایش کنترلشده به استقرار در دنیای واقعی، ریسک به صورت تصاعدی افزایش مییابد. «آخرین مایل» به مشتریان جایی است که بیشترین شکستها رخ میدهد.
In February 2024, the British Columbia Civil Resolution Tribunal ruled that Air Canada was liable for negligent misrepresentation after its website chatbot gave a passenger false information about bereavement fares, and it ordered the airline to pay compensation (Moffatt v. Air Canada 2024). The decision, and the scrutiny that followed, shows that when AI touches customer facing _lows, wrong answers can create real financial, legal, and trust risks. These high-profile missteps are not isolated. In 2024, Google’s Gemini (previously Bard) had to abruptly pause its image generation feature after it produced “inaccurate or even offensive” images; executives publicly called the outputs “embarrassing and wrong” and apologized (Raghavan 2024). Together, cases like Air Canada and Gemini surface the same lesson: no matter how impressive a Large Language Model (LLM) appears in demos, if it is not rigorously evaluated and tested under real operating conditions, it can break a product, or shatter public trust in it. In Fig. 1.1, the AI deployment risk curve shows that risk increases exponentially as systems move from controlled testing to real-world deployment. The “last mile” to customers is where most failures occur.
این کتاب را میتوانید از لینک زیر بصورت رایگان دانلود کنید:





نظرات کاربران