0

دانلود کتاب ارزیابی‌های قابل‌اطمینان برای مدل‌های زبانی بزرگ (LLM) و عامل‌های هوش مصنوعی؛ چارچوب‌های ارزیابی سرتاسری برای مدل‌های زبانی بزرگ و عامل‌های هوش مصنوعی خودمختار.

  • عنوان کتاب: Reliable Evaluations for LLMs and AI Agents End-to-End Evaluation Frameworks for LLMs and Autonomous AI Agents
  • نویسنده: Alexei Robsky
  • حوزه: مدل‌های زبانی بزرگ
  • تعداد صفحه: 229
  • زبان اصلی: انگلیسی
  • نوع فایل: pdf
  • حجم فایل: 3.62 مگابایت

در فوریه 2024، دادگاه حل اختلاف مدنی بریتیش کلمبیا حکم داد که ایر کانادا پس از آنکه چت‌بات وب‌سایتش اطلاعات نادرستی در مورد کرایه‌های سوگواری به مسافر داد، مسئول ارائه اطلاعات نادرست ناشی از سهل‌انگاری است و به این شرکت هواپیمایی دستور پرداخت غرامت داد (موفات علیه ایر کانادا 2024). این تصمیم و بررسی‌های پس از آن نشان می‌دهد که وقتی هوش مصنوعی با مشتری مواجه می‌شود، پاسخ‌های اشتباه می‌تواند خطرات مالی، حقوقی و اعتمادی واقعی ایجاد کند. این اشتباهات فاحش، منحصر به فرد نیستند. در سال 2024، جمینی گوگل (که قبلاً بارد نام داشت) پس از تولید تصاویر “نادرست یا حتی توهین‌آمیز” مجبور شد به طور ناگهانی ویژگی تولید تصویر خود را متوقف کند. مدیران علناً خروجی‌ها را “شرم‌آور و اشتباه” خواندند و عذرخواهی کردند (راگاوان 2024). مواردی مانند ایر کانادا و جمینی، در مجموع، درس یکسانی را آشکار می‌کنند: مهم نیست که یک مدل زبان بزرگ (LLM) در نسخه‌های نمایشی چقدر چشمگیر به نظر برسد، اگر تحت شرایط عملیاتی واقعی به طور دقیق ارزیابی و آزمایش نشود، می‌تواند یک محصول را از کار بیندازد یا اعتماد عمومی به آن را از بین ببرد. در شکل 1.1، منحنی ریسک استقرار هوش مصنوعی نشان می‌دهد که با حرکت سیستم‌ها از آزمایش کنترل‌شده به استقرار در دنیای واقعی، ریسک به صورت تصاعدی افزایش می‌یابد. «آخرین مایل» به مشتریان جایی است که بیشترین شکست‌ها رخ می‌دهد.

In February 2024, the British Columbia Civil Resolution Tribunal ruled that Air Canada was liable for negligent misrepresentation after its website chatbot gave a passenger false information about bereavement fares, and it ordered the airline to pay compensation (Moffatt v. Air Canada 2024). The decision, and the scrutiny that followed, shows that when AI touches customer facing _lows, wrong answers can create real financial, legal, and trust risks. These high-profile missteps are not isolated. In 2024, Google’s Gemini (previously Bard) had to abruptly pause its image generation feature after it produced “inaccurate or even offensive” images; executives publicly called the outputs “embarrassing and wrong” and apologized (Raghavan 2024). Together, cases like Air Canada and Gemini surface the same lesson: no matter how impressive a Large Language Model (LLM) appears in demos, if it is not rigorously evaluated and tested under real operating conditions, it can break a product, or shatter public trust in it. In Fig. 1.1, the AI deployment risk curve shows that risk increases exponentially as systems move from controlled testing to real-world deployment. The “last mile” to customers is where most failures occur.

این کتاب را میتوانید از لینک زیر بصورت رایگان دانلود کنید:

Download: Reliable Evaluations for LLMs and AI Agents

نظرات کاربران

  •  چنانچه دیدگاه شما توهین آمیز باشد تایید نخواهد شد.
  •  چنانچه دیدگاه شما جنبه تبلیغاتی داشته باشد تایید نخواهد شد.

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *

بیشتر بخوانید