0

دانلود کتاب کوانتیزاسیون و استنتاج سریع

  • عنوان کتاب: Quantization and Fast Inference
  • نویسنده: Vivek Kalyanarangan
  • حوزه: کوانتیزاسیون
  • سال انتشار: 2026
  • تعداد صفحه: 335
  • زبان اصلی: انگلیسی
  • نوع فایل: pdf
  • حجم فایل: 8.76 مگابایت

کوانتیزاسیون به یکی از تکنیک‌های تحمل بار هوش مصنوعی مدرن تبدیل شده است. ارائه یک مدل با پارامتر ۷۰B در FP16 کاری پرهزینه است؛ همان مدل در حالت ۴ بیتی می‌تواند روی یک پردازنده گرافیکی مصرف‌کننده واحد جا شود و به اندازه کافی سریع اجرا شود تا مکالمه‌ای را انجام دهد. شکاف بین «این مدل جالب است» و «این مدل قابل استقرار است» اغلب یک مشکل کوانتیزاسیون است. و با این حال، بیشتر مطالب مربوط به این موضوع در مقالات arXiv، آموزش‌های خاص چارچوب و پست‌های وبلاگ پراکنده شده‌اند که ریاضیات و اشکالات عددی را که در واقع در تولید به شما آسیب می‌زنند، به صورت دستی ارائه می‌دهند. من این کتاب را نوشتم تا این شکاف را پر کنم. هر تکنیکی که در این صفحات وجود دارد، مبتنی بر اندازه‌گیری‌های واقعی از مدل‌های واقعی است که روی سخت‌افزار واقعی اجرا می‌شوند – مدل‌هایی که شما و من هر دو در محل کار استفاده می‌کنیم، نه تانسورهای اسباب‌بازی. وقتی یک عدد گیج‌کننده، یک رقم توان عملیاتی یا یک خرابی حافظه را می‌بینید، از یک اسکریپت همراه بیرون می‌آید که می‌توانید خودتان آن را اجرا و اصلاح کنید. مخزن گیت‌هاب که همراه کتاب است، جایی است که نثر با سیلیکون تلاقی می‌کند: اگر چیزی در متن شما را به شک می‌اندازد، می‌توانید آزمایش را دوباره اجرا و بررسی کنید. من فکر می‌کنم این تنها راه صادقانه برای نوشتن در مورد کوانتیزاسیون است، زیرا این حوزه پر از ادعاهایی است که درست به نظر می‌رسند و به محض اینکه آنها را توصیف می‌کنید، از هم می‌پاشند. این کتاب از پایه‌ها – حساب نقطه ثابت، نگاشت‌های آفین، انتخاب‌هایی که نحوه نگاشت توزیع وزن پیوسته را بر روی یک شبکه گسسته کنترل می‌کنند – از طریق جعبه ابزار استاندارد کوانتیزاسیون پس از آموزش و آموزش آگاه از کوانتیزاسیون، و به تکنیک‌هایی که دوران مدل زبان بزرگ را تعریف می‌کنند، ساخته شده است. شما با فرمت‌هایی که در عمل مهم هستند (INT8، FP8، FP4، NF4، سه‌تایی)، دستورالعمل‌های کالیبراسیون و تنظیم دقیق که باعث می‌شوند آنها کار کنند، مسیرهای خروجی بین چارچوبی که یک مدل کوانتیزه را از تحقیق خارج کرده و به زمان اجرا می‌آورند، و پشته‌های استقرار که در واقع افزایش سرعت‌ها در آنها محقق می‌شود، کار خواهید کرد. در طول مسیر، با مواردی روبرو خواهیم شد که شهود ما را گمراه می‌کند: چرا کوانتیزاسیون متقارن و نامتقارن برای فعال‌سازی‌ها رفتار متفاوتی دارند، چرا برخی از قالب‌های «سریع‌تر» در عمل کندتر هستند، و چرا یک مدل می‌تواند از هر بررسی عددی عبور کند و همچنان در وظایف بعدی دچار پسرفت شود.

Quantization has become one of the load-bearing techniques of modern AI. A 70B-parameter model in FP16 is an expensive thing to serve; the same model in 4-bit can fit on a single consumer GPU and run fast enough to hold a conversation. The gap between “this model is interesting” and “this model is deployable” is, more often than not, a quantization problem. And yet most of the material on the subject is scattered across arXiv papers, framework specific tutorials, and blog posts that hand-wave the math and the numerical gotchas that actually bite you in production. I wrote this book to fill that gap. Every technique in these pages is grounded in real measurements from real models running on real hardware — models you and I both use at work, not toy tensors. When you see a perplexity number, a throughput figure, or a memory breakdown, it comes out of a companion script that you can run and modify yourself. The Github repository that accompanies the book is where the prose meets the silicon: if something in the text makes you skeptical, you can re-run the experiment and check. I think this is the only honest way to write about quantization, because the field is full of claims that sound right and fall apart the moment you profile them. The book builds up from the foundations — fixed-point arithmetic, affine mappings, the choices that govern how you map a continuous weight distribution onto a discrete grid — through the standard toolkit of posttraining quantization and quantization-aware training, and into the techniques that define the large language model era. You’ll work through the formats that matter in practice (INT8, FP8, FP4, NF4, ternary), the calibration and finetuning recipes that make them work, the cross-framework export paths that get a quantized model out of research and into a runtime, and the deployment stacks where the speedups are actually realized. Along the way we’ll confront the places where intuition misleads: why symmetric and asymmetric quantization behave differently for activations, why some “faster” formats are slower in practice, and why a model can pass every numerical check and still regress on downstream tasks.

این کتاب را میتوانید از لینک زیر بصورت رایگان دانلود کنید:

Download: Quantization and Fast Inference

نظرات کاربران

  •  چنانچه دیدگاه شما توهین آمیز باشد تایید نخواهد شد.
  •  چنانچه دیدگاه شما جنبه تبلیغاتی داشته باشد تایید نخواهد شد.

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *

بیشتر بخوانید