- عنوان کتاب: Quantization and Fast Inference
- نویسنده: Vivek Kalyanarangan
- حوزه: کوانتیزاسیون
- سال انتشار: 2026
- تعداد صفحه: 335
- زبان اصلی: انگلیسی
- نوع فایل: pdf
- حجم فایل: 8.76 مگابایت
کوانتیزاسیون به یکی از تکنیکهای تحمل بار هوش مصنوعی مدرن تبدیل شده است. ارائه یک مدل با پارامتر ۷۰B در FP16 کاری پرهزینه است؛ همان مدل در حالت ۴ بیتی میتواند روی یک پردازنده گرافیکی مصرفکننده واحد جا شود و به اندازه کافی سریع اجرا شود تا مکالمهای را انجام دهد. شکاف بین «این مدل جالب است» و «این مدل قابل استقرار است» اغلب یک مشکل کوانتیزاسیون است. و با این حال، بیشتر مطالب مربوط به این موضوع در مقالات arXiv، آموزشهای خاص چارچوب و پستهای وبلاگ پراکنده شدهاند که ریاضیات و اشکالات عددی را که در واقع در تولید به شما آسیب میزنند، به صورت دستی ارائه میدهند. من این کتاب را نوشتم تا این شکاف را پر کنم. هر تکنیکی که در این صفحات وجود دارد، مبتنی بر اندازهگیریهای واقعی از مدلهای واقعی است که روی سختافزار واقعی اجرا میشوند – مدلهایی که شما و من هر دو در محل کار استفاده میکنیم، نه تانسورهای اسباببازی. وقتی یک عدد گیجکننده، یک رقم توان عملیاتی یا یک خرابی حافظه را میبینید، از یک اسکریپت همراه بیرون میآید که میتوانید خودتان آن را اجرا و اصلاح کنید. مخزن گیتهاب که همراه کتاب است، جایی است که نثر با سیلیکون تلاقی میکند: اگر چیزی در متن شما را به شک میاندازد، میتوانید آزمایش را دوباره اجرا و بررسی کنید. من فکر میکنم این تنها راه صادقانه برای نوشتن در مورد کوانتیزاسیون است، زیرا این حوزه پر از ادعاهایی است که درست به نظر میرسند و به محض اینکه آنها را توصیف میکنید، از هم میپاشند. این کتاب از پایهها – حساب نقطه ثابت، نگاشتهای آفین، انتخابهایی که نحوه نگاشت توزیع وزن پیوسته را بر روی یک شبکه گسسته کنترل میکنند – از طریق جعبه ابزار استاندارد کوانتیزاسیون پس از آموزش و آموزش آگاه از کوانتیزاسیون، و به تکنیکهایی که دوران مدل زبان بزرگ را تعریف میکنند، ساخته شده است. شما با فرمتهایی که در عمل مهم هستند (INT8، FP8، FP4، NF4، سهتایی)، دستورالعملهای کالیبراسیون و تنظیم دقیق که باعث میشوند آنها کار کنند، مسیرهای خروجی بین چارچوبی که یک مدل کوانتیزه را از تحقیق خارج کرده و به زمان اجرا میآورند، و پشتههای استقرار که در واقع افزایش سرعتها در آنها محقق میشود، کار خواهید کرد. در طول مسیر، با مواردی روبرو خواهیم شد که شهود ما را گمراه میکند: چرا کوانتیزاسیون متقارن و نامتقارن برای فعالسازیها رفتار متفاوتی دارند، چرا برخی از قالبهای «سریعتر» در عمل کندتر هستند، و چرا یک مدل میتواند از هر بررسی عددی عبور کند و همچنان در وظایف بعدی دچار پسرفت شود.
Quantization has become one of the load-bearing techniques of modern AI. A 70B-parameter model in FP16 is an expensive thing to serve; the same model in 4-bit can fit on a single consumer GPU and run fast enough to hold a conversation. The gap between “this model is interesting” and “this model is deployable” is, more often than not, a quantization problem. And yet most of the material on the subject is scattered across arXiv papers, framework specific tutorials, and blog posts that hand-wave the math and the numerical gotchas that actually bite you in production. I wrote this book to fill that gap. Every technique in these pages is grounded in real measurements from real models running on real hardware — models you and I both use at work, not toy tensors. When you see a perplexity number, a throughput figure, or a memory breakdown, it comes out of a companion script that you can run and modify yourself. The Github repository that accompanies the book is where the prose meets the silicon: if something in the text makes you skeptical, you can re-run the experiment and check. I think this is the only honest way to write about quantization, because the field is full of claims that sound right and fall apart the moment you profile them. The book builds up from the foundations — fixed-point arithmetic, affine mappings, the choices that govern how you map a continuous weight distribution onto a discrete grid — through the standard toolkit of posttraining quantization and quantization-aware training, and into the techniques that define the large language model era. You’ll work through the formats that matter in practice (INT8, FP8, FP4, NF4, ternary), the calibration and finetuning recipes that make them work, the cross-framework export paths that get a quantized model out of research and into a runtime, and the deployment stacks where the speedups are actually realized. Along the way we’ll confront the places where intuition misleads: why symmetric and asymmetric quantization behave differently for activations, why some “faster” formats are slower in practice, and why a model can pass every numerical check and still regress on downstream tasks.
این کتاب را میتوانید از لینک زیر بصورت رایگان دانلود کنید:
Download: Quantization and Fast Inference





نظرات کاربران