- عنوان کتاب: Post-Training AI -A Practical Guide to Fine-Tuning and Reinforcement Learning
- نویسنده: Ben Burtenshaw
- حوزه: یادگیری تقویتی
- سال انتشار: 2026
- تعداد صفحه: 50
- زبان اصلی: انگلیسی
- نوع فایل: pdf
- حجم فایل: 0.9 مگابایت
پسآموزش، دومین مرحله آموزشی است که یک مدل زبان مدرن از آن عبور میکند. سه زیربخش زیر آن را از پیشآموزش جدا میکند، تکنیکهایی را که یک خط لوله پسآموزش معمولی را تشکیل میدهند، نام میبرد و محدودیتهای آنچه پسآموزش میتواند تغییر دهد را مشخص میکند. ساخت یک مدل زبان مدرن در دو مرحله اتفاق میافتد. پیشآموزش ابتدا انجام میشود. این مرحله تریلیونها توکن متن (صفحات وب، کتابها، مخازن کد، مقالات علمی) را مصرف میکند و مدل را آموزش میدهد تا توکن بعدی را به ترتیب پیشبینی کند. این یک هدف بدون نظارت است. به مدل گفته نمیشود که خروجی خوب چگونه است. در عوض، به آن گفته میشود که کلمه بعدی در کل مجموعه داده چیست. نتیجه، مدلی است که ساختار آماری زبان را به همراه یک نمایش گسترده و پر سر و صدا از دانش جهان جذب کرده است. پیشآموزش گران است. آموزش یک مدل مرزی از ابتدا نیاز به هزاران پردازنده گرافیکی دارد که هفتهها یا ماهها کار میکنند و مجموعه دادههایی که در دهها ترابایت اندازهگیری میشوند. این سرمایهگذاری چیزی ارزشمند اما ناقص را میخرد: یک مدل پایه که میتواند هر دنباله متنی را به شیوهای قابل قبول ادامه دهد، اما نمیتواند به دستورالعملهای کاربر پاسخ دهد. اگر یک سوال به مدل پایه بدهید، ممکن است به سوال پاسخ دهد، یا ممکن است پنج سوال دیگر ایجاد کند، یا ممکن است با چیزی که شبیه یک پاراگراف کتاب درسی است ادامه دهد. این متن را تکمیل میکند، نه به دستورالعملهای کاربر. پسآموزش مرحله دوم است. این مرحله مدل پایه را میگیرد و اجراهای آموزشی کوچکتر و هدفمندی را اعمال میکند که رفتار مدل را شکل میدهد. اگر پیشآموزش به مدل آموزش میدهد که زبان چگونه به نظر میرسد، پسآموزش به مدل آموزش میدهد که چگونه از آن دانش استفاده کند. دادههای آموزشی کوچکتر هستند (هزاران تا میلیونها مثال به جای تریلیونها توکن)، اما برای تولید نتایج رفتاری خاص، سازماندهی، ساختار یافته و طراحی شدهاند. این دو مرحله سیگنالهای مختلفی را بهینه میکنند. پیشآموزش روی یک مجموعه گسترده، بازنماییهایی را ایجاد میکند که بین وظایف منتقل میشوند. پسآموزش روی دادههای سازماندهی شده، از آن بازنماییها برای تولید رفتار هدفمند استفاده میکند. آموزش یک مدل از ابتدا بر روی دادههای دستورالعملهای گزینششده، نتایج بدتری را به همراه دارد، زیرا مدل هرگز نمایشهای گستردهای را که آن را انعطافپذیر میکنند، توسعه نمیدهد. صرف نظر کردن از آموزش پس از آموزش، مدلی تولید میکند که دانش دارد اما هیچ نظمی در نحوه استفاده از آن دانش ندارد.
Post-training is the second training phase a modern language model goes through. The three subsections below separate it from pre-training, name the techniques that make up a typical post-training pipeline, and mark the limits of what post-training can change. Building a modern language model happens in two phases. Pre-training comes first. It consumes trillions of tokens of text (web pages, books, code repositories, scientific papers) and trains the model to predict the next token in a sequence. This is an unsupervised objective. The model is not told what good output looks like. Instead, it is told what the next word is across the entire corpus. The result is a model that has absorbed the statistical structure of language, along with a broad and noisy representation of world knowledge. Pre-training is expensive. Training a frontier model from scratch requires thousands of GPUs running for weeks or months, and datasets measured in the tens of terabytes. The investment buys something valuable but incomplete: a base model that can continue any text sequence in a plausible way, but cannot respond to a user’s instructions. Prompt a base model with a question and it may answer the question, or it may generate five more questions, or it may continue with something that looks like a textbook paragraph. It is completing text, not responding to a user’s instructions. Post-training is the second phase. It takes the base model and applies smaller, targeted training runs that shape the model’s behavior. If pretraining teaches the model what language looks like, post-training teaches the model how to use that knowledge. The training data is smaller (thousands to millions of examples rather than trillions of tokens), but it is curated, structured, and designed to produce specific behavioral outcomes. The two phases optimize different signals. Pre-training on a broad corpus builds representations that transfer across tasks. Post-training on curated data uses those representations to produce targeted behavior. Training a model from scratch on curated instruction data produces worse results because the model never develops the broad representations that make it flexible. Skipping post-training produces a model that has knowledge but no discipline in how it uses that knowledge.
این کتاب را میتوانید از لینک زیر بصورت رایگان دانلود کنید:
Download: Post-Training AI





نظرات کاربران