0

دانلود کتاب هوش مصنوعی پس از آموزش، راهنمای عملی برای تنظیم دقیق و یادگیری تقویتی

  • عنوان کتاب: Post-Training AI -A Practical Guide to Fine-Tuning and Reinforcement Learning
  • نویسنده: Ben Burtenshaw
  • حوزه: یادگیری تقویتی
  • سال انتشار: 2026
  • تعداد صفحه: 50
  • زبان اصلی: انگلیسی
  • نوع فایل: pdf
  • حجم فایل: 0.9 مگابایت

پس‌آموزش، دومین مرحله آموزشی است که یک مدل زبان مدرن از آن عبور می‌کند. سه زیربخش زیر آن را از پیش‌آموزش جدا می‌کند، تکنیک‌هایی را که یک خط لوله پس‌آموزش معمولی را تشکیل می‌دهند، نام می‌برد و محدودیت‌های آنچه پس‌آموزش می‌تواند تغییر دهد را مشخص می‌کند. ساخت یک مدل زبان مدرن در دو مرحله اتفاق می‌افتد. پیش‌آموزش ابتدا انجام می‌شود. این مرحله تریلیون‌ها توکن متن (صفحات وب، کتاب‌ها، مخازن کد، مقالات علمی) را مصرف می‌کند و مدل را آموزش می‌دهد تا توکن بعدی را به ترتیب پیش‌بینی کند. این یک هدف بدون نظارت است. به مدل گفته نمی‌شود که خروجی خوب چگونه است. در عوض، به آن گفته می‌شود که کلمه بعدی در کل مجموعه داده چیست. نتیجه، مدلی است که ساختار آماری زبان را به همراه یک نمایش گسترده و پر سر و صدا از دانش جهان جذب کرده است. پیش‌آموزش گران است. آموزش یک مدل مرزی از ابتدا نیاز به هزاران پردازنده گرافیکی دارد که هفته‌ها یا ماه‌ها کار می‌کنند و مجموعه داده‌هایی که در ده‌ها ترابایت اندازه‌گیری می‌شوند. این سرمایه‌گذاری چیزی ارزشمند اما ناقص را می‌خرد: یک مدل پایه که می‌تواند هر دنباله متنی را به شیوه‌ای قابل قبول ادامه دهد، اما نمی‌تواند به دستورالعمل‌های کاربر پاسخ دهد. اگر یک سوال به مدل پایه بدهید، ممکن است به سوال پاسخ دهد، یا ممکن است پنج سوال دیگر ایجاد کند، یا ممکن است با چیزی که شبیه یک پاراگراف کتاب درسی است ادامه دهد. این متن را تکمیل می‌کند، نه به دستورالعمل‌های کاربر. پس‌آموزش مرحله دوم است. این مرحله مدل پایه را می‌گیرد و اجراهای آموزشی کوچک‌تر و هدفمندی را اعمال می‌کند که رفتار مدل را شکل می‌دهد. اگر پیش‌آموزش به مدل آموزش می‌دهد که زبان چگونه به نظر می‌رسد، پس‌آموزش به مدل آموزش می‌دهد که چگونه از آن دانش استفاده کند. داده‌های آموزشی کوچک‌تر هستند (هزاران تا میلیون‌ها مثال به جای تریلیون‌ها توکن)، اما برای تولید نتایج رفتاری خاص، سازماندهی، ساختار یافته و طراحی شده‌اند. این دو مرحله سیگنال‌های مختلفی را بهینه می‌کنند. پیش‌آموزش روی یک مجموعه گسترده، بازنمایی‌هایی را ایجاد می‌کند که بین وظایف منتقل می‌شوند. پس‌آموزش روی داده‌های سازماندهی شده، از آن بازنمایی‌ها برای تولید رفتار هدفمند استفاده می‌کند. آموزش یک مدل از ابتدا بر روی داده‌های دستورالعمل‌های گزینش‌شده، نتایج بدتری را به همراه دارد، زیرا مدل هرگز نمایش‌های گسترده‌ای را که آن را انعطاف‌پذیر می‌کنند، توسعه نمی‌دهد. صرف نظر کردن از آموزش پس از آموزش، مدلی تولید می‌کند که دانش دارد اما هیچ نظمی در نحوه استفاده از آن دانش ندارد.

Post-training is the second training phase a modern language model goes through. The three subsections below separate it from pre-training, name the techniques that make up a typical post-training pipeline, and mark the limits of what post-training can change. Building a modern language model happens in two phases. Pre-training comes first. It consumes trillions of tokens of text (web pages, books, code repositories, scientific papers) and trains the model to predict the next token in a sequence. This is an unsupervised objective. The model is not told what good output looks like. Instead, it is told what the next word is across the entire corpus. The result is a model that has absorbed the statistical structure of language, along with a broad and noisy representation of world knowledge. Pre-training is expensive. Training a frontier model from scratch requires thousands of GPUs running for weeks or months, and datasets measured in the tens of terabytes. The investment buys something valuable but incomplete: a base model that can continue any text sequence in a plausible way, but cannot respond to a user’s instructions. Prompt a base model with a question and it may answer the question, or it may generate five more questions, or it may continue with something that looks like a textbook paragraph. It is completing text, not responding to a user’s instructions. Post-training is the second phase. It takes the base model and applies smaller, targeted training runs that shape the model’s behavior. If pretraining teaches the model what language looks like, post-training teaches the model how to use that knowledge. The training data is smaller (thousands to millions of examples rather than trillions of tokens), but it is curated, structured, and designed to produce specific behavioral outcomes. The two phases optimize different signals. Pre-training on a broad corpus builds representations that transfer across tasks. Post-training on curated data uses those representations to produce targeted behavior. Training a model from scratch on curated instruction data produces worse results because the model never develops the broad representations that make it flexible. Skipping post-training produces a model that has knowledge but no discipline in how it uses that knowledge.

این کتاب را میتوانید از لینک زیر بصورت رایگان دانلود کنید:

Download: Post-Training AI

نظرات کاربران

  •  چنانچه دیدگاه شما توهین آمیز باشد تایید نخواهد شد.
  •  چنانچه دیدگاه شما جنبه تبلیغاتی داشته باشد تایید نخواهد شد.

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *

بیشتر بخوانید