- عنوان کتاب: AI Infrastructure -A Beginner-to-Advanced Field Guide
- نویسنده: aiinfrainterviews
- حوزه: زیرساخت هوش مصنوعی
- سال انتشار: 2026
- تعداد صفحه: 71
- زبان اصلی: انگلیسی
- نوع فایل: pdf
- حجم فایل: 3.66 مگابایت
یک نمای اولیه مفید دارای چهار لایه است. حجم کار میگوید چه اتفاقی باید بیفتد: تولید متن، طبقهبندی یک تصویر، ایجاد جاسازی یا بهروزرسانی پارامترهای مدل. نرمافزار اجرا، عملیات مدل را به هستهها ترجمه کرده و درخواستها را زمانبندی میکند. دستگاه، محاسبات، حافظه و ارتباطات را فراهم میکند. محیط عملیاتی، جایگذاری، برق، خنککننده، کنترل دسترسی، نظارت و بازیابی را فراهم میکند. آموزش، پارامترهای آموختهشده یک مدل را با استفاده از دادهها و یک رویه بهینهسازی تغییر میدهد. استنتاج، یک مدل از قبل آموزشدیده را به یک ورودی اعمال میکند. خدمترسانی، استنتاج را در یک سرویس قابل استفاده میپیچد: درخواستها را دریافت میکند، محدودیتها را بررسی میکند، مسیرها را طی میکند، آنها را دستهبندی میکند، نتایج را پخش میکند و اضافهبار را مدیریت میکند. یک موتور استنتاج همچنین میتواند بدون سرویس وب به صورت آفلاین اجرا شود. بنابراین حلقه آموزش و حلقه استنتاج در حالی که تقاضاهای مختلفی را بر روی آن قرار میدهند، سختافزار را به اشتراک میگذارند. یک CPU به خوبی کنترل انعطافپذیر را انجام میدهد: وظایف سیستم عامل، مدیریت درخواست، تجزیه، توکنسازی و هماهنگی. یک GPU منابع اجرایی زیادی را برای کارهای عددی موازی فراهم میکند. یک TPU یک شتابدهنده مخصوص برنامه است که توسط گوگل برای عملیات یادگیری ماشین طراحی شده است. این نقشها با هم همپوشانی دارند. CPUها میتوانند شبکههای عصبی را اجرا کنند و GPUها کارهای بسیار بیشتری از ضرب ماتریس انجام میدهند. یک شتابدهنده معمولاً به جای جایگزینی کل کامپیوتر، با یک میزبان کار میکند.
A useful first view has four layers. The workload says what must happen: generate text, classify an image, create an embedding, or update model parameters. The execution software translates model operations into kernels and schedules requests. The machine supplies compute, memory, and communication. The operating environment supplies placement, power, cooling, access control, monitoring, and recovery. Training changes a model’s learned parameters using data and an optimization procedure. Inference applies an already trained model to an input. Serving wraps inference in a usable service: it receives requests, checks limits, routes work, batches it, streams results, and handles overload. An inference engine can also run offline without a web service. The training loop and the inference loop therefore share hardware while placing different demands on it. A CPU handles flexible control work well: operating-system tasks, request handling, parsing, tokenization, and coordination. A GPU supplies many execution resources for parallel numerical work. A TPU is an application-specific accelerator designed by Google for machine-learning operations. These roles overlap; CPUs can run neural networks, and GPUs perform much more than matrix multiplication. An accelerator normally works with a host rather than replacing the whole computer.
این کتاب را میتوانید از لینک زیر بصورت رایگان دانلود کنید:
Download: AI Infrastructure





نظرات کاربران