0

دانلود کتاب بیگ‌کوئری (BigQuery) برای مهندسی داده – استاد شدن در بیگ‌کوئری، مدل‌سازی داده، dbt، جریان داده، آپاچی بیم، تحلیل جریانی، بیگ‌کوئری ام‌ال و مهندسی داده عملیاتی

  • عنوان کتاب: Ultimate BigQuery for Data Engineering -Master BigQuery, Data Modeling, dbt, Dataflow, Apache Beam, Streaming Analytics, BigQuery ML, and Production Data Engineering
  • نویسنده: Dinak Lal
  • حوزه: مهندسی داده
  • سال انتشار: 2026
  • تعداد صفحه: 560
  • زبان اصلی: انگلیسی
  • نوع فایل: pdf
  • حجم فایل: 10.8 مگابایت

مهندسی داده مدرن دیگر فقط نوشتن SQL نیست – بلکه ساخت سیستم‌هایی است که داده‌ها را به طور قابل اعتماد در مقیاس بزرگ دریافت، تبدیل و ارائه می‌دهند. این کتاب BigQuery و ابزارهای اطراف آن را در Google Cloud پوشش می‌دهد. BigQuery تجزیه و تحلیل را انجام می‌دهد، اما استفاده موثر از آن در تولید به معنای درک کل اکوسیستم است – dbt برای تبدیل‌ها، Apache Beam و Dataflow برای پردازش دسته‌ای و جریانی، Cloud Composer برای ارکستراسیون و Pub/Sub برای پیام‌رسانی در زمان واقعی. اکثر متخصصان بخش‌هایی از این پشته را می‌شناسند. تعداد کمی از آنها نحوه کار آنها با هم را درک می‌کنند. این شکافی است که این کتاب پر می‌کند. هر فصل شامل کد قابل اجرا، اعداد عملکرد واقعی و الگوهای تولید است – نه نسخه‌های نمایشی ساده شده. شما با مجموعه داده‌های تجارت الکترونیک کار خواهید کرد، هزینه‌های واقعی پرس و جو و بایت‌های اسکن شده را مشاهده خواهید کرد و خطوط لوله کاملی را ایجاد خواهید کرد که می‌توانید با پروژه‌های خود تطبیق دهید. این کتاب دانش پایه SQL و دسترسی به یک حساب Google Cloud را فرض می‌کند. مقداری پایتون برای فصل‌های Beam و Spark کمک می‌کند اما برای بیشتر کتاب لازم نیست. این کتاب به 15 فصل تقسیم شده است. فصل‌های ۱ و ۲ مبانی را پوشش می‌دهند – مهندسی داده امروزی چگونه است، جایگاه BigQuery کجاست و چگونه به صورت داخلی کار می‌کند. درک اسلات‌ها، ذخیره‌سازی ستونی و موتور اجرا، نحوه‌ی رویکرد شما به هر چیزی که در ادامه می‌آید را تغییر خواهد داد. فصل ۳ به بررسی نحوه‌ی ورود داده‌ها به BigQuery می‌پردازد – آپلود کنسول، بارگذاری فضای ذخیره‌سازی ابری، فرمت‌های فایل، سرویس انتقال داده و دریافت جریان با Pub/Sub. فصل‌های ۴ و ۵ بر مدل‌سازی و بهینه‌سازی تمرکز دارند. شما رویکردهای تودرتو، طرحواره ستاره‌ای و غیرنرمال‌شده را با داده‌های عملکرد واقعی مقایسه خواهید کرد و سپس خواهید دید که چگونه پارتیشن‌بندی و خوشه‌بندی می‌تواند هزینه‌های اسکن را به طور چشمگیری کاهش دهد. فصل ۶ به مهندسی هزینه می‌پردازد – استفاده از INFORMATION_SCHEMA برای یافتن پرس‌وجوهای گران‌قیمت، انتخاب بین مدل‌های قیمت‌گذاری و استفاده از نماهای مادی‌شده و موتور BI. فصل ۷ dbt را معرفی می‌کند. اینجاست که کتاب از پرس‌وجوهای تکی به ساخت خطوط لوله تبدیل ماژولار، آزمایش‌شده و مستند تغییر می‌کند. این آزمایشگاه یک سیستم ELT کامل با لایه‌های مرحله‌بندی، میانی و هوشمند می‌سازد. فصل‌های ۸ و ۹ Apache Beam را با Dataflow و Spark را با BigQuery پوشش می‌دهند. شما می‌توانید خطوط لوله دسته‌ای و جریانی بسازید و یاد بگیرید که هر ابزار چه زمانی انتخاب مناسبی است. فصل 10، هماهنگی با Cloud Composer را ارائه می‌دهد – هماهنگی BigQuery، Dataflow و dbt در گردش‌های کاری خودکار با منطق تلاش مجدد و مدیریت شکست. فصل 11 به امنیت، حاکمیت و کیفیت داده‌ها می‌پردازد – از IAM و امنیت سطح ردیف گرفته تا ادعاهای کیفیت داده در SQL. فصل 12 نحوه آموزش مدل‌های ML با استفاده از SQL در BigQuery و استقرار آنها در Vertex AI برای ارائه خدمات در زمان واقعی را نشان می‌دهد. فصل 13 یک خط لوله جریان تولید را از ابتدا تا انتها می‌سازد – Pub/Sub، پنجره‌سازی Beam، مدیریت داده‌های دیرهنگام و داشبوردهای زنده BigQuery. فصل 14 پروژه نهایی است. شما قادر خواهید بود یک انبار سازمانی کامل با مدل‌های افزایشی، تست خودکار و استقرار CI/CD با استفاده از GitHub Actions بسازید. فصل 15 به مسیری که مهندسی داده به آن می‌رود می‌پردازد – معماری‌های جریان-اول، Data Mesh و پلتفرم‌های بومی هوش مصنوعی. بنابراین، در پایان کتاب، شما تمام مهارت‌های لازم برای ساخت پلتفرم‌های داده تولیدی در Google Cloud را خواهید داشت – نه فقط درک آنها.

Modern data engineering is not just writing SQL anymore — it is building systems that ingest, transform, and serve data reliably at scale. This book covers BigQuery and the tools around it on Google Cloud. BigQuery handles the analytics, but using it effectively in production means understanding the full ecosystem — dbt for transformations, Apache Beam and Dataflow for batch and stream processing, Cloud Composer for orchestration, and Pub/Sub for real-time messaging. Most professionals know pieces of this stack. Few understand how they work together. That is the gap this book fills. Every chapter includes runnable code, real performance numbers, and production patterns — not simplified demos. You will work with ecommerce datasets, see actual query costs and bytes scanned, and build complete pipelines you can adapt to your own projects. The book assumes basic SQL knowledge and access to a Google Cloud account. Some Python helps for the Beam and Spark chapters but is not required for most of the book. This book is divided into 15 chapters. Chapters 1 and 2 cover the foundations — what data engineering looks like today, where BigQuery fits, and how it works internally. Understanding slots, columnar storage, and the execution engine will change how you approach everything that follows. Chapter 3 walks through getting data into BigQuery — console uploads, Cloud Storage loads, file formats, Data Transfer Service, and streaming ingestion with Pub/Sub. Chapters 4 and 5 focus on modeling and optimization. You will compare nested, star schema, and denormalized approaches with actual performance data, and then see how partitioning and clustering can reduce scan costs dramatically. Chapter 6 digs into cost engineering — using INFORMATION_SCHEMA to find expensive queries, choosing between pricing models, and leveraging materialized views and BI Engine. Chapter 7 introduces dbt. This is where the book shifts from individual queries to building modular, tested, documented transformation pipelines. The lab builds a complete ELT system with staging, intermediate, and smart layers. Chapters 8 and 9 cover Apache Beam with Dataflow and Spark with BigQuery. You can build batch and streaming pipelines, and learn when each tool is the right choice. Chapter 10 brings orchestration with Cloud Composer — coordinating BigQuery, Dataflow, and dbt into automated workflows with retry logic and failure handling. Chapter 11 tackles security, governance, and data quality — from IAM and row-level security to data quality assertions in SQL. Chapter 12 shows how to train ML models using SQL in BigQuery, and deploy them to Vertex AI for real-time serving. Chapter 13 builds a production streaming pipeline end to end — Pub/Sub, Beam windowing, late data handling, and live BigQuery dashboards. Chapter 14 is the capstone project. You will be able to build a complete enterprise warehouse with incremental models, automated testing, and CI/CD deployment using GitHub Actions. Chapter 15 looks at where data engineering is heading — streaming-first architectures, Data Mesh, and AI-native platforms. Thus, by the end of the book, you will have all the skills to build production data platforms on Google Cloud — not just understand them.

این کتاب را میتوانید از لینک زیر بصورت رایگان دانلود کنید:

Download: Ultimate BigQuery for Data Engineering

نظرات کاربران

  •  چنانچه دیدگاه شما توهین آمیز باشد تایید نخواهد شد.
  •  چنانچه دیدگاه شما جنبه تبلیغاتی داشته باشد تایید نخواهد شد.

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *

بیشتر بخوانید