- عنوان کتاب: Ultimate BigQuery for Data Engineering -Master BigQuery, Data Modeling, dbt, Dataflow, Apache Beam, Streaming Analytics, BigQuery ML, and Production Data Engineering
- نویسنده: Dinak Lal
- حوزه: مهندسی داده
- سال انتشار: 2026
- تعداد صفحه: 560
- زبان اصلی: انگلیسی
- نوع فایل: pdf
- حجم فایل: 10.8 مگابایت
مهندسی داده مدرن دیگر فقط نوشتن SQL نیست – بلکه ساخت سیستمهایی است که دادهها را به طور قابل اعتماد در مقیاس بزرگ دریافت، تبدیل و ارائه میدهند. این کتاب BigQuery و ابزارهای اطراف آن را در Google Cloud پوشش میدهد. BigQuery تجزیه و تحلیل را انجام میدهد، اما استفاده موثر از آن در تولید به معنای درک کل اکوسیستم است – dbt برای تبدیلها، Apache Beam و Dataflow برای پردازش دستهای و جریانی، Cloud Composer برای ارکستراسیون و Pub/Sub برای پیامرسانی در زمان واقعی. اکثر متخصصان بخشهایی از این پشته را میشناسند. تعداد کمی از آنها نحوه کار آنها با هم را درک میکنند. این شکافی است که این کتاب پر میکند. هر فصل شامل کد قابل اجرا، اعداد عملکرد واقعی و الگوهای تولید است – نه نسخههای نمایشی ساده شده. شما با مجموعه دادههای تجارت الکترونیک کار خواهید کرد، هزینههای واقعی پرس و جو و بایتهای اسکن شده را مشاهده خواهید کرد و خطوط لوله کاملی را ایجاد خواهید کرد که میتوانید با پروژههای خود تطبیق دهید. این کتاب دانش پایه SQL و دسترسی به یک حساب Google Cloud را فرض میکند. مقداری پایتون برای فصلهای Beam و Spark کمک میکند اما برای بیشتر کتاب لازم نیست. این کتاب به 15 فصل تقسیم شده است. فصلهای ۱ و ۲ مبانی را پوشش میدهند – مهندسی داده امروزی چگونه است، جایگاه BigQuery کجاست و چگونه به صورت داخلی کار میکند. درک اسلاتها، ذخیرهسازی ستونی و موتور اجرا، نحوهی رویکرد شما به هر چیزی که در ادامه میآید را تغییر خواهد داد. فصل ۳ به بررسی نحوهی ورود دادهها به BigQuery میپردازد – آپلود کنسول، بارگذاری فضای ذخیرهسازی ابری، فرمتهای فایل، سرویس انتقال داده و دریافت جریان با Pub/Sub. فصلهای ۴ و ۵ بر مدلسازی و بهینهسازی تمرکز دارند. شما رویکردهای تودرتو، طرحواره ستارهای و غیرنرمالشده را با دادههای عملکرد واقعی مقایسه خواهید کرد و سپس خواهید دید که چگونه پارتیشنبندی و خوشهبندی میتواند هزینههای اسکن را به طور چشمگیری کاهش دهد. فصل ۶ به مهندسی هزینه میپردازد – استفاده از INFORMATION_SCHEMA برای یافتن پرسوجوهای گرانقیمت، انتخاب بین مدلهای قیمتگذاری و استفاده از نماهای مادیشده و موتور BI. فصل ۷ dbt را معرفی میکند. اینجاست که کتاب از پرسوجوهای تکی به ساخت خطوط لوله تبدیل ماژولار، آزمایششده و مستند تغییر میکند. این آزمایشگاه یک سیستم ELT کامل با لایههای مرحلهبندی، میانی و هوشمند میسازد. فصلهای ۸ و ۹ Apache Beam را با Dataflow و Spark را با BigQuery پوشش میدهند. شما میتوانید خطوط لوله دستهای و جریانی بسازید و یاد بگیرید که هر ابزار چه زمانی انتخاب مناسبی است. فصل 10، هماهنگی با Cloud Composer را ارائه میدهد – هماهنگی BigQuery، Dataflow و dbt در گردشهای کاری خودکار با منطق تلاش مجدد و مدیریت شکست. فصل 11 به امنیت، حاکمیت و کیفیت دادهها میپردازد – از IAM و امنیت سطح ردیف گرفته تا ادعاهای کیفیت داده در SQL. فصل 12 نحوه آموزش مدلهای ML با استفاده از SQL در BigQuery و استقرار آنها در Vertex AI برای ارائه خدمات در زمان واقعی را نشان میدهد. فصل 13 یک خط لوله جریان تولید را از ابتدا تا انتها میسازد – Pub/Sub، پنجرهسازی Beam، مدیریت دادههای دیرهنگام و داشبوردهای زنده BigQuery. فصل 14 پروژه نهایی است. شما قادر خواهید بود یک انبار سازمانی کامل با مدلهای افزایشی، تست خودکار و استقرار CI/CD با استفاده از GitHub Actions بسازید. فصل 15 به مسیری که مهندسی داده به آن میرود میپردازد – معماریهای جریان-اول، Data Mesh و پلتفرمهای بومی هوش مصنوعی. بنابراین، در پایان کتاب، شما تمام مهارتهای لازم برای ساخت پلتفرمهای داده تولیدی در Google Cloud را خواهید داشت – نه فقط درک آنها.
Modern data engineering is not just writing SQL anymore — it is building systems that ingest, transform, and serve data reliably at scale. This book covers BigQuery and the tools around it on Google Cloud. BigQuery handles the analytics, but using it effectively in production means understanding the full ecosystem — dbt for transformations, Apache Beam and Dataflow for batch and stream processing, Cloud Composer for orchestration, and Pub/Sub for real-time messaging. Most professionals know pieces of this stack. Few understand how they work together. That is the gap this book fills. Every chapter includes runnable code, real performance numbers, and production patterns — not simplified demos. You will work with ecommerce datasets, see actual query costs and bytes scanned, and build complete pipelines you can adapt to your own projects. The book assumes basic SQL knowledge and access to a Google Cloud account. Some Python helps for the Beam and Spark chapters but is not required for most of the book. This book is divided into 15 chapters. Chapters 1 and 2 cover the foundations — what data engineering looks like today, where BigQuery fits, and how it works internally. Understanding slots, columnar storage, and the execution engine will change how you approach everything that follows. Chapter 3 walks through getting data into BigQuery — console uploads, Cloud Storage loads, file formats, Data Transfer Service, and streaming ingestion with Pub/Sub. Chapters 4 and 5 focus on modeling and optimization. You will compare nested, star schema, and denormalized approaches with actual performance data, and then see how partitioning and clustering can reduce scan costs dramatically. Chapter 6 digs into cost engineering — using INFORMATION_SCHEMA to find expensive queries, choosing between pricing models, and leveraging materialized views and BI Engine. Chapter 7 introduces dbt. This is where the book shifts from individual queries to building modular, tested, documented transformation pipelines. The lab builds a complete ELT system with staging, intermediate, and smart layers. Chapters 8 and 9 cover Apache Beam with Dataflow and Spark with BigQuery. You can build batch and streaming pipelines, and learn when each tool is the right choice. Chapter 10 brings orchestration with Cloud Composer — coordinating BigQuery, Dataflow, and dbt into automated workflows with retry logic and failure handling. Chapter 11 tackles security, governance, and data quality — from IAM and row-level security to data quality assertions in SQL. Chapter 12 shows how to train ML models using SQL in BigQuery, and deploy them to Vertex AI for real-time serving. Chapter 13 builds a production streaming pipeline end to end — Pub/Sub, Beam windowing, late data handling, and live BigQuery dashboards. Chapter 14 is the capstone project. You will be able to build a complete enterprise warehouse with incremental models, automated testing, and CI/CD deployment using GitHub Actions. Chapter 15 looks at where data engineering is heading — streaming-first architectures, Data Mesh, and AI-native platforms. Thus, by the end of the book, you will have all the skills to build production data platforms on Google Cloud — not just understand them.
این کتاب را میتوانید از لینک زیر بصورت رایگان دانلود کنید:
Download: Ultimate BigQuery for Data Engineering





نظرات کاربران