Azure Databricks: Nền tảng phân tích dữ liệu & Kịch bản học tập chiến lược
· 9 min read
Câu hỏi mở đầu: Bạn đang quản lý một cửa hàng với hàng triệu giao dịch mỗi ngày. Dữ liệu đến từ khắp nơi — POS, website, app, logistics. Làm sao xử lý tất cả trong thời gian thực mà không bị "chết đứng"?
Đó chính xác là bài toán mà Azure Databricks được sinh ra để giải quyết.
🔄 Ẩn dụ: Databricks như một "Nhà máy chế biến thông minh"
Hãy tưởng tượng bạn đang điều hành một nhà máy chế biến thực phẩm:
- Nguyên liệu thô = Dữ liệu thô từ mọi nguồn (log, giao dịch, cảm biến IoT...)
- Băng chuyền sản xuất = Apache Spark Engine — xử lý song song hàng nghìn luồng cùng lúc
- Kho lạnh thông minh = Delta Lake — lưu trữ có phiên bản, ACID, rollback được
- Ban giám đốc = Unity Catalog — kiểm soát ai được xem gì, audit trail đầy đủ
- Dây chuyền AI = MLflow + Notebooks — để tạo ra sản phẩm "thông minh" từ dữ liệu
Cả nhà máy này được thuê theo giờ trên Azure Cloud, không cần mua đất, không cần xây nhà xưởng.
🔬 Deep Dive: Kiến trúc Azure Databricks
Control Plane vs Compute Plane
💡 Trade-off quan trọng:
- Classic Compute: Bạn kiểm soát network, data privacy tối đa → tốn công quản lý hơn
- Serverless Compute: Databricks quản lý hộ → dễ dùng, nhưng ít kiểm soát hơn
Lakehouse Architecture: Tại sao nó khác biệt?
Trước khi có Lakehouse, các công ty phải duy trì 2 hệ thống riêng biệt: