UNIT 4: ADVANCED DATA ANALYTICS, BIG DATA, AND BUSINESS INTELLIGENCE
I. BIG DATA FUNDAMENTALS
Characteristics of Big Data (5 Vs)
| V | Definition | Example |
|---|---|---|
| Volume | Scale of data (terabytes to zettabytes) | Social media posts, IoT sensor streams |
| Velocity | Speed of data generation/processing | Real-time fraud detection, stock tickers |
| Variety | Different data formats | Text, images, logs, video |
| Veracity | Data quality & uncertainty | Incomplete sensor data, biased surveys |
| Value | Extracted insights & utility | Personalized recommendations, predictive maintenance |
Data Types:
- Structured: Fixed schema (SQL databases, spreadsheets).
- Unstructured: No fixed schema (emails, social media, images).
- Semi-structured: Partial schema (JSON, XML, NoSQL).
Processing Considerations
-
Scalability: Horizontal scaling (adding machines) vs. vertical (upgrading hardware).
-
Distributed Systems: Partition data across clusters (e.g., HDFS).
-
Parallel Processing: MapReduce, Spark for simultaneous computation.
-
Challenges: Storage cost, latency, data integration, security.
Phases of Big Data Analytics
-
Data Ingestion: Collecting data from sources (APIs, logs, streams).
-
Storage: Distributed storage (HDFS, cloud object stores).
-
Processing: Cleaning, transforming (MapReduce, Spark).
-
Analysis: ML, statistical modeling, mining.
-
Visualization: Dashboards, reports (Tableau, Power BI).
-
Analytic Sandbox: Isolated environment for experimentation without affecting production.
!TIP: Analytic sandbox allows testing new models/scripts safely—key for iterative analysis.
II. HADOOP ECOSYSTEM
HDFS Architecture
-
NameNode: Master server; manages file system metadata (directory tree, block locations). Single point of failure (mitigated by HA).
-
DataNode: Slave nodes; store actual data blocks (default 128 MB). Report status to NameNode.
-
Secondary NameNode: Checkpoints NameNode metadata (not backup). Merges
fsimageandeditslogs. -
Fault Tolerance: Data replicated (default 3x) across racks. Automatic re-replication on node failure.
!TIP: Secondary NameNode ≠ Backup NameNode. It only aids checkpointing.
MapReduce Programming Model
-
Map Phase:
(key, value) → list(key, value)Example (WordCount):
(docID, text) → (word, 1)for each word. -
Shuffle & Sort: Groups values by key (framework handles).
-
Reduce Phase:
(key, list(value)) → (key, aggregated)Example:
(word, [1,1,...]) → (word, sum).
- Job Scheduling (Fair Scheduler): Allocates resources to multiple jobs/queues to ensure fairness, not just FIFO.
HBase Storage Mechanism
-
Column-Family Store: NoSQL, column-oriented. Tables have column families (groups of columns).
-
Regions: Tables split into regions (range of row keys). RegionServer manages regions.
-
Scalability: Automatically shards/redistributes regions as data grows.
-
Consistency: Strong consistency per row; eventual across rows.
Pig & Hive
| Feature | Pig Latin | Hive |
|---|---|---|
| Purpose | Data flow scripting | Data warehouse (SQL-like) |
| Language | Pig Latin (procedural) | HiveQL (declarative) |
| Execution | MapReduce/Tez/Spark | Compiles to MapReduce/Tez/Spark |
| UDFs | Java/Python UDFs | Java/Scala UDFs |
| Use Case | ETL pipelines | Ad-hoc queries, reporting |
-
Pig Flow: Script → Parser → Logical Plan → Optimizer → Physical Plan → MapReduce.
-
Hive UDF: Write Java class implementing
UDFinterface; add JAR; use in HiveQL.
III. DATA MINING AND ASSOCIATION ANALYSIS
Apriori Algorithm
-
Goal: Find frequent itemsets (items co-occurring often).
-
Key Metrics:
-
Support:
P(itemset)=(transactions containing itemset) / (total transactions). -
Confidence:
P(B \| A)=support(A∪B) / support(A). -
Lift:
confidence(A→B) / support(B); >1 indicates positive correlation.
-
-
Steps:
-
Set min support threshold.
-
Generate candidate 1-itemsets, prune by support.
-
Iteratively generate k-itemsets from (k-1)-itemsets (join step), prune by support.
-
Use frequent itemsets to generate rules meeting min confidence.
-
-
Advantages: Simple, easy to implement.
-
Limitations: Multiple DB scans, combinatorial explosion for low support.
Association Rules
-
Interestingness: Lift > 1, high confidence, actionable, non-obvious.
-
Coincidental Rules: High support but no causal link (e.g., "diapers → beer" may be spurious if both bought together only on weekends).
-
Applications: Market basket analysis, cross-selling, recommendation systems.
Clustering (K-means)
-
Algorithm:
-
Choose
kinitial centroids (randomly or k-means++). -
Assign each point to nearest centroid (Euclidean distance).
-
Recompute centroids as mean of assigned points.
-
Repeat 2–3 until convergence (centroids stable).
-
-
Elbow Method: Plot within-cluster sum of squares (WCSS) vs.
k; choosekat "elbow" (point of diminishing returns). -
Use Cases: Customer segmentation, image compression, anomaly detection.
IV. MACHINE LEARNING FOR ADVANCED ANALYTICS
A. Supervised Learning
Logistic Regression
-
Binary Classification: Predicts probability
P(Y=1|X). -
Model:
log(odds) = β₀ + β₁x₁ + ... + βₙxₙ, whereodds = P/(1-P). -
Cost Function: Log Loss (cross-entropy):
$$J(\theta) = -\frac{1}{m} \sum_{i=1}^{m} \left[ y^{(i)} \log(h_\theta(x^{(i)})) + (1-y^{(i)}) \log(1-h_\theta(x^{(i)})) \right]$$
- Example: Loan approval → features: income, credit score, debt. Output: probability of default.
Decision Trees
-
Structure: Root → internal nodes (splits) → leaf nodes (predictions).
-
Splitting Criteria:
-
Gini Impurity:
G = 1 - Σ(p_i²); minimize weighted Gini after split. -
Entropy:
H = -Σ(p_i log₂ p_i); maximize Information Gain =H(parent) - Σ(weighted H(children)).
-
-
Pruning: Remove branches with low predictive power to prevent overfitting (cost-complexity pruning).
-
Applications: Credit scoring, medical diagnosis.
Random Forest
-
Ensemble (Bagging): Multiple decision trees trained on bootstrapped samples.
-
Prediction: Majority vote (classification) or average (regression).
-
Feature Importance: Mean decrease in impurity (MDI) or permutation importance.
-
Advantages: Reduces overfitting, handles non-linearities, robust to outliers.
Gradient Boosting
-
Boosting: Sequential trees; each corrects errors of previous.
-
Process:
-
Fit initial tree to residuals.
-
Compute pseudo-residuals (negative gradient of loss).
-
Fit new tree to residuals; add to ensemble with learning rate
η.
-
-
Loss Functions: Deviance (classification), squared error (regression).
-
Example: XGBoost, LightGBM.
Naive Bayes
-
Bayes' Theorem:
P(Y|X) = [P(X|Y) P(Y)] / P(X). -
Independence Assumption: Features conditionally independent given
Y.P(X|Y) = Π P(x_i|Y). -
Types:
-
Gaussian: Continuous features (assume normal distribution).
-
Multinomial: Discrete counts (e.g., text word frequencies).
-
Bernoulli: Binary features.
-
-
Example: Spam detection → words as features;
P(spam|words).
B. Unsupervised Learning
-
K-means: (See above).
-
Association Rules: (See above).
C. Dimensionality Reduction
t-SNE (t-Distributed Stochastic Neighbor Embedding)
-
Goal: Visualize high-dim data in 2D/3D by preserving local similarities.
-
How:
-
Convert pairwise similarities to probabilities (high-dim: Gaussian; low-dim: t-distribution).
-
Minimize KL divergence between probability distributions.
-
-
Perplexity: Roughly equivalent to number of nearest neighbors; balances local/global structure.
-
Example: Visualizing word embeddings (e.g., BERT) or image features.
!TIP: t-SNE is for visualization, not feature extraction. Results vary with perplexity; try multiple values.
V. BUSINESS INTELLIGENCE AND ANALYTICS
BI Concepts
-
Definition: Technologies, processes, tools to transform raw data into meaningful information for strategic decisions.
-
Evolution: From static reports → interactive dashboards → predictive/prescriptive analytics.
-
Core Objectives: Improve decision speed/quality, identify opportunities, optimize operations.
Types of BI Analytics
| Type | Focus | Example |
|---|---|---|
| Descriptive | What happened? | Sales reports, dashboards |
| Diagnostic | Why did it happen? | Drill-down analysis, root cause |
| Predictive | What will happen? | Forecast demand, churn prediction |
| Prescriptive | What should we do? | Recommendation engines, optimization |
BI Tools Comparison
| Feature | Tableau | Power BI |
|---|---|---|
| Usability | Drag-and-drop, intuitive | Integrated with Office, steep learning curve |
| Data Handling | Strong with large datasets, live connections | Good with Microsoft ecosystem, limited live connections |
| Cost | Expensive (per user) | Affordable (Pro ~$10/user/month) |
| Sharing | Tableau Server/Online | Power BI Service (cloud) |
| Customization | Extensive calculated fields, R/Python integration | DAX language, Power Query |
BI for Strategic Decision-Making
-
Dashboards: Real-time KPIs (e.g., revenue, customer satisfaction).
-
KPIs: Quantifiable metrics aligned with goals (e.g., conversion rate, CLV).
-
Data-Driven Culture: Decisions based on data, not intuition; requires training & accessible tools.
Data Analysis Methods
-
Predictive: Uses ML/statistical models (e.g., regression, classification) to forecast.
-
Prescriptive: Recommends actions using optimization, simulation (e.g., "Offer discount to X segment to maximize profit").
Excel for BI
-
Advanced Functions:
-
SUMIFS(sum_range, criteria_range1, criteria1, ...)→ Conditional sum. -
INDEX(array, row_num, [col_num])+MATCH(lookup_value, lookup_array, 0)→ Flexible lookup (left lookup, two-way). -
Dynamic Arrays:
FILTER(array, include, [if_empty]),SORT(array, [sort_index], [sort_order]),UNIQUE(array).
-
-
Pivot Tables: Summarize large data; drag-and-drop grouping, filtering, calculated fields.
-
Scenario Manager: What-if analysis; save sets of input values (e.g., best/worst case).
-
Data Validation: Restrict cell inputs (list, date range, custom formula) to prevent errors.
!TIP:
XLOOKUP(newer) replacesVLOOKUP; handles vertical/horizontal, default exact match, no column index number.
VI. ETHICS, BIASES, AND SECURITY
Unfair Discrimination
-
Definition: Treating groups differently based on protected attributes (race, gender) leading to adverse outcomes.
-
Examples:
-
Lending: Loan denial for minority groups despite similar credit scores.
-
Hiring: Algorithm filtering out resumes with "women's" in name.
-
-
Implications: Legal (e.g., Equal Credit Opportunity Act), social (perpetuating inequality), reputational.
Reinforcing Human Biases
-
Sources:
-
Data Bias: Historical discrimination reflected in training data (e.g., policing data biased against minorities).
-
Algorithm Bias: Model amplifies patterns (e.g., word embeddings: "doctor" → male, "nurse" → female).
-
Feedback Loops: Biased predictions influence future data (e.g., predictive policing → more patrols in biased areas → more arrests → reinforces bias).
-
-
Mitigation:
-
Pre-processing: Remove sensitive attributes, re-weight samples.
-
In-processing: Add fairness constraints (e.g., demographic parity).
-
Post-processing: Adjust thresholds per group.
-
Diverse teams, bias audits, transparency.
-
Ethical Issues in Data Science & BI
-
Privacy: Invasive data collection, re-identification risks.
-
Transparency: "Black box" models; lack of explainability.
-
Accountability: Who is responsible for erroneous decisions?
-
Fairness: Equitable outcomes across groups.
Security Issues
-
Data Breaches: Unauthorized access to sensitive data (PII, financial).
-
Access Control: Role-based permissions, least privilege.
-
Encryption: At rest (AES) and in transit (TLS).
-
Secure Handling: Anonymization, secure APIs, audit logs.
VII. ADVANCED STATISTICAL METHODS
Maximum Likelihood Estimation (MLE)
-
Concept: Find parameters
θthat maximize likelihoodL(θ|data)=P(data|θ). -
Steps:
-
Write likelihood function (product of PDFs for i.i.d. data).
-
Take log (
log-likelihood; easier to maximize). -
Differentiate w.r.t.
θ, set to zero, solve.
-
-
Example: For normal distribution, MLE of mean = sample mean, variance = sample variance (biased).
Hypothesis Testing Errors
| Error Type | Definition | Symbol | Example |
|---|---|---|---|
| Type I | False positive: Reject H₀ when true |
α (significance level) |
Convict innocent person |
| Type II | False negative: Fail to reject H₀ when false |
β |
Acquit guilty person |
| Power | 1 - β; probability of correctly rejecting false H₀ |
-
Trade-off: Decreasing
αincreasesβ(for fixed sample size). -
Multiple Testing: Increases family-wise error rate (FWER); use Bonferroni correction (
α' = α/kforktests).
!TIP: In medical testing: Type I = false alarm (unnecessary treatment), Type II = missed disease (no treatment).
\boxed{\text{End of Unit 4 Notes}}
Aligned with RGPV IT-702(A) past papers (2023–2025). Focus on definitions, algorithms, comparisons, and examples for 7-mark questions.