UNIT 3: Data Science - Short Notes
1. Fundamentals of Data
1.1 Data Types
| Type | Definition | Examples | Key Characteristics |
|---|---|---|---|
| Structured | Data organized in fixed fields, typically in rows & columns. | Relational databases, Excel spreadsheets, CSV files. | Schema defined, easy to query & process (SQL). |
| Unstructured | Data without a predefined model or organization. | Text documents, emails, social media posts, images, audio, video. | No fixed schema, requires NLP/CV for analysis. |
| Semi-structured | Data with tags or markers separating elements, but no rigid table structure. | XML, JSON, log files, NoSQL databases. | Flexible schema (self-describing), hierarchical. |
[!TIP] Exam Focus: Be prepared to compare and contrast all three types with specific examples. A common pitfall is calling JSON/XML "structured"—they are semi-structured.
1.2 Importance and Applications of Unstructured Data
-
Healthcare: Analysis of medical notes (NLP), medical imaging (MRI/X-ray via Computer Vision), genomic data.
-
Finance: Sentiment analysis on news/financial reports, fraud detection from transaction logs, analyzing earnings call transcripts.
-
Social Media: Sentiment analysis on posts/tweets, image/video content moderation, understanding user engagement through interaction logs.
2. Data Wrangling and Preprocessing
2.1 Data Wrangling
Definition: The process of cleaning, structuring, and enriching raw data into a desired format for analysis. Importance: Often consumes 60-80% of a data scientist's time. Garbage in, garbage out—quality data is foundational for accurate models.
2.2 Data Cleaning
-
Missing Values: Identify (
isna()), handle via deletion (if few) or imputation (mean/median/mode, predictive models). -
Outliers: Detect using IQR method or Z-score. Decide to cap, remove, or transform based on domain knowledge.
-
Inconsistencies: Fix formatting (dates, units), correct typos, resolve duplicates.
2.3 Data Transformation
- Normalization (Min-Max): Scales features to [0,1]. Sensitive to outliers.
$$X_{norm} = \frac{X - X_{min}}{X_{max} - X_{min}}$$
- Standardization (Z-score): Transforms to mean=0, SD=1. Robust to outliers.
$$X_{std} = \frac{X - \mu}{\sigma}$$
- Encoding Categorical Variables: Label Encoding (ordinal), One-Hot Encoding (nominal).
2.4 Data Integration
Merging datasets from multiple sources using keys (e.g., pd.merge() in Pandas, SQL JOINs). Handle schema conflicts.
2.5 Data Reduction
-
Sampling: Simple random, stratified (preserves class distribution).
-
Dimensionality Reduction: t-SNE (t-Distributed Stochastic Neighbor Embedding) is primarily for visualization of high-dimensional data. It reduces to 2D/3D while preserving local structure. Not for feature engineering in pipelines due to computational cost and non-determinism.
3. Data Visualization
3.1 Principles of Effective Visualization
-
Clarity & Simplicity: Avoid chartjunk.
-
Accuracy: Represent data truthfully.
-
Efficiency: Communicate message quickly.
-
Appropriate Chart Type: Match data and question (comparison, distribution, relationship, composition).
3.2 Fundamental Graphical Representations
| Chart | Purpose | Key Elements |
|---|---|---|
| Pie Chart | Shows parts of a whole (composition). | Slice angles proportional to values. Avoid >6 slices. |
| Bar Graph | Compares categories. | Clustered (multiple series), Stacked (part-to-whole). |
| Histogram | Shows distribution of a single continuous variable. | Bins (intervals). Area proportional to frequency. |
| Box Plot | Shows five-number summary (Min, Q1, Median, Q3, Max) & outliers. | Box (IQR), whiskers, outliers (points beyond 1.5*IQR). |
| Scatter Plot | Shows relationship between two continuous variables. | Points, trend line, correlation coefficient (r). |
3.3 Advanced Visualization Techniques
-
t-SNE: Algorithm Steps: 1) Compute pairwise similarities in high-D space. 2) Map to low-D space (2D/3D) minimizing KL-divergence between distributions. Interpretation: Clusters indicate similar data points. Example: Visualizing word embeddings (e.g., Word2Vec) or image feature vectors.
-
Density Plot: Smoothed version of histogram (KDE). Shows probability density.
-
Rug Plot: Small ticks along axis showing actual data point locations. Often added to density/histogram to show data sparsity.
3.4 Python Visualization Libraries
-
Matplotlib: Foundation library.
plt.plot(),plt.bar(),plt.hist(),plt.scatter(). Highly customizable (labels, titles, subplots viaplt.subplot()). -
Seaborn: Built on Matplotlib. Statistical plots with better aesthetics.
sns.histplot(),sns.boxplot(),sns.scatterplot(),sns.heatmap(). Integrates with Pandas DataFrames (data=parameter).
4. Descriptive Statistics and Probability
4.1 Measures of Central Tendency
-
Mean ($\bar{x}$): $$\displaystyle \bar{x} = \frac{\sum x_i}{n} $$. Sensitive to outliers.
-
Median: Middle value (ordered data). Robust to outliers.
-
Mode: Most frequent value. Can be used for categorical data.
4.2 Measures of Variability
-
Range: $Max - Min$. Sensitive to outliers.
-
Variance ($$\displaystyle s^2 $$): $$\displaystyle s^2 = \frac{\sum (x_i - \bar{x})^2}{n-1} $$. Average squared deviation.
-
Standard Deviation ($s$): $$\displaystyle s = \sqrt{s^2} $$. Same units as data.
-
Interquartile Range (IQR): $$\displaystyle IQR = Q3 - Q1 $$. Measures spread of middle 50%, robust to outliers.
4.3 Probability Concepts
- Conditional Probability: Probability of A given B.
$$P(A|B) = \frac{P(A \cap B)}{P(B)}$$
- Correlation Analysis (Pearson): Measures linear relationship strength/direction.
$$r = \frac{\sum (x_i - \bar{x})(y_i - \bar{y})}{\sqrt{\sum (x_i - \bar{x})^2 \sum (y_i - \bar{y})^2}}$$
**Range:** [-1, 1]. **0** implies no linear correlation.
4.4 Statistical Inference Basics
-
Type I Error ($\alpha$): False positive. Rejecting true null hypothesis.
-
Type II Error ($\beta$): False negative. Failing to reject false null hypothesis.
Trade-off: Decreasing $\alpha$ increases $\beta$.
-
Maximum Likelihood Estimation (MLE): Method to estimate model parameters by finding parameters that maximize the likelihood function (probability of observed data). For i.i.d. data: $$\displaystyle L(\theta) = \prod P(x_i|\theta) $$. Often work with log-likelihood: $$\displaystyle \ell(\theta) = \log L(\theta) $$.
5. Data Analysis Tools
5.1 Microsoft Excel for Data Analysis
| Feature | Key Points | Exam Relevance |
|---|---|---|
| Data Validation | Rules: List, Whole number, Date, Custom formula. Error alerts (Stop, Warning, Information). Role: Ensures data integrity at entry point. | 7m Q: "Explain role in improving accuracy." |
| VLOOKUP | =VLOOKUP(lookup_value, table_array, col_index_num, [range_lookup]). Limitations: Slow, only searches leftmost column, breaks if column inserted. range_lookup=FALSE for exact. |
7m Q: "Explain operations... for data analysis." |
| XLOOKUP | =XLOOKUP(lookup_value, lookup_array, return_array, [if_not_found], [match_mode]). Advantages: Default exact match, searches any column, returns entire row/column, simpler syntax. |
7m Q: "Advantages over VLOOKUP." |
| SUMIFS | =SUMIFS(sum_range, criteria_range1, criteria1, ...). Application: Customer segmentation (e.g., sum sales for "Region=East" AND "Product=Widget"). |
7m Q: "Example for customer segmentation." |
| INDEX + MATCH | =INDEX(return_array, MATCH(lookup_value, lookup_array, 0)). Advantages: Flexible (lookup left/right), faster, column insertion safe. Superior to VLOOKUP. |
7m Q: "Advantages over VLOOKUP." |
| Dynamic Arrays | Functions like SORT(), FILTER(), UNIQUE() spill results automatically. Application: Dynamic segmentation lists (e.g., UNIQUE(CustomerRegion)). |
7m Q: "Application in segmentation." |
| Pivot Tables | Summarize data via drag-and-drop. Features: Grouping (dates/numbers), Calculated Fields, Slicers (interactive filters). Pivot Charts linked directly. | 7m Q: "Explain pivot table." |
| Scenario Manager | What-if analysis tool. Steps: Define scenarios (changing cells), generate summary report (including "Scenario PivotTable"). Compare outcomes. | 7m Q: "Explain Scenario Manager." |
| Macros | Recorded VBA code for automation. Steps: View > Macros > Record Macro > Perform actions > Stop Recording. Use case: Repetitive formatting, report generation. | 7m Q: "Steps to create a macro." |
5.2 Python for Data Analysis
-
Pandas DataFrame:
-
Structure: 2D labeled data structure with
index(rows),columns,data. Axes:axis=0(rows),axis=1(columns). Heterogeneous data types per column. -
Features:
df.isna(),df.fillna(),pd.merge(),pd.concat(),df.groupby(). -
vs NumPy Array: DataFrame has labeled axes, supports heterogeneous data types, operations align on labels. NumPy arrays are homogeneous, use integer indexing, operations are element-wise without alignment.
-
-
String Operations in Pandas:
-
Access via
.straccessor:df['col'].str.contains('pattern'),.str.startswith(),.str.split(),.str.replace(). -
Regex:
df['col'].str.extract(r'(pattern)')(capture group),df['col'].str.findall(r'pattern'). Example: Extract email:r'([\w\.-]+@[\w\.-]+)'.
-
-
Python Visualization (Code Logic):
# Matplotlib plt.pie(data, labels=labels) # Pie plt.bar(categories, values) # Bar plt.hist(data, bins=30) # Histogram plt.scatter(x, y) # Scatter # Seaborn (statistical, nicer defaults) sns.barplot(x='cat', y='val', data=df) sns.histplot(data=df, x='col', kde=True) # Histogram + Density sns.boxplot(x='cat', y='val', data=df) sns.scatterplot(x='x', y='y', hue='category', data=df)
5.3 R Programming for Data Analysis
-
Features: Open-source, extensive statistical/graphical packages (
CRAN), vectorized operations (fast), strong community. -
Major Components: Console (interactive), Workspace (
.RData), Packages (library()), Help (?func). -
Vector Operations: Arithmetic (
+,-,*,/), logical (>, ==, %in%), subsetting (x[condition]orx[indices]). Recycling Rule: Shorter vector repeated to match longer in operations. -
Categorical Data:
factor(vector)creates a factor with levels. Essential for modeling categorical predictors.
6. Data Analysis Approaches
| Approach | Focus | Techniques | Example |
|---|---|---|---|
| Descriptive | "What happened?" | EDA, summary stats, visualization. | Sales report for last quarter. |
| Predictive | "What will happen?" | ML models (regression, classification). | Predicting customer churn. |
| Prescriptive | "What should we do?" | Optimization, simulation, recommendation engines. | Determining optimal price point. |
Role of Regression Analysis: Predicts continuous outcomes. Provides interpretable coefficients (effect size). Used for inference (understanding relationships) and prediction.
7. Business Intelligence (BI)
7.1 Definition & Evolution
BI: Technologies, applications, and practices for collecting, integrating, analyzing, and presenting business information to support better decision-making. Evolution: From static, IT-generated reports (1.0) to interactive, self-service dashboards (2.0) to AI-driven, embedded analytics (3.0).
7.2 Types of BI
| Type | Focus | Users | Tools/Outputs |
|---|---|---|---|
| Operational | Real-time monitoring, day-to-day operations. | Operations staff. | Real-time dashboards, alerts. |
| Tactical | Middle-management, ad-hoc analysis, short-term. | Business analysts. | OLAP cubes, ad-hoc queries. |
| Strategic | Long-term trends, KPIs, strategic goals. | Senior management. | Scorecards (Balanced Scorecard), trend reports. |
7.3 BI Tools Comparison (Tableau vs. Power BI)
| Feature | Tableau | Power BI |
|---|---|---|
| Usability | Drag-and-drop, intuitive for visual-first users. | Similar drag-and-drop, deeply integrated with Microsoft ecosystem (Excel, Azure). |
| Key Features | Superior visualizations, geographic mapping, large dataset performance. | Strong data modeling (Power Query, DAX), cost-effective, seamless SharePoint/Teams integration. |
| Data Handling | Handles large volumes well, live connections to many sources. | Efficient with Microsoft sources (SQL Server, Excel), robust data transformation (Power Query). |
7.4 BI in Strategic Decision-Making
Logic of BI Systems:
-
ETL: Extract from sources, Transform (clean, integrate), Load into Data Warehouse.
-
Data Warehouse: Centralized repository of integrated, subject-oriented, time-variant data.
-
OLAP Cubes: Multidimensional structures for fast slicing/dicing of aggregated data.
-
Front-End: Dashboards, reports, visualizations for end-users.
How BI Supports Decisions:
-
Data Aggregation: Summarizes vast data into KPIs.
-
Interactive Visualization: Allows drill-down, slice-and-dice to explore "why."
-
Predictive Insights: Integration with ML models for forecasting (e.g., sales prediction).
7.5 Ethical Issues in BI
-
Privacy: Tracking employee/customer performance/behavior without consent.
-
Bias: Reports/dashboards reflecting historical biases (e.g., in hiring, lending).
-
Misuse: Using BI for manipulation (e.g., deceptive visualizations), lack of transparency in metrics.
8. Machine Learning and Predictive Modeling
8.1 Regression Models
-
Linear Regression: $$\displaystyle y = \beta_0 + \beta_1 x_1 + ... + \beta_p x_p + \epsilon $$
-
Assumptions: Linearity, independence, homoscedasticity, normality of errors.
-
Interpretation: $$\displaystyle \beta_j $$ = change in $y$ for 1-unit change in $$\displaystyle x_j $$, holding others constant.
-
-
Logistic Regression: For binary classification ($y \in \{0,1\}$). Models $$\displaystyle \log(\frac{p}{1-p}) = \beta_0 + \beta_1 x_1 + ... $$
-
Odds Ratio: $$\displaystyle e^{\beta_j} $$ = change in odds of $$\displaystyle y=1 $$ for 1-unit change in $$\displaystyle x_j $$.
-
Example: Predict loan approval (Yes=1) using income, credit score, debt-to-income ratio.
-
8.2 Classification Models
| Model | Principle | Key Feature | Example Use |
|---|---|---|---|
| Decision Tree | Split data recursively using feature that best separates classes. | Splitting Criteria: Gini Impurity ($$\displaystyle 1 - \sum p_i^2 $$) or Entropy ($$\displaystyle -\sum p_i \log p_i $$). Interpretable rules. | Customer segmentation, medical diagnosis. |
| Random Forest | Ensemble (Bagging): Many decorrelated trees. Prediction = majority vote (classification) or average (regression). | Feature Importance: Mean decrease in impurity/Gini. Out-of-Bag (OOB) Error: Internal validation using ~37% of data not in bootstrap sample. | Fraud detection, credit scoring. |
| Naive Bayes | Applies Bayes Theorem with conditional independence assumption: $$\displaystyle P(x_1,...,x_p|y) = \prod P(x_i|y) $$. | Types: Gaussian (continuous), Multinomial (discrete counts, text), Bernoulli (binary). Fast, works well with high-dimensional text. | Spam filtering (Multinomial), document classification. |
| Gradient Boosting | Boosting: Builds trees sequentially, each correcting errors of previous. Fits residuals (pseudo-residuals). | Example: XGBoost, LightGBM. Often highest predictive accuracy. Uses regularization to prevent overfitting. | Search ranking, click-through rate prediction. |
8.3 Clustering
-
K-means: Algorithm:
-
Initialization: Choose K centroids randomly.
-
Assignment: Assign each point to nearest centroid (Euclidean distance).
-
Update: Recalculate centroids as mean of assigned points.
-
Repeat 2-3 until convergence (centroids stable).
-
Elbow Method: Plot SSE (inertia) vs. K. Choose K at "elbow" where SSE decrease slows.
-
Example: Segment customers into K groups based on spending/frequency.
-
8.4 Association Rule Mining (Apriori)
-
Goal: Find items that frequently co-occur in transactions (e.g., market basket analysis).
-
Key Metrics:
-
Support: $$\displaystyle P(\text{itemset}) = \frac{\text{freq( itemset )}}{\text{total transactions}} $$. Measures popularity.
-
Confidence: $$\displaystyle P(Y|X) = \frac{\text{support}(X \cup Y)}{\text{support}(X)} $$. Measures conditional probability.
-
Lift: $$\displaystyle \frac{\text{confidence}(X \rightarrow Y)}{\text{support}(Y)} = \frac{P(X \cap Y)}{P(X)P(Y)} $$. Lift > 1 implies positive correlation (rule is interesting). Lift = 1 = independence.
-
-
Apriori Principle: Any subset of a frequent itemset must be frequent. Pruning: Eliminate candidate itemsets with any infrequent subset.
-
Advantages: Simple, easy to implement, well-suited for sparse datasets (many items, few per transaction).
9. Big Data Analytics
9.1 Characteristics (5Vs)
-
Volume: Size of data (TB, PB, EB).
-
Variety: Different types (structured, unstructured, semi-structured).
-
Velocity: Speed of data generation/processing (real-time, streaming).
-
Veracity: Uncertainty, quality, trustworthiness of data.
-
Value: Potential insights and benefit derived from data.
9.2 Processing Considerations
-
Storage: Distributed File Systems (HDFS) for scalable, fault-tolerant storage.
-
Processing: Parallel/distributed frameworks (MapReduce, Spark). Scalability: Horizontal (add more nodes). Fault Tolerance: Data replication, task re-execution on failure.
9.3 Phases of Big Data Analytics
[[DIAGRAM: CANVAS: A circular or linear flow diagram with 5 labeled stages in order:
1. Data Acquisition (sources: IoT, social media, logs)
2. Data Storage (HDFS, NoSQL)
3. Data Processing (MapReduce, Spark)
4. Data Analysis (ML, stats, mining)
5. Data Visualization (dashboards, reports)
Arrows connecting each stage in sequence.]]
9.4 Hadoop Ecosystem
-
HDFS Architecture:
-
NameNode: Master server. Manages metadata (file system tree, block locations). Single Point of Failure (HA solutions exist).
-
DataNode: Slave server. Stores data blocks (default 128MB/256MB). Performs block operations (read/write, replication). Sends heartbeats & blockreports to NameNode.
-
Secondary NameNode: Not a backup NameNode. Performs checkpointing: Merges fsimage (metadata snapshot) and edit logs to prevent edit log from becoming too large. Does NOT provide failover.
-
Block Replication: Default factor = 3. One copy on local node, two on different racks (for rack awareness).
-
-
MapReduce Programming Model:
-
Mapper: Processes input key-value pairs (e.g.,
<line_num, line_text>) → intermediate key-value pairs (e.g.,<word, 1>). Shuffling & Sorting happens automatically between map and reduce phases, grouping values by key. -
Reducer: Processes grouped intermediate keys (e.g.,
<word, [1,1,1...]>) → final output (e.g.,<word, total_count>). -
Job Scheduling (Fair Scheduler): Allocates cluster resources (containers) to jobs/pools to ensure fair share over time, not just FIFO. Supports preemption.
-
Word Count Example:
// Mapper public void map(Object key, Text value, Context context) { StringTokenizer itr = new StringTokenizer(value.toString()); while (itr.hasMoreTokens()) { word.set(itr.nextToken()); context.write(word, one); } } // Reducer public void reduce(Text key, Iterable<IntWritable> values, Context context) { int sum = 0; for (IntWritable val : values) { sum += val.get(); } context.write(key, new IntWritable(sum)); }
-
-
HBase Storage Mechanism:
-
Column-family store (NoSQL). Data stored as rows with column families (groups of columns). Within a column family, data stored lexicographically.
-
Schema-less: Columns can be added dynamically per row.
-
Scalability: Automatic sharding (region splitting), built on HDFS.
-
Real-time: Low-latency read/write (random access), unlike HDFS (write-once, read-many).
-
-
Hadoop File System Commands:
# Copy file/dir from local FS to HDFS hadoop fs -copyFromLocal /local/path /hdfs/path # Show content of file (text files) hadoop fs -cat /hdfs/path/file.txt # For sequence/other binary files, use -text to attempt conversion hadoop fs -text /hdfs/path/file.seq
9.5 Higher-Level Tools
-
Apache Pig:
-
Architecture: Pig Latin script → Pig Latin Compiler → Logical Plan → MapReduce Plan → Execution Engine (on Hadoop).
-
Pig Latin Script Flow:
LOAD→FILTER/FOREACH/GROUP(TRANSFORM) →STORE. -
Example:
A = LOAD 'data' AS (user:chararray, item:chararray); B = GROUP A BY user; C = FOREACH B GENERATE group, COUNT(A); STORE C INTO 'output';
-
-
Apache Hive:
-
Architecture: HiveServer2 (JDBC/ODBC server for clients), Metastore (RDBMS storing table schemas, partitions, locations).
-
HiveQL: SQL-like query language. Compiles to MapReduce/Tez/Spark jobs.
-
UDFs (User Defined Functions): Write Java class implementing
UDForGenericUDFinterface. Register:CREATE TEMPORARY FUNCTION myfunc AS 'com.example.MyUDF';Use:SELECT myfunc(col) FROM table;
-
9.6 Analytic Sandbox
Definition: An isolated, flexible environment (often cloud-based) where data scientists can experiment, prototype, and test analytics models and processes without affecting production systems. Importance: Enables rapid iteration, testing of new tools/algorithms, safe exploration of sensitive data, and proof-of-concept development before deployment.
10. Ethical, Legal, and Social Implications
10.1 Bias and Discrimination
-
Reinforcing Human Biases: Algorithms learn from historical data that may contain societal biases (e.g., gender, racial). Example: Hiring algorithm downgrading resumes with "women's" in name if trained on historically male-hired data.
-
Unfair Discrimination: Using protected attributes (race, gender, age) or proxies (zip code) to make adverse decisions, even if algorithmically "accurate." Example: Loan denial model using zip code as proxy for race.
10.2 Privacy and Security Issues
-
Data Privacy: Collection: Transparency, informed consent. Anonymization/Pseudonymization: Removing direct identifiers (hard for re-identification). GDPR: EU regulation granting individuals rights (access, erasure, portability).
-
Security Issues: Data Breaches: Unauthorized access. Access Control: Role-based permissions. Secure Storage: Encryption at rest and in transit.
10.3 Ethical Issues in Business Intelligence
-
Misuse of Reports: Creating biased dashboards to mislead stakeholders.
-
Lack of Transparency: "Black box" metrics or KPIs not clearly defined.
-
Data Integrity: Manipulating source data or ETL processes for desired outcomes.
10.4 Transparency and Accountability
-
Explainability (XAI): Ability to explain model predictions (e.g., SHAP, LIME).
-
Audit Trails: Logging data lineage, model versions, and decision points.
-
Responsibility: Clear ownership of models and their outcomes (data scientist, business owner).
11. Advanced and Specialized Topics
11.1 Dimensionality Reduction: t-SNE (Revisit)
-
Goal: Visualization of high-D data in 2D/3D.
-
Key Idea: Preserve local structure (similar points stay close). Uses t-distribution in low-D to alleviate crowding problem.
-
Parameters:
perplexity(roughly # of nearest neighbors),learning_rate. -
Limitation: Non-linear, non-parametric, results change with different runs/params. Not for feature extraction in supervised learning.
11.2 Regular Expressions (Regex)
-
Syntax:
.(any char),*(0+),+(1+),?(0-1),^(start),$(end),\d(digit),\w(word char),[](character set),|(or). -
Pandas Examples:
df['phone'].str.extract(r'(\d{3}-\d{3}-\d{4})') # Extract (xxx-xxx-xxxx) df['email'].str.findall(r'[\w\.-]+@[\w\.-]+') # Find all emails in a string
11.3 Exploratory Data Analysis (EDA)
-
Role: Understand data, discover patterns, spot anomalies, test hypotheses before formal modeling.
-
Techniques: Summary statistics (mean, SD, IQR), visualization (histograms, box plots, scatter matrix), correlation analysis.
-
vs. Confirmatory Data Analysis (CDA): EDA is open-ended, inductive. CDA is hypothesis-driven, deductive (e.g., significance testing).
11.4 Role of Data Scientist vs. Data Analyst
| Aspect | Data Scientist | Data Analyst |
|---|---|---|
| Primary Focus | Prediction & advanced analytics (ML). | Analysis & reporting (descriptive). |
| Skills | Statistics, ML, programming (Python/R), software engineering. | SQL, BI tools (Power BI/Tableau), basic stats, business acumen. |
| Output | Predictive models, algorithms, data products. | Dashboards, reports, insights for business decisions. |
| Question | "What will happen?" / "Why did it happen?" | "What happened?" / "What is happening?" |
11.5 Maximum Likelihood Estimation (MLE) (Revisit)
-
Concept: Find parameter values ($\hat{\theta}$) that make the observed data most probable.
-
Steps:
-
Write down likelihood function $$\displaystyle L(\theta) = P(X_1, X_2, ..., X_n | \theta) = \prod_{i=1}^n P(X_i|\theta) $$ (assuming i.i.d.).
-
Take log: $$\displaystyle \ell(\theta) = \log L(\theta) = \sum \log P(X_i|\theta) $$.
-
Differentiate $\ell(\theta)$ w.r.t. $\theta$, set to zero, solve for $\hat{\theta}$.
-
-
Example: For Normal($$\displaystyle \mu, \sigma^2 $$), MLE for $\mu$ is sample mean $\bar{x}$.