Skip to content
IT-702 (A) · Data Science/Quick Revision Short Notes

Data Science (IT-702 (A)) - Unit 3 Short Notes

UNIT 3: Data Science - Short Notes


1. Fundamentals of Data

1.1 Data Types

Type Definition Examples Key Characteristics
Structured Data organized in fixed fields, typically in rows & columns. Relational databases, Excel spreadsheets, CSV files. Schema defined, easy to query & process (SQL).
Unstructured Data without a predefined model or organization. Text documents, emails, social media posts, images, audio, video. No fixed schema, requires NLP/CV for analysis.
Semi-structured Data with tags or markers separating elements, but no rigid table structure. XML, JSON, log files, NoSQL databases. Flexible schema (self-describing), hierarchical.

[!TIP] Exam Focus: Be prepared to compare and contrast all three types with specific examples. A common pitfall is calling JSON/XML "structured"—they are semi-structured.

1.2 Importance and Applications of Unstructured Data

  • Healthcare: Analysis of medical notes (NLP), medical imaging (MRI/X-ray via Computer Vision), genomic data.

  • Finance: Sentiment analysis on news/financial reports, fraud detection from transaction logs, analyzing earnings call transcripts.

  • Social Media: Sentiment analysis on posts/tweets, image/video content moderation, understanding user engagement through interaction logs.


2. Data Wrangling and Preprocessing

2.1 Data Wrangling

Definition: The process of cleaning, structuring, and enriching raw data into a desired format for analysis. Importance: Often consumes 60-80% of a data scientist's time. Garbage in, garbage out—quality data is foundational for accurate models.

2.2 Data Cleaning

  • Missing Values: Identify (isna()), handle via deletion (if few) or imputation (mean/median/mode, predictive models).

  • Outliers: Detect using IQR method or Z-score. Decide to cap, remove, or transform based on domain knowledge.

  • Inconsistencies: Fix formatting (dates, units), correct typos, resolve duplicates.

2.3 Data Transformation

  • Normalization (Min-Max): Scales features to [0,1]. Sensitive to outliers.

$$X_{norm} = \frac{X - X_{min}}{X_{max} - X_{min}}$$

  • Standardization (Z-score): Transforms to mean=0, SD=1. Robust to outliers.

$$X_{std} = \frac{X - \mu}{\sigma}$$

  • Encoding Categorical Variables: Label Encoding (ordinal), One-Hot Encoding (nominal).

2.4 Data Integration

Merging datasets from multiple sources using keys (e.g., pd.merge() in Pandas, SQL JOINs). Handle schema conflicts.

2.5 Data Reduction

  • Sampling: Simple random, stratified (preserves class distribution).

  • Dimensionality Reduction: t-SNE (t-Distributed Stochastic Neighbor Embedding) is primarily for visualization of high-dimensional data. It reduces to 2D/3D while preserving local structure. Not for feature engineering in pipelines due to computational cost and non-determinism.


3. Data Visualization

3.1 Principles of Effective Visualization

  • Clarity & Simplicity: Avoid chartjunk.

  • Accuracy: Represent data truthfully.

  • Efficiency: Communicate message quickly.

  • Appropriate Chart Type: Match data and question (comparison, distribution, relationship, composition).

3.2 Fundamental Graphical Representations

Chart Purpose Key Elements
Pie Chart Shows parts of a whole (composition). Slice angles proportional to values. Avoid >6 slices.
Bar Graph Compares categories. Clustered (multiple series), Stacked (part-to-whole).
Histogram Shows distribution of a single continuous variable. Bins (intervals). Area proportional to frequency.
Box Plot Shows five-number summary (Min, Q1, Median, Q3, Max) & outliers. Box (IQR), whiskers, outliers (points beyond 1.5*IQR).
Scatter Plot Shows relationship between two continuous variables. Points, trend line, correlation coefficient (r).

3.3 Advanced Visualization Techniques

  • t-SNE: Algorithm Steps: 1) Compute pairwise similarities in high-D space. 2) Map to low-D space (2D/3D) minimizing KL-divergence between distributions. Interpretation: Clusters indicate similar data points. Example: Visualizing word embeddings (e.g., Word2Vec) or image feature vectors.

  • Density Plot: Smoothed version of histogram (KDE). Shows probability density.

  • Rug Plot: Small ticks along axis showing actual data point locations. Often added to density/histogram to show data sparsity.

3.4 Python Visualization Libraries

  • Matplotlib: Foundation library. plt.plot(), plt.bar(), plt.hist(), plt.scatter(). Highly customizable (labels, titles, subplots via plt.subplot()).

  • Seaborn: Built on Matplotlib. Statistical plots with better aesthetics. sns.histplot(), sns.boxplot(), sns.scatterplot(), sns.heatmap(). Integrates with Pandas DataFrames (data= parameter).


4. Descriptive Statistics and Probability

4.1 Measures of Central Tendency

  • Mean ($\bar{x}$): $$\displaystyle \bar{x} = \frac{\sum x_i}{n} $$. Sensitive to outliers.

  • Median: Middle value (ordered data). Robust to outliers.

  • Mode: Most frequent value. Can be used for categorical data.

4.2 Measures of Variability

  • Range: $Max - Min$. Sensitive to outliers.

  • Variance ($$\displaystyle s^2 $$): $$\displaystyle s^2 = \frac{\sum (x_i - \bar{x})^2}{n-1} $$. Average squared deviation.

  • Standard Deviation ($s$): $$\displaystyle s = \sqrt{s^2} $$. Same units as data.

  • Interquartile Range (IQR): $$\displaystyle IQR = Q3 - Q1 $$. Measures spread of middle 50%, robust to outliers.

4.3 Probability Concepts

  • Conditional Probability: Probability of A given B.

$$P(A|B) = \frac{P(A \cap B)}{P(B)}$$

  • Correlation Analysis (Pearson): Measures linear relationship strength/direction.

$$r = \frac{\sum (x_i - \bar{x})(y_i - \bar{y})}{\sqrt{\sum (x_i - \bar{x})^2 \sum (y_i - \bar{y})^2}}$$

**Range:** [-1, 1]. **0** implies no linear correlation.

4.4 Statistical Inference Basics

  • Type I Error ($\alpha$): False positive. Rejecting true null hypothesis.

  • Type II Error ($\beta$): False negative. Failing to reject false null hypothesis.

    Trade-off: Decreasing $\alpha$ increases $\beta$.

  • Maximum Likelihood Estimation (MLE): Method to estimate model parameters by finding parameters that maximize the likelihood function (probability of observed data). For i.i.d. data: $$\displaystyle L(\theta) = \prod P(x_i|\theta) $$. Often work with log-likelihood: $$\displaystyle \ell(\theta) = \log L(\theta) $$.


5. Data Analysis Tools

5.1 Microsoft Excel for Data Analysis

Feature Key Points Exam Relevance
Data Validation Rules: List, Whole number, Date, Custom formula. Error alerts (Stop, Warning, Information). Role: Ensures data integrity at entry point. 7m Q: "Explain role in improving accuracy."
VLOOKUP =VLOOKUP(lookup_value, table_array, col_index_num, [range_lookup]). Limitations: Slow, only searches leftmost column, breaks if column inserted. range_lookup=FALSE for exact. 7m Q: "Explain operations... for data analysis."
XLOOKUP =XLOOKUP(lookup_value, lookup_array, return_array, [if_not_found], [match_mode]). Advantages: Default exact match, searches any column, returns entire row/column, simpler syntax. 7m Q: "Advantages over VLOOKUP."
SUMIFS =SUMIFS(sum_range, criteria_range1, criteria1, ...). Application: Customer segmentation (e.g., sum sales for "Region=East" AND "Product=Widget"). 7m Q: "Example for customer segmentation."
INDEX + MATCH =INDEX(return_array, MATCH(lookup_value, lookup_array, 0)). Advantages: Flexible (lookup left/right), faster, column insertion safe. Superior to VLOOKUP. 7m Q: "Advantages over VLOOKUP."
Dynamic Arrays Functions like SORT(), FILTER(), UNIQUE() spill results automatically. Application: Dynamic segmentation lists (e.g., UNIQUE(CustomerRegion)). 7m Q: "Application in segmentation."
Pivot Tables Summarize data via drag-and-drop. Features: Grouping (dates/numbers), Calculated Fields, Slicers (interactive filters). Pivot Charts linked directly. 7m Q: "Explain pivot table."
Scenario Manager What-if analysis tool. Steps: Define scenarios (changing cells), generate summary report (including "Scenario PivotTable"). Compare outcomes. 7m Q: "Explain Scenario Manager."
Macros Recorded VBA code for automation. Steps: View > Macros > Record Macro > Perform actions > Stop Recording. Use case: Repetitive formatting, report generation. 7m Q: "Steps to create a macro."

5.2 Python for Data Analysis

  • Pandas DataFrame:

    • Structure: 2D labeled data structure with index (rows), columns, data. Axes: axis=0 (rows), axis=1 (columns). Heterogeneous data types per column.

    • Features: df.isna(), df.fillna(), pd.merge(), pd.concat(), df.groupby().

    • vs NumPy Array: DataFrame has labeled axes, supports heterogeneous data types, operations align on labels. NumPy arrays are homogeneous, use integer indexing, operations are element-wise without alignment.

  • String Operations in Pandas:

    • Access via .str accessor: df['col'].str.contains('pattern'), .str.startswith(), .str.split(), .str.replace().

    • Regex: df['col'].str.extract(r'(pattern)') (capture group), df['col'].str.findall(r'pattern'). Example: Extract email: r'([\w\.-]+@[\w\.-]+)'.

  • Python Visualization (Code Logic):

    
    # Matplotlib
    
    plt.pie(data, labels=labels)  # Pie
    
    plt.bar(categories, values)   # Bar
    
    plt.hist(data, bins=30)       # Histogram
    
    plt.scatter(x, y)             # Scatter
    
    # Seaborn (statistical, nicer defaults)
    
    sns.barplot(x='cat', y='val', data=df)
    
    sns.histplot(data=df, x='col', kde=True) # Histogram + Density
    
    sns.boxplot(x='cat', y='val', data=df)
    
    sns.scatterplot(x='x', y='y', hue='category', data=df)
    
    

5.3 R Programming for Data Analysis

  • Features: Open-source, extensive statistical/graphical packages (CRAN), vectorized operations (fast), strong community.

  • Major Components: Console (interactive), Workspace (.RData), Packages (library()), Help (?func).

  • Vector Operations: Arithmetic (+,-,*,/), logical (>, ==, %in%), subsetting (x[condition] or x[indices]). Recycling Rule: Shorter vector repeated to match longer in operations.

  • Categorical Data: factor(vector) creates a factor with levels. Essential for modeling categorical predictors.


6. Data Analysis Approaches

Approach Focus Techniques Example
Descriptive "What happened?" EDA, summary stats, visualization. Sales report for last quarter.
Predictive "What will happen?" ML models (regression, classification). Predicting customer churn.
Prescriptive "What should we do?" Optimization, simulation, recommendation engines. Determining optimal price point.

Role of Regression Analysis: Predicts continuous outcomes. Provides interpretable coefficients (effect size). Used for inference (understanding relationships) and prediction.


7. Business Intelligence (BI)

7.1 Definition & Evolution

BI: Technologies, applications, and practices for collecting, integrating, analyzing, and presenting business information to support better decision-making. Evolution: From static, IT-generated reports (1.0) to interactive, self-service dashboards (2.0) to AI-driven, embedded analytics (3.0).

7.2 Types of BI

Type Focus Users Tools/Outputs
Operational Real-time monitoring, day-to-day operations. Operations staff. Real-time dashboards, alerts.
Tactical Middle-management, ad-hoc analysis, short-term. Business analysts. OLAP cubes, ad-hoc queries.
Strategic Long-term trends, KPIs, strategic goals. Senior management. Scorecards (Balanced Scorecard), trend reports.

7.3 BI Tools Comparison (Tableau vs. Power BI)

Feature Tableau Power BI
Usability Drag-and-drop, intuitive for visual-first users. Similar drag-and-drop, deeply integrated with Microsoft ecosystem (Excel, Azure).
Key Features Superior visualizations, geographic mapping, large dataset performance. Strong data modeling (Power Query, DAX), cost-effective, seamless SharePoint/Teams integration.
Data Handling Handles large volumes well, live connections to many sources. Efficient with Microsoft sources (SQL Server, Excel), robust data transformation (Power Query).

7.4 BI in Strategic Decision-Making

Logic of BI Systems:

  1. ETL: Extract from sources, Transform (clean, integrate), Load into Data Warehouse.

  2. Data Warehouse: Centralized repository of integrated, subject-oriented, time-variant data.

  3. OLAP Cubes: Multidimensional structures for fast slicing/dicing of aggregated data.

  4. Front-End: Dashboards, reports, visualizations for end-users.

How BI Supports Decisions:

  • Data Aggregation: Summarizes vast data into KPIs.

  • Interactive Visualization: Allows drill-down, slice-and-dice to explore "why."

  • Predictive Insights: Integration with ML models for forecasting (e.g., sales prediction).

7.5 Ethical Issues in BI

  • Privacy: Tracking employee/customer performance/behavior without consent.

  • Bias: Reports/dashboards reflecting historical biases (e.g., in hiring, lending).

  • Misuse: Using BI for manipulation (e.g., deceptive visualizations), lack of transparency in metrics.


8. Machine Learning and Predictive Modeling

8.1 Regression Models

  • Linear Regression: $$\displaystyle y = \beta_0 + \beta_1 x_1 + ... + \beta_p x_p + \epsilon $$

    • Assumptions: Linearity, independence, homoscedasticity, normality of errors.

    • Interpretation: $$\displaystyle \beta_j $$ = change in $y$ for 1-unit change in $$\displaystyle x_j $$, holding others constant.

  • Logistic Regression: For binary classification ($y \in \{0,1\}$). Models $$\displaystyle \log(\frac{p}{1-p}) = \beta_0 + \beta_1 x_1 + ... $$

    • Odds Ratio: $$\displaystyle e^{\beta_j} $$ = change in odds of $$\displaystyle y=1 $$ for 1-unit change in $$\displaystyle x_j $$.

    • Example: Predict loan approval (Yes=1) using income, credit score, debt-to-income ratio.

8.2 Classification Models

Model Principle Key Feature Example Use
Decision Tree Split data recursively using feature that best separates classes. Splitting Criteria: Gini Impurity ($$\displaystyle 1 - \sum p_i^2 $$) or Entropy ($$\displaystyle -\sum p_i \log p_i $$). Interpretable rules. Customer segmentation, medical diagnosis.
Random Forest Ensemble (Bagging): Many decorrelated trees. Prediction = majority vote (classification) or average (regression). Feature Importance: Mean decrease in impurity/Gini. Out-of-Bag (OOB) Error: Internal validation using ~37% of data not in bootstrap sample. Fraud detection, credit scoring.
Naive Bayes Applies Bayes Theorem with conditional independence assumption: $$\displaystyle P(x_1,...,x_p|y) = \prod P(x_i|y) $$. Types: Gaussian (continuous), Multinomial (discrete counts, text), Bernoulli (binary). Fast, works well with high-dimensional text. Spam filtering (Multinomial), document classification.
Gradient Boosting Boosting: Builds trees sequentially, each correcting errors of previous. Fits residuals (pseudo-residuals). Example: XGBoost, LightGBM. Often highest predictive accuracy. Uses regularization to prevent overfitting. Search ranking, click-through rate prediction.

8.3 Clustering

  • K-means: Algorithm:

    1. Initialization: Choose K centroids randomly.

    2. Assignment: Assign each point to nearest centroid (Euclidean distance).

    3. Update: Recalculate centroids as mean of assigned points.

    4. Repeat 2-3 until convergence (centroids stable).

    • Elbow Method: Plot SSE (inertia) vs. K. Choose K at "elbow" where SSE decrease slows.

    • Example: Segment customers into K groups based on spending/frequency.

8.4 Association Rule Mining (Apriori)

  • Goal: Find items that frequently co-occur in transactions (e.g., market basket analysis).

  • Key Metrics:

    • Support: $$\displaystyle P(\text{itemset}) = \frac{\text{freq( itemset )}}{\text{total transactions}} $$. Measures popularity.

    • Confidence: $$\displaystyle P(Y|X) = \frac{\text{support}(X \cup Y)}{\text{support}(X)} $$. Measures conditional probability.

    • Lift: $$\displaystyle \frac{\text{confidence}(X \rightarrow Y)}{\text{support}(Y)} = \frac{P(X \cap Y)}{P(X)P(Y)} $$. Lift > 1 implies positive correlation (rule is interesting). Lift = 1 = independence.

  • Apriori Principle: Any subset of a frequent itemset must be frequent. Pruning: Eliminate candidate itemsets with any infrequent subset.

  • Advantages: Simple, easy to implement, well-suited for sparse datasets (many items, few per transaction).


9. Big Data Analytics

9.1 Characteristics (5Vs)

  • Volume: Size of data (TB, PB, EB).

  • Variety: Different types (structured, unstructured, semi-structured).

  • Velocity: Speed of data generation/processing (real-time, streaming).

  • Veracity: Uncertainty, quality, trustworthiness of data.

  • Value: Potential insights and benefit derived from data.

9.2 Processing Considerations

  • Storage: Distributed File Systems (HDFS) for scalable, fault-tolerant storage.

  • Processing: Parallel/distributed frameworks (MapReduce, Spark). Scalability: Horizontal (add more nodes). Fault Tolerance: Data replication, task re-execution on failure.

9.3 Phases of Big Data Analytics


[[DIAGRAM: CANVAS: A circular or linear flow diagram with 5 labeled stages in order:

1. Data Acquisition (sources: IoT, social media, logs)

2. Data Storage (HDFS, NoSQL)

3. Data Processing (MapReduce, Spark)

4. Data Analysis (ML, stats, mining)

5. Data Visualization (dashboards, reports)

Arrows connecting each stage in sequence.]]

9.4 Hadoop Ecosystem

  • HDFS Architecture:

    • NameNode: Master server. Manages metadata (file system tree, block locations). Single Point of Failure (HA solutions exist).

    • DataNode: Slave server. Stores data blocks (default 128MB/256MB). Performs block operations (read/write, replication). Sends heartbeats & blockreports to NameNode.

    • Secondary NameNode: Not a backup NameNode. Performs checkpointing: Merges fsimage (metadata snapshot) and edit logs to prevent edit log from becoming too large. Does NOT provide failover.

    • Block Replication: Default factor = 3. One copy on local node, two on different racks (for rack awareness).

  • MapReduce Programming Model:

    • Mapper: Processes input key-value pairs (e.g., <line_num, line_text>) → intermediate key-value pairs (e.g., <word, 1>). Shuffling & Sorting happens automatically between map and reduce phases, grouping values by key.

    • Reducer: Processes grouped intermediate keys (e.g., <word, [1,1,1...]>) → final output (e.g., <word, total_count>).

    • Job Scheduling (Fair Scheduler): Allocates cluster resources (containers) to jobs/pools to ensure fair share over time, not just FIFO. Supports preemption.

    • Word Count Example:

      
      // Mapper
      
      public void map(Object key, Text value, Context context) {
      
          StringTokenizer itr = new StringTokenizer(value.toString());
      
          while (itr.hasMoreTokens()) {
      
              word.set(itr.nextToken());
      
              context.write(word, one);
      
          }
      
      }
      
      // Reducer
      
      public void reduce(Text key, Iterable<IntWritable> values, Context context) {
      
          int sum = 0;
      
          for (IntWritable val : values) { sum += val.get(); }
      
          context.write(key, new IntWritable(sum));
      
      }
      
      
  • HBase Storage Mechanism:

    • Column-family store (NoSQL). Data stored as rows with column families (groups of columns). Within a column family, data stored lexicographically.

    • Schema-less: Columns can be added dynamically per row.

    • Scalability: Automatic sharding (region splitting), built on HDFS.

    • Real-time: Low-latency read/write (random access), unlike HDFS (write-once, read-many).

  • Hadoop File System Commands:

    
    # Copy file/dir from local FS to HDFS
    
    hadoop fs -copyFromLocal /local/path /hdfs/path
    
    # Show content of file (text files)
    
    hadoop fs -cat /hdfs/path/file.txt
    
    # For sequence/other binary files, use -text to attempt conversion
    
    hadoop fs -text /hdfs/path/file.seq
    
    

9.5 Higher-Level Tools

  • Apache Pig:

    • Architecture: Pig Latin script → Pig Latin Compiler → Logical Plan → MapReduce Plan → Execution Engine (on Hadoop).

    • Pig Latin Script Flow: LOAD → FILTER/FOREACH/GROUP (TRANSFORM) → STORE.

    • Example: A = LOAD 'data' AS (user:chararray, item:chararray); B = GROUP A BY user; C = FOREACH B GENERATE group, COUNT(A); STORE C INTO 'output';

  • Apache Hive:

    • Architecture: HiveServer2 (JDBC/ODBC server for clients), Metastore (RDBMS storing table schemas, partitions, locations).

    • HiveQL: SQL-like query language. Compiles to MapReduce/Tez/Spark jobs.

    • UDFs (User Defined Functions): Write Java class implementing UDF or GenericUDF interface. Register: CREATE TEMPORARY FUNCTION myfunc AS 'com.example.MyUDF'; Use: SELECT myfunc(col) FROM table;

9.6 Analytic Sandbox

Definition: An isolated, flexible environment (often cloud-based) where data scientists can experiment, prototype, and test analytics models and processes without affecting production systems. Importance: Enables rapid iteration, testing of new tools/algorithms, safe exploration of sensitive data, and proof-of-concept development before deployment.


10. Ethical, Legal, and Social Implications

10.1 Bias and Discrimination

  • Reinforcing Human Biases: Algorithms learn from historical data that may contain societal biases (e.g., gender, racial). Example: Hiring algorithm downgrading resumes with "women's" in name if trained on historically male-hired data.

  • Unfair Discrimination: Using protected attributes (race, gender, age) or proxies (zip code) to make adverse decisions, even if algorithmically "accurate." Example: Loan denial model using zip code as proxy for race.

10.2 Privacy and Security Issues

  • Data Privacy: Collection: Transparency, informed consent. Anonymization/Pseudonymization: Removing direct identifiers (hard for re-identification). GDPR: EU regulation granting individuals rights (access, erasure, portability).

  • Security Issues: Data Breaches: Unauthorized access. Access Control: Role-based permissions. Secure Storage: Encryption at rest and in transit.

10.3 Ethical Issues in Business Intelligence

  • Misuse of Reports: Creating biased dashboards to mislead stakeholders.

  • Lack of Transparency: "Black box" metrics or KPIs not clearly defined.

  • Data Integrity: Manipulating source data or ETL processes for desired outcomes.

10.4 Transparency and Accountability

  • Explainability (XAI): Ability to explain model predictions (e.g., SHAP, LIME).

  • Audit Trails: Logging data lineage, model versions, and decision points.

  • Responsibility: Clear ownership of models and their outcomes (data scientist, business owner).


11. Advanced and Specialized Topics

11.1 Dimensionality Reduction: t-SNE (Revisit)

  • Goal: Visualization of high-D data in 2D/3D.

  • Key Idea: Preserve local structure (similar points stay close). Uses t-distribution in low-D to alleviate crowding problem.

  • Parameters: perplexity (roughly # of nearest neighbors), learning_rate.

  • Limitation: Non-linear, non-parametric, results change with different runs/params. Not for feature extraction in supervised learning.

11.2 Regular Expressions (Regex)

  • Syntax: . (any char), * (0+), + (1+), ? (0-1), ^ (start), $ (end), \d (digit), \w (word char), [] (character set), | (or).

  • Pandas Examples:

    
    df['phone'].str.extract(r'(\d{3}-\d{3}-\d{4})')  # Extract (xxx-xxx-xxxx)
    
    df['email'].str.findall(r'[\w\.-]+@[\w\.-]+')     # Find all emails in a string
    
    

11.3 Exploratory Data Analysis (EDA)

  • Role: Understand data, discover patterns, spot anomalies, test hypotheses before formal modeling.

  • Techniques: Summary statistics (mean, SD, IQR), visualization (histograms, box plots, scatter matrix), correlation analysis.

  • vs. Confirmatory Data Analysis (CDA): EDA is open-ended, inductive. CDA is hypothesis-driven, deductive (e.g., significance testing).

11.4 Role of Data Scientist vs. Data Analyst

Aspect Data Scientist Data Analyst
Primary Focus Prediction & advanced analytics (ML). Analysis & reporting (descriptive).
Skills Statistics, ML, programming (Python/R), software engineering. SQL, BI tools (Power BI/Tableau), basic stats, business acumen.
Output Predictive models, algorithms, data products. Dashboards, reports, insights for business decisions.
Question "What will happen?" / "Why did it happen?" "What happened?" / "What is happening?"

11.5 Maximum Likelihood Estimation (MLE) (Revisit)

  • Concept: Find parameter values ($\hat{\theta}$) that make the observed data most probable.

  • Steps:

    1. Write down likelihood function $$\displaystyle L(\theta) = P(X_1, X_2, ..., X_n | \theta) = \prod_{i=1}^n P(X_i|\theta) $$ (assuming i.i.d.).

    2. Take log: $$\displaystyle \ell(\theta) = \log L(\theta) = \sum \log P(X_i|\theta) $$.

    3. Differentiate $\ell(\theta)$ w.r.t. $\theta$, set to zero, solve for $\hat{\theta}$.

  • Example: For Normal($$\displaystyle \mu, \sigma^2 $$), MLE for $\mu$ is sample mean $\bar{x}$.

Go to where you left off?

Quick Add to Notes

Save questions, your own notes and screenshots into notes filed by unit. It takes a free account.

Create free account

Have an account? Log in