All Roadmaps / Data Scientist
Data Science Interactive Graph Curriculum

Data Scientist

The master roadmap to becoming a professional Data Scientist — covering applied statistics, SQL data engineering, exploratory analysis, production ML pipelines, and causal experimentation.

5 Phases
10 Topics
~156h Total Time
Study Progress: 0 of 10 completed 0h of ~156h 0%
/
Status:
Level:
🎯
Recommended Next Step Beginner

Intelligent Agents & Problem Formulation

Graph Legend:
Recommended
Optional
Beginner
Intermediate
Advanced
Done In Progress Use J/K or click cards to explore
Curriculum Start
01 Phase 01 0/2 completed

Phase 1: Statistics & Mathematical Intuition

Probability theory, statistical distributions, hypothesis testing, and quantitative reasoning for data-driven decisions.

beginner Recommended • 2 weeks

Descriptive & Inferential Statistics

Measures of central tendency (mean, median, mode), dispersion (variance, standard deviation, IQR), skewness, kurtosis, and the Central Limit Theorem (CLT).

intermediate Recommended • 2 weeks

Probability Distributions & Hypothesis Testing

Normal, Binomial, Poisson, and Student's t-distributions; formulating null vs alternative hypotheses, Type I/II errors, p-values, t-tests, and ANOVA.

02 Phase 02 0/2 completed

Phase 2: SQL & Data Engineering Foundations

Querying relational databases, complex joins, analytical window functions, and data cleaning pipelines.

beginner Recommended • 2 weeks

Modern SQL for Data Science

SELECT, filtering, GROUP BY, aggregations, multi-table JOINs (INNER, LEFT, FULL OUTER), Common Table Expressions (CTEs), and subqueries.

intermediate Recommended • 10 days

Advanced SQL Window Functions & Aggregations

ROW_NUMBER(), RANK(), DENSE_RANK(), LEAD(), LAG(), running totals, moving averages, and cumulative distribution calculations.

03 Phase 03 0/2 completed

Phase 3: Python Data Analysis & Visualization

High-performance data wrangling with Pandas, numerical computing with NumPy, and visual storytelling with Seaborn.

beginner Recommended • 2 weeks

Pandas & NumPy for Data Manipulation

Loading multi-format data (CSV, Parquet, JSON, SQL), handling nulls, vectorized string operations, datetime manipulation, and pivot tables.

intermediate Recommended • 10 days

Exploratory Data Analysis & Visual Storytelling

Matplotlib, Seaborn, distribution plots, correlation heatmaps, pairplots, box plots for outlier detection, and communicating statistical insights.

04 Phase 04 0/2 completed

Phase 4: Predictive Modeling & Experimentation

Applying supervised learning models to solve business problems, feature engineering, and conducting rigorous A/B tests.

intermediate Recommended • 3 weeks

Applied Machine Learning for Business

Linear/Logistic Regression, Random Forests, XGBoost, Scikit-Learn pipelines, customer churn prediction, and lifetime value (LTV) modeling.

advanced Recommended • 2 weeks

A/B Testing & Causal Inference

Randomized controlled trials (RCTs), sample size determination, statistical power, minimum detectable effect (MDE), and causal inference (propensity score matching).

05 Phase 05 0/2 completed

Phase 5: Big Data & Production Analytics

Distributed computing with Apache Spark, cloud data warehouses, and automated analytics pipelines.

advanced Recommended • 2 weeks

Distributed Data Processing with PySpark

Resilient Distributed Datasets (RDDs), Spark DataFrames, distributed aggregation, partitioning strategies, and big data ETL workflows.

intermediate Optional • 10 days

Cloud Data Warehousing & Analytics Engineering

Snowflake, Google BigQuery, dbt (data build tool), columnar storage architectures, data modeling (star and snowflake schemas), and metric layers.

Beginner 45 min

Topic Title

Status:

What You Need to Know

Topic explanation description goes here.

Progress exported & copied to clipboard!