Modul Ajar Informatika Kelas 12 SMA: Pipeline Sains Data, Rekayasa Fitur, dan Visualisasi Data Interaktif (Bab 5)

Menjalankan tahapan Data Science: pembersihan data (cleaning), Exploratory Data Analysis (EDA), pengenalan model Machine Learning, dan visualisasi dashboard.

Capaian dan tujuan pembelajaran

  • Melakukan pembersihan data mentah (handling missing values, outliers, data encoding) menggunakan pustaka analisis data (seperti Pandas/Python).
  • Menganalisis korelasi dan pola distribusi data melalui Exploratory Data Analysis (EDA) dan visualisasi statistik terstandar.
  • Menerapkan konsep dasar algoritma pembelajaran mesin (Machine Learning: Klasifikasi/Regresi) untuk prediksi data dan penyajian temuan bisnis.

Materi pokok & uraian konsep pembelajaran

Sains Data (*Data Science*) menggabungkan ilmu komputasi, matematika statistika, dan pemahaman domain konteks untuk mengekstraksi wawasan berharga (*actionable insights*) dari tumpukan data bervolume besar (*Big Data*). Pada jenjang SMA Kelas 12, peserta didik mempelajari tahapan lengkap jalur pipa data (*Data Pipeline*) dari data mentah (*raw data*) hingga pemodelan prediktif.

Peserta didik mempraktikkan proses pra-pemrosesan data (*Data Preprocessing*), mencakup penanganan data hilang (*missing values imputation*), deteksi data pencilan (*outliers*), normalisasi fitur numerik, dan konversi data kategorikal (*one-hot encoding*). Menggunakan pustaka komputasi sains seperti Pandas, peserta didik melakukan Analisis Eksplorasi Data (*Exploratory Data Analysis* - EDA).

Konsep dasar *Machine Learning* (pembelajaran mesin terawasi/supervised learning seperti Regresi Linear dan Klasifikasi Decision Tree/KNN) diperkenalkan secara konseptual dan aplikatif. Peserta didik menyajikan hasil temuan analisis mereka dalam bentuk grafik visualisasi interaktif dan dashboard data yang komunikatif bagi pengambil keputusan.

Peta subtopik bahasan

  • Pra-pemrosesan Data dan Rekayasa Fitur (Feature Engineering)

    Penanganan missing values (mean/median/drop), deteksi outlier metode IQR/Z-score, standardisasi skala, dan encoding.

  • Analisis Eksplorasi Data (EDA) dan Visualisasi Statistik

    Kalkulasi matriks korelasi Pearson, visualisasi histogram distribusi, boxplot, scatter plot, dan heatmap korelasi.

  • Pengenalan Model Machine Learning dan Evaluasi Prediksi

    Pembagian dataset (Train/Test Split 80:20), konsep regresi/klasifikasi, dan metrik evaluasi (Accuracy, Precision, Recall, MSE).

Istilah kunci dan glosarium

Data Preprocessing
Tahapan pembersihan dan transformasi data mentah ke dalam format terstruktur yang siap diproses oleh model algoritma analisis.
Exploratory Data Analysis (EDA)
Pendekatan analisis data menggunakan ringkasan statistik dan grafik visual untuk memahami karakteristik dan pola data.
Outlier
Nilai pengamatan data yang menyimpang secara ekstrem dari pola umum sebagian besar data lainnya dalam satu kumpulan data.
Train-Test Split
Metode membagi kumpulan data menjadi dua bagian independen: data latih (training data) untuk melatih model dan data uji (testing data) untuk evaluasi performa.
Supervised Learning
Cabang Machine Learning di mana model dilatih menggunakan kumpulan data yang telah memiliki label target output yang jelas.

Instrumen asesmen formatif & contoh soal pembelajaran

5 butir instrumen soal pilihan ganda berbasis HOTS untuk mengukur pemahaman konsep pada bab ini. Dilengkapi kunci jawaban dan uraian pembahasan analitis.

Soal 1

Dalam tahapan pembersihan data, jika sebuah kolom numerik 'Pendapatan' memiliki distribusi data yang sangat miring ke kanan (skewed) dengan banyak nilai pencilan ekstrem tinggi, metode imputasi nilai hilang (missing value) yang paling tepat adalah...

  • A. Mengganti nilai hilang dengan angka nol.
  • B. Mengisi nilai hilang menggunakan nilai Median (karena median resisten terhadap pengaruh outlier ekstrem).
  • C. Menghapus seluruh tabel data dari komputer.
  • D. Mengisi nilai hilang dengan perkalian seluruh angka di kolom tersebut.
Lihat Kunci Jawaban & Pembahasan
Kunci Jawaban: Pilihan B

Pembahasan: Pada data yang terdistribusi miring (skewed) dengan outlier ekstrem, nilai Median lebih representatif dibanding Mean (rata-rata) yang sangat mudah terdistorsi oleh angka ekstrem.

Soal 2

Nilai korelasi Pearson ($r$) antara 'Durasi Belajar Siswa' dan 'Nilai Ujian' diperoleh sebesar $+0.88$. Interpretasi statistik yang paling akurat dari nilai tersebut adalah...

  • A. Semakin lama waktu belajar siswa, maka nilai ujiannya cenderung semakin menurun secara drastis.
  • B. Terdapat hubungan linear positif yang sangat kuat: semakin tinggi durasi belajar siswa, nilai ujian cenderung semakin tinggi pula.
  • C. Tidak ada hubungan sama sekali antara durasi belajar dengan nilai ujian.
  • D. Durasi belajar menyebabkan siswa terkena sakit kepala.
Lihat Kunci Jawaban & Pembahasan
Kunci Jawaban: Pilihan B

Pembahasan: Koefisien korelasi $r = +0.88$ mendekati $+1.0$, menunjukkan korelasi linear positif kuat di mana kenaikan satu variabel beriringan dengan kenaikan variabel lainnya.

Soal 3

Mengapa dalam pembangunan model Machine Learning kita wajib memisahkan dataset menjadi 'Data Latih' (Training Set) dan 'Data Uji' (Testing Set)?

  • A. Untuk menggandakan ukuran memori komputer.
  • B. Menguji kemampuan generalisasi model pada data baru yang belum pernah dilihat sebelumnya dan mendeteksi terjadinya *overfitting*.
  • C. Memastikan kode program berjalan tanpa koneksi listrik.
  • D. Mengubah tipe model menjadi data suara.
Lihat Kunci Jawaban & Pembahasan
Kunci Jawaban: Pilihan B

Pembahasan: Pemisahan data uji mengukur apakah model benar-benar mempelajari pola secara general atau sekadar menghafal data latih (*overfitting*).

Soal 4

Jenis diagram visualisasi data yang paling efektif untuk membandingkan sebaran distribusi, rentang interkuartil (IQR), median, dan mendeteksi adanya data pencilan (outlier) adalah...

  • A. Diagram Lingkaran (Pie Chart)
  • B. Diagram Kotak Garis (Boxplot)
  • C. Diagram Garis Sederhana (Line Chart)
  • D. Word Cloud
Lihat Kunci Jawaban & Pembahasan
Kunci Jawaban: Pilihan B

Pembahasan: Boxplot secara visual menyajikan lima angka ringkasan statistik (minimum, Q1, median, Q3, maksimum) serta menandai titik pencilan (*outliers*) di luar garis kumis (*whiskers*).

Soal 5

Jika sebuah model klasifikasi Machine Learning digunakan untuk mendiagnosis penyakit kanker ganas pada pasien rumah sakit, metrik performa evaluasi yang paling krusial untuk diprioritaskan agar tidak ada pasien kanker yang salah divonis sehat (meminimalkan False Negative) adalah...

  • A. Recall (Sensitivitas)
  • B. Kecepatan mengetik keyboard
  • C. Jumlah warna pada grafik
  • D. Ukuran file CSV
Lihat Kunci Jawaban & Pembahasan
Kunci Jawaban: Pilihan A

Pembahasan: Dalam konteks medis darurat, *Recall* mengukur proporsi kasus positif aktual yang berhasil dideteksi dengan benar; Recall tinggi meminimalkan risiko *False Negative* (pasien kanker terlewat tidak terdeteksi).

Petunjuk penggunaan berkas

Setelah mengunduh berkas perangkat ajar, ikuti langkah berikut untuk menggunakannya secara optimal:

  1. Buka dokumen menggunakan Microsoft Word, Google Docs, atau LibreOffice.
  2. Sesuaikan identitas satuan pendidikan, nama guru pengampu, NIP, serta alokasi waktu kelas.
  3. Cetak instrumen asesmen atau bagikan lembar kerja (LKPD) kepada peserta didik.

Bahan ajar Informatika lainnya

  • Berpikir Komputasional

    Informatika SMP Kelas 7 · Semester 1

  • Teknologi Informasi dan Komunikasi

    Informatika SMP Kelas 7 · Semester 1

  • Sistem Komputer

    Informatika SMP Kelas 7 · Semester 1