Modul Ajar Informatika Kelas 11 SMA: Analisis Data: Big Data dan Machine Learning Sederhana (Bab 5)

Konsep Big Data (5V), siklus pemrosesan data (CRISP-DM), pembersihan data (data wrangling) dengan Python Pandas, visualisasi data eksploratif (EDA), serta algoritma Machine Learning sederhana (Regresi Linear dan K-Nearest Neighbors).

Capaian dan tujuan pembelajaran

  • Peserta didik mampu menganalisis konsep Big Data, siklus CRISP-DM, dan etika privasi pengolahan data.
  • Peserta didik mampu melakukan pembersihan data dan eksplorasi visualisasi data statistik menggunakan pustaka Python.
  • Peserta didik mampu melatih dan mengevaluasi model pembelajaran mesin sederhana (Regresi Linear dan KNN).

Materi pokok & uraian konsep pembelajaran

Dalam era ledakan informasi, data merupakan aset strategis baru (*the new oil*) yang mendorong pengambilan keputusan berbasis bukti di seluruh sektor industri dan sains. Karakteristik *Big Data* didefinisikan oleh prinsip 5V: *Volume* (skala raksasa), *Velocity* (kecepatan arus tinggi), *Variety* (ragam format terstruktur/tidak terstruktur), *Veracity* (keaslian data), dan *Value* (nilai manfaat).

Tahapan analisis data mengikuti metodologi standar seperti CRISP-DM (*Cross-Industry Standard Process for Data Mining*): memahami bisnis, memahami data, persiapan data (*data cleaning/wrangling*), pemodelan (*modeling*), evaluasi (*evaluation*), dan penerapan (*deployment*).

Pembelajaran Mesin (*Machine Learning*) memungkinkan komputer belajar dari pola data tanpa diprogram secara eksplisit. Siswa mempelajari implementasi model *Supervised Learning* meliputi Regresi Linear untuk prediksi nilai kontinu dan algoritma *K-Nearest Neighbors* (KNN) untuk klasifikasi kelompok data.

Peta subtopik bahasan

  • Karakteristik Big Data (5V) dan Metodologi Standar CRISP-DM

    Menelaah skala data raksasa dan siklus hidup perancangan proyek analitik data modern.

  • Persiapan dan Pembersihan Data (Data Wrangling) dengan Python

    Menangani nilai hilang (missing values), duplikasi data, dan normalisasi tipe data dengan Pandas.

  • Analisis Data Eksploratif (EDA) dan Visualisasi Statistik

    Membuat diagram scatter plot, histogram, boxplot, dan korelasi matriks menggunakan Matplotlib/Seaborn.

  • Pengenalan Algoritma Machine Learning (Regresi Linear dan K-NN)

    Membangun model prediksi sederhana, pembagian data latih-uji (train-test split), dan metrik akurasi.

Istilah kunci dan glosarium

Big Data 5V
Lima pilar dimensi data raksasa: Volume (kapasitas), Velocity (laju kecepatan), Variety (keberagaman), Veracity (akurasi keabsahan), dan Value (nilai guna).
Data Wrangling (Cleaning)
Proses membersihkan, menyusun ulang, dan mentransformasikan data mentah yang berantakan menjadi format siap analisis.
Exploratory Data Analysis (EDA)
Pendekatan analisis kumpulan data untuk merangkum karakteristik utamanya seringkali dengan metode visualisasi grafik.
K-Nearest Neighbors (KNN)
Algoritma supervised learning yang mengklasifikasikan data baru berdasarkan mayoritas label dari $k$ tetangga terdekatnya dalam ruang vektor.
Train-Test Split
Pembagian dataset menjadi data latih (training set untuk membangun model) dan data uji (testing set untuk mengukur akurasi performa model).

Instrumen asesmen formatif & contoh soal pembelajaran

5 butir instrumen soal pilihan ganda berbasis HOTS untuk mengukur pemahaman konsep pada bab ini. Dilengkapi kunci jawaban dan uraian pembahasan analitis.

Soal 1

Dimensi 'Veracity' dalam konsep Big Data 5V mengacu pada karakteristik...

  • A. Tingkat keabsahan, kebersihan, keandalan, dan akurasi kebenaran data dari bias atau distorsi
  • B. Besarnya ukuran kapasitas hard disk dalam satuan terabyte
  • C. Kecepatan transmisi aliran data per detik
  • D. Banyaknya variasi format foto dan video
Lihat Kunci Jawaban & Pembahasan
Kunci Jawaban: Pilihan A

Pembahasan: Veracity menitikberatkan pada kualitas, integritas, dan keandalan data dari kebisingan (noise) dan ketidakakuratan.

Soal 2

Fungsi utama dari tahap 'Data Preparation / Cleaning' dalam siklus proyek CRISP-DM adalah...

  • A. Menangani data hilang (missing values), menghapus duplikasi, dan menstandarkan format data sebelum masuk pemodelan machine learning
  • B. Mematikan komputer setelah selesai bekerja
  • C. Mengunggah seluruh data rahasia ke media sosial
  • D. Mengubah seluruh isi tabel menjadi angka nol
Lihat Kunci Jawaban & Pembahasan
Kunci Jawaban: Pilihan A

Pembahasan: Data cleaning memastikan model machine learning tidak mempelajari pola sampah (*garbage in, garbage out*).

Soal 3

Algoritma Machine Learning 'K-Nearest Neighbors' (KNN) mengklasifikasikan sampel data baru berdasarkan...

  • A. Kategori mayoritas dari sejumlah $k$ tetangga data terdekat yang diukur melalui jarak Euclidean
  • B. Tebakan angka acak komputer
  • C. Urutan alfabetis nama pemilik data
  • D. Jumlah total baris dalam basis data
Lihat Kunci Jawaban & Pembahasan
Kunci Jawaban: Pilihan A

Pembahasan: KNN mengukur jarak geometris (misal Euclidean Distance) ke titik data terdekat dan memilih kelas terbanyak dari tetangga $k$ terdekat.

Soal 4

Mengapa dataset wajib dipisahkan menjadi data latih (training set) dan data uji (test set)?

  • A. Untuk menguji kemampuan generalisasi model pada data baru yang belum pernah dilihat dan mencegah fenomena overfitting
  • B. Agar ukuran file memori menjadi dua kali lipat lebih berat
  • C. Hanya karena kebiasaan tanpa tujuan teknis
  • D. Untuk memperlambat proses kalkulasi prosesor
Lihat Kunci Jawaban & Pembahasan
Kunci Jawaban: Pilihan A

Pembahasan: Evaluasi pada data uji terpisah memastikan model memiliki akurasi prediktif nyata (*unseen data*) tanpa overfitting.

Soal 5

Visualisasi statistik yang paling cocok untuk menampilkan hubungan korelasi dan sebaran titik data antara dua variabel kontinu adalah...

  • A. Scatter Plot (Diagram Pencar)
  • B. Pie Chart (Diagram Lingkaran)
  • C. Donut Chart
  • D. Tabel Teks Hitam Putih
Lihat Kunci Jawaban & Pembahasan
Kunci Jawaban: Pilihan A

Pembahasan: Scatter plot menampilkan pasangan titik koordinat $(x, y)$ untuk memperlihatkan tren hubungan korelasi positif/negatif antarvariabel.

Petunjuk penggunaan berkas

Setelah mengunduh berkas perangkat ajar, ikuti langkah berikut untuk menggunakannya secara optimal:

  1. Buka dokumen menggunakan Microsoft Word, Google Docs, atau LibreOffice.
  2. Sesuaikan identitas satuan pendidikan, nama guru pengampu, NIP, serta alokasi waktu kelas.
  3. Cetak instrumen asesmen atau bagikan lembar kerja (LKPD) kepada peserta didik.

Bahan ajar Informatika lainnya

  • Berpikir Komputasional

    Informatika SMP Kelas 7 · Semester 1

  • Teknologi Informasi dan Komunikasi

    Informatika SMP Kelas 7 · Semester 1

  • Sistem Komputer

    Informatika SMP Kelas 7 · Semester 1