Dimensi 'Veracity' dalam konsep Big Data 5V mengacu pada karakteristik...
Lihat Kunci Jawaban & Pembahasan
Pembahasan: Veracity menitikberatkan pada kualitas, integritas, dan keandalan data dari kebisingan (noise) dan ketidakakuratan.
Konsep Big Data (5V), siklus pemrosesan data (CRISP-DM), pembersihan data (data wrangling) dengan Python Pandas, visualisasi data eksploratif (EDA), serta algoritma Machine Learning sederhana (Regresi Linear dan K-Nearest Neighbors).
Dalam era ledakan informasi, data merupakan aset strategis baru (*the new oil*) yang mendorong pengambilan keputusan berbasis bukti di seluruh sektor industri dan sains. Karakteristik *Big Data* didefinisikan oleh prinsip 5V: *Volume* (skala raksasa), *Velocity* (kecepatan arus tinggi), *Variety* (ragam format terstruktur/tidak terstruktur), *Veracity* (keaslian data), dan *Value* (nilai manfaat).
Tahapan analisis data mengikuti metodologi standar seperti CRISP-DM (*Cross-Industry Standard Process for Data Mining*): memahami bisnis, memahami data, persiapan data (*data cleaning/wrangling*), pemodelan (*modeling*), evaluasi (*evaluation*), dan penerapan (*deployment*).
Pembelajaran Mesin (*Machine Learning*) memungkinkan komputer belajar dari pola data tanpa diprogram secara eksplisit. Siswa mempelajari implementasi model *Supervised Learning* meliputi Regresi Linear untuk prediksi nilai kontinu dan algoritma *K-Nearest Neighbors* (KNN) untuk klasifikasi kelompok data.
Menelaah skala data raksasa dan siklus hidup perancangan proyek analitik data modern.
Menangani nilai hilang (missing values), duplikasi data, dan normalisasi tipe data dengan Pandas.
Membuat diagram scatter plot, histogram, boxplot, dan korelasi matriks menggunakan Matplotlib/Seaborn.
Membangun model prediksi sederhana, pembagian data latih-uji (train-test split), dan metrik akurasi.
5 butir instrumen soal pilihan ganda berbasis HOTS untuk mengukur pemahaman konsep pada bab ini. Dilengkapi kunci jawaban dan uraian pembahasan analitis.
Dimensi 'Veracity' dalam konsep Big Data 5V mengacu pada karakteristik...
Pembahasan: Veracity menitikberatkan pada kualitas, integritas, dan keandalan data dari kebisingan (noise) dan ketidakakuratan.
Fungsi utama dari tahap 'Data Preparation / Cleaning' dalam siklus proyek CRISP-DM adalah...
Pembahasan: Data cleaning memastikan model machine learning tidak mempelajari pola sampah (*garbage in, garbage out*).
Algoritma Machine Learning 'K-Nearest Neighbors' (KNN) mengklasifikasikan sampel data baru berdasarkan...
Pembahasan: KNN mengukur jarak geometris (misal Euclidean Distance) ke titik data terdekat dan memilih kelas terbanyak dari tetangga $k$ terdekat.
Mengapa dataset wajib dipisahkan menjadi data latih (training set) dan data uji (test set)?
Pembahasan: Evaluasi pada data uji terpisah memastikan model memiliki akurasi prediktif nyata (*unseen data*) tanpa overfitting.
Visualisasi statistik yang paling cocok untuk menampilkan hubungan korelasi dan sebaran titik data antara dua variabel kontinu adalah...
Pembahasan: Scatter plot menampilkan pasangan titik koordinat $(x, y)$ untuk memperlihatkan tren hubungan korelasi positif/negatif antarvariabel.
Setelah mengunduh berkas perangkat ajar, ikuti langkah berikut untuk menggunakannya secara optimal:
Tidak ada bahan ajar yang cocok dengan kriteria pencarian.