ENSEMBLE LEARNING
- Konsep Dasar Ensemble Learning
Ensemble Learning merupakan pendekatan dalam machine learning yang menggunakan beberapa model atau algoritma secara bersamaan untuk menghasilkan suatu prediksi. Pendekatan ini berbeda dengan penggunaan algoritma tunggal yang hanya mengandalkan satu model dalam melakukan prediksi.
Beberapa algoritma seperti K-Nearest Neighbor (KNN), Decision Tree, Naive Bayes, dan Neural Network dapat menghasilkan tingkat akurasi yang berbeda ketika digunakan pada dataset yang sama. Perbedaan tersebut terjadi karena setiap algoritma memiliki karakteristik dan cara yang berbeda dalam mempelajari pola pada data. Oleh karena itu, model yang memiliki akurasi lebih rendah tidak selalu berarti tidak memiliki manfaat karena setiap model dapat menangkap karakteristik tertentu dari dataset.
Pada Ensemble Learning, beberapa model tersebut dapat digunakan secara bersama-sama. Hasil prediksi dari masing-masing model kemudian digabungkan sehingga keputusan akhir tidak hanya bergantung pada satu model, tetapi berasal dari beberapa model dengan karakteristik yang berbeda.
- Bias dan Variance
Dalam membangun model prediksi, terdapat dua konsep penting yang perlu diperhatikan, yaitu bias dan variance. Keduanya berkaitan dengan tingkat kesalahan model serta kemampuan model dalam melakukan prediksi terhadap data.
Bias merupakan selisih atau kesalahan antara hasil prediksi model dengan nilai yang sebenarnya. Bias yang tinggi menunjukkan bahwa model belum mampu mempelajari pola data dengan baik. Sementara itu, variance menunjukkan perubahan atau sensitivitas model ketika training set mengalami perubahan.
Kompleksitas model juga berhubungan dengan bias dan variance. Semakin kompleks sebuah model, kinerja pada data pelatihan dapat semakin baik. Namun, apabila kompleksitas terlalu tinggi, model dapat mengalami peningkatan kesalahan ketika diuji menggunakan data baru. Oleh karena itu, diperlukan keseimbangan antara bias dan variance agar model dapat menghasilkan prediksi yang baik.
- Underfitting
Underfitting merupakan kondisi ketika model memiliki bias tinggi dan variance rendah. Pada kondisi ini, model terlalu sederhana sehingga tidak mampu menangkap pola yang terdapat pada dataset dengan baik.
Model yang mengalami underfitting dapat menghasilkan prediksi yang kurang sesuai dengan target. Salah satu penyebab yang dibahas dalam video adalah dataset yang terlalu sedikit atau kurang memadai sehingga model tidak memperoleh informasi yang cukup untuk mempelajari pola data.
- Overfitting
Overfitting merupakan kondisi ketika model memiliki bias rendah dan variance tinggi. Model dapat mempelajari data pelatihan dengan sangat baik, tetapi ketika diberikan data yang berbeda, kemampuan prediksinya dapat menurun.
Overfitting dapat terjadi ketika model terlalu mengikuti pola yang terdapat pada dataset, termasuk pola yang sebenarnya merupakan noise. Dataset yang memiliki banyak data tidak valid atau cara pengumpulan data yang kurang dapat dipertanggungjawabkan dapat meningkatkan risiko terjadinya overfitting.
- Cara Membangun Model yang Baik
Untuk memperoleh kondisi model yang baik, terdapat beberapa hal yang perlu diperhatikan. Pertama, dataset yang digunakan harus memiliki kualitas yang baik dan dapat diandalkan. Proses pengumpulan data juga perlu dilakukan dengan cara yang tepat agar data yang digunakan dapat merepresentasikan permasalahan yang dianalisis.
Kedua, dapat digunakan cross-validation untuk membantu meminimalkan overfitting. Melalui proses tersebut, model dapat diuji menggunakan pembagian data yang berbeda sehingga kemampuan model dapat dievaluasi secara lebih baik.
Ketiga, parameter dan hyperparameter pada setiap algoritma perlu ditentukan melalui proses eksperimen. Pemilihan parameter yang sesuai dapat memengaruhi kinerja model. Selain itu, pemilihan metrik evaluasi juga perlu diperhatikan. Evaluasi tidak hanya menggunakan akurasi, tetapi dapat dilengkapi dengan precision, recall, AUC, atau metrik lainnya sesuai kebutuhan.
- Prinsip Kerja Ensemble Learning
Prinsip utama Ensemble Learning adalah menggunakan beberapa model untuk melakukan prediksi terhadap input yang sama. Setiap model akan menghasilkan prediksi berdasarkan pola dan karakteristik yang telah dipelajarinya.
Hasil dari masing-masing model kemudian digabungkan melalui proses agregasi. Agregasi tersebut dapat dilakukan menggunakan metode voting atau nilai rata-rata (mean). Dengan cara tersebut, hasil akhir diperoleh berdasarkan gabungan dari beberapa prediksi model.
Sebagai contoh, apabila digunakan beberapa algoritma seperti KNN, Decision Tree, Naive Bayes, dan Neural Network, seluruh model dapat diberikan dataset dan input yang sama. Setiap model kemudian menghasilkan prediksi yang mungkin berbeda. Hasil tersebut selanjutnya dikombinasikan untuk menghasilkan prediksi akhir
- Bagging
Bagging merupakan salah satu pendekatan dalam Ensemble Learning. Pada metode ini dilakukan proses resampling untuk menghasilkan dataset baru yang kemudian digunakan dalam proses pembentukan model.
Dengan menggunakan sampel data yang berbeda, beberapa model dapat dibangun dan menghasilkan karakteristik prediksi yang berbeda. Hasil prediksi dari model-model tersebut kemudian digabungkan untuk memperoleh hasil akhir.
- Random Forest
Random Forest merupakan pengembangan dari pendekatan Bagging. Selain melakukan resampling terhadap dataset, Random Forest juga melakukan sampling terhadap atribut atau fitur.
Model yang digunakan dalam Random Forest adalah Decision Tree. Beberapa Decision Tree dibentuk dan hasil dari kumpulan pohon tersebut digunakan untuk menghasilkan prediksi. Oleh karena itu, Random Forest dapat dipahami sebagai kumpulan pohon keputusan yang digunakan secara bersama-sama dalam proses prediksi.
- Boosting
Boosting merupakan pendekatan Ensemble Learning yang membangun model secara bertahap. Model-model yang dibangun tidak sepenuhnya berdiri sendiri karena hasil evaluasi dari model sebelumnya dapat memengaruhi pembentukan model berikutnya.
Dengan demikian, model berikutnya dibangun dengan mempertimbangkan hasil dari model sebelumnya. Proses tersebut dilakukan secara berurutan sehingga beberapa model dapat digunakan secara bersama-sama dalam menghasilkan prediksi.
- Kesimpulan
Ensemble Learning merupakan pendekatan machine learning yang menggabungkan beberapa model untuk menghasilkan prediksi secara kolektif. Pendekatan ini memanfaatkan perbedaan karakteristik dari setiap algoritma sehingga hasil dari satu model dapat dilengkapi oleh model lainnya.
Dalam pembangunan model, bias dan variance perlu diperhatikan karena berkaitan dengan permasalahan underfitting dan overfitting. Penggunaan dataset yang berkualitas, cross-validation, pengaturan parameter dan hyperparameter, serta pemilihan metrik evaluasi yang sesuai dapat membantu menghasilkan model yang lebih baik.
Ensemble Learning bekerja dengan memberikan input kepada beberapa model, kemudian menggabungkan hasil prediksi melalui proses agregasi. Beberapa pendekatan yang dibahas dalam materi adalah Bagging, Random Forest, dan Boosting, yang masing-masing memiliki mekanisme berbeda dalam membangun dan menggabungkan beberapa model.