Ensemble learning

Ensemble learning

oleh merry andini -
Jumlah balasan: 0

Kajian Ringkas tentang Cara Meningkatkan Ketepatan dan Kestabilan Prediksi

Abstrak

Ensemble learning merupakan salah satu pendekatan dalam machine learning yang menggunakan beberapa model sekaligus untuk menghasilkan prediksi yang lebih baik. Pendekatan ini dapat digunakan pada permasalahan klasifikasi maupun regresi. Setiap algoritma memiliki cara yang berbeda dalam mempelajari data, sehingga hasil yang diberikan juga tidak selalu sama. Karena itu, menggabungkan beberapa model dapat menjadi salah satu cara untuk mendapatkan hasil prediksi yang lebih stabil. Pembahasan dalam makalah ini dimulai dari perbedaan hasil akurasi beberapa algoritma tunggal, kemudian dilanjutkan dengan konsep bias dan varians. Kedua hal tersebut berkaitan dengan munculnya underfitting dan overfitting pada model. Selanjutnya dibahas tiga metode ensemble, yaitu Bagging, Random Forest, dan Boosting. Selain itu, dibahas juga beberapa hal yang perlu diperhatikan dalam membangun model, seperti kualitas data, cross-validation, hyperparameter tuning, dan pemilihan metrik evaluasi yang sesuai. Dari pembahasan tersebut dapat dilihat bahwa penggunaan beberapa model secara bersama-sama dapat membantu menghasilkan prediksi yang lebih stabil dan lebih mampu bekerja pada data baru dibandingkan hanya menggunakan satu model.

1. Pendahuluan

Dalam membangun model machine learning, salah satu hal yang sering menjadi perhatian adalah nilai akurasi. Model dengan akurasi paling tinggi biasanya dianggap sebagai model yang paling baik. Namun, memilih model hanya dari nilai akurasinya belum tentu menjadi pilihan yang tepat. Bisa saja model lain memiliki cara berbeda dalam membaca data dan mampu menemukan pola yang tidak terlihat oleh model dengan akurasi lebih tinggi.

Sebagai contoh, ketika tiga algoritma digunakan pada dataset yang sama, hasil akurasinya dapat berbeda. K-Nearest Neighbors (KNN) memperoleh akurasi sekitar 73%, Decision Tree sekitar 79%, sedangkan Support Vector Machine (SVM) sekitar 75%. Perbedaan tersebut menunjukkan bahwa setiap algoritma memiliki karakteristik dan cara kerja masing-masing dalam mempelajari data. Ada model yang lebih cocok untuk kondisi data tertentu, tetapi belum tentu memberikan hasil yang sama ketika digunakan pada kondisi yang berbeda.

Dari kondisi tersebut muncul konsep ensemble learning. Sederhananya, ensemble learning dilakukan dengan menggabungkan beberapa model sehingga keputusan akhir tidak hanya bergantung pada satu model. Kelebihan dari satu model dapat membantu menutupi kekurangan model lainnya. Dengan cara ini, hasil prediksi yang diperoleh diharapkan menjadi lebih baik dan lebih stabil.

Sebelum memahami ensemble learning lebih jauh, ada dua konsep yang penting untuk dipahami, yaitu bias dan varians. Kedua konsep tersebut berhubungan dengan kemampuan sebuah model dalam mempelajari pola pada data. Bias dan varians juga menjadi salah satu dasar untuk memahami mengapa model dapat mengalami underfitting maupun overfitting.

2. Keseimbangan antara Bias dan Varians

Bias-variance tradeoff menjelaskan hubungan antara tingkat kompleksitas sebuah model dengan kesalahan yang dihasilkan ketika model digunakan pada data yang belum pernah dilihat sebelumnya. Ketika model dibuat semakin kompleks, bias biasanya akan semakin kecil. Namun, pada saat yang sama, varians dapat menjadi semakin besar. Sebaliknya, model yang terlalu sederhana cenderung memiliki bias yang tinggi, tetapi variansnya lebih rendah.

Karena itu, model tidak selalu harus dibuat serumit mungkin. Model yang terlalu sederhana memang dapat kesulitan dalam menemukan pola pada data, sedangkan model yang terlalu rumit justru dapat terlalu mengikuti data latih. Kondisi yang diharapkan adalah menemukan titik yang cukup seimbang antara bias dan varians sehingga kesalahan pada data uji dapat ditekan. Keseimbangan tersebut penting karena tujuan dari model machine learning bukan hanya mendapatkan hasil yang bagus pada data latih. Model juga harus mampu memberikan hasil yang cukup baik ketika digunakan pada data baru. Kemampuan model untuk bekerja pada data yang belum pernah dilihat sebelumnya inilah yang berkaitan dengan generalisasi.

2.1 Underfitting

Underfitting terjadi ketika model terlalu sederhana sehingga belum mampu menangkap pola yang terdapat pada data dengan baik. Kondisi ini juga dapat terjadi ketika jumlah data latih yang digunakan terlalu sedikit. Akibatnya, hasil prediksi model cenderung masih jauh dari nilai yang sebenarnya. Underfitting biasanya dikaitkan dengan bias yang tinggi. Model belum cukup mampu mempelajari hubungan yang ada dalam data sehingga pola penting bisa terlewat. Salah satu cara yang dapat dilakukan untuk mengatasinya adalah menambahkan fitur yang memang relevan dengan masalah yang sedang dipelajari. Selain itu, dapat digunakan model dengan kapasitas yang lebih besar agar model memiliki kemampuan yang lebih baik dalam menangkap pola.

2.2 Overfitting

Berbeda dengan underfitting, overfitting terjadi ketika model terlalu kompleks dan terlalu mengikuti data latih. Model bukan hanya mempelajari pola yang penting, tetapi juga dapat ikut mempelajari noise atau gangguan yang sebenarnya tidak diperlukan. Pada kondisi ini, performa model pada data latih biasanya terlihat sangat baik. Namun, ketika model diberikan data baru, hasilnya dapat menurun karena pola yang dipelajari terlalu spesifik terhadap data latih. Kondisi tersebut dikenal sebagai varians yang tinggi. Beberapa cara yang dapat digunakan untuk mengurangi overfitting adalah menggunakan regularisasi, menerapkan cross-validation, dan menambah jumlah data latih. Dengan cara tersebut, model diharapkan tidak terlalu bergantung pada pola tertentu yang hanya muncul pada data latih.

3. Kebiasaan Baik demi Model yang Lebih Mampu Beradaptasi

Supaya model yang dibangun benar-benar sanggup bekerja baik pada data yang belum pernah ditemui sebelumnya, ada beberapa kebiasaan yang sebaiknya dijaga selama proses pengembangan model, di antaranya:

         Menjaga agar data yang dipakai benar-benar valid dan bisa dipercaya, sebab proses pengumpulan data yang sembarangan akan menghasilkan sampel yang tidak mewakili keadaan sesungguhnya dan pada akhirnya menurunkan kualitas model.

         Menerapkan validasi silang (cross-validation) sebagai cara untuk menekan risiko overfitting sekaligus mendapatkan gambaran kinerja model yang lebih objektif.

         Mengatur ulang hyperparameter (hyperparameter tuning) serta memilih ukuran evaluasi yang benar-benar cocok dengan jenis persoalan yang sedang dihadapi.

4. Mengenal Ensemble Learning dan Ragamnya

Ensemble learning adalah pendekatan yang menggabungkan beberapa model untuk menghasilkan satu keputusan atau prediksi akhir. Ide dasarnya cukup sederhana, yaitu tidak hanya mengandalkan satu model dalam menyelesaikan suatu permasalahan. Setiap model dapat memiliki kelebihan dan kekurangan yang berbeda. Ada model yang lebih baik dalam mengenali pola tertentu, sedangkan model lain mungkin lebih baik dalam kondisi yang berbeda. Ketika beberapa model digabungkan, kekurangan dari satu model dapat dibantu oleh hasil dari model lainnya. Hasil akhirnya diharapkan menjadi lebih stabil dan mampu bekerja lebih baik pada data baru. Cara menggabungkan hasil model juga dapat disesuaikan dengan jenis permasalahannya. Pada klasifikasi, hasil dari beberapa model dapat digabungkan menggunakan voting. Sementara itu, pada regresi, hasil prediksi beberapa model dapat digabungkan dengan menghitung nilai rata-rata atau mean. Secara umum, ensemble learning yang dibahas dalam materi ini terdiri dari tiga pendekatan, yaitu Bagging, Random Forest, dan Boosting.

4.1 Bagging (Bootstrap Aggregating)

Bagging atau Bootstrap Aggregating merupakan teknik ensemble yang membuat beberapa model menggunakan sampel dari data latih. Sampel tersebut diambil secara acak dan dapat dilakukan dengan pengembalian, sehingga setiap model dapat memperoleh bagian data yang berbeda. Setelah masing-masing model selesai dilatih, hasil prediksi dari model-model tersebut kemudian digabungkan. Dengan cara ini, hasil akhir tidak hanya bergantung pada satu model. Bagging terutama digunakan untuk membantu mengurangi varians dan mengurangi kemungkinan terjadinya overfitting.

4.2 Random Forest

Random Forest dapat dianggap sebagai pengembangan dari konsep bagging yang menggunakan banyak pohon keputusan. Selain melakukan pengambilan sampel data, Random Forest juga melakukan pengacakan fitur ketika membangun setiap pohon. Penggunaan fitur yang berbeda pada setiap pohon membuat model-model yang terbentuk tidak terlalu bergantung satu sama lain. Dengan begitu, ketika hasil dari banyak pohon digabungkan, prediksi yang dihasilkan dapat menjadi lebih stabil. Pendekatan ini juga membantu mengurangi varians dan risiko overfitting.

4.3 Boosting

Boosting memiliki cara kerja yang berbeda dari bagging. Jika pada bagging beberapa model dapat dilatih secara terpisah, boosting membangun model secara berurutan. Model berikutnya akan memberikan perhatian lebih pada data yang sebelumnya masih salah diprediksi. Dengan proses tersebut, model yang baru mencoba memperbaiki kesalahan dari model sebelumnya. Proses ini dilakukan secara bertahap sampai diperoleh gabungan model yang dapat menghasilkan prediksi dengan lebih baik. Jadi, fokus utama boosting adalah memperbaiki kesalahan yang masih terjadi pada proses sebelumnya.

5. Hal-Hal yang Perlu Diwaspadai

Meski menjanjikan banyak manfaat, penerapan ensemble learning tetap menyimpan sejumlah risiko yang perlu dicermati.

         Overfitting tetap mungkin muncul kalau model dilatih terlalu dalam atau bila dataset yang dipakai banyak mengandung noise.

         Model yang terlalu peka terhadap perubahan kecil pada data latih akan memperlihatkan hasil yang naik-turun, sehingga kurang bisa diandalkan saat berhadapan dengan data baru.

         Data yang dikumpulkan secara asal-asalan atau tidak bertanggung jawab akan menghasilkan sampel yang tidak mencerminkan kondisi sesungguhnya, dan pada gilirannya menurunkan mutu kinerja model secara keseluruhan.

6. Rangkuman Konsep

Ensemble learning merupakan pendekatan yang menggabungkan beberapa model untuk menghasilkan prediksi yang lebih stabil. Penggabungan hasil dapat dilakukan dengan voting pada klasifikasi dan rata-rata pada regresi. Sementara itu, bias-variance tradeoff menjelaskan keseimbangan antara kompleksitas model dan kesalahan pada data baru. Model yang terlalu sederhana dapat mengalami underfitting, sedangkan model yang terlalu kompleks dapat mengalami overfitting. Dalam penerapannya, Bagging menggunakan pengambilan sampel data secara acak, Random Forest menambahkan pengacakan fitur pada beberapa decision tree, sedangkan Boosting membangun model secara berurutan dengan berfokus pada kesalahan sebelumnya. Agar hasil model lebih baik, data yang digunakan harus berkualitas dan proses pengembangan model dapat dibantu dengan cross-validation serta hyperparameter tuning.

7. Kesimpulan

Dari seluruh uraian di atas, dapat disimpulkan bahwa ensemble learning merupakan salah satu pendekatan yang dapat digunakan untuk meningkatkan kestabilan hasil prediksi dengan menggabungkan beberapa model. Setiap model memiliki cara sendiri dalam mempelajari data, sehingga penggabungan beberapa model dapat membantu mengurangi kekurangan yang dimiliki oleh satu model saja. Dalam membangun model, pemahaman mengenai bias dan varians juga penting karena keduanya berkaitan dengan underfitting dan overfitting. Model yang terlalu sederhana dapat mengalami underfitting, sedangkan model yang terlalu kompleks dapat mengalami overfitting. Karena itu, diperlukan keseimbangan antara kompleksitas model dan kemampuannya dalam bekerja pada data baru. Selain pemilihan metode, kualitas data, cross-validation, hyperparameter tuning, dan pemilihan metrik evaluasi juga perlu diperhatikan. Bagging, Random Forest, dan Boosting memiliki cara kerja yang berbeda, tetapi ketiganya menggunakan konsep dasar ensemble untuk menggabungkan beberapa model. Dengan penerapan yang tepat, pendekatan tersebut dapat membantu menghasilkan model yang lebih stabil dan lebih mampu melakukan generalisasi pada data baru.