BAB I
PENDAHULUAN
1.1 Latar Belakang
Perkembangan teknologi yang semakin pesat membuat pemanfaatan machine learning semakin luas dalam berbagai bidang. Machine learning digunakan untuk membantu komputer mengenali pola dari data, kemudian menggunakan pola tersebut untuk membuat prediksi atau mengambil keputusan. Dalam proses pengembangan model machine learning, salah satu tahapan yang penting adalah menentukan algoritma yang sesuai dengan karakteristik data yang digunakan.
Pada umumnya, pengembang model akan mencoba beberapa algoritma pada dataset yang sama. Setelah itu, setiap algoritma dibandingkan berdasarkan hasil evaluasi, misalnya menggunakan akurasi, precision, recall, F1-score, atau metrik lainnya. Algoritma yang memberikan hasil paling baik kemudian sering dianggap sebagai pilihan utama, sedangkan algoritma lainnya tidak lagi digunakan. Cara seperti ini memang terlihat sederhana dan masuk akal, tetapi sebenarnya belum tentu menghasilkan model yang paling baik.
Hal tersebut terjadi karena setiap algoritma mempunyai cara yang berbeda dalam memahami data. Sebagai contoh, Decision Tree bekerja dengan membentuk aturan-aturan berdasarkan pembagian data, sedangkan algoritma seperti K-Nearest Neighbors lebih mengandalkan kedekatan antar data. Algoritma lain mungkin lebih cocok untuk menemukan hubungan tertentu yang tidak mudah ditemukan oleh algoritma lainnya. Oleh karena itu, dua algoritma yang dilatih menggunakan dataset yang sama dapat menghasilkan prediksi yang berbeda karena masing-masing mempunyai karakteristik dan cara belajar yang berbeda.
Perbedaan tersebut sebenarnya dapat dimanfaatkan, bukan sekadar dijadikan alasan untuk memilih salah satu algoritma dan meninggalkan algoritma lainnya. Jika beberapa model mempunyai kemampuan yang berbeda dalam mengenali pola, hasil prediksi dari model-model tersebut dapat digabungkan. Dengan menggabungkan beberapa model, kesalahan yang dilakukan oleh satu model dapat dikurangi atau dilengkapi oleh model lainnya. Pendekatan inilah yang dikenal sebagai ensemble learning.
Ensemble learning merupakan salah satu pendekatan penting dalam machine learning yang menggunakan beberapa model sekaligus untuk menghasilkan prediksi akhir. Gagasan sederhananya adalah bahwa keputusan yang diperoleh dari beberapa model dapat menjadi lebih stabil dibandingkan hanya bergantung pada satu model. Namun, penggabungan model bukan berarti semua algoritma dapat digabungkan secara sembarangan. Terdapat prinsip dan metode tertentu yang digunakan agar kombinasi model benar-benar memberikan manfaat.
Selain itu, pemahaman mengenai ensemble learning tidak dapat dipisahkan dari konsep bias dan variance. Kedua konsep tersebut membantu menjelaskan mengapa sebuah model dapat mengalami underfitting atau overfitting. Dengan memahami hubungan antara bias, variance, dan kemampuan model dalam melakukan generalisasi, alasan penggunaan ensemble learning menjadi lebih mudah dipahami.
Berdasarkan hal tersebut, pembahasan mengenai konsep dasar ensemble learning menjadi penting, terutama bagi seseorang yang sedang mempelajari pengembangan model machine learning. Pemahaman ini tidak hanya berkaitan dengan bagaimana menggabungkan beberapa model, tetapi juga mengenai alasan mengapa penggabungan tersebut dilakukan, bagaimana prosesnya, serta kondisi apa yang membuat metode tersebut dapat memberikan hasil yang lebih baik.
1.2 Rumusan Masalah
Berdasarkan latar belakang yang telah dijelaskan, rumusan masalah dalam makalah ini adalah sebagai berikut:
1) Mengapa penggunaan satu algoritma saja dapat memiliki keterbatasan dalam pengembangan model machine learning?
2) Apa yang dimaksud dengan bias dan variance dalam machine learning?
3) Bagaimana hubungan bias dan variance dengan underfitting, overfitting, dan kemampuan generalisasi model?
4) Apa yang dimaksud dengan ensemble learning dan bagaimana prinsip dasarnya?
5) Apa saja metode utama dalam ensemble learning dan bagaimana cara kerja masing-masing metode?
6) Bagaimana bagging, random forest, dan boosting membantu meningkatkan performa model machine learning?
1.3 Tujuan Penulisan
Makalah ini bertujuan untuk memberikan pemahaman mengenai konsep dasar ensemble learning dalam pengembangan model machine learning. Secara khusus, tujuan penulisan makalah ini adalah:
1) Menjelaskan keterbatasan penggunaan satu algoritma dalam pengembangan model machine learning.
2) Menjelaskan pengertian bias dan variance serta pengaruhnya terhadap performa model.
3) Menjelaskan hubungan bias-variance tradeoff dengan underfitting dan overfitting.
4) Menjelaskan pengertian, prinsip, dan tujuan penggunaan ensemble learning.
5) Menjelaskan metode bagging, random forest, dan boosting beserta cara kerjanya.
6) Memberikan pemahaman mengenai bagaimana penggabungan beberapa model dapat membantu menghasilkan prediksi yang lebih stabil dan mampu melakukan generalisasi dengan lebih baik.
BAB II
PEMBAHASAN
2.1 Pengembangan Model Machine Learning dan Pemilihan Algoritma
Pengembangan model machine learning pada dasarnya merupakan proses untuk membuat sebuah sistem yang mampu mempelajari pola dari data sehingga dapat digunakan untuk melakukan prediksi terhadap data baru. Dalam proses tersebut, pemilihan algoritma menjadi salah satu bagian yang cukup penting. Tidak semua algoritma memiliki kemampuan yang sama ketika diterapkan pada suatu dataset.
Misalnya, terdapat sebuah dataset yang berisi informasi mengenai karakteristik pelanggan dan digunakan untuk memprediksi apakah seorang pelanggan akan melakukan pembelian. Ketika dataset tersebut diberikan kepada beberapa algoritma, hasil yang diperoleh belum tentu sama. Satu algoritma mungkin dapat mengenali pola tertentu dengan baik, sedangkan algoritma lain mungkin lebih baik dalam mengenali pola yang berbeda.
Perbedaan tersebut merupakan hal yang wajar karena setiap algoritma memiliki asumsi, struktur, dan mekanisme pembelajaran yang berbeda. Ada algoritma yang lebih sesuai untuk hubungan yang sederhana dan teratur, sementara algoritma lainnya mampu menangani hubungan yang lebih kompleks. Bahkan, model yang memberikan hasil terbaik pada satu dataset belum tentu memberikan hasil terbaik ketika digunakan pada dataset yang berbeda.
Dalam praktiknya, pengembang biasanya melakukan beberapa percobaan dengan algoritma yang berbeda. Hasil setiap model kemudian dievaluasi menggunakan data pengujian atau melalui cross-validation. Dari proses tersebut dapat diketahui algoritma mana yang memberikan performa yang sesuai dengan kebutuhan.
Namun, terdapat satu hal yang perlu diperhatikan. Perbedaan performa antaralgoritma tidak selalu berarti bahwa algoritma yang memperoleh nilai evaluasi lebih rendah sama sekali tidak berguna. Model tersebut mungkin mempunyai kemampuan dalam mengenali pola tertentu yang tidak dimiliki oleh model dengan performa lebih tinggi. Apabila karakteristik tersebut dapat dimanfaatkan, beberapa model dapat digunakan secara bersama-sama.
Dari sinilah muncul gagasan dasar ensemble learning. Alih-alih hanya mencari satu model yang dianggap paling baik, pendekatan ini mencoba memanfaatkan beberapa model untuk menghasilkan keputusan akhir secara bersama-sama.
2.2 Keterbatasan Pendekatan Algoritma Tunggal
Menggunakan satu algoritma bukan berarti selalu menghasilkan model yang buruk. Dalam banyak kasus, satu model memang sudah cukup untuk menyelesaikan suatu permasalahan. Namun, pendekatan tersebut mempunyai keterbatasan karena kemampuan model sangat bergantung pada karakteristik data dan jenis algoritma yang digunakan.
Setiap model memiliki kemungkinan melakukan kesalahan pada bagian data tertentu. Sebagai contoh, sebuah Decision Tree mungkin mampu memprediksi sebagian besar data dengan baik, tetapi dapat melakukan kesalahan pada beberapa pola yang kompleks. Model lain mungkin justru mampu mengenali sebagian pola tersebut. Jika hanya menggunakan Decision Tree, informasi yang dapat diperoleh dari model lain tidak akan dimanfaatkan.
Selain itu, sebuah model juga dapat terlalu bergantung pada data latih yang digunakan. Apabila model terlalu menyesuaikan diri terhadap data latih, model tersebut dapat memberikan hasil yang sangat baik ketika diuji menggunakan data yang pernah dilihat, tetapi hasilnya menurun ketika menghadapi data baru. Kondisi ini disebut overfitting.
Sebaliknya, model yang terlalu sederhana dapat gagal memahami pola penting dalam data. Kondisi tersebut disebut underfitting. Oleh sebab itu, pengembangan model tidak hanya bertujuan memperoleh nilai evaluasi tinggi pada data tertentu, tetapi juga memastikan bahwa model mampu bekerja dengan baik pada data yang belum pernah dilihat sebelumnya.
Dalam konteks inilah pendekatan ensemble menjadi menarik. Dengan menggabungkan beberapa model yang memiliki karakteristik berbeda, diharapkan kelemahan suatu model dapat dikurangi oleh kemampuan model lainnya.
2.3 Memahami Bias dan Variance
Untuk memahami alasan mengapa ensemble learning dapat membantu meningkatkan performa model, terlebih dahulu perlu dipahami dua konsep penting dalam machine learning, yaitu bias dan variance.
Bias dapat dipahami sebagai kecenderungan suatu model untuk membuat kesalahan karena model tersebut terlalu sederhana atau menggunakan asumsi yang terlalu kuat terhadap hubungan dalam data. Model dengan bias tinggi biasanya tidak mampu menangkap pola yang cukup kompleks. Akibatnya, model dapat memberikan kesalahan yang relatif tinggi baik pada data pelatihan maupun data baru. Kondisi ini berkaitan dengan underfitting.
Sebagai contoh sederhana, bayangkan terdapat pola hubungan yang sebenarnya berbentuk melengkung, tetapi model yang digunakan hanya mampu membuat hubungan dalam bentuk garis lurus. Model tersebut mungkin tidak mampu mengikuti pola data dengan baik karena kemampuannya terlalu terbatas. Dalam kondisi seperti ini, model mengalami bias yang tinggi.
Sementara itu, variance berkaitan dengan seberapa besar perubahan hasil model ketika data latih yang digunakan berubah. Model dengan variance tinggi cenderung sangat sensitif terhadap data pelatihan. Model dapat mempelajari detail-detail kecil, termasuk kemungkinan adanya noise, sehingga terlihat sangat baik pada data pelatihan tetapi tidak selalu mampu bekerja dengan baik pada data baru.
Kondisi tersebut dikenal sebagai overfitting. Model seolah-olah terlalu hafal terhadap data yang digunakan untuk belajar, tetapi kesulitan ketika menemukan data yang memiliki karakteristik sedikit berbeda.
Hubungan antara bias dan variance kemudian dikenal dengan istilah bias-variance tradeoff. Secara sederhana, model yang terlalu sederhana cenderung memiliki bias tinggi, sedangkan model yang terlalu kompleks dapat memiliki variance tinggi. Tujuan pengembangan model adalah memperoleh keseimbangan yang sesuai sehingga model dapat menangkap pola penting tanpa terlalu mengikuti noise pada data.
Perlu dipahami bahwa bias dan variance bukan sekadar ukuran yang dapat dilihat secara terpisah untuk menentukan apakah suatu model baik atau buruk. Keduanya merupakan bagian dari cara memahami sumber kesalahan prediksi dan kemampuan model dalam melakukan generalisasi.
2.4 Generalisasi Model terhadap Data Baru
Salah satu tujuan utama dalam machine learning adalah menghasilkan model yang mampu melakukan generalisasi. Generalisasi berarti kemampuan model untuk memberikan prediksi yang baik terhadap data baru yang belum pernah digunakan selama proses pelatihan.
Model yang memiliki performa sangat baik pada data pelatihan belum tentu merupakan model yang baik. Jika model terlalu menyesuaikan diri dengan data pelatihan, performanya dapat menurun ketika diberikan data baru. Oleh karena itu, evaluasi model harus dilakukan dengan cara yang dapat memberikan gambaran mengenai kemampuan model menghadapi data yang belum pernah dilihat.
Salah satu teknik yang umum digunakan adalah cross-validation. Pada teknik ini, dataset dibagi menjadi beberapa bagian. Model kemudian dilatih dan diuji menggunakan pembagian data yang berbeda secara bergantian. Hasil dari beberapa percobaan tersebut dapat memberikan gambaran yang lebih baik mengenai konsistensi performa model dibandingkan hanya melakukan satu kali pembagian data.
Selain cross-validation, kualitas dataset juga mempunyai pengaruh besar terhadap model. Data yang memiliki banyak kesalahan, nilai yang tidak sesuai, duplikasi, atau noise yang berlebihan dapat memengaruhi hasil pembelajaran. Oleh karena itu, penggunaan algoritma yang lebih kompleks tidak otomatis menyelesaikan masalah apabila kualitas data yang digunakan masih buruk.
2.5 Pengertian Ensemble Learning
Ensemble learning merupakan pendekatan dalam machine learning yang menggabungkan beberapa model untuk menghasilkan satu keputusan atau prediksi akhir. Model-model yang tergabung dalam sebuah ensemble sering disebut sebagai base learners atau model dasar.
Gagasan utama ensemble learning sebenarnya cukup sederhana. Daripada bergantung pada satu model, beberapa model digunakan untuk memberikan prediksi. Hasil prediksi tersebut kemudian digabungkan menggunakan metode tertentu sehingga menghasilkan keputusan akhir.
Sebagai ilustrasi, misalkan terdapat tiga model yang digunakan untuk melakukan klasifikasi. Model pertama memberikan prediksi bahwa suatu data termasuk kelas A, model kedua memberikan prediksi kelas A, sedangkan model ketiga memberikan prediksi kelas B. Jika metode yang digunakan adalah majority voting, maka keputusan akhirnya adalah kelas A karena mendapatkan dua suara.
Pada permasalahan regresi, penggabungan dapat dilakukan dengan menghitung rata-rata dari prediksi beberapa model. Misalnya, apabila tiga model memberikan prediksi 70, 75, dan 80, maka prediksi gabungannya dapat diperoleh dari nilai rata-rata ketiga prediksi tersebut.
Meskipun contoh tersebut terlihat sederhana, prinsip ensemble learning dapat diterapkan dengan berbagai cara dan tingkat kompleksitas. Keberhasilan sebuah ensemble sangat dipengaruhi oleh kualitas masing-masing model serta seberapa berbeda kesalahan yang dibuat oleh model-model tersebut.
Jika semua model melakukan kesalahan yang sama, menggabungkannya tidak selalu memberikan manfaat yang besar. Sebaliknya, jika model mempunyai pola kesalahan yang berbeda, penggabungan dapat membantu mengurangi sebagian kesalahan tersebut.
2.6 Mengapa Beberapa Model Dapat Menghasilkan Prediksi yang Lebih Stabil?
Salah satu alasan utama penggunaan ensemble learning adalah untuk mengurangi ketergantungan terhadap satu model. Setiap model memiliki kemungkinan membuat kesalahan. Dengan menggunakan beberapa model, kesalahan dari satu model dapat dikompensasi oleh model lainnya, terutama apabila kesalahan antar-model tidak sepenuhnya sama.
Hal tersebut dapat dianalogikan seperti seseorang yang ingin memperoleh pendapat sebelum mengambil keputusan. Jika hanya meminta pendapat satu orang, keputusan tersebut sepenuhnya dipengaruhi oleh sudut pandang orang tersebut. Namun, jika meminta pendapat dari beberapa orang dengan pengalaman atau cara berpikir yang berbeda, informasi yang diperoleh menjadi lebih beragam.
Dalam machine learning, tentu saja model tidak benar-benar "berdiskusi" satu sama lain. Penggabungan dilakukan secara matematis berdasarkan prediksi yang dihasilkan oleh masing-masing model. Hasil akhirnya diharapkan menjadi lebih stabil dibandingkan apabila hanya menggunakan satu model.
Namun, penting untuk dipahami bahwa ensemble learning tidak selalu menjamin peningkatan performa dalam setiap situasi. Jika model-model yang digabungkan memiliki kualitas yang buruk atau terlalu mirip dalam membuat kesalahan, hasil penggabungan mungkin tidak memberikan peningkatan yang berarti. Oleh karena itu, proses pemilihan dan pengaturan model tetap menjadi bagian penting dalam penerapannya.
2.7 Bagging atau Bootstrap Aggregating
Salah satu metode utama dalam ensemble learning adalah bagging, yang merupakan singkatan dari Bootstrap Aggregating. Metode ini bertujuan terutama untuk mengurangi variance dan membuat prediksi menjadi lebih stabil.
Proses bagging dimulai dengan mengambil beberapa sampel dari dataset asli menggunakan teknik bootstrap. Dalam proses bootstrap, data dipilih secara acak dengan pengembalian. Artinya, satu data dapat terpilih lebih dari satu kali dalam satu sampel, sementara data lainnya mungkin tidak terpilih.
Dari dataset asli kemudian terbentuk beberapa dataset hasil bootstrap. Setiap dataset tersebut digunakan untuk melatih model yang berbeda. Jika digunakan algoritma Decision Tree, misalnya, maka setiap dataset bootstrap akan digunakan untuk membangun satu Decision Tree.
Karena setiap model memperoleh data pelatihan yang sedikit berbeda, model-model tersebut dapat menghasilkan prediksi yang berbeda pula. Setelah semua model selesai dilatih, prediksi dari seluruh model digabungkan. Untuk klasifikasi, penggabungan biasanya dilakukan menggunakan majority voting, sedangkan untuk regresi dapat dilakukan dengan menghitung rata-rata prediksi.
Kekuatan bagging terletak pada proses penggabungan beberapa model tersebut. Sebuah model mungkin terlalu dipengaruhi oleh karakteristik tertentu dari dataset, tetapi ketika banyak model dilatih menggunakan sampel yang berbeda dan hasilnya digabungkan, pengaruh tersebut dapat dikurangi.
Dengan demikian, bagging terutama berguna pada algoritma yang cenderung memiliki variance tinggi. Salah satu contoh penerapan yang paling dikenal adalah penggunaan Decision Tree dalam bagging.
2.8 Random Forest
Random Forest merupakan salah satu metode ensemble learning yang sangat populer. Metode ini dapat dipahami sebagai pengembangan dari konsep bagging yang menggunakan banyak Decision Tree sebagai model dasar.
Pada Random Forest, proses pembentukan pohon tidak hanya melibatkan pengambilan sampel data secara acak, tetapi juga melibatkan pemilihan subset fitur secara acak pada proses pemisahan node. Dengan demikian, setiap pohon tidak selalu menggunakan seluruh fitur yang tersedia untuk menentukan pemisahan pada setiap tahap pembentukan pohon.
Penggunaan data dan fitur secara acak membuat pohon-pohon yang terbentuk menjadi lebih beragam. Keragaman tersebut penting karena apabila semua pohon memiliki struktur yang sangat mirip, maka mereka cenderung melakukan kesalahan yang sama. Sebaliknya, pohon yang lebih beragam dapat menghasilkan prediksi yang lebih bervariasi sehingga proses penggabungan menjadi lebih bermanfaat.
Setelah seluruh Decision Tree selesai dibuat, masing-masing pohon memberikan prediksi. Untuk klasifikasi, prediksi akhir biasanya ditentukan berdasarkan suara terbanyak dari seluruh pohon. Sementara itu, untuk regresi, prediksi dapat diperoleh melalui rata-rata hasil prediksi pohon-pohon tersebut.
Secara sederhana, Random Forest bekerja dengan membangun banyak pohon yang memiliki variasi dalam data dan fitur yang digunakan, kemudian menggabungkan hasil prediksi seluruh pohon tersebut menjadi satu prediksi akhir.
Kelebihan lainnya adalah Random Forest dapat digunakan pada permasalahan klasifikasi maupun regresi dan relatif kuat dalam menangani hubungan yang kompleks dalam data. Namun, seperti metode lainnya, penggunaannya tetap perlu disesuaikan dengan karakteristik dataset dan tujuan pengembangan model.
2.9 Boosting
Metode berikutnya adalah boosting. Berbeda dengan bagging yang pada dasarnya membangun beberapa model secara independen, boosting membangun model secara bertahap dan berurutan.
Pada awal proses, sebuah model sederhana dilatih menggunakan data. Setelah model tersebut menghasilkan prediksi, kesalahan yang terjadi diperhatikan. Model berikutnya kemudian dibangun dengan tujuan memberikan perhatian lebih terhadap bagian yang sebelumnya belum dapat ditangani dengan baik.
Proses tersebut dilakukan berulang kali. Setiap model baru berusaha memberikan perbaikan terhadap hasil dari model-model sebelumnya. Pada akhirnya, prediksi dari model-model tersebut digabungkan untuk menghasilkan model ensemble.
Salah satu cara sederhana untuk memahami boosting adalah membayangkan seorang siswa yang sedang belajar mengerjakan soal. Setelah mengerjakan latihan pertama, siswa menemukan beberapa jenis soal yang masih sering salah. Pada latihan berikutnya, perhatian lebih banyak diberikan pada bagian yang masih menjadi kesulitan. Proses tersebut terus dilakukan sampai pemahaman terhadap materi menjadi lebih baik. Meskipun mekanisme boosting dalam machine learning jauh lebih matematis, gagasan dasarnya memiliki kesamaan, yaitu melakukan perbaikan secara bertahap berdasarkan kesalahan sebelumnya.
Beberapa algoritma boosting yang terkenal antara lain AdaBoost, Gradient Boosting, XGBoost, LightGBM, dan CatBoost. Masing-masing memiliki mekanisme dan karakteristik tersendiri, tetapi secara umum tetap menggunakan gagasan bahwa model dibangun secara bertahap untuk memperbaiki hasil sebelumnya.
Keunggulan boosting dapat diperoleh ketika model-model sederhana mampu dikombinasikan secara efektif. Namun, proses ini juga perlu dikendalikan dengan baik karena penggunaan model yang terlalu kompleks atau pelatihan yang terlalu lama dapat meningkatkan risiko overfitting.
2.10 Perbedaan Prinsip Bagging, Random Forest, dan Boosting
Ketiga metode tersebut sama-sama termasuk dalam ensemble learning, tetapi memiliki cara kerja yang berbeda.
Bagging berfokus pada pembuatan beberapa model menggunakan variasi sampel data dan kemudian menggabungkan hasilnya. Tujuan utamanya adalah mengurangi variance dan membuat prediksi lebih stabil.
Random Forest menggunakan prinsip yang serupa dengan bagging, tetapi secara khusus menggunakan banyak Decision Tree dan menambahkan pengacakan pada pemilihan fitur. Hal ini bertujuan meningkatkan keragaman antar-pohon sehingga penggabungan hasil prediksi dapat bekerja lebih efektif.
Sementara itu, boosting membangun model secara bertahap. Model berikutnya berusaha memperbaiki kesalahan yang dilakukan model sebelumnya. Karena prosesnya dilakukan secara berurutan, hubungan antar-model dalam boosting lebih erat dibandingkan pada bagging.
Dengan memahami perbedaan tersebut, dapat diketahui bahwa istilah ensemble learning bukanlah nama dari satu algoritma tertentu. Ensemble learning merupakan pendekatan yang mencakup berbagai metode untuk menggabungkan beberapa model. Bagging, Random Forest, dan boosting merupakan beberapa metode penting yang menggunakan prinsip tersebut dengan cara yang berbeda.
2.11 Faktor yang Perlu Diperhatikan dalam Penggunaan Ensemble Learning
Walaupun ensemble learning dapat membantu meningkatkan performa model, penerapannya tidak boleh dilakukan tanpa pertimbangan. Salah satu faktor penting adalah kualitas data. Model yang dilatih menggunakan data yang tidak berkualitas tetap dapat menghasilkan prediksi yang buruk meskipun jumlah model yang digunakan sangat banyak.
Selain kualitas data, pemilihan metrik evaluasi juga perlu diperhatikan. Akurasi memang mudah dipahami, tetapi tidak selalu cukup untuk menggambarkan performa model. Pada dataset yang memiliki jumlah data antar-kelas yang tidak seimbang, misalnya, model dapat memperoleh akurasi tinggi tetapi masih kurang baik dalam mengenali kelas tertentu. Dalam kondisi tersebut, metrik seperti precision, recall, dan F1-score dapat memberikan informasi tambahan.
Cross-validation juga dapat digunakan untuk mengetahui apakah peningkatan performa yang diperoleh benar-benar konsisten atau hanya terjadi pada pembagian data tertentu. Selain itu, hyperparameter tuning dapat dilakukan untuk mencari konfigurasi yang sesuai dengan karakteristik dataset.
Hal lain yang juga perlu diperhatikan adalah biaya komputasi. Menggunakan banyak model berarti membutuhkan waktu dan sumber daya yang lebih besar untuk proses pelatihan dan prediksi. Oleh karena itu, peningkatan performa harus dipertimbangkan bersama dengan kebutuhan komputasi dan tujuan penggunaan model.
Pada akhirnya, penggunaan ensemble learning bukan berarti semakin banyak model yang digunakan maka hasilnya pasti semakin baik. Yang lebih penting adalah bagaimana memilih model, mengatur proses pelatihan, dan menggabungkan prediksi secara tepat.
2.12 Penerapan Ensemble Learning dalam Kehidupan Nyata
Konsep ensemble learning dapat diterapkan pada berbagai permasalahan nyata. Dalam bidang keuangan, misalnya, model dapat digunakan untuk membantu memprediksi kemungkinan terjadinya suatu kondisi berdasarkan pola data historis. Dalam bidang kesehatan, machine learning dapat digunakan untuk membantu melakukan klasifikasi berdasarkan data yang tersedia, dengan tetap memperhatikan bahwa keputusan medis tetap memerlukan penilaian tenaga profesional.
Dalam bidang pemasaran, ensemble learning dapat digunakan untuk memprediksi kemungkinan pelanggan melakukan pembelian atau berhenti menggunakan suatu layanan. Sementara itu, pada bidang teknologi, metode ensemble dapat digunakan dalam klasifikasi teks, deteksi pola, sistem rekomendasi, dan berbagai jenis prediksi lainnya.
Pada setiap penerapan, metode yang digunakan harus disesuaikan dengan karakteristik data, tujuan prediksi, kebutuhan interpretasi, serta sumber daya yang tersedia. Dengan demikian, ensemble learning sebaiknya dipandang sebagai salah satu pendekatan yang dapat digunakan untuk menyelesaikan permasalahan machine learning, bukan sebagai solusi yang selalu paling tepat untuk semua kondisi.
BAB III
PENUTUP
3.1 Kesimpulan
Berdasarkan pembahasan yang telah diuraikan, dapat disimpulkan bahwa pengembangan model machine learning tidak hanya berkaitan dengan mencari satu algoritma yang menghasilkan nilai evaluasi paling tinggi. Setiap algoritma memiliki karakteristik, asumsi, dan cara yang berbeda dalam mempelajari pola dari data. Oleh karena itu, algoritma yang tidak terpilih bukan berarti tidak memiliki informasi yang berguna.
Pemahaman mengenai bias dan variance menjadi bagian penting dalam memahami performa model. Bias yang tinggi dapat menyebabkan model terlalu sederhana sehingga mengalami underfitting, sedangkan variance yang tinggi dapat menyebabkan model terlalu menyesuaikan diri terhadap data pelatihan sehingga mengalami overfitting. Keseimbangan antara keduanya berhubungan erat dengan kemampuan model dalam melakukan generalisasi terhadap data baru.
Ensemble learning hadir sebagai pendekatan yang memungkinkan beberapa model digunakan secara bersama-sama. Prediksi dari beberapa model dapat digabungkan melalui mekanisme tertentu sehingga kesalahan yang dibuat oleh satu model dapat dikurangi oleh model lainnya. Dengan cara tersebut, model ensemble dapat menghasilkan prediksi yang lebih stabil dalam kondisi yang sesuai.
Tiga metode yang dibahas dalam makalah ini adalah bagging, Random Forest, dan boosting. Bagging menggunakan beberapa sampel hasil bootstrap untuk melatih beberapa model dan kemudian menggabungkan hasil prediksinya. Random Forest mengembangkan prinsip tersebut dengan menggunakan banyak Decision Tree serta melakukan pengacakan terhadap fitur yang digunakan. Sementara itu, boosting membangun model secara bertahap dengan memberikan perhatian pada kesalahan yang dihasilkan oleh model sebelumnya.
Meskipun ensemble learning memiliki berbagai manfaat, penerapannya tetap harus dilakukan dengan pertimbangan yang tepat. Kualitas data, pemilihan metrik evaluasi, cross-validation, pengaturan hyperparameter, risiko overfitting, dan kebutuhan komputasi merupakan beberapa faktor yang perlu diperhatikan. Oleh karena itu, keberhasilan sebuah model tidak hanya ditentukan oleh metode yang digunakan, tetapi juga oleh bagaimana seluruh proses pengembangan model dilakukan.
3.2 Saran
Dalam pengembangan model machine learning, pemilihan algoritma sebaiknya tidak hanya didasarkan pada hasil satu kali pengujian. Pengembang perlu memahami karakteristik dataset, melakukan evaluasi secara tepat, dan mempertimbangkan kemampuan model dalam melakukan generalisasi terhadap data baru.
Algoritma yang memiliki performa berbeda juga tidak selalu harus langsung dibuang. Apabila model-model tersebut mempunyai karakteristik kesalahan yang berbeda, terdapat kemungkinan bahwa prediksinya dapat dimanfaatkan melalui pendekatan ensemble learning. Oleh karena itu, pemahaman mengenai bagging, Random Forest, dan boosting dapat menjadi bekal penting dalam memilih pendekatan yang sesuai dengan permasalahan yang sedang dihadapi.
Selain itu, penggunaan ensemble learning sebaiknya tetap dilakukan secara proporsional. Jumlah model yang lebih banyak tidak secara otomatis menghasilkan model yang lebih baik. Pengembang perlu melakukan pengujian dan evaluasi secara sistematis agar dapat mengetahui apakah penggabungan model benar-benar memberikan peningkatan yang berarti. Dengan proses tersebut, model yang dikembangkan tidak hanya memiliki performa yang baik pada data pelatihan, tetapi juga diharapkan mampu memberikan hasil yang dapat diandalkan ketika digunakan pada data baru.