Pertumbuhan pesat platform digital telah menghasilkan volume data tekstual yang semakin besar dan beragam, termasuk tinjauan aplikasi, posting media sosial, dan berita online. Sumber-sumber ini berisi informasi berharga tentang kebutuhan, masalah, harapan, dan tujuan pengguna. Namun, karakteristik heterogennya membuat analisis manual semakin sulit. Studi An NLP-Based Framework for Requirement Elicitation from Heterogeneous Online Sources mengusulkan kerangka kerja berbasis NLP yang mengintegrasikan sumber-sumber ini untuk mendukung pengumpulan kebutuhan perangkat lunak selama tahap awal pengembangan perangkat lunak.
Kerangka kerja yang diusulkan memproses data melalui beberapa tahap, termasuk akuisisi dan pra-pemrosesan data, ekstraksi persyaratan, pengelompokan semantik, dan pembuatan artefak persyaratan. Persyaratan direpresentasikan sebagai user story menggunakan WHO–WHAT–WHY struktur, mewakili pengguna atau pemangku kepentingan, fungsionalitas yang dibutuhkan, serta motivasi atau manfaat yang diharapkan di bawahnya. Dua pendekatan ekstraksi dievaluasi secara independen: ekstraksi berbasis aturan linguistik dan ekstraksi berbasis Model Bahasa Besar (LLM). Cerita pengguna yang diekstrak kemudian dikelompokkan berdasarkan kesamaan semantik untuk mengurangi redundansi dan menghasilkan kebutuhan representatif yang lebih mudah diinterpretasikan oleh analis.
Evaluasi menunjukkan bahwa ekstraksi berbasis AI umumnya mengungguli pendekatan berbasis aturan di ketiga sumber data tersebut. Gemini 2.5 Flash mencapai kinerja keseluruhan tertinggi, terutama dalam mengidentifikasi komponen WHY, yang sering kali memerlukan interpretasi motivasi implisit pengguna. Beberapa model open-source, termasuk Qwen dan Mistral, menunjukkan kinerja kompetitif dalam mengidentifikasi APA, atau fungsionalitas yang diminta oleh pengguna, tetapi kinerja mereka lebih rendah karena motivasi implisit. Kinerja juga bervariasi menurut sumber: tinjauan aplikasi dan posting X umumnya menghasilkan hasil ekstraksi yang lebih baik dibandingkan berita online, di mana kebutuhan lebih sering diungkapkan secara tidak langsung melalui kutipan, peristiwa, dan perspektif dari berbagai pemangku kepentingan.
Selain evaluasi kuantitatif, enam pemilik proyek menilai kualitas dan kegunaan praktis artefak yang dihasilkan menggunakan skala Likert lima poin. Kerangka ini memperoleh skor rata-rata 4,33 untuk koherensi semantik, 3,83 untuk keunikan topik, 4,17 untuk representativitas klaster, dan 4,67 untuk interpretabilitas sistem. Temuan ini menunjukkan bahwa artefak yang dihasilkan dapat membantu analis memahami kebutuhan dari volume besar data tekstual. Namun demikian, studi ini mengidentifikasi keterbatasan, termasuk potensi halusinasi LLM dan kecenderungan mekanisme klasterisasi untuk memisahkan persyaratan yang terkait secara semantik ke dalam klaster yang berbeda. Akibatnya, persyaratan yang dihasilkan AI masih memerlukan validasi oleh analis atau praktisi sebelum diintegrasikan ke dalam proyek pengembangan perangkat lunak yang sebenarnya.
Secara keseluruhan, studi ini menunjukkan bahwa mengintegrasikan sumber digital heterogen dapat memperluas pemicu kebutuhan dengan menggabungkan pengalaman pengguna operasional, opini sosial dan kekhawatiran yang muncul, serta perspektif strategis yang lebih luas. Oleh karena itu, AI berpotensi mendukung analis kebutuhan dengan mempercepat identifikasi, organisasi, dan interpretasi kebutuhan dari data digital skala besar. Alih-alih menggantikan penilaian manusia, pendekatan yang diusulkan menempatkan AI sebagai mekanisme dukungan analitis untuk inovasi proses dalam rekayasa kebutuhan perangkat lunak, terutama pada tahap awal pengembangan ketika kebutuhan relevan tersebar di berbagai sumber digital.
Penulis: Indra Kharisma Raharjana
Artikel berikut adalah versi ringkasan populer dari paper jurnal ilmiah yang berjudul “An NLP-Based Framework for Requirement Elicitation from Heterogeneous Online Sources”, diterbitkan di Journal of Information Systems Engineering and Business Intelligence. Artikel asli bisa diakses melalui link berikut: https://e-journal.unair.ac.id/JISEBI/article/view/84251
