INTEGRATING STRUCTURED AND UNSTRUCTURED FEATURES FOR E-TICKETING CLASSIFICATION: A MACHINE LEARNING AND ENSEMBLE-BASED APPROACH

Keywords: Classification, Ensemble, Feature selection, Hybrid data, Machine learning, Ticketing system

Abstract

E-ticketing systems (ETS) generate mixed information from categorical ticket attributes and free-text descriptions, yet many classification studies still treat these sources separately, which can limit routing accuracy. This study aims (i) to develop an effective preprocessing pipeline for hybrid data, (ii) to develop a two-stage feature selection (2-FS) pipeline for hybrid data, (iii) to design an ensemble classification framework that improves hybrid data performance, and (iv) to benchmark all implemented and proposed models using real-world ETS data. The methodology builds a unified preprocessing workflow by combining Natural Language Processing for textual feature with categorical encoding for categorical features, followed by feature concatenation and vector-space integration to form hybrid representations. Five baseline classifiers (LR, SVM, MNB, RF, and KNN) are evaluated and extended with majority-vote ensembles that pair LR with other classifiers (LR-S, LR-M, LR-R, LR-K, and LR-ALL). Model performance is assessed using accuracy, precision, recall, and F1-score, and the Friedman test is applied to examine statistical consistency across datasets. Results show that hybrid data consistently outperforms single-type datasets, while categorical-only data yields the lowest scores. The best hybrid ensemble of LR-K achieves up to 93% classification accuracy, with strong overall performance also observed for RF on hybrid data. The Friedman test indicates minimal rank differences across models, suggesting that several classifiers are competitive under this ETS setting. Limitations include possible noise and overfitting effects that reduce separation between dataset types. Future work will explore feature ranking-based selection, data-driven segmentation during preprocessing, multi-level classification, imbalance handling, and deeper ensemble strategies to strengthen robustness and generalization.

Downloads

Download data is not yet available.

References

S. Heras et al., “MULTI-DOMAIN CASE-BASED MODULE FOR CUSTOMER SUPPORT,” Expert Syst. Appl., vol. 36, no. 3 PART 2, pp. 6866–6873, 2009, doi: https://doi.org/10.1016/j.eswa.2008.08.003.

A. Zangari, M. Marcuzzo, M. Schiavinato, A. Gasparetto, and A. Albarelli, “TICKET AUTOMATION: AN INSIGHT INTO CURRENT RESEARCH WITH APPLICATIONS TO MULTI-LEVEL CLASSIFICATION SCENARIOS,” Sep. 01, 2023, Elsevier Ltd. doi: https://doi.org/10.1016/j.eswa.2023.119984.

F. Al-Hawari and H. Barham, “A MACHINE LEARNING BASED HELP DESK SYSTEM FOR IT SERVICE MANAGEMENT,” Journal of King Saud University - Computer and Information Sciences, vol. 33, no. 6, pp. 702–718, Jul. 2021, doi: https://doi.org/10.1016/j.jksuci.2019.04.001.

M. Gupta, A. Asadullah, S. Padmanabhuni, and A. Serebrenik, “REDUCING USER INPUT REQUESTS TO IMPROVE IT SUPPORT TICKET RESOLUTION PROCESS,” Empir. Softw. Eng., vol. 23, no. 3, pp. 1664–1703, Jun. 2018, doi: https://doi.org/10.1007/s10664-017-9532-2.

S. Z. Mohd Jamaludin, M. K. Majahar Ali, E. S. W. Vun, M. T. Ismail, and N. F. Ibrahim, “SOLVING COMPLEXITY DATASET IN E-TICKETING USING MACHINE LEARNING TO DETERMINE OPTIMUM FEATURE,” Malaysian Journal of Fundamental and Applied Sciences, vol. 19, no. 6, pp. 1068–1081, Dec. 2023, doi: https://doi.org/10.11113/mjfas.v19n6.2921.

C. M. Rump, “MINING A LOTTERY FOR A FAVORABLE JACKPOT[FORMULA PRESENTED],” Expert Syst. Appl., vol. 238, Mar. 2024, doi: https://doi.org/10.1016/j.eswa.2023.122063.

N. A. Azit et al., “PREDICTION OF HEPATOCELLULAR CARCINOMA RISK IN PATIENTS WITH TYPE-2 DIABETES USING SUPERVISED MACHINE LEARNING CLASSIFICATION MODEL,” Heliyon, vol. 8, no. 10, Oct. 2022, doi: https://doi.org/10.1016/j.heliyon.2022.e10772.

M. Azzone, E. Barucci, G. Giuffra Moncayo, and D. Marazzina, “A MACHINE LEARNING MODEL FOR LAPSE PREDICTION IN LIFE INSURANCE CONTRACTS,” Expert Syst. Appl., vol. 191, Apr. 2022, doi: https://doi.org/10.1016/j.eswa.2021.116261.

S. Gan, S. Shao, L. Chen, L. Yu, and L. Jiang, “ADAPTING HIDDEN NAIVE BAYES FOR TEXT CLASSIFICATION,” Mathematics, vol. 9, no. 19, p. 2378, Sep. 2021, doi: https://doi.org/10.3390/math9192378.

M. Qorib, T. Oladunni, M. Denis, E. Ososanya, and P. Cotae, “COVID-19 VACCINE HESITANCY: TEXT MINING, SENTIMENT ANALYSIS AND MACHINE LEARNING ON COVID-19 VACCINATION TWITTER DATASET,” Expert Syst. Appl., vol. 212, p. 118715, Feb. 2023, doi: https://doi.org/10.1016/j.eswa.2022.118715.

M. W. Asres et al., “SUPPORTING TELECOMMUNICATION ALARM MANAGEMENT SYSTEM WITH TROUBLE TICKET PREDICTION,” IEEE Trans. Industr. Inform., vol. 17, no. 2, pp. 1459–1469, Feb. 2021, doi: https://doi.org/10.1109/TII.2020.2996942.

T. Kim and J. S. Lee, “MAXIMIZING AUC TO LEARN WEIGHTED NAIVE BAYES FOR IMBALANCED DATA CLASSIFICATION,” Expert Syst. Appl., vol. 217, May 2023, doi: https://doi.org/10.1016/j.eswa.2023.119564.

S. G. Ozkaya et al., “AN AUTOMATED EARTHQUAKE CLASSIFICATION MODEL BASED ON A NEW BUTTERFLY PATTERN USING SEISMIC SIGNALS,” Expert Syst. Appl., vol. 238, Mar. 2024, doi: https://doi.org/10.1016/j.eswa.2023.122079.

J. Xu, L. Tang, and T. Li, “SYSTEM SITUATION TICKET IDENTIFICATION USING SVMS ENSEMBLE,” Expert Syst. Appl., vol. 60, pp. 130–140, Oct. 2016, doi: https://doi.org/10.1016/j.eswa.2016.04.017.

J. Xu, H. Zhang, W. Zhou, R. He, and T. Li, “SIGNATURE BASED TROUBLE TICKET CLASSIFICATION,” Future Generation Computer Systems, vol. 78, pp. 41–58, Jan. 2018, doi: https://doi.org/10.1016/j.future.2017.07.054.

Q. Li et al., “A SURVEY ON TEXT CLASSIFICATION: FROM TRADITIONAL TO DEEP LEARNING,” Apr. 01, 2022, Association for Computing Machinery. doi: https://doi.org/10.1145/3495162.

M. A. Bouke and A. Abdullah, “AN EMPIRICAL STUDY OF PATTERN LEAKAGE IMPACT DURING DATA PREPROCESSING ON MACHINE LEARNING-BASED INTRUSION DETECTION MODELS RELIABILITY,” Expert Syst. Appl., vol. 230, Nov. 2023, doi: https://doi.org/10.1016/j.eswa.2023.120715.

J. He, L. Qu, P. Wang, and Z. Li, “AN OSCILLATORY PARTICLE SWARM OPTIMIZATION FEATURE SELECTION ALGORITHM FOR HYBRID DATA BASED ON MUTUAL INFORMATION ENTROPY,” Appl. Soft Comput., vol. 152, Feb. 2024, doi: https://doi.org/10.1016/j.asoc.2024.111261.

S. Das, D. R. Khanwelkar, and J. Maiti, “A SEMI-AUTOMATED CODING SCHEME FOR OCCUPATIONAL INJURY DATA: AN APPROACH USING BAYESIAN DECISION SUPPORT SYSTEM,” Expert Syst. Appl., vol. 237, Mar. 2024, doi: https://doi.org/10.1016/j.eswa.2023.121610.

A. K. Biswas, R. Seethalakshmi, P. Mariappan, and D. Bhattacharjee, “AN ENSEMBLE LEARNING MODEL FOR PREDICTING THE INTENTION TO QUIT AMONG EMPLOYEES USING CLASSIFICATION ALGORITHMS,” Decision Analytics Journal, vol. 9, Dec. 2023, doi: https://doi.org/10.1016/j.dajour.2023.100335.

M. Kiguchi, W. Saeed, and I. Medi, “CHURN PREDICTION IN DIGITAL GAME-BASED LEARNING USING DATA MINING TECHNIQUES: LOGISTIC REGRESSION, DECISION TREE, AND RANDOM FOREST,” Appl. Soft Comput., vol. 118, Mar. 2022, doi: https://doi.org/10.1016/j.asoc.2022.108491

R. Slikboer, S. D. Muir, S. S. M. Silva, and D. Meyer, “A SYSTEMATIC REVIEW OF STATISTICAL MODELS AND OUTCOMES OF PREDICTING FATAL AND SERIOUS INJURY CRASHES FROM DRIVER CRASH AND OFFENSE HISTORY DATA,” Syst. Rev., vol. 9, no. 1, Sep. 2020, doi: https://doi.org/10.1186/s13643-020-01475-7.

J. Tanha, Y. Abdi, N. Samadi, N. Razzaghi, and M. Asadpour, “BOOSTING METHODS FOR MULTI-CLASS IMBALANCED DATA CLASSIFICATION: AN EXPERIMENTAL REVIEW,” J. Big Data, vol. 7, no. 1, p. 70, Dec. 2020, doi: https://doi.org/10.1186/s40537-020-00349-y.

M. Phan, A. De Caigny, and K. Coussement, “A DECISION SUPPORT FRAMEWORK TO INCORPORATE TEXTUAL DATA FOR EARLY STUDENT DROPOUT PREDICTION IN HIGHER EDUCATION,” Decis. Support Syst., vol. 168, May 2023, doi: https://doi.org/10.1016/j.dss.2023.113940

F. K. Nakano, K. Pliakos, and C. Vens, “DEEP TREE-ENSEMBLES FOR MULTI-OUTPUT PREDICTION,” Pattern Recognit., vol. 121, Jan. 2021, doi: https://doi.org/10.1016/j.patcog.2021.108211.

G. Manita, A. Chhabra, and O. Korbaa, “EFFICIENT E-MAIL SPAM FILTERING APPROACH COMBINING LOGISTIC REGRESSION MODEL AND ORTHOGONAL ATOMIC ORBITAL SEARCH ALGORITHM,” Appl. Soft Comput., vol. 144, Sep. 2023, doi: https://doi.org/10.1016/j.asoc.2023.110478.

N. E. Zamri et al., “A MODIFIED REVERSE-BASED ANALYSIS LOGIC MINING MODEL WITH WEIGHTED RANDOM 2 SATISFIABILITY LOGIC IN DISCRETE HOPFIELD NEURAL NETWORK AND MULTI-OBJECTIVE TRAINING OF MODIFIED NICHED GENETIC ALGORITHM,” Expert Syst. Appl., vol. 240, p. 122307, Apr. 2024, doi: https://doi.org/10.1016/j.eswa.2023.122307.

S. Z. M. Jamaludin et al., “NOVEL LOGIC MINING INCORPORATING LOG LINEAR APPROACH,” Journal of King Saud University - Computer and Information Sciences, vol. 34, no. 10, pp. 9011–9027, Nov. 2022, doi: https://doi.org/10.1016/j.jksuci.2022.08.026.

P. Supsermpol, V. N. Huynh, S. Thajchayapong, and N. Chiadamrong, “PREDICTING FINANCIAL PERFORMANCE FOR LISTED COMPANIES IN THAILAND DURING THE TRANSITION PERIOD: A CLASS-BASED APPROACH USING LOGISTIC REGRESSION AND RANDOM FOREST ALGORITHM,” Journal of Open Innovation: Technology, Market, and Complexity, vol. 9, no. 3, Sep. 2023, doi: https://doi.org/10.1016/j.joitmc.2023.100130.

H. Chen et al., “TEXTCNN-BASED ENSEMBLE LEARNING MODEL FOR JAPANESE TEXT MULTI-CLASSIFICATION,” Computers and Electrical Engineering, vol. 109, Aug. 2023, doi: https://doi.org/10.1016/j.compeleceng.2023.108751.

A. Rehman, K. Javed, H. A. Babri, and N. Asim, “SELECTION OF THE MOST RELEVANT TERMS BASED ON A MAX-MIN RATIO METRIC FOR TEXT CLASSIFICATION,” Expert Syst. Appl., vol. 114, pp. 78–96, Dec. 2018, doi: https://doi.org/10.1016/j.eswa.2018.07.028.

Published
2026-08-24
How to Cite
[1]
S. Z. Mohd Jamaludin, M. K. Majahar Ali, E. W. V. Shiung, M. T. Ismail, N. F. Ibrahim, and N. E. Zamri, “INTEGRATING STRUCTURED AND UNSTRUCTURED FEATURES FOR E-TICKETING CLASSIFICATION: A MACHINE LEARNING AND ENSEMBLE-BASED APPROACH”, BAREKENG: J. Math. & App., vol. 20, no. 4, pp. 2839-2850, Aug. 2026.