七种算法在 PLN Mobile 的 SPKLU 评论情感分析中,MLP 以 89.16% 准确率但 59.42% 宏 F1 胜出
核心概要
该研究从 Google Play Store 抓取 PLN Mobile 中 EV Charging/SPKLU 功能的用户评论,以评分作为弱标签进行情感标注,在训练集上按各算法特性施加类别权重以应对类别不平衡,并比较 Logistic Regression、SVM、Naive Bayes、MLP、RNN、BiLSTM 与 DistilBERT 七种分类算法,结果显示 MLP 在验证集上取得最高宏 F1(67.80%)并被选作最终测试模型,在 286 条测试数据上达到 89.16% 准确率与 59.42% 宏 F1,说明整体分类表现较高但各情感类别之间表现尚不均衡。
深度剖析
研究在 PLN Mobile 的 EV Charging/SPKLU 评论上系统比较了七种分类算法,覆盖机器学习、深度学习与 Transformer 三类方法。 既有 PLN Mobile 情感分析文献多聚焦 Naive Bayes、SVM、Random Forest 等少数算法,本研究将 MLP、RNN、BiLSTM 与 DistilBERT 一并纳入同一评测流程。 摘要明确列出七种算法名称与三类分组,并说明数据来自 Google Play Store,但未给出各算法的逐项对比数值。
研究采用基于评分的弱标签策略完成情感标注,并在训练集上按各算法特性施加类别权重以处理类别不平衡。 与使用 SMOTE 或词典标注的同类工作相比,本研究选择 class weighting 作为不平衡处理手段,并针对不同算法调整权重设置。 摘要说明数据经 text preprocessing 与基于 rating 的弱标签标注,并明确 class weighting 施加于训练数据;具体权重取值未在文本中给出。
MLP 在验证集上取得最高宏 F1(67.80%)并被选为最终模型,在 286 条测试数据上得到 89.16% 准确率与 59.42% 宏 F1。 该结果提供了同一数据条件下七种算法中 MLP 优于深度序列模型与 Transformer 的实证记录,并同时报告了准确率与宏 F1 的差距。 摘要给出验证集与测试集的具体数值及测试样本量 286,并指出准确率高而各类别表现不均衡;未提供混淆矩阵细节或置信区间。
启示与展望
该研究面向需要从 PLN Mobile 的 EV Charging/SPKLU 用户评论中自动识别情感的产品与运营团队,适用于以 Google Play Store 评论为数据源、以评分为弱标签、并以 class weighting 处理类别不平衡的场景。其流程可作为同类应用评论情感分析的参考模板,尤其是当需要在机器学习、深度学习与 Transformer 之间做算法选型时。
由于本次读取范围不完整,摘要之外的正文、图表与各算法逐项对比结果未能获取,因此无法确认七种算法在验证集上的完整排名、混淆矩阵所揭示的类别分布,以及 class weighting 的具体取值。读者若关心宏 F1 与准确率落差背后的类别结构,或希望复现该流程,仍需查阅原文的方法与结果细节。
