学术发表

基于深度学习的修辞语步识别

Sociedade Brasileira de Computação · Sep 2025

在 CorpusDT 语料库上对 BERTimbau 的蒸馏版本进行微调,用于识别葡萄牙语科学摘要中的修辞语步,句子分类 F1 分数达到 0.94。展示了 NLP 在提升葡萄牙语学术写作质量方面的潜力。

案例研究

F1 0.94 · 准确率 93.97% · 6 个修辞类别 · 52 篇摘要 → 1,409 个样本

问题

葡萄牙语缺乏支持科学写作的工具。Swales 提出的修辞语步(背景、研究空白、目的、方法、结果与结论)通常凭直觉组织,研究空白往往未被明确表述。此前葡萄牙语的参考分类器 AZPort 采用朴素贝叶斯方法,准确率为 72%。

限制

CorpusDT 是葡萄牙语中为数不多的标注语料库之一,仅包含 52 篇科学摘要,不足以直接微调 Transformer 模型。

方法

我构建了一条保留每个句子修辞含义的数据增强管道:回译(葡→英→葡)、同义词替换、随机插入与交换,以及作为正则化手段的随机删除,以随机方式应用并向少数类倾斜。由此将 52 篇摘要扩充为 1,409 个类别均衡的句子样本(分层 80/20 划分)。在该数据集上,我微调了 BERTimbau 的蒸馏版本 distilbert-portuguese-cased,配置 6 类分类头、按类别加权的交叉熵、混合精度(FP16)、余弦调度的 AdamW,并以验证集 F1 进行早停。

结果

最终分类器在验证集上取得加权 F1 0.94(宏平均 0.9403)、准确率 93.97%,这是葡萄牙语修辞语步识别领域已知的最佳结果。误差分析显示,误分类集中在语义相邻的语步之间(例如 7.7% 的"结果"句被判为"方法"),即使对人工标注者而言这也是一条微妙的边界。错误呈现出符合逻辑的模式,而非随机分布。

面向 Exascale 系统仿真的图形界面

ERADSP 2023 · 2023

参与 iSPD(并行与分布式系统图标化仿真器)图形界面的开发,该工具用于大规模分布式系统的性能分析。主导界面基于 C++ 和 Qt 的重新设计与实现,专注于响应式设计、事件处理以及海量性能指标的高效可视化。