文本分类项目

从文本预处理、词嵌入到 Transformer 与预训练模型,系统建立文本分类的核心认知。

内容列表

当前目录下的专题与页面会统一按权重排序。

项目背景

介绍文本分类项目的业务背景、数据集来源与结构,并完成配置文件与探索性数据分析。

随机森林实现

基于 TF-IDF 特征与随机森林完成文本分类模型的训练、评估、预测与 Flask/Streamlit 部署。

Fasttext实现

使用 FastText 分别完成字符级与词级文本分类模型的训练、调优、预测与部署。

Bert实现

基于 BERT 预训练模型构建分类器,完成数据加载、模型训练、评估与预测函数封装。

LLM实现

通过 DeepSeek 与通义千问 API,结合提示词工程实现基于 LLM 的新闻分类。

模型压缩

介绍模型量化、模型蒸馏与模型剪枝三种压缩方式的原理与代码实现。