大模型
大语言模型是一种基于深度学习、通过海量文本数据训练而成,能够理解并生成自然语言、完成复杂任务的人工智能系统。
大语言模型是通用语言理解与生成的AI底座,聊天机器人是其产品化形态;
大模型虽能力广泛但存在幻觉、时效、推理及安全偏见等原生缺陷,需通过RAG(检索增强生成)与联网搜索弥补事实与时效短板,借助Agent架构与工具调用稳定复杂推理,并依托价值对齐(RLHF)与系统级安全护栏管控风险,最终以“模型+工程化”的系统方案实现可靠落地。
Ollama、Streamlit
Streamlit 可以用 Python 搭建网页
Ollama 是部署、运行大模型的工具。
机器学习
人工智能(AI):让机器表现出类似人类智能的能力
深度学习(DL):使用多层神经网络来自动学习更复杂的特征和表示
机器学习(ML):让机器从数据中学出规律
常见的机器学习算法有:
| 算法 | 类型 | 有无监督 |
|---|---|---|
| KNN | 分类/回归 | 监督 |
| 线性回归 | 回归 | 监督 |
| 逻辑回归 | 分类 | 监督 |
| 决策树 | 分类/回归 | 监督 |
| 随机森林 | 分类/回归(集成) | 监督 |
| 聚类算法(如 K-Means) | 聚类 | 无监督 |
| 支持向量机(SVM) | 分类/回归 | 监督 |
常见的四种学习方式:
有监督学习:训练集数据同时包含输入特征值和目标值,包括分类和回归任务。
无监督学习:训练集数据仅包含输入特征值,不包含目标值,聚类、降维、异常发现等任务。
半监督学习:训练集数据同时包含输入特征值和目标值,但目标值部分缺失
强化学习:训练集数据仅包含输入特征值,不包含目标值,模型通过与环境交互学习目标值
机器学习建模的一般步骤包括:
- 数据采集:收集相关数据,包括训练集和测试集。
- 数据预处理:清洗数据,处理缺失值、异常值等。
- 特征工程:提取有用的特征,包括数值型、分类型等。
- 机器学习建模:选择合适的算法进行训练。
- 模型评估:使用测试集数据评估模型性能。
特征工程的核心,是把原始数据转换成更适合模型学习的输入形式,例如:
提取关键特征
对类别特征做编码
对数值特征做 归一化 或 标准化
把原始信息转换成向量或更适合训练的表示
模型状态和泛化能力
拟合:模型学到的规律,和真实数据分布到底有多接近。
过拟合:模型在训练集上的表现好,但在测试集上的表现差。
欠拟合:模型在训练集上表现很差,在测试集上表现也很差。
泛化能力:模型在未见过的数据上的表现能力。
K-近邻算法
K-近邻算法(KNN)是一种基于距离的分类算法,用于预测未知数据的类别。
如果是分类,就看这 $K$ 个邻居里哪个类别人最多,投票决定结果。
如果是回归,就把这 $K$ 个邻居的目标值取平均,作为预测结果。
距离度量
欧氏距离的核心思想是两点间的直线最短距离;
曼哈顿距离则关注各维度差异绝对值的总和;
切比雪夫距离只取各维度中差异最大的那个值;
闵可夫斯基距离通过参数 $p$ 统一多种距离,平衡维度差异。
特征预处理
数据归一化:将数据转换到 [0, 1] 范围内,注意有异常值影响。
数据标准化:将数据转换到标准正态分布。
线性回归算法
线性回归(Linear Regression)是一种用于预测连续值的监督学习算法,用来建立特征和标签之间的线性关系。它的目标是找到一个线性公式,让模型的预测结果尽量接近真实值。
线性回归的分类
- 一元线性回归:只有一个特征参与预测,公式通常写成 $y = wx + b$
- 多元线性回归:有多个特征共同参与预测,公式通常写成 $y = w_1x_1 + w_2x_2 + \cdots + w_nx_n + b$
损失函数:衡量标准
预测值和真实值之间的差值(误差)是损失函数,在线性回归里,就是找到一条直线或一个超平面,让整体误差最小。
回归问题中常见的损失函数:
- 均方误差(MSE):计算模型预测值与真实值的平方差的平均值。
- 均绝对误差(MAE):计算模型预测值与真实值的绝对差的平均值。
- 均方根误差(RMSE):计算均方误差的平方根,用于评估模型的预测能力。
- 交叉熵损失(Cross-Entropy Loss):用于分类任务,计算模型输出与真实标签之间的差异。
逻辑回归算法
逻辑回归(Logistic Regression)是一种用于分类任务的算法,擅长处理二分类任务。
它先对特征做线性组合,再通过 Sigmoid 函数把结果压到 0~1,最后把这个值解释成“属于某个类别的概率”。
Sigmoid函数:通常特指逻辑斯谛函数,一方面常作为逻辑回归的输出层函数,将线性回归的结果直接转换为概率值用于二分类;另一方面也曾广泛用作神经网络中的激活函数,通过引入非线性帮助网络拟合复杂模式。不过,由于该函数在输入值极大或极小时梯度趋近于零,容易导致深层网络训练时出现“梯度消失”问题,因此在现代深度学习的隐藏层中,它已较多被ReLU等函数取代,但在输出层需要表达概率的场景中仍然应用广泛。
一句话理解原理
逻辑回归本质上是:预测时先算分数、再转概率、最后做分类;训练时用交叉熵衡量误差,再用梯度下降调整参数。
分类模型评估方法
- 准确率(Accuracy):预测对了多少,最直观。
- 精确率(Precision):预测成正类的样本里,有多少是真的正类。
- 召回率(Recall):真实正类里,有多少被模型找出来了。
- F1-score:精确率和召回率的折中指标。
混淆矩阵(错题表)
| 预测 | 真实 |
|---|---|
| 正类 | 正类 |
| 负类 | 负类 |
混淆矩阵和准确率、精确率、召回率、F1 都是模型评估的知识,是一家人。混淆矩阵是最基础的"数据底表",其他指标都是从它上面算出来的,各自从不同角度衡量模型的好坏。
聚类算法
分类是“我有标准答案,教你怎么分”;聚类是“我没标准答案,你自己看着把像的凑一块”。