课程目标
- 用最短路径理解什么是语言模型
- 看清语言模型从 N-gram 到大模型的演进逻辑
- 快速认识 BLEU、ROUGE、PPL 这 3 个常见指标
- 了解通用大模型通常评什么
- 对国内外主流模型差异形成整体印象
一句话理解大模型
大模型本质上还是语言模型,核心任务只有一件事:根据上文,预测下一个最可能出现的词。
比如:
- “中国的首都是___”,更可能补出“北京”
- “到中午了,我们去吃___”,更可能补出“饭”而不是“篮球”
所以语言模型说白了,就是一个“判断一句话像不像人话、顺不顺、合理不合理”的概率模型。
什么是语言模型
如果一个句子是:
$S = [W_1, W_2, ..., W_n]$
语言模型要做的,就是计算这个句子出现的概率:
$P(S) = P(W_1, W_2, ..., W_n)$
根据链式法则,它也可以写成:
$P(S)=P(W_1)P(W_2|W_1)...P(W_n|W_1,...,W_{n-1})$
这说明了一件事:语言模型既可以看成“给整句话打分”,也可以看成“根据前文预测下一个词”。
语言模型是怎么一路发展到今天的
1. 统计语言模型:靠计数
最早的方法是 N-gram。它假设:一个词是否出现,只和前面有限几个词有关。
- 1-gram:只看当前词本身
- 2-gram:看前 1 个词
- 3-gram:看前 2 个词
比如 bigram(二元模型)本质上就是:
“前一个词是 我 时,下一个词是 想 的概率有多大?”
优点是简单直观,缺点也很明显:
- 组合太多,参数会爆炸
- 没见过的词组合,概率直接变成 0
- 只能看很短的上下文,理解能力弱
2. 神经语言模型:靠向量和神经网络
后来大家不再死记硬背词频,而是先把词变成向量,再用神经网络预测下一个词。
这样做的好处是:即使某个词组没见过,只要语义相近,模型也可能“猜对”。所以它比 N-gram 泛化更强,数据稀疏问题也缓解了很多。
但它仍然有短板:长文本一长,就容易忘前文。
3. 预训练语言模型:先通学,再专修
Transformer 出现后,模型理解上下文的能力大幅提升,BERT、GPT、T5 这类预训练模型开始成为主流。
它们的套路可以概括成两步:
- 先在海量通用文本上学习语言规律,这叫预训练
- 再拿到具体任务上继续训练,这叫微调
这一步的关键变化是:模型不再只学“局部搭配”,而是开始学更深层的语义和上下文关系。
4. 大语言模型:把规模做大,能力跃迁
当模型参数更多、训练数据更大、训练方法更成熟后,模型能力会明显增强,这背后对应的就是 Scaling Law(扩展法则)。
大模型相比传统预训练模型,最大的变化不是“原理完全变了”,而是:
- 规模更大
- 泛化更强
- 能做更多任务
- 开始出现少样本学习、上下文学习等“涌现能力”
所以可以把大语言模型理解成:站在 Transformer 和预训练方法之上的超大号语言模型。
总结来看,语言模型的发展其实一直在解决同一个问题:怎么让模型既看得更远、理解得更深,又能在没见过的新场景里继续做出合理预测。 从最早的“靠计数”,到后来的“靠神经网络理解语义”,再到今天“靠大规模预训练获得通用能力”,本质上就是模型对语言规律的建模能力越来越强。
怎么评估一个语言模型好不好
生成任务不像分类任务那样只有一个标准答案,所以评估更难。实际中常见 3 类指标:
1. BLEU:更看“生成得准不准”
BLEU 常用于机器翻译,本质是比较生成文本和参考答案中有多少 n-gram 重合。
- 分数范围通常在 0 到 1
- 越高说明和参考答案越接近
- 更偏向看精确率
通俗理解:你生成的内容,和标准答案在“字词搭配”上有多像。
2. ROUGE:更看“关键信息有没有覆盖到”
ROUGE 常用于摘要、问答、生成类任务。
- 和 BLEU 很像,也比较重合程度
- 但它更偏向看召回率
通俗理解:参考答案里重要的信息,你覆盖到了多少。
其中:
ROUGE-N:比较 n-gram 重合ROUGE-L:比较最长公共子序列,更适合看句子结构相似度
3. PPL(困惑度):更看模型会不会“迷糊”
PPL 衡量的是模型对测试文本的困惑程度。
- PPL 越小越好
- 说明模型越能给正常句子更高概率
通俗理解:看到一句正常的话,模型越“不惊讶”,说明它学得越好。
通用大模型一般评什么
现在评估大模型,通常不会只看一个 BLEU 或 ROUGE,而是看一组综合能力:
- 知识理解:常识、专业知识、阅读理解
- 推理能力:数学、逻辑、多步推理
- 代码能力:补全、解释、调试、生成
- 指令跟随:能不能按要求稳定输出
- 安全性:是否输出有害、偏见、违规内容
- 多模态能力:是否能同时处理文本、图片、音频等
也就是说,今天评大模型,更像是在评“综合智能水平”。
国内外大模型差异,怎么快速理解
可以先抓住这几个结论:
- 国外模型通常在基础研究、通用能力、生态工具上起步更早
- 国内模型通常在中文理解、本地部署、成本控制、产业落地上更贴近实际需求
- 国外榜单更适合看全球通用能力,国内榜单更适合看中文场景表现
如果你是做业务落地,往往不能只看“谁榜单第一”,还要一起看:
- 中文效果好不好
- 推理和生成是否稳定
- 价格是否合适
- 是否方便私有化部署
- 是否支持 Agent、工具调用、多模态
最后总结
把整篇文章压成一条主线,其实就是:
- 语言模型的本质是预测下一个词
- 早期靠 N-gram 计数,简单但看不远
- 后来靠神经网络和 Transformer,理解能力越来越强
- 当参数、数据、训练方法一起放大后,就发展成了今天的大语言模型
- 评估大模型不能只看一个指标,而要看生成质量、推理能力、知识能力和安全性等综合表现
如果你刚开始学大模型,先把这条主线想明白,后面的 Transformer、BERT、GPT、微调、RAG、Agent 都会更容易串起来。