大模型基础-精华版

用一篇文章快速理解语言模型是什么、大模型怎么来的、常见评估指标有哪些,以及国内外主流模型的差异。

课程目标

  • 用最短路径理解什么是语言模型
  • 看清语言模型从 N-gram 到大模型的演进逻辑
  • 快速认识 BLEU、ROUGE、PPL 这 3 个常见指标
  • 了解通用大模型通常评什么
  • 对国内外主流模型差异形成整体印象

一句话理解大模型

大模型本质上还是语言模型,核心任务只有一件事:根据上文,预测下一个最可能出现的词。

比如:

  • “中国的首都是___”,更可能补出“北京”
  • “到中午了,我们去吃___”,更可能补出“饭”而不是“篮球”

所以语言模型说白了,就是一个“判断一句话像不像人话、顺不顺、合理不合理”的概率模型。


什么是语言模型

如果一个句子是:

$S = [W_1, W_2, ..., W_n]$

语言模型要做的,就是计算这个句子出现的概率:

$P(S) = P(W_1, W_2, ..., W_n)$

根据链式法则,它也可以写成:

$P(S)=P(W_1)P(W_2|W_1)...P(W_n|W_1,...,W_{n-1})$

这说明了一件事:语言模型既可以看成“给整句话打分”,也可以看成“根据前文预测下一个词”。


语言模型是怎么一路发展到今天的

1. 统计语言模型:靠计数

最早的方法是 N-gram。它假设:一个词是否出现,只和前面有限几个词有关。

  • 1-gram:只看当前词本身
  • 2-gram:看前 1 个词
  • 3-gram:看前 2 个词

比如 bigram(二元模型)本质上就是:

“前一个词是 时,下一个词是 的概率有多大?”

优点是简单直观,缺点也很明显:

  • 组合太多,参数会爆炸
  • 没见过的词组合,概率直接变成 0
  • 只能看很短的上下文,理解能力弱

2. 神经语言模型:靠向量和神经网络

后来大家不再死记硬背词频,而是先把词变成向量,再用神经网络预测下一个词。

这样做的好处是:即使某个词组没见过,只要语义相近,模型也可能“猜对”。所以它比 N-gram 泛化更强,数据稀疏问题也缓解了很多。

但它仍然有短板:长文本一长,就容易忘前文。

3. 预训练语言模型:先通学,再专修

Transformer 出现后,模型理解上下文的能力大幅提升,BERT、GPT、T5 这类预训练模型开始成为主流。

它们的套路可以概括成两步:

  1. 先在海量通用文本上学习语言规律,这叫预训练
  2. 再拿到具体任务上继续训练,这叫微调

这一步的关键变化是:模型不再只学“局部搭配”,而是开始学更深层的语义和上下文关系。

4. 大语言模型:把规模做大,能力跃迁

当模型参数更多、训练数据更大、训练方法更成熟后,模型能力会明显增强,这背后对应的就是 Scaling Law(扩展法则)

大模型相比传统预训练模型,最大的变化不是“原理完全变了”,而是:

  • 规模更大
  • 泛化更强
  • 能做更多任务
  • 开始出现少样本学习、上下文学习等“涌现能力”

所以可以把大语言模型理解成:站在 Transformer 和预训练方法之上的超大号语言模型。

总结来看,语言模型的发展其实一直在解决同一个问题:怎么让模型既看得更远、理解得更深,又能在没见过的新场景里继续做出合理预测。 从最早的“靠计数”,到后来的“靠神经网络理解语义”,再到今天“靠大规模预训练获得通用能力”,本质上就是模型对语言规律的建模能力越来越强。


怎么评估一个语言模型好不好

生成任务不像分类任务那样只有一个标准答案,所以评估更难。实际中常见 3 类指标:

1. BLEU:更看“生成得准不准”

BLEU 常用于机器翻译,本质是比较生成文本和参考答案中有多少 n-gram 重合。

  • 分数范围通常在 0 到 1
  • 越高说明和参考答案越接近
  • 更偏向看精确率

通俗理解:你生成的内容,和标准答案在“字词搭配”上有多像。

2. ROUGE:更看“关键信息有没有覆盖到”

ROUGE 常用于摘要、问答、生成类任务。

  • 和 BLEU 很像,也比较重合程度
  • 但它更偏向看召回率

通俗理解:参考答案里重要的信息,你覆盖到了多少。

其中:

  • ROUGE-N:比较 n-gram 重合
  • ROUGE-L:比较最长公共子序列,更适合看句子结构相似度

3. PPL(困惑度):更看模型会不会“迷糊”

PPL 衡量的是模型对测试文本的困惑程度。

  • PPL 越小越好
  • 说明模型越能给正常句子更高概率

通俗理解:看到一句正常的话,模型越“不惊讶”,说明它学得越好。


通用大模型一般评什么

现在评估大模型,通常不会只看一个 BLEU 或 ROUGE,而是看一组综合能力:

  • 知识理解:常识、专业知识、阅读理解
  • 推理能力:数学、逻辑、多步推理
  • 代码能力:补全、解释、调试、生成
  • 指令跟随:能不能按要求稳定输出
  • 安全性:是否输出有害、偏见、违规内容
  • 多模态能力:是否能同时处理文本、图片、音频等

也就是说,今天评大模型,更像是在评“综合智能水平”。


国内外大模型差异,怎么快速理解

可以先抓住这几个结论:

  • 国外模型通常在基础研究、通用能力、生态工具上起步更早
  • 国内模型通常在中文理解、本地部署、成本控制、产业落地上更贴近实际需求
  • 国外榜单更适合看全球通用能力,国内榜单更适合看中文场景表现

如果你是做业务落地,往往不能只看“谁榜单第一”,还要一起看:

  • 中文效果好不好
  • 推理和生成是否稳定
  • 价格是否合适
  • 是否方便私有化部署
  • 是否支持 Agent、工具调用、多模态

最后总结

把整篇文章压成一条主线,其实就是:

  1. 语言模型的本质是预测下一个词
  2. 早期靠 N-gram 计数,简单但看不远
  3. 后来靠神经网络和 Transformer,理解能力越来越强
  4. 当参数、数据、训练方法一起放大后,就发展成了今天的大语言模型
  5. 评估大模型不能只看一个指标,而要看生成质量、推理能力、知识能力和安全性等综合表现

如果你刚开始学大模型,先把这条主线想明白,后面的 Transformer、BERT、GPT、微调、RAG、Agent 都会更容易串起来。