参数规模大
参数可以理解为模型内部保存知识和模式的“权重”。参数规模越大,模型容量通常越强,但训练和运行成本也更高。
大模型可以先理解为一种通过海量数据训练出来的 AI 系统。它能阅读、理解、生成内容,也能在一定程度上完成翻译、总结、问答、代码编写、图像理解等任务。
大语言模型通常指 LLM,也就是 Large Language Model。它主要处理文本,通过学习大量语料中的语言规律、知识关联和表达模式,形成理解与生成自然语言的能力。
参数规模大
参数可以理解为模型内部保存知识和模式的“权重”。参数规模越大,模型容量通常越强,但训练和运行成本也更高。
核心机制是预测
模型会根据前文语境,计算下一个 Token 的概率分布,再选择更合适的内容继续生成。
具备通用能力
同一个模型可以处理问答、写作、翻译、代码、信息抽取等多种任务。
一句话:大语言模型的本质,是一个通过大量文本训练出来的“语言预测系统”。
大模型从“会续写文本”到“能稳定回答问题”,通常会经历几个关键阶段。
预训练 Pretraining:让模型阅读海量文本,学习语言规律、常识知识和基础推理模式。这个阶段算力消耗最大,周期也最长。
监督微调 SFT:用高质量问答、指令和示例训练模型,让它更懂人类指令,知道用户问什么时应该怎么回答。
奖励建模 Reward Modeling:训练一个评价模型,用来判断不同回答的好坏,为后续优化提供“评分标准”。
强化学习 RLHF:基于奖励模型继续优化,让模型输出更符合人类偏好、更安全、更稳定的回答。
| 阶段 | 目标 | 重点 | 成本特点 |
|---|---|---|---|
| 预训练 | 学语言、学常识、打基础 | 海量数据与大规模算力 | 成本最高 |
| SFT 微调 | 学会听懂指令 | 高质量人工标注问答 | 成本相对较低 |
| 奖励建模 | 建立回答质量标准 | 对多个回答进行排序 | 数据质量很关键 |
| RLHF 强化学习 | 让回答更符合偏好 | 根据奖励信号持续优化 | 工程复杂度较高 |
Transformer 是现代大模型的核心架构。它的重要价值,是让模型可以更高效地理解上下文关系,并支持大规模并行训练。
里程碑意义
Transformer 让大模型具备了更强的上下文建模能力,是 GPT、BERT 等模型的重要基础。
自注意力机制
模型在处理一句话时,会关注句子中不同词之间的关系,而不是只按顺序机械读取。
并行处理能力
相比传统序列模型,Transformer 更适合利用 GPU 并行训练,因此能支撑大规模模型训练。
Token 是大模型理解和处理文字的最小单位。它不一定等于一个汉字、一个单词或一个字符,而是模型分词器切出来的片段。
模型的原子单位
模型不是直接理解整段文字,而是先把文本切成 Token,再对 Token 序列进行计算。
降低计算复杂度
模型只需要处理有限数量的 Token 组合,而不是直接处理无限复杂的自然语言。
影响上下文长度
上下文窗口通常按 Token 计算。输入越长,Token 越多,可用于推理和生成的空间就越紧张。
举个简单例子:I love AI 可能会被拆成 I、love、AI 这样的 Token;中文也会根据分词规则拆成不同片段。
大模型生成内容不是一次性写完整篇,而是一步一步预测下一个 Token。
输入与拆分:用户输入文本,Prompt 会被分词器拆成一串 Token。
上下文编码:Transformer 会理解这些 Token 之间的关系,形成上下文表示。
概率计算:模型根据当前上下文,计算下一个 Token 的候选概率。
采样输出:从候选结果中选出一个 Token,作为下一步输出。
迭代生成:把新生成的 Token 加回上下文,重复预测、采样、生成,直到满足停止条件。
大模型不只处理文字。按输入和输出能力,可以分成多种类型。
主要处理自然语言和代码,擅长问答、总结、翻译、写作、信息抽取和代码生成。常见代表包括 ChatGPT、Claude、Gemini、豆包等。
能同时处理文本、图片、音频、视频等多种信息,适合图文理解、视觉问答、语音交互和复杂场景分析。
根据文本或其他输入生成图片、语音、视频或 3D 内容,例如文生图、图生图、语音合成、视频生成等。
| 类型 | 核心能力 | 常见场景 |
|---|---|---|
| 文本大模型 | 文本理解、生成、推理、代码 | 问答、写作、翻译、编程 |
| 多模态大模型 | 处理文本、图像、音频、视频 | 图文理解、视觉问答、语音助手 |
| 图像生成模型 | 文生图、图生图、图像识别 | 设计草图、插画、素材生成 |
| 语音大模型 | 语音识别、语音合成、音乐生成 | TTS、ASR、语音交互 |
| 视频生成模型 | 文生视频、图生视频、视频编辑 | 短视频生成、分镜、广告创意 |
| 3D 生成模型 | 文本或图片生成 3D 模型 | 游戏资产、空间设计、原型建模 |