Skip to content

什么是 AI 大模型

大模型可以先理解为一种通过海量数据训练出来的 AI 系统。它能阅读、理解、生成内容,也能在一定程度上完成翻译、总结、问答、代码编写、图像理解等任务。

大语言模型通常指 LLM,也就是 Large Language Model。它主要处理文本,通过学习大量语料中的语言规律、知识关联和表达模式,形成理解与生成自然语言的能力。

参数规模大

参数可以理解为模型内部保存知识和模式的“权重”。参数规模越大,模型容量通常越强,但训练和运行成本也更高。

核心机制是预测

模型会根据前文语境,计算下一个 Token 的概率分布,再选择更合适的内容继续生成。

具备通用能力

同一个模型可以处理问答、写作、翻译、代码、信息抽取等多种任务。

一句话:大语言模型的本质,是一个通过大量文本训练出来的“语言预测系统”。

大模型从“会续写文本”到“能稳定回答问题”,通常会经历几个关键阶段。

  1. 预训练 Pretraining:让模型阅读海量文本,学习语言规律、常识知识和基础推理模式。这个阶段算力消耗最大,周期也最长。

  2. 监督微调 SFT:用高质量问答、指令和示例训练模型,让它更懂人类指令,知道用户问什么时应该怎么回答。

  3. 奖励建模 Reward Modeling:训练一个评价模型,用来判断不同回答的好坏,为后续优化提供“评分标准”。

  4. 强化学习 RLHF:基于奖励模型继续优化,让模型输出更符合人类偏好、更安全、更稳定的回答。

阶段 目标 重点 成本特点
预训练 学语言、学常识、打基础 海量数据与大规模算力 成本最高
SFT 微调 学会听懂指令 高质量人工标注问答 成本相对较低
奖励建模 建立回答质量标准 对多个回答进行排序 数据质量很关键
RLHF 强化学习 让回答更符合偏好 根据奖励信号持续优化 工程复杂度较高

Transformer 是现代大模型的核心架构。它的重要价值,是让模型可以更高效地理解上下文关系,并支持大规模并行训练。

里程碑意义

Transformer 让大模型具备了更强的上下文建模能力,是 GPT、BERT 等模型的重要基础。

自注意力机制

模型在处理一句话时,会关注句子中不同词之间的关系,而不是只按顺序机械读取。

并行处理能力

相比传统序列模型,Transformer 更适合利用 GPU 并行训练,因此能支撑大规模模型训练。

Token 是大模型理解和处理文字的最小单位。它不一定等于一个汉字、一个单词或一个字符,而是模型分词器切出来的片段。

模型的原子单位

模型不是直接理解整段文字,而是先把文本切成 Token,再对 Token 序列进行计算。

降低计算复杂度

模型只需要处理有限数量的 Token 组合,而不是直接处理无限复杂的自然语言。

影响上下文长度

上下文窗口通常按 Token 计算。输入越长,Token 越多,可用于推理和生成的空间就越紧张。

举个简单例子:I love AI 可能会被拆成 IloveAI 这样的 Token;中文也会根据分词规则拆成不同片段。

大模型生成内容不是一次性写完整篇,而是一步一步预测下一个 Token。

  1. 输入与拆分:用户输入文本,Prompt 会被分词器拆成一串 Token。

  2. 上下文编码:Transformer 会理解这些 Token 之间的关系,形成上下文表示。

  3. 概率计算:模型根据当前上下文,计算下一个 Token 的候选概率。

  4. 采样输出:从候选结果中选出一个 Token,作为下一步输出。

  5. 迭代生成:把新生成的 Token 加回上下文,重复预测、采样、生成,直到满足停止条件。

大模型不只处理文字。按输入和输出能力,可以分成多种类型。

主要处理自然语言和代码,擅长问答、总结、翻译、写作、信息抽取和代码生成。常见代表包括 ChatGPT、Claude、Gemini、豆包等。

类型 核心能力 常见场景
文本大模型 文本理解、生成、推理、代码 问答、写作、翻译、编程
多模态大模型 处理文本、图像、音频、视频 图文理解、视觉问答、语音助手
图像生成模型 文生图、图生图、图像识别 设计草图、插画、素材生成
语音大模型 语音识别、语音合成、音乐生成 TTS、ASR、语音交互
视频生成模型 文生视频、图生视频、视频编辑 短视频生成、分镜、广告创意
3D 生成模型 文本或图片生成 3D 模型 游戏资产、空间设计、原型建模