基础概念
19 个词条理解 AI 与大模型必备的基础术语
在海量文本上预训练、擅长理解与生成自然语言的深度学习模型。
在几乎所有认知任务上达到或超越人类水平的人工智能。
用户输入给 AI 模型的问题、指令或示例文本。
模型处理文本的最小单位,可能是单词、子词或字符。
模型单次处理时可容纳的最大 Token 数量。
模型生成看似合理但实际错误或虚构的内容。
控制模型输出随机性的参数,越高越发散、越低越确定。
模型内部可学习的数值,规模通常以「多少 B」衡量。
能够创造文本、图像、视频、代码等内容的人工智能。
使用多层神经网络从数据中自动学习特征与规律的机器学习方法。
由大量互连的「神经元」组成的计算模型,可逼近任意复杂函数。
让模型行为符合人类意图、价值观与安全要求的训练过程。
用于量化比较模型能力的标准化任务与评分体系。
权重公开、可自由下载与部署的模型(开源权重)。
仅通过 API 提供服务、权重不公开的模型。
在提示中给出少量示例,让模型举一反三完成任务。
不给示例、仅凭任务描述让模型直接完成从未见过的任务。
模型训练数据的时间截止点,之后发生的事模型并不知晓。
模型进行逻辑推导、多步思考与复杂问题求解的能力。
模型架构
15 个词条Transformer、注意力与混合专家等模型结构
基于自注意力机制的神经网络架构,现代大语言模型的基础。
让模型动态聚焦输入中重要部分的计算机制。
序列内部元素两两计算相关性的注意力机制。
并行运行多组注意力,从不同子空间捕捉多样的关系。
为模型注入序列中位置信息的方法。
将模型拆分为多个「专家」子网络、每次只激活少数的架构。
通过逐步去噪生成图像、视频等数据的一类生成模型。
由编码器读入输入、解码器生成输出的两段式架构。
推理时缓存已算好的键值向量,避免重复计算的优化手段。
将文本切分为 Token 序列的组件,模型输入输出的第一站。
逐 Token 预测下一个 Token 的生成方式。
只计算部分 Token 对之间注意力的高效近似方案。
数据被压缩编码后的低维语义表示空间。
不更新权重,仅通过提示中的示例让模型学会新任务。
从输出误差反向计算梯度、逐层更新参数的训练算法。
训练方法
14 个词条预训练、微调与对齐技术
在海量无标注文本上训练模型学习语言规律的过程。
在预训练模型基础上用特定数据继续训练,适配专门任务。
用人工标注的「指令-回答」数据训练模型学会遵循指令。
用人类偏好反馈训练奖励模型、再优化策略的对齐方法。
只训练少量低秩矩阵实现高效微调的方法。
结合 4-bit 量化与 LoRA 的极省显存微调方案。
直接从偏好数据优化策略、无需奖励模型的简化对齐方法。
RLHF 中常用的强化学习算法,通过裁剪更新幅度保持训练稳定。
用多样化指令数据训练模型,使其理解并执行各种任务描述。
在预训练之后用新语料继续训练,注入领域知识或新语言。
用大模型(教师)的输出训练小模型(学生)的技术。
模型过度记忆训练数据、在未见数据上表现下降的现象。
用于训练模型的海量文本、图像等语料。
通过变换、改写等方式扩充训练数据的技术。
推理部署
14 个词条推理性能、量化与成本优化
使用训练好的模型对新输入生成输出的过程。
从发出请求到收到首个(或完整)响应的时间。
单位时间内模型处理的请求或 Token 数量。
模型边生成边返回 Token,用户无需等待完整回答。
让模型严格按 JSON 等预定义格式输出。
用低精度数值(如 8-bit、4-bit)表示模型权重以压缩体积、加速推理。
高性能大模型推理服务框架,主打高吞吐与易用性。
通过增加推理时的计算投入换取更高质量输出的策略。
推理阶段额外分配的计算资源(搜索、验证、迭代)。
应用程序访问模型服务的标准接口,按用量计费。
API 提供商对单位时间内请求次数或 Token 量的上限。
将多个请求合并为一次推理批次以提升吞吐。
复用相同前缀内容的计算结果以降低重复输入的成本。
按实际调用量计费、无需自建 GPU 集群的推理服务模式。
应用开发
16 个词条Agent、RAG 与提示工程实践
让大模型在生成前先检索外部资料,再基于资料作答的技术。
能自主规划、调用工具并完成多步任务的 AI 系统。
将文本映射为高维数值向量,语义相近的文本向量距离更近。
专为存储与检索高维向量设计的数据库。
基于含义而非关键词匹配的搜索方式。
通过设计提示词优化模型输出的实践与方法论。
引导模型分步思考再作答的推理提示技法。
让模型交替「思考-行动-观察」完成任务的 Agent 范式。
模型按预定义函数签名生成调用参数、触发外部工具的能力。
模型调用外部工具(搜索、代码执行、数据库等)扩展能力。
为模型或应用扩展新能力的可插拔组件。
让 Agent 在多次交互间保留与利用信息的能力。
将多步任务编排为固定流程的自动化方案。
多个各司其职的 Agent 协作完成复杂任务的模式。
内嵌于开发工具、辅助写代码的 AI 助手产品形态。
以对话方式提供服务的 AI 应用形态。
多模态
11 个词条图像、视频、语音等跨模态能力
能同时处理文本、图像、音频等多种输入输出形式的模型。
结合视觉编码器与语言模型的图像理解模型。
根据文字描述生成图像的 AI 能力。
根据文字描述生成视频片段的 AI 能力。
模型识别并解释图像内容的能力。
将文本转换为自然流畅语音的技术,用于有声内容与语音助手。
将语音转换为文本的技术,用于转写、字幕与语音输入。
从图像中识别并提取文字的技术,文档数字化的基础。
模型理解视频内容、时序与事件的能力。
在不同模态(文本、图像、音频)之间迁移与对齐信息的能力。
用少量样本复制特定人声的音色与风格。
治理与生态
13 个词条安全、合规与开源生态
确保 AI 系统可靠、可控、不造成危害的研究与实践。
模拟攻击者视角系统性探测模型漏洞的过程。
理解并解释模型为何做出某决策的能力。
训练数据与生成内容的版权归属与合规问题。
训练与使用模型时对个人数据的保护要求。
训练与运行 AI 模型所需的计算资源。
并行计算能力强的芯片,AI 训练与推理的主力硬件。
规定模型权重与代码使用、修改、商用权利的许可协议。
随模型发布的能力、局限与使用说明文档。
按评测分数排名的模型能力榜单。
各国对 AI 开发与应用的法规与治理框架。
通过构造恶意输入劫持模型行为的安全攻击。
模型输出中存在的系统性偏差或不公平倾向。