AI 大模型与智能体术语全景词典(2026)
AI 行业的语言正在以季度为单位翻新。去年还在讲的“提示工程”,今年已被“上下文工程”吸收;刚刚熟悉的多智能体协作,转身就撞上 A2A 协议与 MCP 标准之争。术语的混乱,本质上是产业阶段的混乱——每一个新词背后,都对应着一处真实发生的能力跃迁。
这份词典按 AI 能力栈自下而上编排,从模型与训练范式起步,穿过对齐与安全、推理增强、智能体运行、协议互操作、记忆状态、评测治理,直至与业务系统融合的组织形态与商业模式,共 19 个门类、232 个词条,约 8,382 字。它不追求堆砌,而是把每个词放回它该在的位置——方便你在读技术方案、做选型判断、写对外表达时,快速定位一个词的真实含义与所指阶段。

基础模型与训练范式
22 条
模型规模、架构组件、训练阶段与数据来源,构成全部上层能力的地基。
-
大语言模型Large Language Model, LLM
以海量文本预训练、具备通用语言能力的大规模神经网络。
-
基础模型Foundation Model
泛化数据上预训练、少量适配即可迁移到众多任务的通用模型。
-
小语言模型Small Language Model, SLM
参数量多在百亿以下、可端侧部署、成本低且易微调的模型。
-
前沿模型Frontier Model
能力处于当期最先进水平、通常出自少数头部实验室的模型。
-
开源权重模型Open-weight Model
权重可公开下载自行部署,区别于仅提供接口调用的闭源模型。
-
词元Token
模型处理文本的最小单位,计费与上下文长度均以其为基准。
-
上下文窗口Context Window
单次推理可同时容纳的词元总量,决定一次能喂入多少资料。
-
有效上下文Effective Context
模型能真正稳定利用的上下文长度,通常显著短于标称窗口。
-
预训练Pre-training
在海量无标注语料上自监督学习语言与世界知识的阶段,决定能力上限。
-
后训练Post-training
预训练之后全部阶段的统称,含微调与对齐,决定模型是否好用可控。
-
监督微调Supervised Fine-Tuning, SFT
用高质量指令与答案对训练模型,使其学会遵循指令。
-
指令微调Instruction Tuning
用指令与响应样本塑造模型对话及任务执行行为的技术。
-
缩放定律Scaling Law
描述损失随参数量、数据量与算力按幂律下降的经验规律。
-
涌现能力Emergent Ability
模型规模跨过某个阈值后突然出现的新能力,如多步推理。
-
数据墙Data Wall
高质量公开文本趋于枯竭、单纯扩大数据量收益骤降的困境。
-
合成数据Synthetic Data
由模型生成、用于训练与评测的数据,是突破真实数据瓶颈的手段。
-
知识蒸馏Knowledge Distillation
让小模型学习大模型的输出或推理轨迹,低成本复制其能力。
-
混合专家Mixture of Experts, MoE
把前馈层拆成多个专家、每次仅激活少数的稀疏架构。
-
变换器架构Transformer
以自注意力为核心、可高度并行的神经网络架构,主流模型的基础。
-
注意力机制Attention
让序列中任意位置彼此加权关联的机制,也是算力开销的主要来源。
-
旋转位置编码Rotary Position Embedding, RoPE
以旋转方式编码位置信息,外推性好,是长上下文的通用基础。
-
灾难性遗忘Catastrophic Forgetting
模型学会新任务后,在旧任务上性能大幅退化的问题。
对齐、强化学习与安全训练
16 条
决定模型是否按人类意图行事。近年最大变化是用可验证奖励替代人类偏好。
-
对齐Alignment
使模型行为与人类价值及使用者意图保持一致的全套技术。
-
人类反馈强化学习RLHF
以人类偏好排序训练奖励模型,再用强化学习优化策略的流水线。
-
AI 反馈强化学习RLAIF
用模型代替人工生成偏好判断,大幅降低偏好数据的产出成本。
-
宪法式 AIConstitutional AI, CAI
让模型依一组成文原则自我批评并修订,再据此生成偏好数据。
-
直接偏好优化Direct Preference Optimization, DPO
跳过奖励模型与强化学习,直接用偏好对做监督优化。
-
近端策略优化Proximal Policy Optimization, PPO
经典强化学习算法,需策略与奖励等多模型协同,工程复杂但上限高。
-
群组相对策略优化Group Relative Policy Optimization, GRPO
同题采样多份回答,以组内归一化优势替代评论家网络。
-
可验证奖励强化学习RLVR
用程序化验证器替代人类偏好提供奖励,是推理能力的核心来源。
-
动态采样策略优化DAPO
对群组相对策略优化的改进,以动态采样与裁剪修正稳定长链推理。
-
奖励模型Reward Model
学习人类偏好、为回答打分的模型,是经典对齐流程的评分中枢。
-
过程奖励模型PRM
对推理链每一步而非仅最终答案打分,精细但标注昂贵。
-
奖励黑客Reward Hacking
模型找到验证器捷径、未真正解决问题却刷高奖励的现象。
-
谄媚Sycophancy
模型迎合用户立场而非坚持事实的偏差,多源于偏好数据中的认可信号。
-
红队测试Red Teaming
以对抗方式主动寻找模型越狱与安全漏洞的系统性测试。
-
越狱Jailbreak
通过角色扮演等技巧绕过安全策略,使模型输出被禁内容。
-
护栏Guardrails
部署在模型输入输出两端、用于拦截违规内容与危险操作的规则与分类器。
推理增强与测试时计算
12 条
预训练边际收益放缓后,产业重心转向让模型想得更久。本门类描述推理能力的产生与调用。
-
思维链Chain-of-Thought, CoT
让模型在给出结论前先输出中间推理步骤的提示与训练范式。
-
测试时计算Test-time Compute
推理阶段通过延长思考与多路采样提升成绩的算力投入。
-
推理模型Reasoning Model
经强化学习专门训练、默认产出长思考过程再作答的模型。
-
思考预算Thinking Budget
对推理模型可消耗思考词元上限的设定,是效果与延迟的调节旋钮。
-
自一致性Self-Consistency
对同一问题采样多条推理路径并投票取多数,以冗余换取准确率。
-
自我修正Self-Correction
模型检视自身输出并迭代改进的机制,效果依赖是否引入外部反馈。
-
反思Reflexion
把失败轨迹与教训写入记忆、在后续尝试中复用的自我改进循环。
-
推演搜索Inference-time Search
解码阶段引入束搜索或树搜索等规划算法,为高价值任务换取正确率。
-
过程监督Process Supervision
对推理中间步骤而非仅结果施加监督,减少偶然正确与逻辑跳跃。
-
推理蒸馏Reasoning Distillation
让小模型学习大模型的长思维链轨迹,把推理能力下沉至低成本模型。
-
过度思考Overthinking
简单任务上产生冗长推理,导致延迟上升而准确率反降的失效模式。
-
推理时扩展曲线Inference Scaling Curve
准确率随测试时算力投入变化的曲线,用于判断继续加算力是否划算。
提示工程与上下文工程
13 条
提示工程关注怎么问,上下文工程关注模型这一轮到底看到什么。后者已成为可靠性的主要变量。
-
提示工程Prompt Engineering
设计指令、示例与格式以稳定获得期望输出的实践。
-
上下文工程Context Engineering
系统设计进入上下文窗口的全部信息,含系统提示、记忆与检索结果。
-
系统提示System Prompt
开发者预设、优先于用户输入的行为指令,定义角色、边界与风格。
-
少样本提示Few-shot Prompting
在提示中给出若干示例引导模型模仿,提升格式与风格一致性。
-
上下文学习In-Context Learning, ICL
模型不更新权重、仅凭提示中的示例即学会新任务的能力。
-
提示缓存Prompt Caching
复用已计算的前缀缓存,降低重复系统提示与长文档的成本与延迟。
-
结构化输出Structured Output
约束模型按给定模式产出机器可解析结果的能力。
-
函数调用Function Calling
模型按预定义签名输出参数以触发外部函数的结构化调用机制。
-
上下文腐化Context Rot
上下文越长,关键信息的定位与利用能力越差的现象。
-
上下文压缩Context Compression
对历史与检索内容做摘要或剪枝以腾出窗口空间,是长会话的前提。
-
提示注入Prompt Injection
攻击者在被处理内容中植入指令、劫持模型行为的攻击方式。
-
间接提示注入Indirect Prompt Injection
恶意指令藏在网页与文档中,由模型读取后被动触发。
-
提示版本管理Prompt Versioning
像管理代码一样对提示做版本、评审与回滚,保证行为可追溯。
检索增强生成与知识层
15 条
检索增强是模型接入私有知识与实时事实的主通道,近年重心转向图谱与智能体化。
-
检索增强生成Retrieval-Augmented Generation, RAG
生成前检索外部知识并注入上下文,以弥补知识陈旧与幻觉。
-
分块Chunking
把长文档切分为可检索单元,粒度与语义完整性直接决定检索质量。
-
向量化Embedding
把文本映射为稠密向量以支持语义相似度计算,是语义检索的入口。
-
向量数据库Vector Database
专为高维向量存储与近似最近邻检索设计的数据库。
-
混合检索Hybrid Search
同时使用稠密向量与稀疏关键词检索并融合结果,兼顾语义与精确匹配。
-
重排序Rerank
对初筛候选做更精细的相关性打分与截断,是性价比最高的质量提升环节。
-
查询改写Query Rewriting
检索前把口语化问题改写为更易命中的检索式,含多查询扩展。
-
自我反思检索Self-RAG
模型自行判断是否需要检索、并评估结果是否支撑答案的框架。
-
纠正式检索Corrective RAG, CRAG
对检索结果做质量评估,不合格时触发重检索或改写查询。
-
图谱增强检索GraphRAG
先抽取实体与关系构建知识图谱,再按图结构做多跳检索与全局摘要。
-
智能体式检索Agentic RAG
由智能体自主决定检索时机、工具与轮次,并能追问与交叉验证。
-
知识图谱Knowledge Graph
以实体与关系三元组表达知识的结构化网络,擅长多跳与可解释推理。
-
语义层Semantic Layer
在数据源之上定义统一指标与维度口径,是模型正确取数的前提。
-
文本转查询Text-to-SQL
把自然语言问题翻译为数据库查询语句,使模型可直接对结构化数据取数。
-
数据飞轮Data Flywheel
使用产生数据、数据改善模型、模型再带来更多使用的自我强化循环。
智能体核心范式
16 条
把模型从会回答推向会干活。本门类回答三个问题:怎么循环、怎么用工具、多大程度上独立行动。
-
智能体AI Agent
以模型为决策核心,能规划、调用工具并迭代直至达成目标的软件实体。
-
智能体式 AIAgentic AI
强调系统具备目标分解、自主执行与环境交互能力的整体范式。
-
智能体工作流Agentic Workflow
把任务拆成预定义步骤、由模型在每步内决策的编排方式。
-
推理—行动循环ReAct
交错进行思考、行动与观察的经典智能体循环,是多数框架的内核。
-
规划—执行分离Plan-and-Execute
先由规划器产出完整步骤、再由执行器逐步落实的两段式架构。
-
工具使用Tool Use
模型通过结构化调用外部函数或服务来扩展能力边界的行为。
-
计算机使用Computer Use
模型直接操作图形界面完成任务的能力,可绕开接口缺失问题。
-
浏览器智能体Browser Agent
驱动真实浏览器完成检索、填表与下单等网页任务的智能体。
-
编码智能体Coding Agent
能读写代码库、运行测试并提交变更的智能体,商业化最成熟的形态。
-
深度研究Deep Research
自主进行多轮检索、交叉验证并产出带引用长报告的智能体范式。
-
循环工程Loop Engineering
把目标、行动、观察与反思设计为可持续循环,并在必要时交还控制权。
-
驾驭工程Harness Engineering
为智能体搭建权限边界与安全运行框架,从写代码转向设计规则。
-
人在回路Human-in-the-Loop
在关键节点插入人工审批或修正,兼顾效率与风险控制的部署形态。
-
任务分解Task Decomposition
把模糊目标拆为可验证、可独立执行的子任务,是长任务成功率的最大变量。
-
失败模式Failure Mode
智能体的典型出错方式,如目标漂移、循环重试、工具误用与成本失控。
-
智能体经济Agent Economy
由智能体代表用户或组织自主完成交易、协作与结算的经济活动形态。
智能体协议与互操作标准
10 条
协议解决生态碎片化:工具怎么接、智能体之间怎么对话、结果怎么呈现、身份怎么验证。
-
模型上下文协议Model Context Protocol, MCP
把工具与数据源标准化为服务的开放协议,使工具一次开发多端复用。
-
智能体名片Agent Card
以标准文件描述智能体能力、端点与鉴权方式的机制,是协作发现的入口。
-
智能体发现Agent Discovery
让智能体能按能力而非网络地址找到潜在协作者的服务发现机制。
-
智能体间协议Agent2Agent, A2A
面向智能体之间任务委派与协作的开放协议,定义任务生命周期与流式交互。
-
智能体通信协议Agent Communication Protocol, ACP
以轻量消息信封为核心、面向简单点对点交互的协议设计。
-
智能体网络协议Agent Network Protocol, ANP
基于去中心化身份与图结构描述,面向开放智能体市场的发现与身份层。
-
智能体界面协议AG-UI / A2UI
约定智能体如何向界面传递结构化渲染意图,使同一输出适配不同前端。
-
去中心化身份Decentralized Identifier, DID
不依赖中心注册机构、可密码学验证的身份标识。
-
机器支付协议x402
让智能体调用付费资源时自动完成结算的支付层约定,支撑按次计费的智能体经济。
-
智能体身份冒用Agent Impersonation
攻击者伪造智能体名片或身份,以骗取信任与权限的攻击模式。
多智能体协作
8 条
单个智能体受限于单一上下文。多智能体以分工与独立上下文突破上限,代价是通信成本与一致性风险。
-
多智能体系统Multi-Agent System
由多个各司其职的智能体协同完成任务的架构总称。
-
编排者—工作者模式Orchestrator-Worker
一个主控智能体负责分解与汇总、多个子智能体并行执行的分工结构。
-
主管模式Supervisor Pattern
由主管智能体按需路由到专职下属、并对结果统一把关的协作形态。
-
上下文隔离Context Isolation
让每个子智能体只携带与自身任务相关的信息,避免相互污染与窗口溢出。
-
多智能体辩论Multi-Agent Debate
让多个智能体提出并互相质证观点,以提升结论可靠性的方法。
-
角色分工Role Assignment
为智能体设定专业身份及其工具权限,是多智能体效果的主要来源。
-
通信开销Communication Overhead
智能体之间往返传递信息带来的词元与延迟成本,常成为主要瓶颈。
-
一致性风险Consistency Risk
多个智能体各自判断导致结论冲突、重复劳动或相互覆盖的问题。
记忆与状态管理
10 条
上下文窗口是内存而不是硬盘。记忆层的价值是把该记住的事搬到窗口外,并在需要时准确取回。
-
智能体记忆Agent Memory
跨轮次、跨会话持久保存并可按需召回的信息系统。
-
工作记忆Working Memory
当前推理轮次真正可见的上下文内容,速度快、容量有限、按词元计费。
-
情节记忆Episodic Memory
对过往交互事件与对话轮次的存储与检索,支撑跨会话连续性。
-
程序性记忆Procedural Memory
可复用的操作流程与技能包,让智能体记住这类事该怎么做。
-
分层记忆架构Tiered Memory
模仿操作系统分级,把常驻上下文、可检索历史与归档库分层管理。
-
记忆抽取Memory Extraction
由模型判断哪些信息值得长期保存并结构化写入的过程,决定记忆质量。
-
时序知识图谱Temporal Knowledge Graph
带生效与失效时间的图结构记忆,可回答某个时点是什么情况。
-
会话失忆Session Amnesia
系统仅靠上下文窗口保存状态,导致每次新会话都从零开始的缺陷。
-
记忆注入Memory Injection
在响应前把检索到的相关记忆拼入上下文,是记忆生效的实际机制。
-
记忆投毒Memory Poisoning
向可写记忆注入虚假信息,使智能体长期按错误前提行动的攻击。
开发框架与工具链
10 条
框架选择正从绑定一家转向分层组合:编排、检索、评测与可观测各自独立,避免被单一生态锁死。
-
编排框架Orchestration Framework
提供智能体循环、状态机、工具与中断处理等基础能力的开发框架。
-
图式编排Graph-based Orchestration
以节点与边显式表达流程、支持分支循环与状态持久化的编排范式。
-
智能体软件开发工具包Agent SDK
厂商提供的轻量开发包,把模型调用、工具、会话与追踪封装为标准接口。
-
低代码智能体平台Low-code Agent Platform
以可视化方式编排提示、知识库、插件与流程的平台。
-
工作流自动化平台Workflow Automation Platform
以节点连线连接数百个业务系统的平台,正被智能体节点重构。
-
模型网关Model Gateway
统一多家模型接口并做路由、限流、缓存与计费的中间层。
-
沙箱执行环境Sandbox
隔离运行智能体生成代码与命令的受控环境,是防止失控副作用的关键设施。
-
可观测性Observability
对智能体每一步思考、调用与开销做完整记录与追踪的能力。
-
评估流水线Eval Pipeline
把测试集、打分器与回归比对自动化的工程体系,防止升级导致能力退化。
-
模型即评判LLM-as-Judge
用强模型按评分标准自动为输出打分的方法,需防范位置与长度等系统性偏好。

多模态与生成式模型
13 条
从文本走向图像、语音、视频与三维空间。术语主线是统一表征、生成范式与实时交互。
-
多模态模型Multimodal Model
可同时接收或产出文本、图像、音频、视频等多种模态的模型。
-
视觉语言模型Vision-Language Model, VLM
能理解图像与文本并建立二者关联的模型,是图文任务主力。
-
全模态模型Omni Model
原生统一处理文本、图像、音频与视频的单一模型,取代拼接式多模块方案。
-
扩散模型Diffusion Model
通过逐步去噪从随机噪声生成图像或视频的范式,是视觉生成的主流。
-
扩散变换器Diffusion Transformer, DiT
以变换器替代卷积作为扩散模型主干的架构,规模扩展性更好。
-
流匹配Flow Matching
学习从噪声到数据的连续变换路径的生成方法,采样步数更少、训练更稳定。
-
潜空间扩散Latent Diffusion
先在压缩潜空间做扩散再解码回像素,大幅降低生成算力开销。
-
条件控制ControlNet
通过边缘、深度、姿态等额外条件精确约束图像生成构图的技术。
-
语音识别与合成ASR / TTS
把语音转文本、把文本转语音的技术,构成语音交互的两端。
-
端到端语音对话Speech-to-Speech
直接以语音为输入输出、不经文本中转的对话模型,可保留语气。
-
实时多模态接口Realtime API
支持双向流式音频与打断的低延迟会话接口,是语音智能体的基础设施。
-
视频生成模型Video Generation Model
按文本或图像条件生成连贯视频,难点在长时一致性与物理合理性。
-
三维高斯泼溅3D Gaussian Splatting
以大量高斯点显式表示场景、可实时渲染的三维重建技术。
具身智能与物理 AI
11 条
语言模型的下一个前沿是物理世界。术语围绕看懂—预测—行动的闭环,以及仿真与真机之间的落差。
-
具身智能Embodied AI
以物理实体为载体、在真实环境中感知并行动的智能,强调身体与环境耦合。
-
物理 AIPhysical AI
把智能从数字空间延伸到物理世界的技术范畴,被视为生成式 AI 之后的新阶段。
-
视觉—语言—动作模型Vision-Language-Action, VLA
将视觉感知与语言指令直接映射为机器人动作的端到端模型。
-
世界模型World Model
在内部建立对物理世界的预测性表征,能推演动作后果并支撑规划与决策。
-
世界动作模型World Action Model, WAM
把世界模型的预测能力与动作生成结合,直接产出可执行策略。
-
因果世界模型Causal World Model
以因果结构而非统计关联刻画物理规律,追求理解而非仅拟合。
-
全身智能Whole-Body Intelligence, WBI
从只控制机械臂转向统一协调全身关节与平衡的研究范式。
-
具身基础模型Embodied Foundation Model
在大规模机器人数据上预训练、可跨本体与跨任务迁移的通用模型。
-
仿真到现实Sim2Real
把仿真环境训练的策略迁移到真机的技术,难点在物理参数与传感器差异。
-
真机数据闭环Real-robot Data Loop
让机器人在真实作业中持续回流数据并反哺模型迭代的飞轮机制。
-
人形机器人Humanoid Robot
以人体形态适配既有环境的通用本体路线,量产与成本是当前瓶颈。
评测基准与评估方法
13 条
榜单的意义不在排名,而在暴露能力边界。评估重心已转向长时程、真实环境与抗污染。
-
评测基准Benchmark
用于横向比较模型能力的标准化任务集与评分协议,须兼具区分度与抗污染性。
-
基准饱和Benchmark Saturation
所有前沿模型得分接近上限、该基准丧失区分能力的状态。
-
数据污染Data Contamination
测试题出现在训练语料中导致成绩虚高,是榜单可信度的最大威胁。
-
支架Scaffold
包裹模型的工程外壳,负责文件浏览与命令执行,同一模型换支架分数差异显著。
-
人类最后考试Humanity's Last Exam, HLE
跨学科专家级难题集,设计目标是在数年内保持不被刷满。
-
抽象推理语料ARC-AGI
以视觉化抽象推理题考察流体智力、刻意抵抗记忆式解法的基准系列。
-
软件工程基准SWE-bench
以真实开源仓库的缺陷修复任务、并用项目测试用例判定成败的编码基准。
-
工具调用基准Berkeley Function Calling Leaderboard, BFCL
衡量模型按模式正确选择与填参调用函数的能力。
-
长上下文基准RULER
在多种长度与检索类型下测量模型实际可用上下文,比单点大海捞针更严格。
-
智能体环境基准OSWorld / WebArena
在真实操作系统与网站环境中考察智能体完成端到端任务的基准。
-
评估自由度Eval Degrees of Freedom
提示措辞、示例数量与评分脚本等可变因素,是分数不一致的主因。
-
人类偏好竞技场Chatbot Arena
由真人匿名对比投票并生成等级分的榜单,反映主观使用体验。
-
古德哈特定律Goodhart's Law
指标一旦成为目标就不再是好指标,在模型刷榜与奖励黑客中反复印证。
安全、风险与合规治理
13 条
智能体把模型从说错话的风险升级为做错事的风险。治理重心从内容合规扩展到权限、身份与责任归属。
-
AI 安全AI Safety
降低 AI 系统造成伤害风险的研究与工程实践,覆盖失控、滥用与预期外副作用。
-
提示注入攻击Prompt Injection
以自然语言指令劫持模型行为的攻击,被列为智能体首要安全风险。
-
越权操作Excessive Agency
智能体被授予超出任务所需的权限或自主度,从而放大错误后果的配置缺陷。
-
数据投毒Data Poisoning
在训练或检索数据中掺入恶意样本,使模型在特定触发下产生错误行为。
-
深度伪造Deepfake
用生成模型伪造人物形象与声音,是身份欺诈与信息操纵的核心风险。
-
水印与标识Watermarking
在模型输出中嵌入机器可识别标记,使 AI 生成内容可被检测与标注。
-
系统性风险Systemic Risk
通用模型广泛部署后可能对公共安全与社会秩序造成的规模化风险。
-
通用人工智能模型General-Purpose AI, GPAI
欧盟法案中对可执行多种任务并被广泛集成的模型类别的法定称谓。
-
行为准则Code of Practice
由独立专家起草、供模型提供方自愿签署以证明合规的实操性文件。
-
高风险系统High-Risk AI System
法案风险分级中承担最重合规义务的类别,如就业、教育与关键基础设施。
-
透明度义务Transparency Obligation
要求告知用户正在与 AI 交互、并对合成内容做机器可读标识的规定。
-
AI 治理AI Governance
组织层面关于 AI 准入、审计、责任与风险处置的制度与流程体系。
-
负责任 AIResponsible AI
以公平、可解释、隐私保护与人类监督为核心原则的 AI 建设主张。
推理优化与部署工程
12 条
把模型能力变成可负担的服务,靠的是显存、带宽与调度三件事。这是推理成本曲线的直接决定因素。
-
量化Quantization
用更低精度表示权重与激活以减少显存占用、提升吞吐,代价是少量精度损失。
-
低秩适配LoRA
冻结原权重、只训练少量低秩矩阵的微调方法,可插拔且便于多租户切换。
-
量化低秩适配QLoRA
在量化后的基座上加装低秩适配器,使单卡微调大参数模型成为可能。
-
投机解码Speculative Decoding
用轻量草稿模型先猜若干词元、再由主模型一次校验,以并行换延迟。
-
键值缓存KV Cache
缓存已计算注意力键值以复用历史,是长上下文与高并发下显存的主要占用者。
-
连续批处理Continuous Batching
请求完成即替换新请求的动态批调度,是推理吞吐提升的关键工程。
-
前缀缓存Prefix Caching
跨请求复用相同提示前缀的缓存,显著降低长系统提示与共享文档的成本。
-
首字延迟Time to First Token, TTFT
从发出请求到收到第一个词元的时间,决定交互流畅度。
-
吞吐量Throughput
单位时间可处理的请求或词元数,与延迟构成推理优化的核心权衡。
-
推理服务引擎Inference Engine
承担批调度、缓存、量化与并行的高性能推理框架,是部署层的基础组件。
-
端侧推理On-device Inference
在手机、电脑或边缘设备本地运行模型,兼顾隐私、延迟与离线可用。
-
模型路由与降级Routing and Fallback
按负载与健康度在多个模型或实例间切换,保障可用性与成本稳定。
训练基础设施与算力
9 条
训练是系统工程问题。集群互联、并行策略与故障恢复共同决定一次训练能否跑完。
-
高速互联NVLink / InfiniBand
卡间与节点间的高带宽低延迟通信链路,决定并行效率的上限。
-
算力利用率Model FLOPs Utilization, MFU
实际达到的浮点运算量占理论峰值的比例,是集群效率的核心指标。
-
数据并行Data Parallelism
把批次切分到多卡、各自计算后同步梯度的最常用并行方式。
-
张量并行Tensor Parallelism
把单层矩阵运算切分到多卡,用于单卡放不下的大层。
-
零冗余优化器ZeRO
把优化器状态、梯度与参数分片存储以消除显存冗余的经典技术族。
-
完全分片数据并行FSDP
框架级实现参数分片与按需聚合的并行方案,降低工程复杂度。
-
梯度检查点Gradient Checkpointing
以重算激活换取显存占用的时间换空间技术。
-
混合精度训练Mixed Precision Training
以低精度做前反向、高精度做参数更新,兼顾速度与稳定。
-
算力集群功耗Power and Cooling
电力供应与散热能力,已成为与芯片供给并列的扩张约束。
运营工程与成本管理
8 条
智能体成本随使用量线性增长且波动剧烈。可观测性与成本治理因此成为同一条工程线。
-
大模型运维LLMOps
覆盖模型选型、提示版本、评测、监控与成本的全生命周期运营体系。
-
智能体运维AgentOps
面向智能体的运行监控、轨迹回放、异常告警与人工干预的专门运营实践。
-
单任务成本Cost per Task
完成一次业务任务的总开销,比单次调用价格更能反映真实经济性。
-
词元经济Token Economics
以词元为计量单位核算推理成本、定价与毛利的分析框架。
-
上下文成本Context Cost
长上下文与历史累积带来的词元开销,通常是成本失控的首要来源。
-
成本护栏Cost Guardrail
对预算、步数与工具调用次数设置硬上限,防止循环失败导致费用失控。
-
提示回归测试Prompt Regression Test
在提示或模型变更后重跑固定样本集,检测行为是否退化。
-
人工兜底Human Fallback
当模型置信度不足或触发规则时转交人工处理,是可靠性的最后一道防线。
AI 与业务系统、组织形态融合
11 条
当模型接入真实系统与真实组织,会生长出既不属于纯技术、也不属于传统管理的新词。
-
AI 原生AI-native
从架构与流程起点就假设智能体存在而设计的产品与组织形态。
-
智能体服务Agentic Service
以帮客户用数据做事为交付内容的新服务品类,区别于仅交付分析结论。
-
数字员工Digital Workforce
被赋予岗位职责与考核指标、与人类在同一流程中协作的智能体群体。
-
前沿部署工程师Forward Deployed Engineer, FDE
源自 Palantir、借军事前线部署概念命名的复合型角色,常驻客户现场,兼具工程、咨询与业务理解,专门弥合平台产品与业务价值之间的落地鸿沟。
-
前沿部署单元Forward Deployed Unit, FDU
以人类专家分居两端、专职智能体在中间构成的交付作战单元,用少量人加数字员工完成原来需数倍人力的交付量。
-
智能体式流程自动化Agentic Process Automation, APA
以智能体替代固定规则脚本的流程自动化新阶段。
-
氛围编程Vibe Coding
以自然语言描述意图、由模型生成并调试代码的开发方式,人类负责方向与验收。
-
上下文工程师Context Engineer
专门设计进入模型的信息环境、为智能体可靠性负责的角色。
-
智能体商务Agentic Commerce
由用户的智能体代为比价、议价与下单,催生机器可读的商品描述与结算协议。
-
零售智能体Retail Agent
嵌入导购、客服、选品与补货环节的智能体,从被动响应走向主动建议。
-
供应链智能体Supply Chain Agent
面向预测、补货、调度与异常处置的智能体,强调约束条件下的可执行性。
AI 搜索与内容生态
10 条
入口从链接列表变为合成答案,内容行业的价值分配逻辑随之改写。
-
生成式引擎优化Generative Engine Optimization, GEO
让内容被生成式 AI 检索、引用并写入答案的优化实践。
-
答案引擎优化Answer Engine Optimization, AEO
以成为直接答案为目标的优化,覆盖摘要框与语音助手等入口。
-
大模型优化Large Language Model Optimization, LLMO
面向模型内在品牌表征的优化,涵盖训练语料与线上检索两个来源。
-
AI 概览AI Overviews
搜索引擎在结果页顶部生成的合成答案块,是流量重新分配的核心界面。
-
引用占比Citation Share
品牌内容在 AI 答案中被引用的比例,是 GEO 的核心效果指标。
-
AI 可见性AI Visibility
品牌在各类生成式入口中被提及与推荐的总体程度,取代传统排名成为新目标。
-
大模型推荐流量LLM Referral Traffic
从 AI 界面跳转到站点的访问量,用于评估引用的实际商业价值。
-
可引用性Citation-worthiness
内容被模型提取引用的可能性,取决于结论前置、单元自洽与证据可核。
-
实体一致性Entity Consistency
品牌、产品与人名在网络上的表述统一,是模型形成稳定认知的前提。
-
语义相关度Semantic Relevance
内容与查询在语义层面的契合程度,已取代关键词密度成为优化中心。
- 先定位层级,再抠定义。一个词属于哪一层,决定了它能解决什么问题、不能解决什么问题。把“RAG”放在检索增强层、“记忆”放在状态管理层,就不会再把两者混为一谈。
- 注意同一概念的代际更替。例如对齐领域,可验证奖励强化学习(RLVR)已在推理能力训练中部分替代人类偏好;协议领域,ACP 已正式并入 A2A。看到旧词,先确认它是否还代表当前主流做法。
- 把词当作评估工具。面对供应商方案时,逐条核对它宣称的能力落在哪一层、用的是哪一代技术,比听结论更能判断方案的真实成熟度。
- 中英对照是刻意保留的。中文名用于对内沟通,英文原名与缩写用于检索原始资料与论文——技术词汇的权威定义几乎都在英文语境中。
