GLOSSARY / CONCEPTS
AI 术语表
用大白话解释核心 AI 概念——没有黑话,没有废话。
01大语言模型(LLM)在海量文本上训练、能预测和生成语言的神经网络,是所有 AI 聊天助手背后的引擎。02生成式 AI能创造新内容(文本、图像、视频、音频或代码)的 AI,而不只是从固定选项中分类或预测。03提示词(提示词工程)提示词是你给 AI 模型的指令;提示词工程则是撰写“能稳定产出所需结果”的指令的技艺。04Token(词元)AI 模型实际读取和生成的小文本块(约等于一个词或词的一部分);计费与上下文限制都以 token 计数。05幻觉(AI 幻觉)指 AI 模型自信地陈述虚假信息——编造事实、虚构引用,或看似合理实则错误的回答。06多模态能同时处理多种媒介的模型——读图、生成音频、看懂视频——而不只处理文本。07微调在预训练模型基础上,用你自己的样本继续训练,使其适配特定风格、任务或领域。08开放权重(开源模型)训练参数公开可下载的模型——任何人都能在自己的硬件上运行、审计或改造它们。09上下文窗口模型一次能“看到”的文本量——以 token 计的工作记忆,涵盖你的对话与所附文档。10检索增强生成(RAG)一种技术:模型先检索相关文档(或网络),再基于检索到的内容作答并引用来源。11AI 智能体能自主规划并执行多步任务的 AI 系统——浏览、写代码、使用工具——而不只是回答单个问题。12推理(推断)运行训练好的模型以产出结果的过程——每条聊天回复、每张生成图像、每次 API 调用都是一次推理。13向量嵌入(Embedding)文本、图像或音频的数值化表示,捕捉语义,使机器能通过比较向量找到相似内容。14API(AI 接口)让开发者能在自己的软件中调用 AI 模型的编程接口,通常按用量计费。15AI 安全与对齐让 AI 系统有用、诚实、无害的实践——追随人类的意图与价值观,而非产出“有能力但有害”的结果。16基础模型在广泛数据上训练的大型通用模型,设计初衷是适配众多下游任务,而非单一工作。17扩散模型支撑现代大多数图像与视频生成的模型家族:学习逐步去除噪声,直至浮现清晰画面。18LoRA(低秩适应)让基础模型学会新风格、新角色或新技能的轻量方法——一个小型附加文件,几小时即可训成,无需重训整个模型。19量化把模型权重从 16 位压缩到 8 位、4 位甚至更低——让大模型能在更小的硬件上运行,代价是轻微的质量损失。20分词器把文本切成 token 的组件——模型实际读取、生成与计费的最小单位。21混合专家(MoE)一种把每次请求路由到少数专家子网络的架构——以每个 token 更低的算力,达到前沿级质量。22向量数据库把文本(或图像)以数值向量存储、并在毫秒级找到最相似条目的数据库——RAG 与 AI 搜索背后的记忆层。23系统提示词在对话开始前发给模型的隐藏指令——定义它的角色、语气、边界与规则。24温度控制模型输出可预测性或创造性的旋钮——低值求准确,高值求多样。25Transformer 架构几乎当代所有 AI 模型(从聊天机器人到图像生成器)背后的神经网络架构,核心是一种名为注意力(attention)的机制。26RLHF(基于人类反馈的强化学习)让原始语言模型变得礼貌、有用且安全的训练步骤——用数千条“哪个回答更好”的人类评判来教学。27知识蒸馏训练一个更小更快的模型去模仿大模型——以极低的运行成本保留大部分质量。28护栏(Guardrails)AI 系统外围的安全层:在毒性输出、违禁话题、提示攻击与危险操作到达用户之前拦截它们的过滤器与规则。29工具调用模型使用软件的方式:不再只输出文本,而是发出结构化请求去调用计算器、搜索引擎、API——再把结果织入回答。30结构化输出让模型返回符合你 schema 的合法 JSON——这是演示与可上生产线的软件之间的差别。31少样本提示在提示词内“以例教学”:给模型看几组输入-输出对,它就会在新输入上模仿该模式——无需重新训练。32提示注入针对 AI 系统的入侵技术:把指令藏进模型读取的数据里,诱使其无视真正的命令——LLM 时代的 SQL 注入。33思维链(推理)让模型在作答前逐步推演问题——在数学、逻辑与规划上显著更强,代价是额外的时间与 token。34评测(Evals)对 AI 行为的系统化测试:固定的任务集与评分器,告诉你模型或提示词的改动是否真的变好了。35越狱(Jailbreak)一种精心构造的提示:诱使 AI 助手无视安全规则,产出其本应拒绝的内容。36视觉语言模型(VLM)既能读图也能读文的模型:发一张截图、图表、照片或示意图,用自然语言提问即可。37语音识别(ASR)把语音转成文本——会议转写、语音助手与字幕工具的底层能力,清晰语音的准确率已接近人类。38声音克隆从录音中生成特定人声的合成副本——如今几秒音频即可,这既是创作超能力,也是欺诈渠道。39落地依据(Grounding)把模型的回答锚定在可核验的来源上——你的文档、数据库或实时网络——而非信赖它的记忆。40小语言模型(SLM)紧凑型模型(约 1–13B 参数),经过调校以小博大——足够快、便宜且私密,能在手机、笔记本与边缘设备上运行。41潜在空间模型表征概念的内部数值空间——相近的点意味着相似的概念,沿某方向移动则平滑地改变概念。42局部重绘(Inpainting)只重新生成图像的选中区域——抹掉路人、替换产品、扩展背景——其余部分保持逐像素不变。43Checkpoint(模型检查点)模型权重的保存快照——下载开源模型时拿到的那种文件,也是社区在枢纽上分享的单位。44KV 缓存让模型为已读 token 保留“笔记”而无需重算的内存——长对话吞噬显存的原因。45重排序(Rerank)按真实相关度对检索结果二次排序的模型——严肃 RAG 与企业搜索背后安静的质提升。46AGI(通用人工智能)假想中能在几乎所有认知工作上比肩人类的 AI——整个行业宣称的目的地,也是争议最大的词。47谄媚性(Sycophancy)AI 助手附和你、恭维你、在反驳下放弃正确答案的习得倾向——人类反馈训练的直接副作用。48采样参数温度之外的旋钮(top-p、top-k、惩罚项),决定模型如何选词——调节输出的多样性、聚焦与重复度。49MCP(模型上下文协议)一个开放标准,让 AI 模型通过统一接口接入外部工具与数据源——“AI 应用的 USB-C”。50语音合成(TTS)把文本变成自然的语音——语音 AI 的输出半边,在许多语言上已与真人朗读难以区分。51AI 放大(Upscaling)把图像或视频放大到超出原始分辨率——从忠实的 2 倍锐化,到会“编造”可信新细节的生成式放大。52AI 水印嵌入 AI 生成内容中的隐形标记(或在内容上的显式标签),使合成媒体日后可被识别——AI 溯源的核心环节。53合成数据人工生成的训练数据——当真实数据稀缺、涉隐私或昂贵时,用模型输出或仿真来顶替真实记录。54端侧 AI完全运行在手机、笔记本或设备本体的 AI——不经过云端——用峰值能力换取隐私、低延迟与离线自由。55训练(预训练与后训练)创造模型的过程:预训练从海量文本学习语言,后训练把它塑造成有用的助手。56上下文工程超出“写提示词”的学科:决定什么东西进入模型有限的上下文窗口——指令、检索到的文档、工具结果、历史——以及按什么顺序。57注意力机制让模型为每个输出判断输入中哪些部分重要的机制——让现代 AI 成为可能的那一个想法。58指令微调用数千条“指令-回答”对微调基础模型,让它学会听懂要求——介于原始预测器与可用助手之间的那一步。59红队测试在对手之前蓄意攻击 AI 系统——越狱、提示注入、古怪边界情况——然后修复被攻破之处。60测试时计算在作答阶段投入更多算力——想得更久、多次采样、自我验证——而非只靠事前把模型做大。61AI 垃圾内容泛滥的低成本批量 AI 内容——清单体文章、假图、机器人评论——正日益污染搜索、信息流乃至训练数据。62AI 偏见从数据中学到的系统性不公:模型以机器规模重复并放大关于性别、种族、语言与文化的刻板印象。63人机协同(Human-in-the-Loop)设计 AI 系统,让人在正确的时机批准、纠正或接管——这是“你信任的自动化”与“你侥幸存活的自动化”之间的差别。64AI 检测器猜测文本或媒体是否机器生成的工具——可作信号,不可作裁判,且日益与抄袭指控纠缠。65模型合并把多个微调模型的权重合并为一个——无需再付一次训练成本即可融合技能。66分块(Chunking)在嵌入前把文档切成适合检索的小块——不体面却悄悄决定 RAG 答案质量的关键决策。67过拟合模型记住了训练样本而非学会模式——模拟考满分,遇到新题就脆。68数据标注每个 AI 系统脚下的人工劳动:给文本、图像与音频打标签,让模型有真值可学——一个数百万从业者规模的产业。69模型卡片AI 模型的营养标签:它是什么、用什么训练、如何评测、哪里失效——让模型可比较、可审计的文档。70AI 治理让 AI 系统可问责的规则、角色与审查流程——公司内部(政策、审计)与社会层面(如欧盟 AI 法案等监管)。71集成(Ensemble)组合多个模型的输出以得到优于任何单一模型的答案——多数投票、best-of-N 择优,或大规模的专家混合路由。72数据策展选择什么进入训练——过滤、去重与加权——在质量竞赛中如今与模型架构同等重要。