每个 AI 产品页面都默认你已经通晓这套行话。定价表按 token 计费,更新日志为更大的上下文窗口欢呼,销售材料承诺由 RAG 支撑的 agent——可这些都没告诉你,这些词对于唯一重要的问题意味着什么:这款工具到底能不能把活儿干好。
所以这是一份为采购者、而非研究者准备的 AI 术语详解。它有意不做成一本从 A 到 Z 的字典,而是一套约两打术语的实用词汇,围绕人们在评估工具时真正会问的四个问题来组织:我在跟什么东西对话、它为什么有时会出错、规格表上的数字意味着什么、以及部署都涉及些什么。每个词条都是几句大白话,外加它在采购环节为什么重要的原因。
你可以从头读到尾,也可以直接跳到你需要的那一节。凡是通过一个真实产品更容易理解的术语,示例都会链接到它的列表页。ToolPotion 追踪着 13,000 多款 AI 工具,每日更新,所以每个示例背后都有一个实时页面。
你在跟什么东西对话:核心 AI 术语详解
第一层困惑来自命名。“Model”“LLM”“chatbot”“assistant”和“agent”在营销文案里被混着用,可它们并不是一回事。
Model(模型)
指经过训练的系统本身:一个非常庞大的统计函数,把输入转换成输出,通过将海量数据推过一个训练过程而得到。产品是模型外面的一层包装:一个聊天应用、一个 API、一个浏览器扩展,可以都建立在同一个模型之上。这一点在比较工具时很关键,因为模型决定了质量的上限,而产品决定了工作流程。你可以在目录中把当前的 AI 模型作为一个独立类别来浏览。
Large language model(LLM,大语言模型)
一种主要用文本训练、用来预测序列中下一个词的模型。事实证明,这就足以完成起草、摘要、翻译和写代码。Claude Opus 和 Gemini 3.1 Pro 是当前的前沿代表。目录里也列出了你可以自己运行的、更小的开源 LLM。当供应商说“由 LLM 驱动”时,有用的追问是具体是哪一个,以及你以后能不能换掉它。
Chatbot(聊天机器人)
这是一种界面形态,而非一项技术:一个连着模型的消息框,通常只针对一项任务,比如回答客户问题。现代聊天机器人建立在 LLM 之上,但这个词比它们出现得更早,这也是为什么它既能描述一个死板的 FAQ 脚本,也能描述一套真正能干活的客服系统。
Assistant(助手,或 copilot)
一种面向个人日常工作的通用聊天产品:起草、摘要、答疑,通常就存在于那些工作实际发生的应用里。ChatGPT 是最典型的独立助手。“Copilot”通常意味着一个嵌入在既有产品里的助手。它与聊天机器人在采购上的区别在于受众:助手服务于你的员工,聊天机器人通常服务于你的客户。
AI agent(AI 智能体)
一种接受目标、规划步骤、调用工具并核查自身结果的软件:它会去行动,而不只是回答。Claude Code 能读取代码库、编辑文件并运行命令。Intercom 提供了一个名为 Fin 的客服 agent,它会去处理对话,而不只是回复对话。它的取舍在于波及范围:一个能行动的系统也会因行动而出错,所以权限和审核环节在这里比在任何其他地方都更重要。AI agent 类别是目录中变化最快的板块。
| 术语 | 它做什么 | 什么时候该买 |
|---|---|---|
| Chatbot | 在一个限定领域内回答问题 | 你需要大规模、面向客户的问答 |
| Assistant | 帮助一个人处理多种任务 | 你想要员工效率、低风险 |
| Agent | 规划并执行多步骤工作 | 某个工作流值得端到端地自动化 |
Multimodal(多模态)
一种处理能力超越文本的模型:把图像、音频或视频作为输入、输出,或两者兼有。Gemini 3.1 Pro 能读取混合媒体并对其进行推理。在生成这一侧,Kling 3.0 能把文本和参考图像转成带音频的视频。如果你的工作涉及截图、带图表的 PDF 或录音,那么多模态支持就是刚需,而不是锦上添花。
它为什么有时会出错:幻觉、上下文和知识截止
这四个术语几乎能解释你今后会看到的每一次令人失望的 AI 输出,它们也是任何一场关于准确性的严肃供应商谈话中的核心词汇。
Hallucination(幻觉)
一个自信、流畅、却错误的答案。模型是在生成看似合理的文本,而不是在查阅一个事实数据库,所以它可能凭空捏造引用、统计数据和产品细节,却毫无迹象表明它正在这么做。对于需要事实的工作,优先选择那些会引用可检索来源的工具,并把任何没有引用的具体说法当作未经证实,直到你亲自核查。
Context window(上下文窗口)
指模型一次能考虑多少文本,以 token 计量:它是模型的工作记忆,有别于它的知识。窗口增长得很快。Claude Opus 宣称拥有百万 token 的窗口,足以在单次请求中容纳整个代码库或好几本书。
更大的上下文窗口抬高了你能粘贴进去内容的上限,但它并不保证模型会权衡其中的全部。
实际上,模型可能会遗漏埋在超长输入中间的细节,所以“塞得进窗口”和“被用得好”是两码事。
Training cutoff(训练截止)
模型训练数据结束的日期。在此之后发布的任何内容对模型都是不可见的,除非产品外挂了联网搜索或检索。你为什么要在意:如果工具必须知道当前的价格、法律或新闻,就问清供应商最新信息究竟是怎么进来的。“这个模型很聪明”不是答案。
RAG(检索增强生成,retrieval-augmented generation)
先检索,后回答:系统先在你的文档里找到相关段落,再让模型据此写出答案。这让回复扎根于你实际的内容,减少(但不消除)幻觉,并且在文档一改动的当下就保持最新,无需重新训练。当供应商说“用你的数据训练过”时,问问他们指的是不是 RAG。通常就是,而对于内部知识来说,RAG 往往正是你想要的。
Prompt 和 system prompt(提示词与系统提示词)
Prompt 是你发给模型的任何内容。System prompt 则是供应商放在每次对话最前面的那份常驻指令单:语气、规则、护栏。数量惊人的小众 AI 产品,本质上就是一层套在别人模型之上的 system prompt。这依然可能值得付费,但它的定价应当像包装,而不是像研发。
读懂规格表:token、参数、推理
AI 定价页面上的数字不是营销装饰。其中有三个直接决定了你的账单。
Token
模型读取和产出的单位:一小段文本,其中一个常见的英文单词往往就是一个 token。一条可用的经验法则:1,000 个 token 大约相当于 750 个英文单词。API 定价按每百万 token 报价,输入和输出分开计费,这正是为什么长文档进、长答案出会推高成本。
Parameters(参数)
模型在训练中学到的内部数值权重。参数量是衡量模型大小的标准简称。以 Muse Glimmer 为例,它是一个 300 亿参数的模型,专为在消费级硬件上运行 agent 任务而打造。更多的参数通常以速度和成本为代价换来更强的能力,而一个能把你的任务处理好的小模型,胜过一个你花了冤枉钱却没用足的大模型。
Inference(推理)
运行训练好的模型来产生输出。训练只发生一次,由供应商买单;推理发生在每一次请求上,由你买单。延迟和每次请求的成本都是推理的属性,所以当供应商宣传更便宜或更快的推理时,那说的是你的账单和你用户的等待时间,而不是答案的质量。
Fine-tuning(微调)
在你自己的样例上进行额外训练,以改变模型的行为:语气、格式、领域习惯。它擅长塑造一致的风格和结构化输出,却不擅长教会那些会变化的事实——那是 RAG 的活儿。它隐藏的成本是维护:每一次基础模型升级都可能意味着重做一遍。
Reasoning model(推理模型)
一种在回答之前会花额外算力走完中间步骤的模型,这在数学、规划和难代码上有可衡量的帮助。有些是混合型的:Claude Opus 既可以快速作答,也可以按需思考更久。这个取舍是真实存在的:推理过程更慢、消耗更多 token,所以把一个简单的抽取任务塞给它,就是在为你不需要的思考付费。
Benchmark(基准测试)
一种标准化测试,产出发布文章里那些排行榜分数。把它们当作粗略的能力信号,而不是对你工作负载的预测:供应商自然会展示他们能赢的那些基准。拿你自己二十个真实任务,跑一遍两款候选工具,比任何排行榜都更能说明问题。
部署相关术语:API、开放权重,以及它跑在哪里
最后这组术语决定了成本结构、隐私姿态,以及你要担下多少工程量。
API
以编程方式访问:你的软件通过互联网调用模型并按 token 付费,而不是由一个人为一款应用按席位付费。同一家供应商往往两者都卖,而它们是两笔不同的预算:席位随人头规模增长,API 成本随使用量增长。在比价之前,先弄清楚你实际要买的是哪一种。
Open weights vs. closed(开放权重 vs. 封闭)
开放权重模型会公开模型文件:你可以下载它们、在自己的硬件上运行、把数据留在内部、不向制作方支付任何按 token 计的费用。Gemma 4 提供由与 Gemini 相同技术打造的轻量开放模型,Stability AI 则发布用于图像、视频和音频的开放生成模型。封闭模型则通过供应商的服务器租用:控制权更少、运维负担小得多,而且最强的封闭模型在原始能力上仍往往领先。
On-device vs. cloud(端侧 vs. 云端)
指推理在物理上发生在哪里。云端意味着请求会离开你的网络;端侧或自托管意味着它们不会——这正是合规要求高的团队在意的原因,也是像 Muse Glimmer 这样能在消费级硬件上运行的模型存在的原因。要预期到能力上的差距:最大的那些模型是塞不进一台笔记本电脑的。
Embedding(嵌入)
把文本转换成一串数字,其位置经过安排,使得含义相近的内容彼此靠近。嵌入正是软件如何按含义、而非精确关键词来搜索的机制,也是为什么一个搜“退款规则”的查询能找到一篇标题为“退货政策”的文档。
Vector database(向量数据库)
一种专为存放嵌入、并快速找出最近匹配而构建的存储。它是大多数 RAG 系统里检索的那一半。Chroma 是一个开源示例,它把向量、全文和元数据搜索结合在一起。如果一家供应商说他们“在你的文档上做 RAG”,那栈里就有这么一样东西。问问它跑在哪里、存了什么。
Framework(框架)
把模型、工具和检索接入一个应用的代码脚手架:这是自己动手搭建的路子,做内部研发的团队会早早选它。浏览 AI 框架类别可以看到当前的选项。如果团队里没人写代码,像 Microsoft Copilot Studio 这样的可视化搭建工具能覆盖常见场景,而且目录里还维护着一整个任务页,收录了横跨两种路子的用于构建 AI agent 的工具。
Observability and evals(可观测性与评测)
可观测性就是追踪一个模型或 agent 实际做了什么:每一步、每一次工具调用、每一笔 token 成本,以及每一处延迟。评测则是对输出质量的评分测试,反复运行,好让退化在客户之前先暴露出来。Langfuse 是一个开源平台,覆盖追踪、提示词管理和评测。如果你是要买一个 agent 而不是自己搭一个,那么对供应商的对应问题很简单:当这个 agent 把某件事搞错时,你到底会给我看什么?
常见问题
ChatGPT 是 LLM 吗?
严格来说,不是:ChatGPT 是一个建立在 OpenAI 的 GPT 系列 LLM 之上的应用。这个区别之所以重要,是因为记忆、文件上传、联网浏览这些功能属于应用,而不属于模型,而另一款用同一个模型的产品可能这些统统没有。
AI agent 和 chatbot 有什么区别?
Chatbot 负责回答;agent 负责行动。Agent 会规划多步骤工作、调用其他软件、并在真实系统里改动东西,这让它们同时变得更有用也更有风险。实际的采购问题落在权限上:一个 agent 被允许触碰什么,以及在它动手之前有什么会被审核。
参数更多就意味着 AI 模型更好吗?
对你的任务来说,未必。更大的模型在抽象意义上通常能力更强,但它们成本更高、响应更慢,而大量日常工作——分类、抽取、常规起草——在小模型上跑得就很好。在默认选最大的那个之前,先测一测可能够用的最便宜的模型。
我能在自己的电脑上运行一个 AI 模型吗?
可以,只要它有开放权重且体量不大:像 Gemma 系列这样的小型开放模型就是为此而设计的,而如今一些 300 亿参数的模型也开始瞄准消费级硬件。要预期到结果会弱于前沿的云端模型,换来的是零 token 成本,以及永不离开你机器的数据。