English.guru
返回

AI 模型如何理解你:token、上下文窗口与幻觉

用通俗的语言讲清 AI 背后的技术词汇——token、上下文窗口、温度和幻觉——让你能够准确地谈论人工智能。

当你已经能写出清晰的提示词,下一个阶段就是理解提示词在模型内部发生了什么——不是数学原理,而是那些概念,以及描述它们的英语。这些术语会出现在任何一场关于 AI 的正经对话里,而准确使用它们,正是「读过标题的人」和「真正思考过这个工具的人」之间的分界线。

Token

模型读的不是单词,而是 token——大致相当于一个单词或单词的一部分的文本片段。unhappy 可能是一个 token;unbelievable 可能是两个。

  • The model splits the text into tokens.
  • This model has a large token limit.

由此得出一个实用的概念——token limit,也就是模型一次能接收或输出的最大 token 数量。当提示词「太长」时,用完的正是 token。

上下文窗口

Context window 指的是模型能同时记住多少内容,也就是它以 token 计量的短期记忆。你整段对话加上提示词,都装在这个窗口里。

  • The whole document fits inside the context window.
  • Once the conversation exceeds the context window, the model forgets the beginning.

这就是为什么和聊天机器人聊得太久,有时会「跑题」:开头的部分已经被挤出了窗口。准确的英语说法是模型 runs out of context,而不是它「忘记了」——「忘记」暗示着一种模型在会话之间根本不具备的记忆。

温度

Temperature 控制回答的可预测程度。这个概念借自物理学——温度越高,运动就越剧烈。

  • 低温度——可预测、稳妥、字面化。适合事实和代码。

  • 高温度——多样、出人意料、有创意。适合创意和草稿。

  • Set the temperature low for a technical answer.

  • The model's temperature was high, so it gave three very different drafts.

这个词已经普及到人们会直接说 the response felt high-temperature——意思是「难以预测」——完全不用解释。

幻觉

Hallucination 指的是一个听起来很自信、实际上却完全错误的回答。模型编造了一个事实、一个名字、一个来源,然后把它当作确凿无疑的事实说出来。

  • The model hallucinated a citation.
  • That reference is a hallucination — it doesn't exist.

这是每一个谨慎使用 AI 的人都需要掌握的术语,因为它点明了这个工具最主要的故障模式。它的动词变化很规则:hallucinate、hallucinated、has hallucinated。名词可数:a hallucination、two hallucinations。

幻觉不是撒谎。 撒谎需要先知道真相,再反其道而行。模型并不知道什么是真的;它只是在预测接下来该出现什么文本。把一个错误的结论称为 hallucination,而不是不准确的 lie 或 mistake——正是因为模型从来就没有对照过现实。

其余核心词汇

它们补全了这套核心概念,你会在精确的技术词汇旁边遇到它们:

术语 含义
training data 模型学习所用的文本
parameters 模型学到的数字;技术上说的「体量」
inference 模型生成回答的那一刻
prompt injection 藏在提示词里、诱使模型无视指令的攻击
fine-tuning 针对某一具体任务对模型做的微调

准确地谈论这些概念

请留意这个规律:每个术语都有自己固定搭配的动词,这种搭配就像搭配用法一样固定。

  • The model splits text into tokens.
  • The answer exceeded the context window.
  • I lowered the temperature.
  • The model hallucinated a source.

用对动词,说明你理解的是背后的机制,而不只是几个词。

自测一下

下面的测验会考察这些术语,以及与它们固定搭配的动词。

自我检测:测试:AI 模型如何理解你 →