跳转至

概念词汇表:X

本页整理拼音首字母为 X 的中文概念词条。词条正文由单词源文件 include 生成。

相似度

  • 含义: 相似度是比较两个样本、向量或表示有多接近的标准。它可以来自距离、方向、共同特征或其他按任务定义的比较规则。
  • 为什么重要: 聚类和检索都依赖“什么算相似”的定义。理解相似度,才能看出聚类结果不是数据自己说出的唯一答案,而是建立在当前比较标准上的结构候选。
  • 相关概念: 距离(distance), 余弦相似度(cosine similarity), 相似度搜索(similarity search), 表示(representation)
  • 中心 Section: P4-17.1
  • 出现 Section: P1-13.2, P2-3.2, P6-3.2

RNN,循环神经网络

  • 含义: RNN 是一种把上一步的隐藏状态传给下一步计算、用来处理有顺序数据的神经网络结构。它不是一次看完整个输入,而是按顺序一步一步读取,并把信息累积在内部状态里。
  • 为什么重要: RNN 展示了神经网络早期怎样尝试处理语言、时间序列等顺序数据。理解 RNN,才能更清楚地比较门控记忆设计和后来的 Transformer 为什么要用不同方式处理长距离上下文。
  • 相关概念: 隐藏状态, 长程依赖, Transformer 架构(Transformer)
  • 核心 Section: P1-11.2
  • 出现 Section: P5-12.1, P5-12.2

向量

  • 含义: 向量是把有顺序的多个数值作为一个整体来表示的结构。在 AI 语境中,它常用来把一个对象表示成一维数值集合。
  • 为什么重要: 向量不是单纯的值列表,而是可以比较、计算和转换的表示单位。理解向量,才能读懂特征向量、嵌入向量、梯度向量以及后续矩阵计算。
  • 相关概念: 矩阵, 维度, 表示
  • 核心 Section: P2-3.1
  • 出现 Section: P1-3.3, P1-4.3, P1-13.1, P2-3.2, P2-3.3, P2-3.4, P2-3.6, P2-4.3, P2-11.1, P2-11.3, P6-3.1

向量数据库

  • 含义:向量数据库是存储 embedding 向量,并同时管理搜索索引、metadata、过滤和更新的检索系统。它不是只保存几个向量的地方,而是实际搜索服务所需的基础设施层。
  • 为什么重要:RAG 实现依赖的不只是向量比较算法,还包括存储、metadata 过滤、权限、更新和运营。这个概念能帮助读者把“寻找邻近向量”的数学问题,与“安全、快速、最新地取回哪些文档”的服务问题连接起来。
  • 相关概念:搜索索引(search index)近似最近邻(ANN, approximate nearest neighbor)元数据(metadata)
  • 核心 Section:P6-13.1
  • 出现 Section:P1-13.4, P6-3.2, P6-13.2

向量化

  • 含义: 向量化是把重复计算写成数组运算,而不是在 Python 代码里逐个元素写 for 循环。重复没有消失,只是被表达为数组级计算。
  • 为什么重要: NumPy 和机器学习代码经常需要按整个数组来读,而不是按单个值一步步读。理解向量化,才能把 scores + 5 这类代码读成同一规则应用到所有位置,而不是误以为没有发生重复计算。
  • 相关概念: 广播(broadcasting), 张量(tensor), 矩阵(matrix)
  • 核心 Section: P2-11.3
  • 出现 Section: P2-12.1, P2-15.1, P3-6.2

训练数据

  • 含义: 训练数据是模型直接用来学习模式或规则的数据。在监督学习中,它可以包含输入和答案;在生成式 AI 中,也可以指训练阶段使用的大规模文本、图像或代码材料。
  • 为什么重要: 模型从什么数据中学习,会影响性能、偏差、泛化、版权和隐私问题。区分训练数据,才能把用于学习的数据和保留用于评估的数据分开。
  • 相关概念: 数据集, 测试数据, 泛化, 偏差
  • 核心 Section: P1-15.2
  • 出现 Section: P2-5.3, P2-6.2, P2-15.2, P4-1.2, P4-4.1, P4-4.2, P4-5.1, P4-5.2, P4-7.3, P4-12.1

学习数据语境下的文本与数据挖掘(text and data mining, TDM)

  • 含义:学习数据语境下的文本与数据挖掘,是分析大量文本或数据以寻找模式、统计和关系的处理方式。在 AI 学习数据争议中,它会连接到读取和分析资料在什么范围内被允许的问题。
  • 为什么重要:有些地区会用研究或数据分析例外来讨论文本与数据挖掘,但这并不表示所有资料使用都会自动被允许。这个概念能帮助我们把模型训练、资料分析和原文再分发分开理解。
  • 相关概念:训练数据(training data), 版权(copyright), 引用(quotation)
  • 核心 Section: P1-15.2
  • 出现 Section:

学习型方法

  • 含义: 学习型方法不是由人写出所有判断规则,而是从案例数据中拟合输入和输出之间的关系,形成模型的判断标准。
  • 为什么重要: 它能避免把机器学习误解成“直接发现人能读懂的规则”。因为判断标准来自数据拟合,所以数据质量、标签和评估设计会变得关键。
  • 相关概念: 机器学习(machine learning), 特征(feature), 监督学习标签(supervised learning label), 模型(model), 模型评估设计(evaluation design)
  • 首次说明于: P4-1.2
  • 出现 Section: P4-1.2

选择性标签(selective labels)

  • 含义:选择性标签指并非所有案例都以同样方式获得标签,而是只有经过人工复核或通过某个先前决策规则的部分案例留下了结果标签。此时观察到的标签可能反映复核路径,而不是全部事件的随机样本。
  • 为什么重要:如果只用选择性标签来评估模型或解释原因分布,未复核区间里的错误就可能被隐藏。这个概念帮助区分 有标签代表整体,并要求同时写出缺失标签的含义、复核路径和可能的偏向。
  • 相关概念:监督学习标签(supervised learning label)人工监督(human oversight)偏见(bias)出处追踪(provenance)
  • 核心 Section:P3-8.6
  • 出现 Section:P3-8.6, P3-8.7

序列建模(sequence modeling)

  • 含义:对顺序很重要的数据进行建模,例如文本、时间序列、音频或动作轨迹。
  • 为什么重要:它解释了为什么一些模型必须保留时间或位置关系,而不能把样本当成无序集合。
  • 相关概念:可结合本页相邻词条和正文中的相关 Section 一起阅读。
  • 中心 Section:P1-9.3
  • 出现 Section:P1-11.1, P1-11.2, P1-11.3

向量空间(vector space)

  • 含义:其中的元素可以相加并按比例缩放,同时保持线性结构的数学空间。
  • 为什么重要:它为向量、embedding、线性变换和表示空间提供背景。
  • 相关概念:可结合本页相邻词条和正文中的相关 Section 一起阅读。
  • 中心 Section:P2-3.2
  • 出现 Section:P1-13.1, P6-3.1, P6-3.2

线性代数(linear algebra)

  • 含义:研究向量、矩阵、线性变换和空间的数学分支。
  • 为什么重要:它是理解数据表示、模型参数、神经网络计算和 embedding 的核心语言。
  • 相关概念:可结合本页相邻词条和正文中的相关 Section 一起阅读。
  • 中心 Section:P2-3.1

向量微积分(vector calculus)

  • 含义:把微积分扩展到向量值函数和多变量函数的数学领域。
  • 为什么重要:它支撑梯度、优化以及神经网络学习背后的数学。
  • 相关概念:可结合本页相邻词条和正文中的相关 Section 一起阅读。
  • 中心 Section:P2-4.5

线性变换(linear transformation)

  • 含义:保持加法和数乘结构的变换,通常可以用矩阵乘法表示。
  • 为什么重要:它帮助读者把矩阵乘法读成移动或重塑向量的结构化方式。
  • 相关概念:可结合本页相邻词条和正文中的相关 Section 一起阅读。
  • 中心 Section:P2-3.3

相关系数(correlation coefficient)

  • 含义:概括两个变量之间线性关系方向和强度的标准化数值。
  • 为什么重要:它帮助读者把一起变化和因果解释分开,并能比较不同尺度变量之间的关系。
  • 相关概念:可结合本页相邻词条和正文中的相关 Section 一起阅读。
  • 中心 Section:P2-5.5

协方差(covariance)

  • 含义:衡量两个变量围绕各自均值时倾向于怎样一起变化的量。
  • 为什么重要:它打开了变量关系的第一层阅读,同时也说明为什么受尺度影响的量常常需要标准化。
  • 相关概念:可结合本页相邻词条和正文中的相关 Section 一起阅读。
  • 中心 Section:P2-5.5
  • 出现 Section:P4-18.1

信息完整性(information integrity)

  • 含义:信息在创建、传递、改写和再使用过程中保持可靠与可信的性质。
  • 为什么重要:它很重要,因为如果出处、语境或事实一致性丢失,AI 输出、检索资料和摘要都会退化。
  • 相关概念:可结合本页相邻词条和正文中的相关 Section 一起阅读。
  • 中心 Section:P1-10.3
  • 出现 Section:P1-15.1

  • 含义:把项目表示成向量,并按距离或相似度检索近邻向量的搜索方法。
  • 为什么重要:它把 embedding 连接到检索系统,并说明语义搜索与精确关键词匹配有什么不同。
  • 相关概念:可结合本页相邻词条和正文中的相关 Section 一起阅读。
  • 中心 Section:P1-13.4
  • 出现 Section:P1-13.2, P1-13.3

信任边界(trust boundary)

  • 含义:系统中不应彼此自动信任的部分之间的边界。
  • 为什么重要:当 prompt、检索文本、工具、凭据和用户输入在一个 AI 工作流中相遇时,它非常关键。
  • 相关概念:可结合本页相邻词条和正文中的相关 Section 一起阅读。
  • 中心 Section:P1-14.4