1 基本概念
1.1 定义与核心思想
嵌入表示是一类将离散对象映射到连续向量空间的表示方法。对象可以是词语、句子、实体、关系、图节点,也可以是更复杂的文本片段或多模态信息。映射之后,原本难以直接计算的符号对象会被转换为可进行距离、相似度和代数运算的向量。
其核心思想是:语义相近、功能相似或在结构上相关的对象,应当在向量空间中彼此靠近。借助这一原则,计算机可以把“是否相关”“是否相似”“是否可推断”等问题,转化为几何空间中的运算问题,从而提升检索、分类、预测和推理效率。
1.2 发展背景
嵌入表示的发展,源于早期人工智能对符号处理方式的局限性。传统方法依赖人工设计规则和离散编码,虽然便于精确表达,但对语义连续性和大规模数据的适应能力较弱。随着数据规模扩大、计算资源提升以及机器学习方法成熟,研究者开始尝试用低维稠密向量来表示复杂对象。
在自然语言处理和知识图谱研究中,这一思路尤为突出。文本、实体和关系具有高度离散、组合性强、上下文依赖明显等特点,嵌入表示能够较好地捕捉它们之间的统计规律与语义联系,因此逐渐成为现代表示学习的重要基础。
1.3 与传统符号表示的区别
传统符号表示通常以离散标识、逻辑公式或人工编码为主,强调精确、可枚举和规则化处理。其优点是语义边界清晰,便于逻辑推演;不足在于难以自然表达相似性、模糊性和上下文变化。
嵌入表示则偏向分布式、连续化和统计化。它不直接保存对象的显式定义,而是通过大量数据中的共现、上下文或结构关系学习向量。这样做的结果是,模型能够自然地处理“相近但不完全相同”的现象。不过,这种方式也会带来解释性不足的问题,因为向量维度往往不对应人类可直接理解的语义标签。
1.4 嵌入空间的几何直观
嵌入空间可以理解为一个由向量构成的几何场域。对象被投射到该空间后,点与点之间的距离、方向和分布结构,往往对应语义或结构上的某种规律。正因如此,嵌入表示不仅是数值编码,也是一种几何建模方式。
1.4.1 距离与相似度
在嵌入空间中,距离通常用来描述对象之间的接近程度。距离越小,表示越相似;距离越大,则表示差异越明显。常见的度量包括欧氏距离和余弦相似度,它们在不同任务中各有适用场景。
这种“近者相似”的假设并非绝对真理,但在许多实际数据中相当有效。尤其在文本和图数据中,局部邻近关系往往能反映语义共现、结构联系或功能相似性。
1.4.2 方向与语义关系
除了距离,向量的方向也常被赋予语义含义。某些关系并不体现为绝对位置的接近,而体现为相对位移。例如,若多个对象之间共享类似变化模式,那么它们在空间中的方向差异可能对应某种稳定关系。
这使得嵌入空间不仅能表达“像不像”,还可以表达“如何变化”或“处于什么关系之中”。因此,方向信息在关系建模和类比推理中具有特殊价值。
1.4.3 线性可分性与类比关系
如果若干类别或概念在向量空间中能够被较简单的超平面分开,就说明该空间具有较好的线性可分性。这一性质有利于分类任务,也说明嵌入在一定程度上提炼了可区分的特征。
类比关系则是嵌入表示的典型现象之一。研究者常通过“a 之于 b,如同 c 之于 d”这样的关系,检验向量空间是否保留了某种线性规律。若该规律成立,说明嵌入不只是压缩数据,还捕捉到了对象之间的结构化对应关系。
2 嵌入表示的类型
2.1 按表示对象划分
嵌入表示可根据所表示对象的不同,分为词、句子、实体、关系、图结构等多种类型。不同对象具有不同粒度和语义层次,因此对应的训练目标和建模方式也会有所差异。
2.1.1 词嵌入
词嵌入用于表示单个词语,将词映射到稠密向量。它能够反映词语的语义接近程度、词性倾向以及上下文共现特征,是自然语言处理中最基础的表示形式之一。
2.1.2 句子嵌入
句子嵌入用于刻画整句语义,通常比词嵌入更强调组合后的整体含义。它适合用于文本匹配、语义检索和分类任务,能够在句级别压缩信息并保持较强的可比较性。
2.1.3 段落嵌入
段落嵌入面向更长的文本单元,目标是概括段落主题、逻辑结构或语篇语义。由于信息更丰富,它往往需要结合上下文聚合与层次化编码方法。
2.1.4 实体嵌入
实体嵌入主要用于知识图谱与结构化知识库,将人名、地名、组织或概念实体映射到向量空间。它侧重描述实体之间的关系模式,而不只是表面文本相似性。
2.1.5 关系嵌入
关系嵌入用于表示实体之间的关联类型,例如“属于”“位于”“创造”等。它通常与实体嵌入联合学习,以刻画三元组中的结构规律。
2.1.6 图嵌入
图嵌入针对节点、边或子图进行表示,目的是保留图中的拓扑结构和邻域信息。它广泛应用于社交网络、分子结构和知识网络分析。
2.2 按建模粒度划分
从建模粒度来看,嵌入表示可分为低维稠密嵌入、上下文化嵌入和静态嵌入等。不同粒度对应不同的信息丰富度,也影响表示的灵活性与计算成本。
2.2.1 低维稠密嵌入
低维稠密嵌入强调用较少维度承载尽可能多的信息。它通常比稀疏表示更节省存储,并且更适合后续的数值计算与模型训练。
2.2.2 上下文化嵌入
上下文化嵌入会根据上下文动态生成表示,同一对象在不同语境下可能得到不同向量。该类方法能更好地处理多义词、语境依赖和复杂句法现象。
2.2.3 静态嵌入
静态嵌入对同一对象始终使用固定向量,不随上下文变化而变化。它结构简单、速度较快,但对于一词多义或复杂语境的刻画能力有限。
2.3 按结构信息划分
根据所依赖的结构信息,嵌入表示还可分为序列嵌入、网络嵌入和多模态嵌入。该划分强调输入数据的组织方式,以及模型如何利用结构线索。
2.3.1 序列嵌入
序列嵌入面向具有顺序关系的数据,如文本、时间序列或行为序列。它关注元素的先后顺序与局部依赖。
2.3.2 网络嵌入
网络嵌入用于图和网络结构,重点在于保留连接关系、邻接模式和社群特征。它常用于复杂关系网络中的表示学习。
2.3.3 多模态嵌入
多模态嵌入将文本、图像、音频等不同模态映射到统一空间,便于跨模态对齐和联合检索。这类方法在内容理解与跨媒体搜索中尤为常见。
3 生成方法
3.1 基于统计共现的方法
这类方法主要依据对象在大规模语料或结构数据中的共现规律来构造表示。其基本思想是“在相似上下文中出现的对象,应具有相似向量”。
3.1.1 矩阵分解
矩阵分解通过将高维共现矩阵拆解为低维因子矩阵,得到对象的向量表示。它能够把全局统计信息压缩到较小空间中,适合处理词共现或关系矩阵。
3.1.2 潜在语义建模
潜在语义建模试图从观测数据中提取隐藏主题或潜在因素,使表示不只反映表面词频,还能概括更深层的语义结构。这类方法常用于文本分析和信息检索。
3.2 基于预测任务的方法
预测式方法通过设计上下文预测、目标识别或关系补全任务来学习表示。其优势在于目标明确,且通常能直接优化面向任务的向量结构。
3.2.1 跳字模型
跳字模型通过中心词预测上下文词,迫使词向量学习周围语境信息。它在大规模语料上训练效率较高,且对低频词具有一定建模能力。
3.2.2 连续词袋模型
连续词袋模型以上下文词预测中心词,强调局部窗口内的整体信息。该方法计算简洁,常用于学习稳定的词语分布式表示。
3.2.3 负采样训练
负采样训练通过引入负例,减少全量归一化计算的开销。它使得模型能够在较大词表或对象集合上高效训练,并保持较好的表示质量。
3.3 基于神经网络的方法
神经网络方法通过多层非线性变换学习表示,能够从复杂输入中抽取更抽象的特征。与简单统计方法相比,这类模型通常具备更强的表达能力。
3.3.1 前馈神经网络
前馈神经网络通过固定层次的映射将输入转化为嵌入。它结构清晰,适合对局部特征进行非线性组合。
3.3.2 循环神经网络
循环神经网络擅长处理序列数据,能够把历史上下文逐步编码到当前状态中。它常用于文本、语音和行为序列的表示学习。
3.3.3 Transformer 编码器
Transformer 编码器利用自注意力机制建模长距离依赖,能够并行处理序列中的各个位置。它在上下文化表示学习中影响深远,适合大规模文本编码。
3.4 基于图结构的方法
图结构方法直接利用节点之间的连接关系来学习表示,适用于网络、知识图谱和复杂关系数据。它们的目标是让局部邻域与整体拓扑在向量空间中得到保留。
3.4.1 邻域聚合
邻域聚合通过汇总节点周围邻居的信息来更新自身表示。这样能够把结构上下文编码进向量之中。
3.4.2 随机游走
随机游走方法沿图中路径采样节点序列,再将其视作类似文本的上下文数据进行学习。它能够较好地保留局部和中程结构特征。
3.4.3 消息传递机制
消息传递机制在图神经网络中非常常见,节点通过接收、变换和聚合邻居消息不断更新表示。该机制使图中的结构信息能够逐层传播。
4 表示学习过程
4.1 特征构造
特征构造是嵌入学习的起点,决定了模型输入包含哪些信息。对于文本,可使用词序、上下文窗口、句法关系;对于图数据,则可引入邻接关系、节点属性和边类型。特征设计越合理,后续表示学习通常越有效。
4.2 目标函数设计
目标函数决定嵌入向量应当满足什么样的约束或优化方向。不同任务会采用不同的学习目标,以匹配相似性、排序、分类或对比需求。
4.2.1 相似度学习
相似度学习直接优化样本间的接近程度,使正样本在空间中靠近、负样本相互远离。这种方式常用于匹配、检索和度量学习。
4.2.2 对比学习
对比学习通过构造正负样本对,让模型学会区分相似与不相似对象。它在无监督和自监督场景中应用广泛。
4.2.3 排序学习
排序学习关注候选对象的相对顺序,而不仅是绝对分数。它常用于搜索排序、推荐和链接预测等任务。
4.3 参数优化
参数优化是将目标函数转化为具体学习结果的关键步骤。通常通过迭代更新参数,使损失逐渐下降并达到较优表示。
4.3.1 梯度下降
梯度下降通过沿损失函数下降方向更新参数,是最基础的优化方法之一。其变体可适应不同规模的数据与模型结构。
4.3.2 自适应优化器
自适应优化器会根据历史梯度自动调整学习率,从而提升训练稳定性与收敛速度。它们在深度模型中使用非常广泛。
4.4 正则化与约束
为避免过拟合并增强表示质量,训练中常加入额外约束。正则化有助于控制模型复杂度,使向量空间更平滑、更稳定。
4.4.1 范数约束
范数约束限制向量长度或参数规模,防止表示过度膨胀。它有助于提升数值稳定性。
4.4.2 稀疏约束
稀疏约束鼓励部分参数接近零,使模型更简洁。虽然嵌入表示通常以稠密向量为主,但在某些场景下稀疏性仍有价值。
4.4.3 归一化策略
归一化策略通过统一向量尺度,减少因长度差异带来的干扰。它常用于相似度计算前的标准化处理。
5 语义与结构特性
5.1 局部语义邻近性
局部语义邻近性指语义相近的对象在嵌入空间中通常相互接近。它体现了分布式表示的基本假设,也是许多应用得以成立的前提。
5.2 全局结构保持
较好的嵌入不仅要保留局部邻近关系,还应尽量反映全局结构,如类别分布、社群组织或层级关系。若只保留局部信息,表示可能在整体上失真。
5.3 类比推理能力
某些嵌入空间可支持类比推理,即通过向量差异推断对象之间的对应关系。这种能力说明表示已经抽取出一定程度的关系模式,而非仅仅记录共现频率。
5.4 多义性与歧义消解
同一词语、实体或符号在不同上下文中可能含义不同。上下文化嵌入通过条件化表示,能够缓解多义性问题,并在一定程度上实现歧义消解。
5.5 一对多与多对一关系表达
现实数据中,许多概念之间并非一一对应,而是存在一对多或多对一的映射关系。嵌入模型需要在有限维度内表达这种复杂结构,这对关系建模提出了更高要求。
5.6 组合性与泛化性
嵌入表示通常具有一定组合性,即简单单元的表示可以组合成更复杂结构的表示。良好的组合性有助于模型对未见样本进行泛化,从而提升迁移能力。
6 相似度与度量方法
6.1 欧氏距离
欧氏距离衡量两个向量在空间中的直线距离。它直观易懂,常用于需要明确几何差异的任务中。
6.2 余弦相似度
余弦相似度关注向量夹角而非长度,适合比较方向一致性。它在文本表示和高维稠密向量比较中使用非常普遍。
6.3 点积相似度
点积相似度兼顾方向和长度信息,常用于排序模型和神经网络输出层。其计算简便,利于大规模检索系统实现。
6.4 马氏距离
马氏距离考虑变量之间的协方差关系,能够根据数据分布进行更细致的距离调整。它在统计建模中具有较强的理论意义。
6.5 学习型度量
学习型度量由模型自动学习相似标准,而不是预先固定度量公式。它能够适应复杂任务中的非线性关系,但通常需要更多训练数据。
6.6 最近邻检索
最近邻检索是嵌入表示最直接的应用之一。给定查询向量后,系统在向量空间中寻找最接近的候选对象,用于搜索、推荐和匹配任务。
7 典型应用
7.1 自然语言处理
嵌入表示在自然语言处理中应用极广,因为语言本身具有显著的分布式特征。词、句子和篇章都可以通过向量表达其语义或功能属性。
7.1.1 词义表示
词义表示利用向量捕捉词语的语义范围、上下文倾向和相互关系,是语言理解系统的重要基础。
7.1.2 文本分类
在文本分类中,嵌入可将文本转化为固定维度表示,再交由分类器判断类别。这样既减少了稀疏性,也提升了泛化能力。
7.1.3 机器翻译
机器翻译中,嵌入有助于对齐不同语言中的词语、短语和句子结构,为跨语言映射提供表示基础。
7.1.4 信息检索
信息检索系统可使用嵌入来度量查询与文档的语义距离,从而超越简单关键词匹配,提高召回与排序效果。
7.2 推荐系统
推荐系统依赖对用户和物品偏好的建模,嵌入表示能够将行为记录压缩为可计算向量,便于相似性匹配和兴趣预测。
7.2.1 用户表示
用户表示将历史点击、购买或浏览行为编码为向量,以概括其偏好模式。
7.2.2 物品表示
物品表示用于刻画商品、内容或服务的属性特征,便于与用户向量进行匹配。
7.2.3 兴趣匹配
通过比较用户与物品嵌入之间的关系,系统可以预测潜在兴趣并生成推荐结果。
7.3 知识图谱
知识图谱中的实体与关系天然适合用嵌入方式建模,因为图中模式往往需要通过向量空间来表达结构规律。
7.3.1 实体对齐
实体对齐旨在识别不同数据源中指向同一对象的实体。嵌入表示可帮助比较跨库实体的语义和结构相似性。
7.3.2 链路预测
链路预测通过已有关系推断缺失边或潜在联系,是知识图谱嵌入的重要任务之一。
7.3.3 关系抽取
关系抽取旨在从文本中识别实体间的关系类型。嵌入表示可增强模型对语义上下文和关系模式的捕捉能力。
7.4 计算机视觉
在计算机视觉中,嵌入表示可用于刻画图像内容、对象类别与跨模态语义对应关系,从而支持识别与检索任务。
7.4.1 图像特征嵌入
图像特征嵌入将视觉内容压缩为向量,便于进行相似图像搜索、分类和聚类。
7.4.2 跨模态检索
跨模态检索通过统一文本与图像的表示空间,实现“以文搜图”或“以图搜文”等功能。
7.5 图神经网络
图神经网络通常以嵌入作为中间表示,并通过邻域传播不断更新节点状态,是图数据分析的重要工具。
7.5.1 节点分类
节点分类任务中,节点嵌入可作为输入特征,帮助模型判断节点所属类别。
7.5.2 社区发现
社区发现关注图中紧密连接的子群体。嵌入表示有助于揭示结构上相近的节点集群。
8 经典模型与代表方法
8.1 Word2Vec
Word2Vec 是词嵌入领域的经典方法,通过上下文预测学习词向量,推动了分布式表示的大规模应用。
8.1.1 CBOW
CBOW 通过上下文词预测中心词,训练速度较快,适合学习较稳定的词语表示。
8.1.2 Skip-gram
Skip-gram 通过中心词预测上下文词,通常对低频词更友好,也更能捕捉细粒度关系。
8.2 GloVe
GloVe 结合全局共现统计与向量学习,将词语共现矩阵中的信息压缩到低维空间。它强调利用整体语料统计结构来构造表示。
8.3 FastText
FastText 在词级表示基础上进一步利用子词信息,因此对未登录词、形态变化和拼写变体更为敏感,适合处理词形丰富的语言。
8.4 BERT 类上下文化表示
BERT 类方法通过双向上下文编码获得动态表示,同一词在不同语境下可产生不同向量。它在语义理解任务中表现突出。
8.5 TransE
TransE 是知识图谱嵌入的代表方法之一,利用“实体加关系近似等于另一实体”的平移假设建模三元组结构。它简洁高效,便于处理大规模关系数据。
8.6 DeepWalk
DeepWalk 通过图上的随机游走生成节点序列,再借助类似词向量的方式学习图嵌入。该方法直观、实现简单,具有较强影响力。
8.7 Node2Vec
Node2Vec 在随机游走中引入灵活的采样策略,以平衡局部邻域与更广范围结构信息。它在节点表示学习中应用广泛。
9 评估与分析
9.1 内在评估
内在评估关注嵌入本身是否具备良好的结构和语义性质,而不直接依赖具体下游任务结果。它有助于分析表示质量。
9.1.1 类比测试
类比测试检验向量空间是否能够表达关系迁移,例如某种属性变化是否可由线性位移近似描述。
9.1.2 邻近词任务
邻近词任务通过查看某个对象的最近邻是否合理,判断局部语义空间是否自然。
9.1.3 聚类质量
聚类质量用于衡量嵌入是否能把相近对象聚到一起,并与真实类别或结构相对应。
9.2 外在评估
外在评估考察嵌入在实际任务中的效果,是判断表示方法实用性的关键方式。
9.2.1 下游任务性能
下游任务性能通常包括分类、预测、检索和排序等指标,能够直接反映嵌入的应用价值。
9.2.2 检索效果
检索效果主要看召回率、精确率和排序质量,尤其适合衡量语义匹配能力。
9.2.3 分类与预测表现
分类与预测表现体现嵌入作为输入特征时对模型性能的促进作用。
9.3 可解释性分析
可解释性分析试图说明向量维度、方向或分布与语义概念之间的对应关系,但这一目标通常较难完全实现。
9.3.1 维度解释
维度解释关注某些维度是否对应特定语义属性,不过在多数嵌入中,这种对应关系并不总是显式存在。
9.3.2 语义轴分析
语义轴分析通过构造方向或轴线,观察概念在空间中的排列方式,以解释表示中的语义组织规律。
9.4 鲁棒性评估
鲁棒性评估用于考察嵌入在噪声、偏移或数据变化条件下的稳定性。
9.4.1 噪声敏感性
噪声敏感性反映模型对错误上下文、异常样本或采样偏差的抵抗能力。
9.4.2 域迁移能力
域迁移能力衡量嵌入在新语料、新场景或新任务中的适应程度。
10 局限与挑战
10.1 维度选择问题
嵌入维度过低可能导致信息损失,过高则会增加计算与存储成本,并可能引入冗余。如何在表达能力与效率之间取得平衡,是长期存在的问题。
10.2 语义漂移
对象的含义会随时间、领域或上下文变化而改变。若嵌入更新不及时,就可能出现语义漂移,导致表示与实际含义不一致。
10.3 冷启动与稀疏数据
在数据稀少或新对象首次出现时,模型难以获得足够的上下文来学习可靠表示。这在推荐和知识图谱场景中尤为常见。
10.4 偏差与公平性
嵌入会继承训练数据中的统计偏差,进而影响后续系统决策。若不加控制,可能放大某些偏向,带来公平性问题。
10.5 可解释性不足
稠密向量通常难以直接对应人类可读概念,因此模型为何做出某种判断并不总是清楚。这限制了其在高透明度场景中的使用。
10.6 大规模训练与存储开销
当词表、实体集或图规模极大时,嵌入训练需要大量计算资源,存储、更新和检索也会面临压力。如何实现高效训练与在线服务,是工程实践中的重要课题。
11 相关概念
11.1 符号表示
符号表示是以离散符号和规则系统为核心的表示方式,强调精确语义和逻辑操作。
11.2 分布式表示
分布式表示指将对象信息分散编码到多个维度中,而不是由单一符号承载全部意义,是嵌入表示的重要思想基础。
11.3 表征学习
表征学习强调从原始数据中自动提取有用特征,嵌入表示通常是其典型结果之一。
11.4 表示空间
表示空间是对象向量所处的几何空间,用于承载距离、方向和结构关系。
11.5 向量数据库
向量数据库用于存储、索引和检索嵌入向量,是大规模相似度搜索的重要基础设施。
11.6 潜在语义分析
潜在语义分析是一类较早的文本表示方法,通过降维提取隐含语义结构,对后续嵌入研究具有启发意义。