向量与 Embedding:AI 如何判断两句话“意思相近”?

开场问题:文字不同,为什么搜索结果却能对上意思?

在公司知识库里搜索“客户付款后多久发货”,系统可能找到一份标题为“订单出库时效说明”的文档。两句话没有重复多少字,传统关键词匹配未必容易把它们联系起来,但语义搜索往往可以。

这并不是 AI 像人一样真正理解了公司的业务,而是它把文字转换成了一组可以计算的数字。这个转换结果通常叫作 Embedding(嵌入向量)。有了它,计算机就能用距离或角度,估计两段内容在某种语义表示下有多接近。

Embedding 将语义相近的句子映射到相邻位置的图解

图解:Embedding 把内容变成语义空间中的向量,相近含义会靠得更近,不相关内容则分布在更远的位置。

核心解释:从一句话到向量空间

向量可以先理解成一串有顺序的数字,例如 [0.12, -0.37, 0.81, ...]。现实中的 Embedding 往往有很多维,每个维度不是人工规定的“价格”“情绪”或“行业”标签,而是模型在训练中形成的综合特征。单独看某个数字通常没有直观含义,整组数字之间的关系才有价值。

Embedding 模型接收一句话、一段文章,甚至图片等内容,然后把它放进一个高维的“向量空间”。在这个空间中,模型认为语义相关的内容通常会靠得更近。例如“如何申请退款”与“退货后怎么拿回货款”可能距离较近;“如何修改登录密码”则可能更远。

系统判断接近程度时,常用余弦相似度。它主要比较两个向量的方向是否一致,而不是机械地比较每个数字是否相等。相似度越高,通常表示在该模型的表示方式下越相关。但它只是一个数学分数,不等于事实正确,也不等于两句话逻辑完全相同。

生活化类比:给图书馆画一张“意义地图”

可以把向量空间想成一座没有固定书架的图书馆。管理员不按书名首字母摆放,而是按照内容关系排位置:露营装备靠近户外旅行,合同审批靠近法务流程,员工报销靠近财务制度。

读者问“出差打车的钱怎么报”,管理员先把问题放到这张地图上,再寻找附近的资料,于是可能找到《差旅费用报销规范》。这里的“附近”不是地理距离,而是由向量计算出的语义距离。

真实的语义搜索通常分为几步:先把文档切成合适的小段;再用同一个 Embedding 模型生成向量并存入向量数据库;用户提问时生成查询向量;最后找出附近的文档片段,必要时再由排序模型或大语言模型整理答案。Embedding 负责“找候选”,并不天然负责“给最终结论”。

它适合什么,又有哪些局限?

Embedding 很适合知识库检索、相似问题推荐、内容聚类、商品或文章召回,也能帮助发现用词不同但主题接近的材料。不过,它的能力受模型、语种、业务领域、文本切分方式和数据质量影响。

否定、数字和细微条件尤其容易造成误判。“允许七天内退款”和“不允许七天内退款”共享大量词语,向量可能仍然很接近;“基础版支持导出”和“仅专业版支持导出”主题相同,业务结论却不同。旧制度与新制度也可能同时被召回。如果只看相似度,不检查版本、权限和有效期,搜索结果就可能看似合理却不能直接使用。

常见误区

第一,认为相似度高就是答案正确。相似度只能说明内容相关,不能证明资料真实、最新或适用于当前用户。

第二,认为每个向量维度都能被人准确解释。大多数通用模型的维度是共同起作用的,不宜强行给单个数字贴业务标签。

第三,认为用了向量数据库就有了完整知识库。文档清洗、切分、权限、更新、引用和答案校验同样重要。

第四,认为一个阈值适合所有场景。客服问答、合同检索和商品推荐对漏检、误检的容忍度不同,阈值必须结合真实样本评估。

实践建议

业务团队落地时,可以先选一个边界清晰的小场景,例如内部制度问答,并准备一批真实问题及应命中的文档。随后重点做好几件事:按自然段或业务章节切分文本,同时保留标题、来源、版本和权限等元数据;确保文档与查询使用兼容的模型和版本;观察召回结果,而不只看一个平均分;对高风险内容增加关键词过滤、二次排序、来源展示和人工确认。

还要建立更新机制。制度变化后,应及时删除或降权旧片段,并重新生成受影响的向量。涉及客户资料、合同或内部敏感信息时,也要先确定数据是否允许发送给所选模型服务,不能因为“只是生成向量”就忽略隐私与权限。

简短总结

Embedding 的核心,是把内容变成可比较的数字位置,让计算机能够按语义关系寻找“附近”的信息。它让搜索不再只依赖字面相同,但相近不代表正确,更不代表可以跳过业务规则。把向量召回与可靠来源、元数据、重排和人工审批结合起来,语义搜索才会从有趣的演示变成可信的工具。

系列导读

这是“AI 科普入门”系列第 5 篇。上一篇:RAG 是什么:为什么要让 AI 先查资料再回答?;下一篇:AI Agent 是什么:从会聊天到会做事

代码世界的构建师,现实生活的悠游者。